Развитие AI-технологий ставит вопрос построения эффективных рабочих фреймворков (Harness) для AI-агентов в число приоритетных. Часто проблемы в работе AI-агентов связаны не с моделью, а с рабочим фреймворком — набором системных подсказок, инструментов, правил проверки, логики координации и процессов восстановления после сбоев. Среди распространённых фреймворков — SWE-agent, Claude Code, Codex и OpenHands.
Шанхайская лаборатория искусственного интеллекта представила фреймворк Self-Harness. Он позволяет AI-агентам на основе LLM самостоятельно оптимизировать работу, анализируя собственные действия. Фреймворк состоит из трёх этапов:
- Выявление слабых мест (Weakness mining): AI-агент выполняет набор задач и создаёт отслеживаемые траектории выполнения, затем классифицирует неудачные сценарии и выявляет модели сбоев.
- Предложение изменений (Harness proposal): на основе выявленных сбоев агент генерирует упрощённые и разнообразные тестовые модификации, каждая из которых связана с конкретной проблемой.
- Проверка предложений (Proposal validation): агент проводит регрессионные тесты, чтобы оценить предложенные изменения. Модификация принимается, только если она улучшает производительность и не вредит другим задачам. Если несколько предложений проходят тесты, их объединяют и продолжают итеративную оптимизацию.
Например, если AI-агент для автоматического исправления ошибок перестал работать из‑за изменения формата документов, фреймворк Self-Harness поможет ему самостоятельно выявить проблему и предложить решение. В случае с моделью MiniMax M2.5 фреймворк ввёл ограничение: агент должен прекращать работу после 50 вызовов инструментов и менять стратегию. Для Qwen-3.5, которая часто переписывала файлы и удаляла нужные данные, ввели строгие правила повторных попыток выполнения команд.
На бенчмарке Terminal-Bench-2.0 фреймворк показал рост производительности AI-агентов на 33–60 % независимо от базовой модели (MiniMax M2.5, Qwen3.5-35B-A3B или GLM-5).
При этом в сферах с высокими рисками (медицина, безопасность, право) не стоит полностью автоматизировать настройку AI-моделей с помощью Self-Harness — это может привести к серьёзным ошибкам. Кроме того, автоматизация требует значительных вычислительных ресурсов. По словам Hangfan Zhang, хотя Self-Harness — это эффективное решение, опытный инженер часто предлагает более качественные улучшения, чем LLM. Роль инженеров при этом меняется: вместо ручной настройки подсказок они будут проектировать системы, позволяющие AI-агентам самосовершенствоваться.
