Архитектура управления повысила показатель успешности модели до 100%
Опубликованные 21 августа 2026 года исследования показали, что ключевым фактором, определяющим успех ИИ-агентов в сложных и длительных задачах, является не языковая модель, а архитектура управления (harness) вокруг модели. В исследовании Nvidia модель Claude Opus 5 была поддержана специально разработанной системой управления. Показатель производительности модели в среде ARC-AGI-3, представляющей собой тест интерактивного рассуждения без каких-либо специальных инструкций, вырос с 30% до 100%.
Языковые модели могут оказаться недостаточными сами по себе в процессах, выходящих за рамки текстовых команд и требующих принятия многоэтапных решений на протяжении нескольких дней. В исследовании, проведенном Microsoft в рамках задач по документированию, были протестированы 19 различных больших языковых моделей, и было установлено, что даже наиболее современные модели приводили к многочисленным ошибкам в документации. Полевые наблюдения, показавшие, что автономные ИИ-агенты без механизма управления могут переходить к нарушениям правил или борьбе за власть, также подтверждают необходимость такой инфраструктуры.
Роль управляющего агента у контролирующего компонента
Архитектура управления, которую Nvidia назвала AVO (Agentic Variation Operators), берет на себя управление памятью, отслеживание контекста и выполнение циклов обратной связи. Важнейшим элементом архитектуры является контролирующий компонент, расположенный над агентом, выполняющим основную задачу. Эта контролирующая система включается, когда основной агент заходит в тупик или начинает повторяющийся процесс, и направляет работу по правильному пути.
В тесте ARC-AGI-3, охватывающем 2D-игры без инструкций, Claude Opus 5 достиг показателя успешности 30,16% без каких-либо дополнительных компонентов и получил самый высокий индивидуальный результат среди моделей. Инженеры OpenAI утроили этот показатель, изменив параметры управления собственных моделей, однако не смогли добиться полного успеха. Это продемонстрировало разницу, которую создает компонент управляющего агента.
Значение открытых архитектур для затрат и безопасности
Влияние архитектуры управления не ограничивается показателями точности. Исследования, проведенные Databricks, показывают, что даже при использовании одной и той же модели искусственного интеллекта ошибочный управляющий слой может увеличить эксплуатационные расходы в 2 раза.
Агент состоит не только из API-вывода, полученного от модели.
Агент представляет собой целостную систему, включающую, помимо модели, архитектуру набора инструментов, окружающего модель, среду выполнения и библиотеки, которыми он может пользоваться.
Nvidia стремится предоставить разработчикам возможности управления с помощью инфраструктурных инструментов, предлагаемых в рамках экосистемы NeMo с открытым исходным кодом. Отмечается, что вместо постоянного увеличения весов модели гибкий контрольный механизм позволяет оптимизировать затраты и снижать риски для безопасности.