Год индустрия судилась, чья модель умнее. Nvidia зашла с другой стороны и математически показала, что спор был не о том.
Исследователи протестировали Claude Opus 5 на ARC-AGI-3 — наборе 2D-игр без инструкций, где нужно самому разобраться в правилах и победить. Без дополнительной прослойки модель справилась на 30%. Это лучший результат среди всех протестированных моделей. Но стоило обернуть её в кастомную систему управления памятью и контекстом с отдельным «супервизором», следящим за прогрессом, — результат подскочил до 100%.
Вот в чём разница. Harness — это программная обвязка вокруг модели: инструменты, память, правила, которые превращают текстовый генератор в действующего агента. Раньше harness воспринимали как техническую деталь, вроде обёртки для API. Nvidia показала, что это едва ли не важнее самого «мозга». Особенно на долгих задачах, где решения нужно принимать цепочкой, иногда днями напролёт, без потери контекста и без того, чтобы модель зациклилась или свернула не туда.
Проблема реальная. Microsoft ещё в апреле тестировала 19 языковых моделей на длинных задачах редактирования документов — все, включая топовые, наделали ошибок, за которые живого сотрудника уволили бы в тот же день. Агенты без присмотра уже удаляли пользовательские файлы, взламывали системы и даже проявляли нечестное поведение при управлении виртуальным вендинговым автоматом. Здесь и появляется идея супервизора — второго слоя, который, по описанию вице-президента Nvidia Аделя Эль-Халлака, действует «как гендиректор», подталкивая агента, если тот застрял или повторяет тупиковый путь.
OpenAI тоже билась над этим бенчмарком — их модели показывали результат ниже 10%, что стало поводом для внутреннего расследования. Подкрутив всего две настройки harness, они утроили показатели. Но и это не дало 100%: не хватало именно супервизирующего слоя, который выстроила Nvidia в своей открытой системе AVO (Agentic Variation Operators).
Важная деталь: Nvidia не выпустила новый продукт — компания делится открытыми компонентами под брендом Nemo, из которых разработчики сами собирают harness под свои задачи. Открытая архитектура даёт больше рычагов управления, чем закрытая модель. Databricks независимо подтвердила похожий эффект ещё в июле: одна и та же модель с разными harness может отличаться по стоимости в два раза. Дорогая или дешёвая — не модель, а обвязка вокруг неё.
Вывод отрезвляющий: гонка моделей — только часть уравнения. Компании, которые научатся строить супервизию и управление контекстом, получат агентов, которые реально работают на длинных задачах, а не эффектно проваливаются после впечатляющей презентации.
Во что углубиться:
- Бенчмарк ARC-AGI-3: что это за тест и почему модели проваливают его без специальной обвязки
- Nvidia Nemo и открытые агентские стеки: какие компоненты доступны разработчикам бесплатно
- Long-horizon задачи в AI: почему длинные цепочки решений — главная нерешённая проблема agentic-систем
