Цифра, которая должна была бы остановить индустрию, но не остановила: половина крупных компаний за последний год отправила в работу AI-агента, который прошёл все внутренние тесты, а потом всё равно подвёл клиента. Причём у четверти это случалось не один раз.
Исследование VentureBeat Pulse, опросившее 157 компаний со штатом от 100 человек, обнажает разрыв между тем, сколько самостоятельности бизнес готов дать AI-агентам, и тем, насколько он доверяет тестам, которые должны эту самостоятельность контролировать. Доверие к автоматическим проверкам оказалось катастрофически низким — только 5% компаний полностью полагаются на них, а главная претензия у 29% опрошенных: тесты плохо соотносятся с реальными результатами. Проще говоря, агент отвечает правильно на экзамене, но ошибается в жизни.
При этом две трети компаний (66%) уже разрешают или готовятся в течение года разрешить полностью автономный запуск изменений в продакшен — без единого человека, проверяющего результат. И только 22% исключают такой сценарий на обозримое будущее. Получается парадокс: чем меньше компании доверяют своим тестам, тем быстрее они убирают людей из цепочки контроля.
Ещё один тревожный штрих — то, как компании вообще следят за работающими агентами. 51% мониторят только техническую исправность: отвечает ли система, с какой скоростью, сколько это стоит. И только 23% реально проверяют правильность ответов в реальном времени. Получается, что уверенно неправильный ответ агента невидим для большинства систем мониторинга — запрос выполнился быстро, ошибки нет, всё выглядит здоровым, а смысл ответа никто не проверил.
Есть и обнадёживающий сигнал: следующие инвестиции компании планируют направить в наблюдение за продакшеном и — что примечательно — в человеческую проверку, а не только в автоматизацию. Получается, бизнес одновременно строит путь к полной автономии и увеличивает бюджет на людей, которые должны эту автономию тормозить. Хедж на случай, если что-то пойдёт не так — и, судя по цифрам, пойти не так может очень многое.
Во что углубиться:
- Что такое AI agent evaluation и как компании тестируют автономных агентов: раскрывает техническую сторону проблемы
- Реальные случаи провалов AI-агентов в бизнесе 2025-2026: примеры того, как теория превращается в убытки
- Zero-human deployment в AI: что это значит и почему компании к этому стремятся несмотря на риски
