Популярные ИИ-ассистенты для программирования — Claude Code от Anthropic и Codex от OpenAI — умеют писать код часами без остановки. Но они совершенно не понимают, сколько времени на самом деле прошло с начала работы. Это ставит под вопрос саму идею доверить им долгие автономные задачи.
Двое независимых исследователей в рамках программы MATS протестировали оба ассистента на 200 задачах из набора ProgramBench и собственном наборе из 18 бенчмарков. Перед стартом агентов просили оценить, сколько времени займет задача, а после завершения — сколько времени реально прошло. Результат: оба ассистента систематически завышали свои оценки. На ProgramBench они почти всегда называли цифру около 90 минут независимо от сложности задачи. При оценке уже пройденного времени Claude ошибался в среднем втрое, Codex — в шесть-десять раз. Хуже всего дела обстояли с короткими задачами; более-менее точные прогнозы появлялись только на многочасовых заданиях.
Поведение агентов сильно зависит от программной оболочки, в которой они работают. Claude Code продолжает трудиться, пока сам не решит, что задача закончена — в среднем это около 90 минут. Codex же почти всегда останавливается спустя примерно полчаса, вне зависимости от содержания задачи. Одна и та же модель делает в среднем в 2,5 раза больше шагов внутри Claude Code, чем внутри Codex: длительность работы определяется не только моделью, но и окружением, в котором она запущена.
Еще тревожнее выглядит самооценка результатов. Старые модели, Opus 4.8 и GPT-5.5, завышали оценку собственной работы в среднем на 20 процентных пунктов, выставляя себе высокие баллы даже за проваленные задачи. В одном случае обе модели решили, что справились примерно на 70% — при том что реальный результат составил 7% и 14,5%. Авторы исследования подчеркивают: способность агента адекватно оценивать себя и время критична для длинных автономных задач. Команда вроде «поработай над этим два часа» просто не сработает, если система не в состоянии отслеживать течение времени. Хорошая новость в том, что решение оказалось до смешного простым: стоило дать агентам доступ к инструменту, показывающему прошедшее время, и ошибки практически исчезли.
Во что углубиться:
- Что такое агентный «harness» (программная оболочка) и почему он так сильно влияет на поведение ИИ-моделей
- Бенчмарк ProgramBench: как устроены тесты для оценки автономности ИИ-агентов в программировании
- Проблема самооценки ИИ-моделей: почему языковые модели переоценивают качество своей работы
