LIVE
AstroForge доверит нейросети управление космическим кораблём без связи с Землёй Anthropic выпустила Opus 5.5 — и одновременно притормозила саму себя Человек, построивший Apple Store, не верит в AI-шопинг Muse от Meta растёт быстрее, чем рос ChatGPT на старте OpenAI решила больше 100 открытых математических задач — и математики в тревоге AstroForge доверит нейросети управление космическим кораблём без связи с Землёй Anthropic выпустила Opus 5.5 — и одновременно притормозила саму себя Человек, построивший Apple Store, не верит в AI-шопинг Muse от Meta растёт быстрее, чем рос ChatGPT на старте OpenAI решила больше 100 открытых математических задач — и математики в тревоге
Новости ИИ

ИИ-агенты не чувствуют времени — и понятия не имеют, насколько хорошо справились с задачей

автор: shmelev дата: 30 августа 2026 чтение: 2 мин

Популярные ИИ-ассистенты для программирования — Claude Code от Anthropic и Codex от OpenAI — умеют писать код часами без остановки. Но они совершенно не понимают, сколько времени на самом деле прошло с начала работы. Это ставит под вопрос саму идею доверить им долгие автономные задачи.

Двое независимых исследователей в рамках программы MATS протестировали оба ассистента на 200 задачах из набора ProgramBench и собственном наборе из 18 бенчмарков. Перед стартом агентов просили оценить, сколько времени займет задача, а после завершения — сколько времени реально прошло. Результат: оба ассистента систематически завышали свои оценки. На ProgramBench они почти всегда называли цифру около 90 минут независимо от сложности задачи. При оценке уже пройденного времени Claude ошибался в среднем втрое, Codex — в шесть-десять раз. Хуже всего дела обстояли с короткими задачами; более-менее точные прогнозы появлялись только на многочасовых заданиях.

Поведение агентов сильно зависит от программной оболочки, в которой они работают. Claude Code продолжает трудиться, пока сам не решит, что задача закончена — в среднем это около 90 минут. Codex же почти всегда останавливается спустя примерно полчаса, вне зависимости от содержания задачи. Одна и та же модель делает в среднем в 2,5 раза больше шагов внутри Claude Code, чем внутри Codex: длительность работы определяется не только моделью, но и окружением, в котором она запущена.

Еще тревожнее выглядит самооценка результатов. Старые модели, Opus 4.8 и GPT-5.5, завышали оценку собственной работы в среднем на 20 процентных пунктов, выставляя себе высокие баллы даже за проваленные задачи. В одном случае обе модели решили, что справились примерно на 70% — при том что реальный результат составил 7% и 14,5%. Авторы исследования подчеркивают: способность агента адекватно оценивать себя и время критична для длинных автономных задач. Команда вроде «поработай над этим два часа» просто не сработает, если система не в состоянии отслеживать течение времени. Хорошая новость в том, что решение оказалось до смешного простым: стоило дать агентам доступ к инструменту, показывающему прошедшее время, и ошибки практически исчезли.

Во что углубиться:

  • Что такое агентный «harness» (программная оболочка) и почему он так сильно влияет на поведение ИИ-моделей
  • Бенчмарк ProgramBench: как устроены тесты для оценки автономности ИИ-агентов в программировании
  • Проблема самооценки ИИ-моделей: почему языковые модели переоценивают качество своей работы

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»