LIVE
GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы
Новости ИИ

Google научила ИИ-агентов вести дневник собственных провалов — и результаты выросли на десятки процентов

автор: shmelev дата: 30 августа 2026 чтение: 2 мин

Исследователи Google описали систему WikiSkill — способ заставить AI-агента становиться лучше без единого цикла переобучения. Вместо того чтобы менять веса модели, система собирает историю выполненных задач, выделяет из неё закономерности успехов и ошибок и переписывает инструкции, по которым агент действует в следующий раз.

Идея опирается на предложение исследователя Андрея Карпатого о «вики для языковых моделей» — постоянно растущей базе накопленного опыта. WikiSkill строит вокруг этой идеи трёхуровневую архитектуру. Внизу — «сырой слой» с полными следами выполнения задач: какие инструменты вызывались, что получилось в ответ. Выше — «слой вики», куда стекаются уже осмысленные выводы: какие стратегии сработали, какие с треском провалились. Этот слой никогда не откатывается назад, только растёт. На вершине — «слой навыков», собственно рабочие инструкции агента, которые можно откатить, если обновление ухудшило результат.

Цикл работает так: агент выполняет задачи и оставляет следы → «хранитель вики» анализирует их и фиксирует паттерны → «предлагающий навыки» модуль на основе вики предлагает правки к инструкциям → отдельный механизм проверяет на тестовой выборке, действительно ли правка помогает. Если нет — навык откатывают, но запись в вики остаётся: даже неудачный эксперимент становится знанием для следующей попытки.

Цифры впечатляют. Gemini 3.5 Flash в среднем по пяти бенчмаркам поднялась с 49.5% до 68.1%, а на отдельных задачах скачок ещё резче: 33% → 72.6% на математических задачах, 50.5% → 76.6% на работе с таблицами. Похожий эффект — и у моделей Qwen: версия на 27 миллиардов параметров выросла с 39.4% до 63.3%. Интересный побочный эффект: маленькие модели с WikiSkill начинают догонять по производительности большие модели без этой системы, а навыки, наработанные одной моделью, неплохо переносятся на другую.

Это не настоящее обучение в классическом смысле — модель не меняется внутри. Но как рабочий обходной путь метод решает задачу, над которой индустрия бьётся давно: как сделать так, чтобы агент не наступал на одни и те же грабли раз за разом.

Во что углубиться:

  • Андрей Карпаты и концепция «LLM Wiki»: откуда взялась идея накопительной памяти для моделей
  • Проблема continual learning в машинном обучении: почему модели до сих пор не умеют учиться на лету
  • Сравнение WikiSkill с другими методами эволюции навыков — Trace2Skill, EvoSkill, SkillOpt

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»