LIVE
GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы
Новости ИИ

Anthropic показала, как AI улучшает сам себя — и это выходит дешевле и быстрее, чем через людей

автор: shmelev дата: 29 августа 2026 чтение: 2 мин

Исследователь из фелло-программы Anthropic опубликовал результаты, которые стоит перечитать дважды. Автоматизированная система взяла на себя работу, которую обычно выполняют люди-специалисты по alignment — настройке моделей так, чтобы те не выдавали вредных или нежелательных ответов. И справилась лучше.

Схема работы системы повторяет логику научного поиска: она сканирует доступную литературу, предлагает метод улучшения, обучает модель этим методом полчаса, смотрит на результат по конкретному бенчмарку и либо сохраняет подход, либо отбрасывает и пробует следующий. Из десяти тестов на разные виды «плохого» поведения моделей система улучшила результат по всем десяти, не испортив остальные показатели.

Цифры в статье не оставляют простора для сомнений. Лучший метод, найденный автоматической системой, обходит по эффективности предложения опытных людей-исследователей — и это происходит в среднем за шесть часов работы. Люди, направляющие исследование вручную, не дают более сильного результата. А по деньгам разница ещё нагляднее: час работы такой системы обходится примерно в четыре доллара против полутора сотен долларов за час работы человека-исследователя.

Авторы работы честно указывают на ограничения: система эффективна ровно настолько, насколько бенчмарки отражают реальные цели безопасности, а создание и поддержка таких бенчмарков — отдельная сложная задача, которую пока делают люди. Но общий вывод звучит однозначно: автоматизированная настройка alignment может стать рабочей практикой в ближайшее время, а не отдалённой перспективой.

Так это выглядит на практике. Именно здесь — первый кирпичик в фундамент идеи recursive self-improvement, гипотезы, что модели способны улучшать сами себя без участия человека на каждом шаге. Если система может настраивать безопасность лучше людей, логично предположить, что со временем она справится и с более широкими задачами обучения. А это уже вопрос не про эффективность лабораторий, а про то, останется ли профессия AI-исследователя в её нынешнем виде.

Во что углубиться:

  • Recursive self-improvement AI: что это за концепция и почему её называют следующим шагом после AGI
  • Anthropic alignment research: как компания подходит к безопасности моделей и какие методы использует
  • AI benchmarks для оценки безопасности моделей: как устроены и в чём их слабые места

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»