LIVE
Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему
Новости ИИ

GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы

автор: shmelev дата: 13 сентября 2026 чтение: 2 мин

Модель, которая красиво рассуждает о физике, и модель, которая реально берёт линейку и передаёт её другому роботу, — до сих пор между ними лежала пропасть. Новый бенчмарк StationeryBench показывает, что GPT-6 Astra начала её сокращать.

Тест простой и честный: два одинаковых двуруких робота YAM, пять задач с обычными канцелярскими предметами — снять колпачок с маркера, высыпать скрепки, передать линейку между руками. Astra и конкурирующая модель MolmoAct2 от Ai2 прогонялись через 200 попыток каждая. Результат неровный, но показательный: Astra полностью довела до конца 7 задач из 100, MolmoAct2 — ноль. По медианному прогрессу разрыв ещё заметнее: 46 баллов из 100 против 12.

Йоав Арци, исследователь из Cornell и Google DeepMind, назвал это «качественным скачком в пространственном рассуждении». На ещё не опубликованном бенчмарке REMAP Astra подбирается к точности, близкой к человеческой — хотя сам Арци уточняет, что до человека модель всё ещё не дотягивает в целом ряде сценариев. Его версия происхождения скачка — Astra могли обучить на большом массиве 3D-данных, вероятно, сценах из Blender. Это объясняет, почему именно задачи с объёмом и расположением предметов модель решает заметно увереннее прежних версий.

За этим прогрессом стоит не абстрактный интерес к роботам. OpenAI и раньше говорила о планах на собственных бытовых роботов, и результаты StationeryBench читаются как первый осязаемый шаг в эту сторону. Семь решённых задач из ста — не повод для фанфар, но и не случайность на фоне нулевого результата у конкурента. За таким прогрессом стоит следить: сегодня — скрепки на столе, завтра — задачи, которые до этого казались доступны только человеческим рукам.

Во что углубиться:

  • StationeryBench и методология оценки роботов: как устроен бенчмарк и почему выбраны именно бытовые предметы
  • Планы OpenAI на потребительских роботов: что известно о разработке собственного железа
  • Обучение AI на 3D-данных из Blender: как синтетические сцены помогают моделям понимать пространство

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»