Модель, которая красиво рассуждает о физике, и модель, которая реально берёт линейку и передаёт её другому роботу, — до сих пор между ними лежала пропасть. Новый бенчмарк StationeryBench показывает, что GPT-6 Astra начала её сокращать.
Тест простой и честный: два одинаковых двуруких робота YAM, пять задач с обычными канцелярскими предметами — снять колпачок с маркера, высыпать скрепки, передать линейку между руками. Astra и конкурирующая модель MolmoAct2 от Ai2 прогонялись через 200 попыток каждая. Результат неровный, но показательный: Astra полностью довела до конца 7 задач из 100, MolmoAct2 — ноль. По медианному прогрессу разрыв ещё заметнее: 46 баллов из 100 против 12.
Йоав Арци, исследователь из Cornell и Google DeepMind, назвал это «качественным скачком в пространственном рассуждении». На ещё не опубликованном бенчмарке REMAP Astra подбирается к точности, близкой к человеческой — хотя сам Арци уточняет, что до человека модель всё ещё не дотягивает в целом ряде сценариев. Его версия происхождения скачка — Astra могли обучить на большом массиве 3D-данных, вероятно, сценах из Blender. Это объясняет, почему именно задачи с объёмом и расположением предметов модель решает заметно увереннее прежних версий.
За этим прогрессом стоит не абстрактный интерес к роботам. OpenAI и раньше говорила о планах на собственных бытовых роботов, и результаты StationeryBench читаются как первый осязаемый шаг в эту сторону. Семь решённых задач из ста — не повод для фанфар, но и не случайность на фоне нулевого результата у конкурента. За таким прогрессом стоит следить: сегодня — скрепки на столе, завтра — задачи, которые до этого казались доступны только человеческим рукам.
Во что углубиться:
- StationeryBench и методология оценки роботов: как устроен бенчмарк и почему выбраны именно бытовые предметы
- Планы OpenAI на потребительских роботов: что известно о разработке собственного железа
- Обучение AI на 3D-данных из Blender: как синтетические сцены помогают моделям понимать пространство
