Пока одни разбираются, как удержать AI под контролем, другие превращают банальную, но критическую проблему в миллиардный бизнес. XDOF — стартап, который собирает данные для обучения роботов, — всего за три месяца после выхода из stealth-режима вышел на переговоры о раунде Series B с оценкой около $1,2 млрд.
Основатели компании — Филипп Ву и Фред Шэньту, оба из UC Berkeley. Ву во время учёбы в аспирантуре изучал, как роботы обучаются на больших массивах данных, и упёрся в главную проблему индустрии: в отличие от языковых моделей, которые тренировались буквально на всём интернете, у роботов нет своего «интернета» реальных физических действий. Вместе с Шэньту они создали GELLO — недорогую систему телеоперации, позволяющую человеку удалённо управлять роборукой и таким образом генерировать данные для обучения. Разработка легла в основу научной статьи, а затем и самой компании.
Модель работы простая и оттого элегантная: часть данных собирают операторы, дистанционно управляя роботами, часть — люди в носимых датчиках, которые фиксируют обычные бытовые движения вроде складывания одежды или сборки коробок. Так набирается массив, который инвесторы уже сравнивают с ролью Scale AI в буме языковых моделей — только применительно к физическим роботам. Вместе с исследовательской лабораторией UC Berkeley компания готовит к выпуску набор данных ABC, который называет крупнейшей коллекцией качественных данных для обучения роботов на сегодня.
В июне TechCrunch писал о раунде Series A на $70 млн с участием Thrive Capital, Andreessen Horowitz, Lux и Spark Capital. Тогда новый раунд не планировался. Годовая выручка компании, приближающаяся к $50 млн, заставила инвесторов во главе с 8VC самим прийти с предложением. Среди клиентов XDOF — больше двадцати компаний, включая ведущие AI-лаборатории, которые уже платят за доступ к этим данным.
Индустрия физических данных для роботов только формируется, но растёт стремительно: помимо XDOF, за нишу борются Mecka AI и платформы вроде Micro1, ранее специализировавшиеся на разметке данных для языковых моделей. Похоже, следующий этап гонки AI — не в чипах и не в параметрах моделей, а в том, кто соберёт больше качественных данных о том, как человек двигается и работает руками.
Во что углубиться:
- Что такое GELLO и телеоперация роботов: как устроена система дистанционного управления, ставшая основой XDOF
- Scale AI и разметка данных для языковых моделей: как устроен бизнес на человеческом труде внутри AI-индустрии
- Проблема данных в робототехнике: почему роботам не хватает аналога интернет-текстов для обучения
