История Design Arena начиналась без особых амбиций. Группа выпускников 2025 года пыталась сделать AI-движок для игр, но столкнулась с простой проблемой: модели генерировали рабочие игры, но не увлекательные. А как измерить «увлекательность» алгоритмически? Никак — нужен живой человек с собственным вкусом.
Так родился сервис, которым сейчас пользуются 5,3 миллиона человек по всему миру. Работает он как продвинутый роутер моделей: пользователь вводит запрос — сайт, картинку, любой визуальный формат — и получает серию вариантов «А против Б», которые нужно проранжировать от лучшего к худшему. Обычному пользователю всё равно, чья это модель, ему важен только лучший результат — и именно эта незаинтересованность делает его оценки честным сигналом того, что людям реально нравится.
Для фронтир-лабораторий это золото: постоянный поток живой обратной связи о качестве генерируемых медиа. Компания уже вышла на $60 млн годовой выручки — цифра, которая превращает нишевую идею в полноценный рынок человеческой оценки AI. Есть и любопытный побочный эффект: поскольку пользователи авторизуются, компания видит, как вкусы отличаются по регионам — например, веб-дизайн в Азии тяготеет к более максималистичному стилю. Такие данные становятся ценным дополнением к автоматическим бенчмаркам, которые, как показал недавний взлом Hugging Face, можно обмануть или подделать.
Рынок этот не гарантированно прибыльный: похожий проект Yupp, поднявший $33 млн от a16z crypto, закрылся меньше чем через год работы, несмотря на 1,3 млн пользователей. Но конкурент Design Arena — LM Arena, работающая с текстовыми ответами, — привлекла $150 млн уже через четыре месяца после запуска платного продукта. Рынок оценки человеческих предпочтений явно живой, просто не прощает ошибок в модели монетизации.
Во что углубиться:
- Что случилось с Hugging Face после взлома OpenAI-хакером
- Почему закрылся стартап Yupp, несмотря на 1,3 млн пользователей
- LM Arena и рынок бенчмарков для языковых моделей
