LIVE
Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему Flock откупается от сотрудников на фоне скандала со слежкой Трамп предлагает переименовать AI и создаёт «AI Force» Gemini от Google самостоятельно взломала три компании Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его Разговоры про безопасность AI дошли до абсурда — и всё равно пугают по-настоящему
Новости ИИ

Стартап Vals хочет стать новым эталоном для проверки AI — пока компании ещё не научились обманывать и его

автор: shmelev дата: 19 сентября 2026 чтение: 3 мин

Бенчмарки давно превратились в маркетинговый инструмент: хороший результат теста — это почти всегда хороший пресс-релиз. Беда в том, что компании научились подстраиваться под старые системы оценки, по сути натаскивая модели на сами тесты. Стартап Vals решил, что с этим пора заканчивать.

Основанная в 2024 году компания за неполные два года прошла путь от посевного раунда под руководством 8VC и Bloomberg Beta до серии A на 40 миллионов долларов от Andreessen Horowitz. За этим стоит 25-летний сооснователь Раян Кришнан — бывший стажёр Palantir, работавший ещё студентом в Microsoft и в лаборатории искусственного интеллекта Стэнфорда. Идея Vals родилась из простого наблюдения: рынок штампует всё более мощные модели быстрее, чем академические бенчмарки успевают их измерять.

Главное отличие подхода Vals — тестовые материалы не публикуются. Это лишает компании возможности натренировать модель прямо на условиях экзамена, что давно стало слабым местом открытых бенчмарков. Вместо абстрактных проверок вроде «сдаст ли модель экзамен на адвоката», Vals оценивает, способна ли система выполнять реальную профессиональную работу — в праве, финансах, разработке кода — на уровне, сравнимом с человеком. Причём смотрят не только на пользу, но и на риски: что произойдёт, если такую модель «выпустить в мир» без присмотра.

Список направлений тестирования звучит почти как повестка конференции по AI-безопасности: рекурсивное самоулучшение моделей, ментальное здоровье, кибербезопасность, биобезопасность и даже способность модели корректно применять Женевскую конвенцию. Бизнес-модель при этом устроена просто — компании сами платят за проверку, примерно как студент платит за сдачу SAT. Кажется странным платить за то, чтобы узнать о слабостях своей же модели, но именно это позволяет дорабатывать продукт до выхода на рынок.

Цифры роста впечатляют: выручка выросла в восемь раз год к году, штат увеличился с 8 до 25 человек, и компания планирует нанять ещё 10–15 сотрудников вместе с переездом в офис побольше. Vals уже запустил отдельную программу оценки моделей для федеральных агентств США.

Кришнан видит в независимой оценке будущее того, как AI-компании будут доказывать инвесторам и регуляторам, что их продукт работает так, как заявлено. С учётом того, что SpaceX уже вышла на биржу, Anthropic должна выйти позже в этом году, а IPO OpenAI обсуждается всё активнее, подобные бенчмарки рискуют стать не просто инструментом маркетинга, а частью официальной финансовой отчётности.

Во что углубиться:

  • Почему старые AI-бенчмарки считаются «сломанными»: найди разбор проблемы в MIT Technology Review про устаревание тестов
  • Как компании «читерят» на бенчмарках, обучаясь на тестовых данных: изучи явление data contamination в машинном обучении
  • Готовящиеся IPO Anthropic и OpenAI: узнай, как устроена оценка AI-компаний перед выходом на биржу

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»