LIVE
Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям Rippling спалила миллионы на AI за два месяца — и построила систему, чтобы это не повторилось Как модели OpenAI превратили внутреннее хранилище файлов в чат для взлома систем OpenAI остановила разработку модели, которая научилась взламывать системы самостоятельно Alibaba хочет брать долю с выручки компаний, использующих её бесплатную модель Meta заплатит почти миллиард долларов по одному только делу о вреде детям
Новости ИИ

Почему в поиске лекарств данные важнее самой модели

автор: shmelev дата: 3 августа 2026 чтение: 2 мин

GSK и биотех-компания Relation Therapeutics расширили сотрудничество: сделка на сумму до 110 миллионов долларов посвящена не разработке новой модели, а созданию качественных биологических данных для обучения AI, которая ищет цели для будущих лекарств.

Схема сделки простая и от этого показательная: Relation будет генерировать масштабные наборы данных о том, как человеческие клетки реагируют на генетические изменения и воздействие препаратов. Эти данные пойдут на обучение моделей платформы MORGAN, которые ищут потенциальные цели для терапии. Подход компании называется Lab-in-the-Loop — лабораторные эксперименты и вычислительный анализ работают в связке, а не по отдельности.

Здесь кроется урок, который расходится с привычной логикой AI-индустрии: больше данных не значит лучше модель. Исследование в Nature Methods, где протестировали 400 моделей на корпусе из 22 миллионов клеток, показало, что модели для анализа отдельных клеток выходят на плато производительности задолго до использования всего доступного массива данных — в отличие от языковых моделей, у них нет чёткого закона масштабирования. Другое исследование в Genome Biology обнаружило, что даже продвинутые модели вроде Geneformer и scGPT не всегда превосходят простые методы анализа.

Проблема не только в объёме, но и в качестве: данные из разных публичных источников — CZ CELLxGENE, Human Cell Atlas, NCBI GEO — собираются разными протоколами, содержат технический шум и пересекаются между собой, создавая риск утечки данных между тренировочной и тестовой выборками. Именно поэтому фармкомпании всё чаще платят не за доступ к готовой модели, а за создание собственных, специализированных датасетов — как в случае GSK с Ochre Bio за 37,5 миллионов долларов или сделки AstraZeneca и Tempus на 200 миллионов.

Вывод простой и не самый очевидный для человека, привыкшего думать, что AI решает всё «сам»: настоящая работа в AI-медицине происходит не в момент запуска модели, а на этапе сбора чистых, правильно устроенных биологических данных. Модель — только часть уравнения.

Во что углубиться:

  • Что такое foundation-модели для одиночных клеток (single-cell foundation models) и как они устроены
  • Крупные сделки фарм-компаний с AI-стартапами в 2025-2026: обзор рынка
  • Как федеративное обучение решает проблему нехватки данных в фармацевтике
Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»