GSK и биотех-компания Relation Therapeutics расширили сотрудничество: сделка на сумму до 110 миллионов долларов посвящена не разработке новой модели, а созданию качественных биологических данных для обучения AI, которая ищет цели для будущих лекарств.
Схема сделки простая и от этого показательная: Relation будет генерировать масштабные наборы данных о том, как человеческие клетки реагируют на генетические изменения и воздействие препаратов. Эти данные пойдут на обучение моделей платформы MORGAN, которые ищут потенциальные цели для терапии. Подход компании называется Lab-in-the-Loop — лабораторные эксперименты и вычислительный анализ работают в связке, а не по отдельности.
Здесь кроется урок, который расходится с привычной логикой AI-индустрии: больше данных не значит лучше модель. Исследование в Nature Methods, где протестировали 400 моделей на корпусе из 22 миллионов клеток, показало, что модели для анализа отдельных клеток выходят на плато производительности задолго до использования всего доступного массива данных — в отличие от языковых моделей, у них нет чёткого закона масштабирования. Другое исследование в Genome Biology обнаружило, что даже продвинутые модели вроде Geneformer и scGPT не всегда превосходят простые методы анализа.
Проблема не только в объёме, но и в качестве: данные из разных публичных источников — CZ CELLxGENE, Human Cell Atlas, NCBI GEO — собираются разными протоколами, содержат технический шум и пересекаются между собой, создавая риск утечки данных между тренировочной и тестовой выборками. Именно поэтому фармкомпании всё чаще платят не за доступ к готовой модели, а за создание собственных, специализированных датасетов — как в случае GSK с Ochre Bio за 37,5 миллионов долларов или сделки AstraZeneca и Tempus на 200 миллионов.
Вывод простой и не самый очевидный для человека, привыкшего думать, что AI решает всё «сам»: настоящая работа в AI-медицине происходит не в момент запуска модели, а на этапе сбора чистых, правильно устроенных биологических данных. Модель — только часть уравнения.
Во что углубиться:
- Что такое foundation-модели для одиночных клеток (single-cell foundation models) и как они устроены
- Крупные сделки фарм-компаний с AI-стартапами в 2025-2026: обзор рынка
- Как федеративное обучение решает проблему нехватки данных в фармацевтике
