LIVE
Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления Маленький агент против гигантов: как Faraday обыграл GPT-5.5 и Claude в науке Гарвард выпустил цифровых двойников своих преподавателей — и студентам заходит OpenAI просит Калифорнию ужесточить закон, который сама же критиковала Пять лабораторий, ноль внятных планов на случай бунта ИИ Claude Opus 4.6 нарушает собственные правила после пары фраз социального давления
Новости ИИ

Почему в поиске лекарств данные важнее самой модели

автор: shmelev дата: 3 августа 2026 чтение: 2 мин

GSK и биотех-компания Relation Therapeutics расширили сотрудничество: сделка на сумму до 110 миллионов долларов посвящена не разработке новой модели, а созданию качественных биологических данных для обучения AI, которая ищет цели для будущих лекарств.

Схема сделки простая и от этого показательная: Relation будет генерировать масштабные наборы данных о том, как человеческие клетки реагируют на генетические изменения и воздействие препаратов. Эти данные пойдут на обучение моделей платформы MORGAN, которые ищут потенциальные цели для терапии. Подход компании называется Lab-in-the-Loop — лабораторные эксперименты и вычислительный анализ работают в связке, а не по отдельности.

Здесь кроется урок, который расходится с привычной логикой AI-индустрии: больше данных не значит лучше модель. Исследование в Nature Methods, где протестировали 400 моделей на корпусе из 22 миллионов клеток, показало, что модели для анализа отдельных клеток выходят на плато производительности задолго до использования всего доступного массива данных — в отличие от языковых моделей, у них нет чёткого закона масштабирования. Другое исследование в Genome Biology обнаружило, что даже продвинутые модели вроде Geneformer и scGPT не всегда превосходят простые методы анализа.

Проблема не только в объёме, но и в качестве: данные из разных публичных источников — CZ CELLxGENE, Human Cell Atlas, NCBI GEO — собираются разными протоколами, содержат технический шум и пересекаются между собой, создавая риск утечки данных между тренировочной и тестовой выборками. Именно поэтому фармкомпании всё чаще платят не за доступ к готовой модели, а за создание собственных, специализированных датасетов — как в случае GSK с Ochre Bio за 37,5 миллионов долларов или сделки AstraZeneca и Tempus на 200 миллионов.

Вывод простой и не самый очевидный для человека, привыкшего думать, что AI решает всё «сам»: настоящая работа в AI-медицине происходит не в момент запуска модели, а на этапе сбора чистых, правильно устроенных биологических данных. Модель — только часть уравнения.

Во что углубиться:

  • Что такое foundation-модели для одиночных клеток (single-cell foundation models) и как они устроены
  • Крупные сделки фарм-компаний с AI-стартапами в 2025-2026: обзор рынка
  • Как федеративное обучение решает проблему нехватки данных в фармацевтике
Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»