Представьте видеоредактор, который не заставляет ждать финального рендера, а рисует ролик прямо во время того, как вы его описываете. Именно это показала Runway — исследовательский прототип, где видео стримится кадр за кадром, синхронно с вводом пользователя.
Сегодняшние модели работают пакетно: ввёл промпт, подождал (секунды или минуты), получил готовый файл. Не понравилось — начинай заново. Runway ссылается на жалобы пользователей: больше всего времени уходит именно на ожидание и переделки. Компания решила урезать это время до минимума — до первого кадра должно проходить как можно меньше времени, а дальше видео течёт потоком, реагируя на новые команды: движение камеры, действия робота, аудиоввод.
Технически это построено на GWM-1 — «общей модели мира», которую Runway представила в декабре 2025 года на базе Gen-4.5. У видео есть особенность, которой нет у текста: языковая модель может исправить ошибку прямо посреди фразы, а видео строится кадр за кадром, и любая мелкая неточность накапливается, превращаясь в заметное искажение. Runway решает это тренировкой модели на её же несовершенных результатах — система учится сама себя корректировать, а не усиливать ошибку. Похожий трюк использовал стартап Decart в своей модели MirageLSD.
За скоростью стоит и экономика: более лёгкие модели требуют меньше GPU-времени, а значит, дешевле в эксплуатации. По логике Runway, чем ниже стоимость генерации при сохранении качества, тем шире круг задач, где AI-видео становится рентабельным. Главная ставка — не развлекательный контент, а интерактивные сценарии: обучение роботов и беспилотных автомобилей в синтетических мирах, которые должны генерироваться и реагировать мгновенно, включая редкие нештатные ситуации. У Runway для этого уже есть GWM Robotics, а Waymo идёт параллельным путём — использует модель Genie 3 от Google DeepMind для симуляции того, с чем реальные машины на дорогах ещё не сталкивались: торнадо, наводнение, слон посреди трассы.
В марте Runway вместе с Nvidia уже показывала ранний прототип на конференции GTC, работающий на платформе Vera Rubin с целью выдавать первый кадр меньше чем за 100 миллисекунд. Даты релиза пока нет, но направление обозначено чётко: видео перестаёт быть файлом, который ждут, и становится процессом, которым управляют.
Во что углубиться:
- Genie 3 от Google DeepMind: как устроена генерация интерактивных 3D-миров, сохраняющих согласованность несколько минут подряд
- Waymo World Model: зачем беспилотным автомобилям виртуальные мили перед выездом на реальные дороги
- Autoregressive diffusion в видео: почему модели, генерирующие кадр за кадром, склонны накапливать ошибки
