Немецкая некоммерческая организация LAION, уже известная скандальными датасетами изображений, выпустила Big Video Dataset. Масштаб внушительный: организация нашла 1.3 миллиарда видео-ссылок в архиве CommonCrawl, скачала из них 80 миллионов роликов общей длительностью 10 миллионов часов и нарезала 55 миллионов клипов с автоматически сгенерированными описаниями видео и звука, плюс 300 миллионов стоп-кадров.
Большая часть материала — с YouTube, преимущественно на английском языке. Но дело в объёме самом по себе: модели, обученные на этом наборе, обходят конкурентов, тренированных на популярном датасете InternVid, до 2.1 процентных пункта на стандартных бенчмарках видео-в-текст. Секрет в том, что тренировка связывает воедино видео, звук и текст — модель учится сопоставлять, какая картинка соответствует какому описанию или звуку.
Юридически LAION стоит на относительно твёрдой почве: в 2024 году суд Гамбурга признал право организации собирать защищённый авторским правом контент для некоммерческих исследований. Именно поэтому датасет распространяется строго для исследовательских целей, а сама LAION просит пользователей уважать права создателей оригинального контента.
Значение здесь в том, кому он достаётся. Тренировка моделей на видео такого масштаба обычно требует ресурсов уровня Google или Meta. Открытый датасет позволяет университетским лабораториям и небольшим стартапам работать с теми же исходными данными, что и корпоративные гиганты. Разрыв в возможностях сокращается, пусть и не полностью.
Во что углубиться:
- Решение суда Гамбурга 2024 года по LAION: как оно определило правила скрейпинга для исследований в Германии
- LAION-5B и предыдущие скандалы: почему организацию уже критиковали за содержимое датасетов изображений
- InternVid и другие крупные видео-датасеты: как устроена конкуренция открытых наборов данных для видео-ИИ
