LIVE
GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы GPT-6 Astra сама управляет бизнесом и пилотирует дрон-разведчик Обама требует от демократов внятного плана по AI, пока Трамп делает ставку на гонку Глава Anthropic просит мировое соглашение об ограничении AI — пока рекурсивное самосовершенствование не вышло из-под контроля Perplexity доверила GPT-6 Astra тестировать и следить за живыми системами без постоянного присмотра GPT-6 Astra научилась работать руками — и обогнала всех соперников в разы
Новости ИИ

Французский стартап Kog разгоняет обычные GPU до 3000 токенов в секунду

автор: shmelev дата: 14 августа 2026 чтение: 3 мин

Пока Cerebras выходит на биржу со специализированными чипами под аплодисменты инвесторов, парижский стартап Kog идет другим путем: не строить новое железо, а выжимать из существующего максимум с помощью софта. В мае компания показала техническое демо — 3000 токенов в секунду на один запрос на стандартных GPU AMD MI300X и Nvidia H200, тех самых, что уже стоят в дата-центрах корпораций.

Демо попало на первую страницу Hacker News и принесло основателю Гаэлю Делало более 200 предметных обращений от бизнеса. Логика простая: скорость инференса и его цена стали узким горлышком всей AI-индустрии. Даже Anthropic берет отдельную плату за ускоренный режим работы Claude, потому что пользователи готовы платить за то, чтобы не ждать часами ответа от Claude Code. Именно разработчиков софта Kog считает первой волной клиентов, следом идут партнеры, которые дают пользователям генерировать игры и приложения по промпту — там скорость напрямую превращается в выручку.

Есть нюанс: впечатляющие 3000 токенов в секунду были достигнуты не на большой языковой модели, а на компактном Laneformer 2B — всего 2 миллиарда параметров, который Kog уже открыл как опенсорс. Повторить тот же трюк на полноразмерных LLM — задача совсем другого масштаба, и именно здесь скептики сомневаются в подходе стартапа.

Уверенность Делало держится на нестандартном бэкграунде: физика твердого тела в École Polytechnique плюс карьера в наступательной кибербезопасности — белый хакинг с четырьмя финалами турнира DEFCON CTF. Это научило его разбирать системы до ассемблера и бинарного кода, а потом использовать их не по задуманному инженерами сценарию. Команда из 11 человек тратит недели, а то и месяцы на изучение особенностей каждого нового чипа — подход трудоемкий, но именно глубина, а не широта, по мнению Делало, отличает Kog от конкурентов вроде другого французского стартапа ZML, который решает похожую задачу иначе — в обход CUDA от Nvidia.

Ставки высоки: если к сентябрю Kog покажет десятикратное ускорение на крупной модели, компания рассчитывает пойти за раундом Series A. До тех пор все обещания остаются красивой демкой на маленькой модели — но именно такие демки иногда меняют расстановку сил на рынке инференса.

Во что углубиться:

  • Чем отличается инференс от обучения нейросетей: разберешься, почему скорость ответа модели стала отдельным бизнесом
  • IPO Cerebras и его специализированные чипы для инференса: сравнишь подход «железо» против подхода «софт» на конкретных цифрах
  • CUDA от Nvidia и попытки конкурентов обойти эту экосистему: поймешь, почему это узкое место индустрии

Реклама
ЛИДЕРБОРД · 728 × 90зона «Реклама: между секциями»