Счета за токены выросли настолько, что клиенты начали в открытую жаловаться крупным лабораториям. Writer, компания, делающая AI-инструменты для маркетологов, отвечает не громкой моделью, а скучной на первый взгляд оптимизацией инфраструктуры — и обещает снизить расходы клиентов на базовые задачи вдвое.
Новая флагманская модель компании, Palmyra X6, построена поверх открытой GLM-5.2 от Z.ai — сама по себе она не революция. Куда важнее апгрейд «harness» — инфраструктурной обвязки, которая управляет тем, как модель выполняет многошаговые задачи. Собственное исследование Writer показало: изменения в этой обвязке снижают затраты сильнее и надёжнее, чем смена модели — в среднем на 40% в их тестах. Логика простая: harness работает поверх любой модели, которую компания использует сейчас или будет использовать в будущем, поэтому эффект от его оптимизации умножается на каждый следующий апгрейд модели.
CEO Writer Мэй Хабиб формулирует настроение рынка жёстко: предприятия устали гнаться за очередным бенчмарком, они хотят предсказуемых, а лучше падающих расходов — и, по её словам, крупные лаборатории пока не умеют это дать, потому что финансово заинтересованы в росте потребления токенов. Отсюда, добавляет она, растущее недоверие CIO к большим AI-лабораториям в целом.
Palmyra X6 останется модель-агностичной частью экосистемы Writer — она будет соседствовать с другими моделями компании и внешними моделями через Azure или Amazon Bedrock. История здесь не про то, чья модель умнее, а про то, что рынок наконец готов платить за экономику, а не за очередной процент в бенчмарке.
Во что углубиться:
- Что такое agentic harness: как инфраструктурная обвязка влияет на стоимость и скорость работы AI-агентов
- Open source модели вроде GLM: почему компании берут их за основу вместо разработки с нуля
- Экономика токенов: как формируется цена на использование больших языковых моделей
