Компания Writer опубликовала исследование, которое показывает: можно сократить расходы на AI-агентов на 40% без смены модели. Достаточно оптимизировать слой оркестрации - то, что авторы называют «упряжкой» (harness). Токенов на задачу стало меньше на 38%, стоимость успешной задачи упала на 41%, а качество не изменилось.

Проблема, которую решают авторы, называется «токенмаксинг» (tokenmaxxing). Разработчики кидают в контекст всё больше данных вместо того, чтобы проектировать эффективные пайплайны. Цикл «сгенерировал - запустил - упал - засунул ошибку обратно в контекст - повторил» стал стандартом де-факто.

Ваш счёт - это токены на задачу умножить на цену токена. Большинство команд смотрят только на второе число. В агентных нагрузках токены на задачу растут быстрее, чем падают цены. Снижение цены - анестезия. Оно маскирует то, что сам цикл истекает кровью.

Васим Аль-Шейх, CTO и сооснователь Writer, объясняет это просто: «Команды токенмакс-ят, потому что это самое дешёвое решение здесь и сейчас. И потому что так работает большинство инженеров».

Ключевые цифры:

  • Токенов на задачу: -38% (с 14,2K до 8,8K)
  • Стоимость задачи: -41% (с 21 до 12 центов)
  • Успешность: 78% -> 81% (качество не упало)
  • Задержка: -44% (с 48 до 27 секунд)
  • 6 моделей, 22 корпоративные задачи в эксперименте

Что такое «упряжка» и почему она важнее модели

Harness - это слой оркестрации, который превращает API модели в работающую систему. Исторически разработчики относились к нему как к одноразовому клею: соединил API с интерфейсом - и хватит. Writer говорит: это primary software artifact, который требует собственного тестирования, версионирования и дизайна.

В эксперименте сравнивали обычный продакшен-цикл агента с оптимизированным Writer Agent Harness на шести моделях: Claude Sonnet 4.6, Gemini 3.1, Gemini Flash 3.5, Qwen 3.6, GLM 5.1 и собственной Palmyra X6. 22 задачи - от поиска и извлечения данных до многошаговых воркфлоу и генерации контента.

Что конкретно можно сделать: рецепты для инженеров

Исследователи дают три практических приёма, которые работают без дообучения модели.

Двухзонный промпт. Современные API поддерживают кеширование промптов, но разработчики должны правильно структурировать нагрузку. Статическая часть (правила, схемы инструментов, стандартные процедуры) - в начало промпта. Динамическая (конкретный запрос, состояние задачи) - в конец. Эта простая перестановка заставляет кеширование работать и останавливает повторную оплату одних и тех же инструкций на каждом из тридцати шагов агента.

Выгрузка контекста. Вместо того чтобы складывать всю историю в монолитный промпт до упора в окно контекста, выносите историю и промежуточные артефакты во внешнее хранилище. Возвращайте только то, что нужно текущему шагу. Если можно - делегируйте задачу узкоспециализированному суб-агенту.

Жёсткие бюджетные ограничения. Никогда не просите модель контролировать собственные расходы. «Забор должен стоять ниже модели, в коде, на вашей стороне API», - говорит Аль-Шейх. Три правила: твёрдый бюджет токенов на задачу, ограничение шагов и вызовов инструментов, контроль расходов после первой неудачной валидации.

Что не работает

Мульти-агентная оркестрация оказалась ненадёжной на лёгких моделях. Gemini Flash 3.5 и Qwen 3.6 показали неприемлемо низкую точность на задачах делегирования (0.45 и 0.42). Порог применимости пересекли только две модели - собственная Palmyra X6 (0.86) и Claude Sonnet 4.6 (0.85).

Если модель слишком мала, структурные надстройки только мешают: модель тратит ограниченную ёмкость на разбор каркаса вместо выполнения задачи. Правило простое: «Если фича добавляет больше координационных токенов, чем убирает рабочих - удалите её», - говорит Аль-Шейх. «Ничто в упряжке не бесплатно».

Что это значит для бизнеса

Для компаний во Владивостоке и на Дальнем Востоке, которые внедряют AI-агентов или автоматизируют бизнес-процессы, главный вывод: не обязательно менять модель, чтобы сократить расходы. Оптимизация слоя оркестрации даёт 40% экономии без потери качества.

Внедрение искусственного интеллекта перестаёт быть вопросом «какую модель выбрать». Когда автоматизация с помощью AI упирается в бюджет на токены, правильная архитектура упряжки важнее мощности модели. AG Branding помогает компаниям во Владивостоке проектировать эффективные AI-решения с самого начала - чтобы не переплачивать за токенмаксинг.