13 августа Writer, платформа для корпоративных AI-агентов, клиентами которой числятся Accenture, Uber и Vanguard, выпустила флагманскую модель Palmyra X6 вместе с пересобранным каркасом оркестрации агентов и инструментами контроля расходов. Цифры из заголовка: агентный продукт стал дешевле в среднем на 52%, быстрее на 48%, качество выросло на 10%. Но интереснее, как компания к этому пришла и что её выбор говорит о рынке корпоративного AI.

Модель на базе GLM-5.2: пост-трейн вместо обучения с нуля

Palmyra X6 не обучали с нуля. Это пост-обученная версия GLM-5.2, открытой mixture-of-experts модели от пекинской Z.ai (бывшая Zhipu AI). Writer открыто пишет об этом в техническом отчёте и тем самым оказывается в центре одного из самых острых споров отрасли: стоит ли американским предприятиям строить на китайских открытых основаниях.

«Эта модель никоим образом не связана с её первоначальными разработчиками. Она полностью работает на нашей инфраструктуре в США» - Матан-Пол Шетрит, директор по управлению продуктом Writer.

Дэн Бикел, глава AI-исследований Writer, выразился короче: «Это очень даже модель Palmyra, мы взяли числа с плавающей точкой как отправную точку и обучаем оттуда».

Palmyra X6 - это модель на 744 млрд параметров с 40 млрд активных на токен, архитектура GLM-5.2 без изменений. Вклад Writer - консервативный рецепт пост-обучения: метод anchored supervised fine-tuning (ASFT) на крошечном корпусе из всего 626 отобранных синтетических агентных траекторий, одна эпоха обучения, низкая скорость обучения.

Маленький датасет - это идея, а не ограничение. ASFT сочетает взвешивание токенов с «якорем» на основе KL-дивергенции, который штрафует модель за слишком сильное отклонение от замороженной копии базовой модели. Так новые навыки работы с инструментами не разрушают общие способности базы. Вместо стандартного оптимизатора Adam Writer использовала Muon, который трактует матрицы весов как геометрические объекты. Все обучающие данные синтетические: планы, вызовы инструментов и ответы сгенерированы моделями-учителями и прошли структурные фильтры, модельный верификатор и панель из двух LLM-судей.

Почему AI-агенты раздувают бюджеты, а чат-боты нет

Релиз Writer приходится на момент, когда экономика агентного AI вышла в центр корпоративных закупок. Чат-бот выдаёт один ответ на запрос. Агент превращает один запрос в повторяющиеся циклы планирования, поиска, вызовов инструментов, проверок и повторов, каждый из которых ест токены. Пользователь видит один ответ, счёт приходит за весь цикл.

Масштаб проблемы понятен из прогноза Goldman Sachs: потребление токенов вырастет в 24 раза с 2026 по 2030 год и достигнет 120 квадриллионов токенов в месяц. Рост дадут не люди с вопросами, а постоянно работающие корпоративные агенты. При этом падение цены за токен не гарантирует падения счетов: если агентная задача тратит в 20 раз больше токенов, а цены падают на 75%, итоговый счёт всё равно растёт в пять раз.

«Предприятие хочет, чтобы потребление токенов росло: это значит, что внедрение идёт. Но им нужно, чтобы расходы выравнивались» - Васем Альших, сооснователь и CTO Writer.

Шетрит назвал стоимость главным барьером внедрения корпоративного AI, более важным, чем возможности моделей: «Самый большой барьер для расширения использования AI на предприятии в большинстве случаев не возможности модели, а стоимость вокруг них. Реальность такова, что альтернатива AI чаще всего не другой AI, а человеческий труд».

На вопрос, не съедает ли снижение потребления токенов собственную выручку Writer, Шетрит ответил отказом от посылки: «Снижение стоимости не вредит моей прибыли. Оно её расширяет, потому что расширяет объём возможностей внутри организации». Дешёвые задачи открывают процессы, которые компании раньше не автоматизировали бы. Это знакомый по облачной эре паттерн: цены падали десятилетие, а счета росли вместе с потреблением.

Цифры и цена

На внутренних оценках Writer - девять способностей от работы с контекстом и инструментами до делегирования субагентам и голоса бренда - X6 набрала в среднем 0,87 из 1,00. У Claude Opus 4.8 - 0,86, у Claude Sonnet 4.6 - 0,85, у GPT-5.5 - 0,80, у Gemini 3.1 - 0,77. Цена - главный дифференциатор: Writer продаёт X6 по 2 доллара за миллион входных токенов и 8 долларов за миллион выходных против 15 и 75 долларов у Opus 4.8. Среднее время выполнения задачи - 26 секунд, модель может работать без присмотра до восьми часов к одной цели.

Цифры: Palmyra X6 - 744 млрд параметров, ~40 млрд активных. Цена 2/8 долларов за миллион токенов против 15/75 у Opus 4.8. Средняя оценка 0,87 против 0,86 у Opus 4.8. Обучение на 626 синтетических траекториях. Агенты дешевле на 52%, быстрее на 48%.

Writer честна, что внутренние бенчмарки вызывают вопросы: компания оценивает собственную работу. Бикел сказал, что технический отчёт описывает и протокол публичных бенчмарков, и внутренние оценки: «Мы делаем публичные бенчмарки, чтобы знать, что карабкаемся на правильный холм и у нас нет огромных разрывов, но мы не следуем им рабски, потому что это не служит нашим клиентам».

Выбор базовой модели два года назад был бы немыслим для американского корпоративного вендора. Сегодня это рыночная реальность: GLM-5.2, выпущенная в июне под MIT, считается одной из самых способных открытых моделей в мире. Artificial Analysis ставит ей 51 балл в индексе интеллекта, а цена кратно ниже флагманских API США. Writer называет её «самой сильной доступной open-weight моделью».

Открытые веса: возможности и риски

У открытого веса есть и издержки. Августовский отчёт SaferAI показал, что GLM-5.2 через публичный API Z.ai не отказала ни в одной из offensive-задач по кибербезопасности и биологии, а Z.ai не опубликовала фреймворк безопасности или предрелизную оценку рисков. Разрыв расширяется, когда веса может скачать и модифицировать кто угодно.

Ответ Writer: происхождение и пост-обучение важнее источника. Компания взяла веса с американского Hugging Face, обучала на инфраструктуре в США, все данные синтезированы и хранились в США. Writer провела предрегистрированную оценку рисков модели: 19 674 оценённых ответа, слепые судьи, сравнение с GLM-5.2 и четырьмя фронтирными моделями. На тесте ModelSlant от Washington Post X6 в 80% случаев представляла обе стороны спорных вопросов, самый высокий показатель среди протестированных. На adversarial-бенчмарке FORTRESS модель с системным сообщением набрала на 8,6 балла больше по безопасности, чем сырая GLM-5.2, почти без потери полезности.

Отчёт честно оговаривается в одном месте: если в англоязычном поведении нет статистически значимой политической асимметрии, «поведение различается по языкам». 626 траекторий дообучения не вычищают все следы обучения базовой модели.

Каркас важнее модели: эффект Harness

Самый стратегически интересный пункт релиза не про Palmyra X6. Writer говорит, что пересобранный каркас Writer Agent - слой оркестрации, который планирует задачи, батчит работу, делегирует субагентам и управляет контекстом, - режет расходы на 41% и ускоряет задачи на 44% на всех протестированных моделях, включая сторонние от Anthropic и OpenAI. Вывод опубликован в исследовательской работе «The Harness Effect».

VentureBeat задал прямой вопрос: если каркас даёт основную экономию на любой модели, зачем вообще строить свою модель? Ответ Шетрита - про контроль: «Я не могу контролировать, если лаборатория выводит из эксплуатации свою модель. Я не могу контролировать, какие данные они используют. А когда я строю модель, у меня есть значительный моральный контроль, и я могу ответить на жёсткие вопросы корпоративных клиентов». Бикел добавил, что модель и каркас развивались вместе, и это невозможно, если не строишь собственную модель.

При этом Writer одновременно страхуется: платформа Writer Agent теперь поддерживает модели Anthropic, OpenAI и облачных провайдеров, включая Azure, AWS Bedrock и Nvidia NIM, даже генераторы изображений. Послание CIO короткое: используйте нашу модель, она самая дешёвая и лучшая для ваших процессов, но платформа экономит деньги в любом случае.

Третья часть релиза - контроль расходов: админы получают централизованный обзор использования агентов по бизнесу, аналитику по автоматизациям Playbooks и Skills, алерты и лимиты трат. Раньше никто в C-suite не знал, сколько тратят агенты. Шетрит назвал это не разбором сюрпризов со счетами, а инструментом расширения: видимость позволяет руководителям сказать «да» новым сценариям AI.

Что это значит для бизнеса

Релиз Writer - сигнал о том, куда движется рынок. Хорошо капитализированная американская AI-компания с пятилетним опытом строительства моделей пришла к выводу, что ценность больше не в претрейне, а в последней миле: пост-обучение открытых весов, инженерия каркаса вокруг них и панель расходов для финансового директора.

Для бизнеса во Владивостоке и на Дальнем Востоке практический вывод в том, что внедрение искусственного интеллекта всё чаще начинается с экономики, а не с бенчмарков. Ии агенты для бизнеса окупаются, когда компания считает стоимость завершённой задачи: повторы, вызовы инструментов, эскалации. Нейросети для бизнеса на открытых весах становятся доступнее, а автоматизация бизнес-процессов перестаёт требовать бюджета уровня фронтирных лабораторий. Разобрать, где агенты окупятся в вашей компании, поможет бесплатный аудит.