На этой неделе Alibaba выпустила Qwen 3.8-Max и в рекламных материалах назвала модель второй после Claude Fable 5. Независимый тест VulcanBench пришел почти к противоположному выводу: лучшая настройка усилия поставила модель в середину списка, а настройка по умолчанию - на последнее место. Оба результата реальны. Разница в том, сколько времени и токенов давали модели на задачу: Alibaba давала пять часов на кодинг и до двенадцати на PaperBench, а независимый харнесс - от 45 до 60 минут.
Цена за токен перестала предсказывать счет
В первую неделю после выхода Qwen 3.8-Max все сравнивали только цены, потому что других данных не было. Модель недешевая: DeepSeek-V4-Flash-0731 стоит 14 центов за миллион входных токенов и 28 центов за выходные. Qwen 3.8-Max - 2 и 6 долларов. Kimi K3 - 3 и 15 долларов.
Эти цены говорят меньше, чем раньше, по причине, характерной для рассуждающих моделей: путь к результату стоит токенов мышления. Модель, которая тратит почти весь лимит на рассуждения, может упереться в потолок токенов до того, как напишет ответ. На выходе пустой результат, который не отличить от полного провала, при этом стоит он как полноценный запуск.
Цифры: прогон Intelligence Index на DeepSeek-V4-Flash с максимальным усилием занял 210 млн выходных токенов при медиане класса 100 млн. Claude Opus 5 на самой дешевой настройке решил 20 задач из 23, на высокой - 18. При неограниченном времени высокая настройка только сравнивается с дешевой, но в 3,1 раза дороже.
Нужна метрика, которая считает все, что вы потратили, включая пустые попытки, против задач, которые реально сделаны в заданный бюджет времени и токенов. Это цена за успешную задачу: общие расходы, поделенные на количество задач, прошедших вашу проверку приемки.
Доля провалов - отчасти настройка конфигурации
Запуск, который выдал неверный ответ, и запуск, который уперся в бюджет, это разные события с разными решениями. Почти ни один харнесс их не различает, и почти ни один лидерборд не публикует разбивку. Когда эти случаи разделяют, выясняется, что доминирует именно исчерпание бюджета.
В тесте Long-Horizon-Terminal-Bench, опубликованном в июле, 17 моделей гоняли по 46 задачам с одной попыткой по 90 минут на модель. Таймауты составили 79% нерешенных запусков, 19% - агенты, остановившиеся сами, 3% - ошибки харнесса. Авторы подчеркивают: ушедшие в таймаут запуски были далеки от завершения, средняя награда от 0,10 до 0,35, так что больше времени не гарантировало успех. Вывод другой: бенчмарки измеряют эффективность по времени, даже когда не заявляют об этом.
Самый наглядный пример - тот же VulcanBench. В отчете от 26 июля дешевая настройка Claude Opus 5 оказалась лучшей: 20 решенных задач из 23 против 18 на высокой. Дополнительные рассуждения не были бесполезны: высокая настройка дала меньше всего неверных ответов, один против трех. Она уперлась в таймаут, а таймаут оценивается в ноль. Две из трех регрессий - обрывы на задачах, которые дешевая настройка решает.
Для тех, кто строит лестницу маршрутизации, это прямой удар по стандартной схеме: сначала дешевая попытка, при провале эскалация на более рассуждающую и дорогую ступень. Для заметной доли комбинаций модель-задача это допущение ошибочно: вы платите цену высокой ступени, чтобы упереться в таймаут или потолок.
Кто уже считает цену за успешную задачу
Несколько команд независимо пришли к цене за успешную задачу за последние месяцы. Это самый сильный сигнал, что метрика становится стандартом.
VulcanBench публикует доллары за решенную задачу как заглавную колонку с первых отчетов. Long-Horizon-Terminal-Bench печатает стоимость задачи рядом с точностью: самый показательный ряд у GPT-5.4, около 26 долларов за задачу с заметно меньшим процентом прохождения, чем у Grok 4.5 около 11 долларов. TestEvo-Bench гоняет агентов под лимитом расходов: у Claude Code оценка генерации тестов падает с 71% до 44% при более жестком лимите.
Вендоры уже перешли на эту логику. HubSpot в апреле перевел своего агента Breeze Customer Agent на 50 центов за решенный диалог вместо 1 доллара за обработанный. Zendesk выставляет счета за автоматически решенное обращение. Fin берет 99 центов за результат и выставляет счет только при сквозном решении.
Что поменять на этой неделе
Первое: фиксировать причину провала каждого запуска агента как обязательное поле. Исчерпание бюджета, ошибка проверки и сбой харнесса должны быть разными значениями, а не одним флагом. Пока вы не разделяете таймаут и неверный ответ, ваш процент прохождения измеряет две вещи сразу.
Второе: считать цену за успешную задачу по каждому уровню усилия, а не по модели в целом. Общие расходы с учетом провальных попыток, поделенные на задачи, прошедшие приемку. Рейтинг разойдется с прайс-листом, и самая дешевая настройка может победить.
Третье: ограничивать токены, а не время по часам, если только задержка не входит в ваш SLA. Ограничение по времени оценивает скорость сервера провайдера как качество модели.
Четвертое: проверить настройку усилия по умолчанию на всем, что развернуто. Qwen 3.8-Max без заданного поля effort работает на самом высоком уровне рассуждений, а в независимом тесте именно он показал худший результат. Команда, которая ни разу не трогала этот параметр, платит больше всех за каждую решенную задачу.
Что это значит для бизнеса
Для компаний, которые внедряют AI-агентов в продажи, поддержку и внутренние процессы, главный вывод: прайс-лист провайдера и реальный счет за результат могут расходиться в разы. Прежде чем выбирать модель по рейтингу или цене токена, прогоните свои типовые задачи с разными настройками усилия и посчитайте цену за успешный результат.
Автоматизация с помощью ИИ окупается, когда вы знаете стоимость решенной задачи, а не стоимость миллиона токенов. Для бизнеса во Владивостоке и на Дальнем Востоке это значит: при внедрении искусственного интеллекта закладывайте тестовый период с измерением реальной цены за результат, иначе дорогая рассуждающая модель может съесть экономию от автоматизации бизнес-процессов.
Внедрение искусственного интеллекта стоит начинать с пилота на двух-трех задачах с фиксацией причин провалов. Данные за две недели покажут, какая модель и с какой настройкой решает ваши задачи дешевле всего. Это дешевле, чем верить рекламным таблицам с бенчмарками.