Anthropic выпустила Claude Sonnet 5.5 через шесть дней после флагманской Opus 5.5. Младшая модель обошла старшую на бенчмарке для терминальных задач, почти догнала её на офисной работе и обошлась вдвое дешевле. В тот же день OpenAI отменила релиз GPT-6.1 Astra и выкатила Sol по цене в пятую часть от Astra. Два события за одну неделю показали одно и то же: за топовой моделью больше не нужно гнаться.

Раньше логика была простой. Есть флагман, есть середняк, есть дешёвый вариант. Берёшь флагман, если задача сложная, и терпишь счёт. Теперь эта лестница поехала: середняк подтянулся к вершине по качеству и остался внизу по цене. Для компаний во Владивостоке и на Дальнем Востоке, которые считают каждый рубль на ИИ, это меняет расчёт бюджета.

Что случилось с ценами

Claude Sonnet 5.5 сохранила цену предыдущей версии: 2 доллара за миллион входных токенов и 10 долларов за выходные. Для сравнения, Opus 5.5 стоит 4 и 20 долларов. Вывод стал быстрее более чем на 30 процентов, а стоимость одной задачи упала до 30 процентов от прежней: модель тратит меньше токенов и реже дёргает инструменты. На низком и среднем усилии Sonnet 5.5 бьёт лучший результат Sonnet 5 за десятую часть цены за задачу.

Цифры недели
  • Sonnet 5.5: 2 и 10 долларов за миллион токенов против 4 и 20 у Opus 5.5
  • Box получил ускорение в 2,4 раза и на 12 процентов меньше токенов
  • Lovable увидел на треть меньше вызовов инструментов и вдвое меньше запусков команд
  • GPT-6.1 Sol стоит в пятую часть от цены Astra

Ранние клиенты уже выложили замеры. Box зафиксировал ускорение в 2,4 раза и на 12 процентов меньше токенов. Lovable увидел на треть меньше вызовов инструментов и вдвое меньше запусков команд в оболочке. Это не маркетинговые обещания, а данные компаний, которые гоняли модель на своих задачах.

Агенты, которые работают без команды

В тот же день OpenAI представила Dots: агентов, которые работают в фоне без запроса. Вы не пишете промпт и не ждёте ответа, агент сам понимает, что нужно сделать, и действует через ChatGPT, Slack и Teams. Первый Dot входит в тарифы Pro и Business Premium без доплат. Параллельно перестроился Codex в облаке и появился план Pro 500.

Здесь и сходятся две новости. Проактивный агент работает постоянно и жжёт токены в фоне, даже без вашей команды. Если такой агент крутится на флагманской модели, счёт растёт незаметно: вы его не запускали, а он всё считал. Дешёвая модель с сопоставимым качеством превращает фоновых агентов из роскоши в рабочий инструмент.

Что это даёт бизнесу

Разница между «модель на все случаи» и «модель под задачу» теперь стоит реальных денег. Компания, которая держит на флагмане разбор тикетов, ответы в чате и сортировку заявок, платит в два раза больше за тот же результат. По нашим наблюдениям, в типовом процессе внедрения ИИ 70-80 процентов вызовов приходится на повторяющиеся задачи: классификация, извлечение данных, черновики текстов. Именно там младшие модели 2026 года работают наравне с топовыми.

Маршрутизация задач между ИИ-моделями по стоимости и сложности
Маршрутизация задач: сложное на флагман, рутинное на младшую модель

Практический вывод простой: не выбирайте одну модель на весь бизнес. Разделите задачи по сложности и разведите их по моделям. Флагман оставьте для того, где цена ошибки высокая: сложный анализ, юридические тексты, архитектурные решения. Рутину отдайте младшим моделям. Экономия на типовом процессе доходит до половины бюджета, а качество остаётся тем же, потому что задачи там ниже порога, где модели расходятся.

Есть и второй слой. Когда модель дешевеет, становится выгодно делать то, что раньше не считали: анализировать каждый звонок клиента, а не каждый десятый, проверять каждую заявку, а не случайную выборку. Раньше это упиралось в счёт за токены, теперь упирается только в вашу фантазию процесса.

Что это значит для бизнеса

Гонка за топовой моделью закончилась. Дальше выигрывают те, кто умеет считать стоимость одной задачи и подбирать модель под неё. Это работа с архитектурой, а не покупка подписки.

  • Посчитайте стоимость задачи, а не токена. Модель с дешёвыми токенами может делать больше вызовов и жрать больше контекста. Смотрите на итоговый счёт за одну операцию.
  • Разведите процессы по уровням. Заведите правило: рутина на младшую модель, сложное на флагман. Один раз настроили, дальше экономия идёт сама.
  • Проверьте фоновые агенты. Проактивные агенты OpenAI и подобные работают без запроса. Убедитесь, что они крутятся на подходящей по цене модели.

Внедрение искусственного интеллекта перестало быть вопросом «какую модель взять». Теперь это вопрос «как связать несколько моделей в один процесс и не переплатить». Мы в AG Branding разбираем процессы клиентов и подбираем модель под каждую задачу: от аудита текущих сценариев до автоматизации с помощью ИИ. Начните с бесплатного AI-аудита: за один разбор видно, где вы платите за флагман там, где хватит младшей модели.

Читайте также