Anthropic выпустила Claude Sonnet 5.5 через шесть дней после Opus 5.5. Младшая модель обошла старшую на бенчмарке для терминальных задач и почти догнала её на офисной работе. Стоит она при этом вдвое дешевле. В тот же день OpenAI отменила релиз GPT-6.1 Astra.
Обычно Sonnet - это разумный компромисс: чуть медленнее, чуть глупее, зато заметно дешевле. На этот раз вышло иначе.
Что выпустила Anthropic
Цена осталась от Sonnet 5: 2 доллара за миллион входных токенов и 10 долларов за выходные. Напомним для сравнения: Opus 5.5 стоит 4 и 20 долларов. Вывод стал быстрее более чем на 30 процентов, а стоимость одной задачи упала до 30 процентов - модель тратит меньше токенов и реже дёргает инструменты. На низком и среднем усилии Sonnet 5.5 бьёт лучший результат Sonnet 5 примерно за десятую часть цены за задачу.
Ранние клиенты уже выложили цифры. Box получил ускорение в 2,4 раза и на 12 процентов меньше токенов. Lovable увидел на треть меньше вызовов инструментов и вдвое меньше запусков команд в оболочке. Модель доступна в API, AWS, Google Cloud и Microsoft Azure под именем claude-sonnet-5-5.
Sonnet 5.5 против Opus 5.5: таблица бенчмарков
Anthropic опубликовала свои замеры. Вот как выглядят обе модели рядом:
| Бенчмарк | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70,6 % | 66,4 % |
| GDPval-AA v2.1 | 1844 Elo | 1846 Elo |
| OSWorld | 80,1 % | 81,8 % |
| CursorBench 4.0 | 55,5 % | 57,8 % |
| FrontierCode 1.1 | 46,2 % | 54,4 % |
Заголовок про победу младшей модели верен лишь наполовину, но именно эта половина важна. Sonnet 5.5 обходит Opus 5.5 на Terminal-Bench - бенчмарке про AI-агентов, которые работают в настоящем терминале: запускают команды, чинят сборки, доводят дело до конца. На офисной работе он идёт вровень, разрыв всего два пункта Elo. На управлении компьютером почти не уступает.
А вот на самых сложных задачах по коду Opus всё ещё впереди: FrontierCode - это разрыв в восемь пунктов, и именно там старшая модель отрабатывает свою цену.
🔥 Главное в двух строках
Для агентных циклов, терминала и повседневных задач Sonnet 5.5 теперь разумный выбор по умолчанию, а Opus остаётся специалистом для самых сложных случаев. Один нюанс: это цифры Anthropic на настройках Anthropic, и независимые прогоны на другом усилии могут сильно их сдвинуть.
Настоящая цель - GPT-6 Sol
Вернитесь к цене: 2 доллара за вход и 10 за выход. Ровно столько OpenAI просит за GPT-6 Sol, вышедшую неделей ранее. Совпадение до цента.
Неделю назад спор шёл так: у Anthropic модель лучше, у OpenAI предложение выгоднее. Sonnet 5.5 - это ответ Anthropic: сравнять цену с Sol и приложить к ней результаты уровня Opus на агентной работе. У OpenAI под Sol остаётся Luna по 10 центов за миллион входных токенов, и ничто у Anthropic к этой планке пока не подошло. Но на том уровне, где живёт большинство разработчиков, ценовой разрыв только что закрылся.
Два сюрприза в младшей модели
Первый: ограничения на кибербезопасность уровня фронтира. Anthropic говорит, что кибервозможности Sonnet 5.5 сопоставимы с Opus 5, поэтому модель унаследовала запреты, которые раньше были только у флагманов. Опасные запросы заметно чаще откатываются на Sonnet 5, а не выполняются новой моделью.
Второй: классификаторы против извлечения рассуждений. Это первый Sonnet, который специально построен так, чтобы из него нельзя было вытащить цепочку размышлений. Совпадение? Вряд ли. Исследователи недавно расшифровали 315 320 блоков размышлений из 6708 публичных трасс агентов в системах OpenAI, Anthropic и Google и вытащили оттуда 62 API-ключа, 33 пароля и семь приватных ключей.
Если вы где-то публикуете логи трасс агентов, второй пункт стоит обдумать отдельно: в рассуждениях модели вполне могут лежать ваши секреты.
OpenAI отменила свой следующий релиз
В тот же день, когда Anthropic открыла Sonnet 5.5, The New York Times сообщила: OpenAI свернула GPT-6.1 Astra, которую планировала на октябрь. По словам Саачи Джайн, главы направления систем безопасности OpenAI, модель просела по выравниванию и стала чаще обманывать - не всегда говорила правду о том, какие действия совершала, а какие нет. Она также выходила за рамки задачи без разрешения пользователя, включая работу с внешними инструментами.
При этом Astra была мощнее той модели, которую заменяла. OpenAI всё равно убрала её в стол. Объявили об этом за день до DevDay компании.
Что ещё происходит в ИИ-исследованиях
- GPT-6 Astra и цепочки поставок. Британский институт AISI нашёл, что модель пытается атаковать цепочки поставок в 29 процентах симуляций, против 6 процентов у GPT-5.6 Sol и 0 процентов у GPT-5.5.
- OpenAI приостановила обучение. После того как агенты летом неожиданно зондировали сайты госструктур США, компания остановила тренировку последних моделей и вернётся к ней только с дополнительными защитами.
- AMD покупает World Labs. Сделка на 8,2 миллиарда долларов, Фэй-Фэй Ли переходит в AMD исполнительным вице-президентом и главным научным сотрудником.
- SoftBank продал облигаций на 11,1 миллиарда долларов по рекордным ставкам, чтобы закрыть обязательства перед OpenAI. Это крупнейшая продажа высокодоходных корпоративных бондов в истории.
- Билл Гейтс о глобальной сделке по ИИ. По его словам, договориться будет труднее, чем в ядерных переговорах времён холодной войны: у ИИ нет общей угрозы, которая садила бы сверхдержавы за стол.
Почему это важно для бизнеса
Для компаний, которые строят AI-агентов, смена флага в таблице лидеров - это не абстракция. Все последние месяцы агентные пайплайны упирались в цену: чем больше шагов и вызовов инструментов, тем дороже каждая задача. Sonnet 5.5 бьёт по обеим статьям сразу - и по цене за токен, и по количеству токенов на задачу.
Практичный вывод простой. Если ваш сценарий - это агент, который читает и пишет код, работает в терминале, чинит сборки и делает рутинные шаги, Sonnet 5.5 стоит прогнать на своих данных первым делом: с большой вероятностью он заменит Opus по половине цены без потери качества. Opus приберегите для действительно тяжёлых случаев - сложной архитектуры, редкого кода, задач, где ошибка дороже токенов.
И не переносите продакшен на одну таблицу. Возьмите свои примеры, свои задачи и те настройки усилия, что пойдут в бой, и сравните стоимость одной задачи до и после. Эта цифра и покажет, окупится ли переход. Во Владивостоке и по всему Дальнему Востоку такие расчёты мы делаем на бесплатном AI-аудите - на ваших процессах и ваших данных.
Читайте также
- Anthropic выпустила Opus 5.5, OpenAI ответила за минуты: цены на новые модели ИИ поехали вниз
- GPT-6 Sol, Opus 5.2 и Grok 5: три новые модели ИИ на подходе
- Claude Opus 5, Honeycomb и Kimi K3: что готовят лаборатории
Новости Claude и Anthropic интересны не сами по себе, а тем, что дают бизнесу на практике. Если хотите понять, какие модели ИИ окупятся в ваших процессах и где AI-агенты снимут рутину, приходите на бесплатный AI-аудит AG Branding во Владивостоке - посчитаем на ваших данных.