Anthropic выпустила Claude Opus 5.5 во вторник утром. OpenAI ответила моделями GPT-6 Sol и GPT-6 Luna через минуты, а не через дни. Обе компании по ходу срезали цены. Так календарь релизов превратился в рефлекс, и разбираться в новостях ИИ стало сложнее, чем раньше.
Под этой гонкой сроков спрятан реальный результат, и он не тот, который продаёт каждый из пресс-релизов.
Что показала Anthropic
Opus 5.5 компания называет своей ведущей моделью и самой сильной из всех, что она тестировала. Цена при этом упала: 4 доллара за миллион входных токенов и 20 долларов за выходные - на 20 процентов ниже Opus 5. Чтение из кеша подешевело на 60 процентов, до 0,20 доллара. По типовым задачам Anthropic оценивает общую экономию примерно в 40 процентов.
На своих бенчмарках новая модель обходит Fable 5.1 и Opus 5:
- Terminal-Bench 4.0: 66,4 процента против 55,8 и 52,3.
- CursorBench 4.0: 57,8 процента против 51,8 и 46,6.
- FrontierCode v1.1: 54,4 процента против 50,3 и 48,0.
- GDPval-AA v2.1: 1846 Elo против 1735 и 1708.
Вывод стал быстрее более чем на 30 процентов. Anthropic также заявляет лучшие результаты в истории компании по автоматическому аудиту поведения и меньшую склонность к необратимым действиям. Sonnet 5.5 и Haiku 5.5 обещают в ближайшие недели.
Что успела выпустить OpenAI
Две модели, разделённые по задачам.
GPT-6 Sol берёт сложную работу, код и технические задачи. 2 доллара за вход и 10 за выход за миллион токенов - на 50 процентов ниже уровня 5.6. OpenAI говорит, что ошибок стало примерно вдвое меньше, а надёжность уровня Astra достигается заметно дешевле.
GPT-6 Luna рассчитана на массовую рутинную работу: пересказ документов, извлечение данных, простые вопросы. 0,10 доллара за вход и 0,50 за выход. Это не опечатка.
Снижение цен OpenAI объясняет кешированием и улучшениями инференса, а обе модели называет заметно сильнее продуктов Anthropic Fable и Opus. Sol уже работает в ChatGPT Work, Codex и API. Luna расходится по десктопу и к пользователям Free и Go.
🔥 Главное в двух строках
Anthropic сделала модель лучше, OpenAI сделала её дешевле. Sol на среднем усилии стоит примерно в пять раз меньше, чем Opus 5.5 на среднем усилии. Что выгоднее именно вам, решает не таблица лидеров, а ваш набор задач.
Кто на самом деле выигрывает
Тут пресс-релизы перестают помогать: OpenAI сравнивала свои модели с Opus 5, а не с той, что Anthropic выпустила утром. Если прогнать обе новинки на одном независимом стенде, картина переворачивается.
Стоимость одной задачи по Intelligence Index:
| Усилие | Opus 5.5 | GPT-6 Sol |
|---|---|---|
| Низкое | 0,55 доллара | 0,13 доллара |
| Среднее | 1,34 доллара | 0,25 доллара |
| Высокое | 1,82 доллара | 0,37 доллара |
| Максимум | 5,98 доллара | 1,06 доллара |
Качество, и это та часть, которой в анонсе OpenAI не было: лучший результат Sol - 47,5 балла индекса на максимальном усилии - ниже, чем у Opus 5.5 на обычном среднем режиме с 51,2 балла.
Terminal-Bench 4.0: Opus 5.5 на среднем усилии выдаёт 52,5 процента, Sol на максимуме - 43,9. GDPval-AA: 1576 Elo против 1487. AA-Briefcase: 1642 против 1483. А вот на автоматизации бизнес-процессов они идут вровень - 61,2 против 61,7.
Итог простой: у Anthropic модель сильнее, у OpenAI предложение выгоднее, и заметно. Один нюанс стоит держать в голове: собственный замер Anthropic по Terminal-Bench даёт 66,4 процента, а независимый прогон на среднем усилии - 52,5. Оба числа настоящие, просто они сняты на разных настройках усилия, а эти настройки двигают цифры сильнее, чем кажется.
О чём никто не говорит вслух
14 сентября Дарио Амодеи опубликовал эссе «We Must Pace the Frontier» с призывом к глобальному замедлению разработки ИИ. Он ссылался на потерю контроля над системами, кибератаки и биотерроризм, а рекурсивное самоулучшение предлагал развивать очень осторожно, если вообще развивать.
Сэм Альтман, Демис Хассабис и Илон Маск публично согласились.
Через восемь дней Anthropic выпустила самую мощную модель в своей истории, а OpenAI выкатила две в пределах минут от неё.
Честная защита у Anthropic есть, и компания её озвучивает: Opus 5.5 показала лучшие результаты аудита поведения и специально неохотнее совершает необратимые действия. Замедлять фронтир не значит останавливаться, а безопасная сильная модель как раз и есть цель. Есть и другое чтение, которое предложил венчурный инвестор Дэвид Сакс: просто хороший бизнес - обменять часть мощности на надёжность. Годовая выручка Anthropic перевалила за 100 миллиардов долларов, поднявшись с 65 миллиардов в конце июля, а IPO намечено на ноябрь при оценке около 2 триллионов долларов.
Оба чтения могут быть верными. Но «мы должны замедлить фронтир» и «мы выкатили сильнейшую модель за восемь дней» на этой неделе окажутся в одном абзаце у многих изданий, и аккуратного ответа на это противоречие индустрия пока не дала.
Почему это важно для бизнеса
Интересен сегодня не победитель, а то, что вопрос сменил форму. Два года фронтир был лестницей: одна модель лучшая, вы за неё платите, остальные - компромисс. Теперь две лаборатории выпустили модели с разницей в минуты, обе срезали цены, и честный ответ на вопрос «что использовать» зависит уже от вашей нагрузки, а не от строчки в рейтинге.
Если вы строите агентов для кода или решаете сложные аналитические задачи, Opus 5.5 ощутимо впереди, и вы это почувствуете. Если у вас поток рутинных задач, где важна не гениальность, а аккуратность, Sol за пятую часть цены или Luna за полвека цента за тысячу выходных токенов обойдут премиум, за который вы платите за запас, которого никогда не трогаете.
Практичный ход: перестать выбирать «домашнюю» модель. Прогоните обе на своих примерах, на своих задачах и на тех настройках усилия, которые реально пойдут в продакшен. Эта цифра - единственный бенчмарк, который оплачивает ваш счёт. И держите в поле зрения саму скорость: две фронтир-лаборатории выпустили четыре модели меньше чем за час, через девять дней после того, как их руководители публично согласились, что это должно замедлиться.
Читайте также
- Meta Muse, Grok 4.7 и Xiaomi MiMo: три запуска за один день
- GPT-6 Sol, Opus 5.2 и Grok 5: три новые модели ИИ на подходе
- GPT-7 Bel: утечка о новой модели OpenAI на 10 триллионов параметров
Внедрение искусственного интеллекта начинается не с подписки на самую дорогую модель, а с честного расчёта задач и цен. Если хотите понять, какие модели ИИ окупятся в ваших процессах, приходите на бесплатный AI-аудит AG Branding во Владивостоке - посчитаем на ваших данных.