24 июля Anthropic выпустила Claude Opus 5 - модель, которая даёт почти всю мощность флагманского Fable 5, но стоит вдвое дешевле. 5 долларов за миллион входных токенов и 25 долларов за миллион выходных - цены те же, что у Opus 4.8. Но производительность по ключевым бенчмаркам выросла вдвое. Компания делает ставку на то, что бизнесу нужна не самая умная модель, а самая эффективная за свои деньги.
Представитель Anthropic описал новую стратификацию моделей так: «Opus 5 - ваш ежедневный водитель, модель, которой вы отдаёте сложную работу и проверяете, когда она готова. Fable 5 - для самых амбициозных проектов, которые раньше никто не брал. Sonnet 5 - для работы в масштабе, где скорость и цена на запрос решают, что запускать. Haiku 4.5 - для под-агентов и мгновенных ответов».
Бенчмарки: Opus 5 бьёт Fable 5 на конкретных задачах - и стоит в два раза меньше
Цифры впечатляют. На Frontier-Bench v0.1 - агентном тесте терминального кодинга - Opus 5 набрал 43,3%. Это больше чем вдвое выше Opus 4.8 (18,7%) и заметно выше Fable 5 (33,7%). И всё это при более низкой стоимости за задачу. На ARC-AGI 3 - тесте решения новых задач - модель показала втрое лучший результат, чем любая другая. На OSWorld 2.0 (компьютерные задачи) Opus 5 обходит лучший результат Fable 5, тратя чуть больше трети его стоимости.
Ключевой факт: Opus 5 на Frontier-Bench набирает 43,3% против 33,7% у Fable 5 - и при этом дешевле. Это меняет экономику внедрения AI-агентов. Задачи, которые раньше требовали самого дорогого API, теперь решаются за вдвое меньшие деньги.
Anthropic честно признаёт ограничения. Opus 5 уступает Mythos 5 на задачах кибербезопасности и биологии. Одна из моделей семейства OpenAI всё ещё лидирует на одном из агентных бенчмарков. На вопрос, где Opus 5 проигрывает Fable 5, представитель компании ответил: «Тесты, которые выигрывает Opus 5 - это ограниченные задачи с конкретным результатом. Они не измеряют длительность. Opus 5 - лучший инструмент для работы, которую видят бенчмарки. Fable 5 - для задач, которые бенчмарки не видят».
Экономика токенов: почему бизнесу выгоднее платить за Opus 5, а не за Fable 5
У модели есть регулируемая настройка «effort» - клиент может сам выбирать между интеллектом ответа и скоростью с экономией токенов. Ранние пользователи подтверждают: это работает.
Harvey, AI-платформа для юристов, заявила, что Opus 5 показал производительность на уровне режима максимального мышления Opus 4.8, «генерируя в среднем на 26% меньше токенов». По словам Ричарда Фама из Fundamental Research Lab, на сложных задачах финансового моделирования точность выросла на 9 процентных пунктов при «на треть меньшем числе шагов и вызовов инструментов и на 60% меньшем времени».
Генеральный директор Zapier Уэйд Фостер сказал, что Opus 5 возглавил рейтинг AutomationBench его компании, выполнив полный сценарий предотвращения оттока клиентов от начала до конца. «Предыдущие модели не проходили. Opus 5 прошёл на 100%», - написал он. Скотт Ву из Cognition (создатели Devin) отметил, что на FrontierCode 1.1 «Claude Opus 5 приближается к уровню Fable при вдвое меньшей стоимости» с особым преимуществом в отладке и анализе первопричин.
Самопроверяющиеся агенты: скрытое преимущество новой модели
Главное в Opus 5 - то, как модель ведет себя в работе. Anthropic рассказала несколько показательных тестовых кейсов.
В одном задании Frontier-Bench модель попросили восстановить деталь станка как 3D-CAD-модель по чертежу, который ей намеренно не дали возможности увидеть. Вместо того чтобы сдаться, Opus 5 сам написал пайплайн компьютерного зрения, чтобы извлечь геометрию из сырых пикселей - и сделал это не один раз. Ни одна конкурирующая модель не решила задачу за пять попыток.
В другом случае, получив реальный баг в популярном open-source менеджере пакетов, модель нашла первопричину и исправила краевой случай, который пропустило сообщество. Конкурирующая модель залатала симптом и доложила об успехе.
Инженер Stripe Кристиан Ривера сказал, что дал модели «роль руководителя над моими средами разработки» на выходные: «Она сама построила мониторинг, вела каждый бокс и привлекала меня только для принятия решений».
Разрыв между моделью, которая выдаёт правдоподобный ответ, и моделью, которая проверяет свой ответ - это разница между демо и рабочей системой. Большая часть скрытых затрат enterprise AI сегодня - это проверка работы инженерами. Модель, которая надёжно проверяет свою работу, сжимает эти затраты. Клиенты упоминают не высокие баллы, а меньше шагов, меньше проходов и меньше времени.
Безопасность и стратегия: антропный подход к рискам
Anthropic сознательно не обучала Opus 5 на кибер-задачах - как и Opus 4.8. Модель всё равно улучшилась в этой области за счёт общего роста способностей. Но разрыв между обнаружением уязвимостей (79,4% - почти как Mythos 5 с 80%) и их эксплуатацией (всего 4 успешных эксплойта против 13 у Mythos 5) - это осознанный дизайн.
Компания заявляет, что классификаторы безопасности Opus 5 будут срабатывать на 85% реже, чем у Fable 5. Когда классификатор всё же срабатывает, запрос падает на Opus 4.8. Логика: риск - это свойство вопроса, умноженное на способность системы отвечать на него.
По биологии ситуация обратная: Opus 5 - самая способная общедоступная модель Anthropic для научных исследований, набрав на 10,2 процентных пункта выше Opus 4.8 на внутреннем тесте химии.
Бизнес-контекст: оценка 380 млрд долларов и ставка на массовое внедрение
Запуск происходит в момент, когда Anthropic оценивается в 380 млрд долларов. По данным Contrary Research, годовая выручка компании выросла с 1 млрд долларов в конце 2024 до прогнозируемых 9 млрд в 2025, с внутренними целями на 2026 год до 26 млрд долларов. Эти цели подкреплены контрактами на 30 млрд долларов с Azure, а также соглашениями с Google Cloud и Nvidia.
Удержание цены Opus 5 на уровне Opus 4.8 при удвоении производительности по ключевым агентным бенчмаркам - это фактически резкое снижение цены за единицу способности. Каждая задача, которая была на грани окупаемости при стоимости Opus 4.8, становится выгодной на Opus 5. А каждая выгодная задача - это регулярный токеновый доход.
Также 24 июля Anthropic запустила Fast-режим (в 2,5 раза быстрее при удвоенной цене), автоматическую маршрутизацию fallback на API и изменение инструментов в середине разговора без инвалидации кеша промптов - небольшая, но важная деталь для разработчиков агентов. Модель доступна как claude-opus-5 на Claude API.
Что это значит для бизнеса
Claude Opus 5 меняет экономику внедрения искусственного интеллекта. Задачи, которые раньше оправдывали только самые дорогие модели, теперь решаются вдвое дешевле. Для компаний во Владивостоке и на Дальнем Востоке это снижает порог входа: нейросети для бизнеса становятся доступнее, а возврат на инвестиции - быстрее.
Главный вопрос теперь не «какая модель самая умная», а «какая модель даёт нужный результат за свои деньги». Opus 5 - ответ Anthropic на этот вопрос. Если ваша компания тестировала Claude для автоматизации, но считала Fable 5 дорогим - сейчас время пересчитать. Opus 5 даёт почти тот же уровень за вдвое меньший чек.
Два вопроса определят, окупится ли ставка: подтвердятся ли заявления об эффективности на реальных производственных нагрузках, и примут ли компании мир, где классификаторы безопасности, а не пользователи иногда решают, какая модель отвечает. Но глубинная мысль запуска ясна: центр тяжести AI-индустрии сместился. Три года лаборатории соревновались в том, что может сделать их лучшая модель в лучший день. Anthropic конкурирует на менее гламурном и гораздо более прибыльном поле: что может делать хорошая модель каждый день за половину цены.