Ночью 2 августа команда Qwen из Alibaba выложила заявление, от которого у индустрии поднялись брови: флагманская модель на 2,4 триллиона параметров обходит GPT-5.6 Sol Max и Fable 5 на бенчмарке агентных действий с компьютером. Компания называет Qwen3.8-Max автономным коллегой, который доводит софтверные проекты до конца за десять дней, а не отвечает на отдельные промпты. Разбираем, что подтверждено цифрами, а что пока только обещания.
Что заявила Alibaba и где это проверить
Qwen3.8-Max построена по архитектуре mixture-of-experts: из 2,4 триллиона параметров при каждом запросе работает только часть. Модель мультимодальная и заточена под длинные задачи: автономную разработку, воспроизведение исследовательских работ, итеративную оптимизацию чипов и планирование с обратной связью по изображениям.
Главная цифра: 86,1 балла на OSWorld-Verified. Это бенчмарк, где агент управляет настоящим рабочим столом: открывает программы, кликает, заполняет формы. Для сравнения, GPT-5.6 Sol Max набрала 83,2, Fable 5 - 85,0, Gemini 3.1 Pro - 76,2. На PaperBench модель тоже лидирует с 93,0.
Ключевые цифры Qwen3.8-Max:
- 86,1 на OSWorld-Verified против 83,2 у GPT-5.6 Sol Max и 85,0 у Fable 5
- 93,0 на PaperBench - лучший опубликованный результат
- Цена: 2 доллара за миллион входных токенов, 6 долларов за выходные
- Открытые веса обещают выпустить на следующей неделе
Почему бенчмарки сместились с тестов на работу
Год назад модели соревновались в рассуждениях и задачках по коду. Теперь акцент другой: сколько часов автономной работы выдерживает система, доводит ли она проект до конца, исправляет ли собственные ошибки. Qwen3.8-Max показывает один из самых сбалансированных профилей: лидирует на одних бенчмарках, остаётся конкурентоспособной на других.
На SWE-Pro (профессиональная разработка) впереди всё ещё OpenAI, Opus 4.8 держит лидерство в ряде инженерных оценок. Но для покупателя важнее другое: модель, которая одинаково уверенно пишет код, читает документы, ходит по интерфейсам и собирает отчёты, чем рекордсмен в одной узкой дисциплине.
Цены: треть стоимости американских флагманов
Qwen3.8-Max стоит 2 доллара за миллион входных токенов и 6 долларов за выходные. Это меньше трети комбинированной цены Claude Opus 5 и меньше четверти цены GPT-5.6 Sol Max. Для агентных систем разница критична: многочасовая автономная работа сжигает миллионы токенов за одну задачу.
Компании, которые запускают сотни агентов одновременно, платят за вывод едва ли не больше, чем за сами модели. Небольшое снижение цены за токен здесь накапливается быстро. Отчасти поэтому OpenAI на прошлой неделе урезала цены на GPT-5.6 Terra и Luna на 20% и 80%.
Открытые веса: главный вопрос без ответа
Alibaba обещает выложить открытые веса Qwen3.8-Max и Qwen3.8-27B на следующей неделе. Если это произойдёт под разрешительной лицензией вроде Apache 2.0, Max-класс Qwen впервые можно будет развернуть у себя. Для компаний, которым нельзя отправлять данные во внешние API, это меняет правила игры.
Но лицензия пока не названа. Недавний пример Moonshot с Kimi K3 показывает, что «открытые веса» могут сопровождаться ограничениями на коммерческое использование и требованиями для тех, кто предлагает модель как сервис. Пока Alibaba не опубликует условия, к обещанию стоит относиться как к заявлению о намерениях.
Кому модель подходит
Три сценария выглядят убедительно. Первый: длинная разработка. Постоянные агенты, которые работают над репозиторием, регрессионными тестами и фичами без перерыва. Второй: компьютерные агенты. Если бенчмарк OSWorld переносится в продакшен, модель умеет автоматизировать процессы, где нет API: легаси-системы, внутренние операции, документооборот. Третий: исследовательская автоматизация. PaperBench-лидерство указывает на сильные стороны в научных вычислениях и воспроизведении экспериментов.
Заменой американским моделям Qwen3.8-Max пока не называют. У GPT-семейства зрелая экосистема и интеграции, у Claude - аккуратная инженерная разработка, у Gemini - глубокая связка с Workspace. Сильная сторона Qwen - автономное исполнение, длинный горизонт планирования и цена без потери качества. Именно это сейчас ищут компании, которые строят AI-агентов для реальных бизнес-процессов.
Что это значит для бизнеса
Для компаний во Владивостоке и на Дальнем Востоке эта новость - ориентир по ценам и возможностям. Автономные агенты, которые работают с документами и интерфейсами часами, перестают быть прерогативой корпораций с бюджетами на десятки тысяч долларов. Модель за 2-6 долларов за миллион токенов делает автоматизацию с помощью ИИ доступнее для среднего бизнеса.
Внедрение искусственного интеллекта в компании обычно начинается с одного процесса: обработка заявок, отчёты, документооборот. Нейросети для бизнеса дают эффект, когда под задачу выбрана модель с подходящим балансом цены и автономности. Начать стоит с бесплатного аудита: разберём, какие процессы вашей компании выиграют от агентной автоматизации, а где хватит простого чат-бота.