В пятницу Alibaba выложила на Hugging Face модель Qwen3.8-27B: 27 млрд параметров, лицензия Apache 2.0, в сжатой версии около 17 ГБ. К понедельнику независимые тесты показали, что файл такого размера догоняет GPT-5.6 Luna и обходит Claude Opus 4.8 в агентных задачах. Разработчики называют это первым случаем, когда локальная модель вышла на уровень флагманских.
Модель, которая помещается на рабочий стол
Qwen3.8-27B - это не урезанная игрушка для ноутбука. Внутри: нативное понимание изображений и видео, контекст на 262 144 токена, настраиваемый режим рассуждений и поддержка кодинга и агентных сценариев. Alibaba называет её компактной версией возможностей поколения Qwen3.8.
Аппетит к железу скромный. В полной точности 16-bit модели нужно около 56 ГБ видеопамяти, версии FP8 - около 28 ГБ. Квантование в 4 бита ужимает саму модель до 17 ГБ, и она запускается на мощном игровом компьютере или хорошем ноутбуке. Разработчик Саймон Уиллисон прогнал её на M5 Max MacBook Pro и Nvidia DGX Spark: модель писала код, разбирала изображения и вела агентный цикл через фреймворк Pi.
Цифры, которые взбудоражили сообщество
Сначала выстрелили собственные бенчмарки Alibaba: 61.7 на SWE-bench Pro, 90.3 на LiveCodeBench v6, 70.7 на офисном CoWorkBench и 84.3 на OSWorld-Verified. В таблице Alibaba модель 27B обходит Claude Opus 4.6 Max по кодингу, хотя уступает ему на Terminal-Bench и GPQA Diamond.
Потом пришли независимые замеры. Artificial Analysis поставила модели 52 балла в Intelligence Index - ровно столько же, сколько у GPT-5.6 Luna на максимальном уровне рассуждений, и это облачная проприетарная модель. В Agentic Index Qwen3.8-27B набрала 51, обойдя Claude Opus 4.8, которую Anthropic выпустила меньше трёх месяцев назад.
Разработчик Cline написал в X: «Это первый случай, когда локальная модель показала возможности уровня фронтира. Мы не ждали такого темпа локального прогресса так скоро». За первые три дня модель скачали с Hugging Face больше 3 миллионов раз.
Ключевая цифра: файл на 17 ГБ набирает 52 балла в Intelligence Index - столько же, сколько GPT-5.6 Luna, и 51 в Agentic Index - больше, чем Claude Opus 4.8.
Цена скорости: рассуждения стоят времени
Часть качества модель покупает долгим мышлением. Artificial Analysis посчитала, что на своих тестах Qwen3.8-27B сгенерировала 160 миллионов токенов вывода против медианы 43 миллионов у сопоставимых открытых моделей.
Уиллисон столкнулся с крайним случаем: из-за стандартного режима xhigh запрос нарисовать SVG с пеликаном на велосипеде занял 21 минуту и съел больше 22 000 токенов рассуждений. Он советует для обычной локальной работы включать low или отключать рассуждения вовсе.
Инвестор Томаш Тунгуз прогнал девять задач против DeepSeek V4 Flash: с рассуждениями Qwen чуть выиграла по качеству, но оказалась в 30 раз медленнее и в 4.5 раза дороже. Он оговорился, что девять задач - мало для вердикта. Разрыв частично закрывает технология Multi-Token Prediction: Уиллисон получил около 72% прироста скорости на DGX Spark после включения MTP в llama.cpp.
Что это значит для бизнеса
Для компаний сравнение теперь другое: может ли модель, которая запускается внутри собственной инфраструктуры, закрыть заметную долю задач кодинга, разбора документов и работы с изображениями вместо вызовов API. Веса Apache 2.0 можно проверять, менять и держать за своим периметром, а Alibaba документирует совместимость с vLLM, SGLang и TokenSpeed.
Данные не покидают машину, и это меняет расчёт приватности и стоимости. Для компаний во Владивостоке и на Дальнем Востоке, которые присматриваются к внедрению искусственного интеллекта, локальная модель значит: нейросети для бизнеса перестают быть только облачной подпиской. Оценить, какие задачи стоит переводить на локальные open weights модели, а какие оставить в облаке, поможет бесплатный аудит.