10 августа Meta выпустила Muse Glimmer - открытую модель на 30 млрд параметров, которая запускает автономных AI-агентов прямо на потребительском железе: топовых Mac и ПК с 24 ГБ памяти. Лицензия - Apache 2.0, самая свободная за всю историю Meta: свободнее, чем у Llama.

Apache 2.0 вместо особой лицензии

Первое, что бросается в глаза, - лицензия. Glimmer выходит под Apache 2.0, это первый полностью открытый релиз Meta с апреля, когда компания сменила открытую семью Llama на проприетарную Muse Spark. Собственная лицензия Llama годами вызывала критику из-за ограничений вроде порога в 700 млн месячных пользователей. У Apache 2.0 таких условий нет: коммерческое использование, модификация и распространение без ограничений.

Веса уже на Hugging Face. Поддержку подключают Ollama, LM Studio, vLLM, SGLang, Together AI, Fireworks AI и OpenRouter, в ближайшие дни - оптимизированные интеграции llama.cpp, MLX и ExecuTorch. Meta работает с AMD, Arm, Dell, Intel и Nvidia над производительностью на разных устройствах.

Марк Цукерберг написал в X: «Сегодня мы открываем веса Muse Glimmer, отличной плотной модели на 30B, которая работает локально. Скоро откроем веса Muse Spark 1.2, нашей новейшей фундаментальной модели». Релиз Muse Spark 1.2 стал бы ещё большим сдвигом: это frontier-модель за Muse Code, терминальным кодинг-агентом, выпущенным пять дней назад. До сегодняшнего дня вся семья Muse была проприетарной.

Модель, построенная вокруг цикла агента

Meta тренировала Glimmer не как обычного чат-бота, а вокруг последовательности операций автономного агента: составить план, вызвать инструменты, интерпретировать результаты, продолжать работу и восстанавливаться после сбоев. «Как и гораздо более крупные модели, muse glimmer работает полноценным агентом: планирование, вызовы инструментов, проверка собственных результатов и восстановление после ошибок», - написал главный AI-директор Meta Алексанр Ванг. Модель «работает на 24 ГБ VRAM без потери агентной надёжности».

По карточке модели: плотный каузальный трансформер на 29,6 млрд параметров в 52 слоях, включая отдельный зрительный энкодер на ~1,8 млрд параметров. Принимает текст и изображения, выдаёт текст, поддерживает более 100 языков, контекст от 131 072 токенов, обрезка знаний - 4 января 2026.

Настройки рассуждения: low, medium, high и xhigh через системный промпт. Meta говорит, что модель работает с агентными каркасами OpenClaw и Hermes Agent. В демо модель сама обнаружила Home Assistant в сети, опросила API устройств, написала с нуля адаптивный дашборд на HTML/CSS/JavaScript и развернула локальный сервер, чтобы проверить свою работу.

Как 30 млрд параметров влезают в 24 ГБ

В полной точности модель требует более 55 ГБ памяти - больше, чем у любой потребительской видеокарты. Поэтому Meta выпустила 4-битные квантованные версии: веса языка сжимаются до 20 ГБ, оставляя место для KV-кэша, энкодера и модели спекулятивного декодирования в пределах 24 или 32 ГБ.

Конфигурация K-Quant-17GB под 24 ГБ влезает на одну топовую карту: RTX 3090 или RTX 4090. Версия K-Quant-Dynamic под 32 ГБ соответствует RTX 5090. На Mac роль VRAM играет унифицированная память, так что MacBook Pro или Mac Studio от 32 ГБ держат весь стек: тесты Meta шли на M4 Max и M5 Max. Обычные ноутбуки на 8-16 ГБ остаются за бортом, а полная BF16-версия на 64 ГБ - удел дата-центровых GPU.

Цифры: точность падает в среднем на 0,2% у версии под 32 ГБ и на 1% у версии под 24 ГБ. Спекулятивное декодирование DFlash ускоряет генерацию на RTX 5090 с 74,9 до 233,4 токенов в секунду (3,1x), на M5 Max - с 26,6 до 50,2.

Для агентов эти множители важнее, чем для чата: один запрос пользователя запускает много ходов модели, вызовов инструментов и шагов проверки, и задержка на каждом этапе быстро делает агента непрактичным.

Бенчмарки: сильная, но не везде первая

Glimmer лидирует в тройном сравнении с Gemma 4 и Qwen3.6-27B на части агентных тестов: MCP Atlas - 75,5, DeepSearch QA - 74,6, SWE-Bench Pro - 51,2 против 36,9 у Gemma4-31B и 50,2 у Qwen. Но Qwen выигрывает на OSWorld-Verified (75,6 против 65,9), TerminalBench 2.1 и большинстве мультимодальных бенчмарков, а на SWE-Bench Verified Glimmer (76,0) чуть уступает Qwen (77,2).

Честное чтение цифр: Glimmer интереснее как специализированная локальная агентная модель, чем как доказательство универсального превосходства.

Контекст: китайские модели задают темп

Релиз добавляет к короткому списку по-настоящему открытых моделей frontier-класса от американских компаний. Последние два года темп задавал Китай: DeepSeek, Qwen, Kimi, GLM и MiniMax выпускали открытые модели под MIT и Apache 2.0 с ритмом, которого западные лаборатории не выдерживали. К маю 2026 китайские открытые модели давали около 61% всех токенов на OpenRouter, четыре из пяти самых используемых моделей - китайские, а Llama выпала из рейтингов.

Американские контрпримеры можно пересчитать по пальцам: gpt-oss от OpenAI под Apache 2.0, Gemma от Google под собственной ограничительной лицензией, Inkling от Thinking Machines. Glimmer ближе всего к gpt-oss: обе под Apache 2.0, обе с регулируемыми усилиями рассуждения, обе под самостоятельный хостинг. Но gpt-oss - текстовые разреженные модели, а Glimmer - плотная, с нативным зрительным входом и обучением вокруг цикла агента, со своими квантованными вариантами под 24 ГБ.

Что это значит для бизнеса

Локальный инференс меняет не только место вычислений. Агент, работающий с файлами, скриншотами и средами разработки, не отправляет чувствительный контекст в удалённый сервис непрерывно. Локальное развёртывание убирает зависимость от доступности сети и посекундной оплаты токенов, хотя железо, электричество и обслуживание остаются на компании.

Meta не выпустила данные и код обучения: открыты именно веса. Но для бизнеса во Владивостоке и на Дальнем Востоке это практичный вариант: нейросети для бизнеса с локальным запуском решают вопросы конфиденциальности, когда данные нельзя отдавать в облако. Внедрение искусственного интеллекта на своём железе начинается с оценки, какие процессы вообще стоит автоматизировать. Посчитать это поможет аудит.