Две недели назад Thinking Machines, стартап Миры Мурати, выпустила первую открытую модель Inkling на 975 млрд параметров. Теперь компания показала Inkling Small: 276 млрд параметров, лицензия Apache 2.0. На индексе Artificial Analysis Intelligence младшая модель набрала 40 баллов против 41 у флагмана, а на нескольких бенчмарках обошла его.
Компания пошла по пути сжатия, а не только наращивания. Inkling Small использует 12 млрд активных параметров на токен против 41 млрд у Inkling, сохраняя большую часть возможностей старшей модели в кодинге, рассуждениях и мультимодальности. Контекст - до миллиона токенов, на вход принимаются текст, изображения и аудио.
Веса выложены на Hugging Face, дообучение доступно через API Tinker. На старте действует скидка 50%: стандартная версия с контекстом 64K стоит 0,58 доллара за миллион входных токенов, 1,44 доллара за миллион выходных и 1,73 доллара за миллион токенов обучения. Кешированные запросы - 0,116 доллара за миллион.
Ключевые цифры:
- 276 млрд параметров всего, 12 млрд активных (у Inkling: 975 и 41 млрд)
- Индекс Artificial Analysis: 40 против 41
- SWE-bench Verified: 80,2% против 77,6%
- Контекст до 1 млн токенов
- Вход: текст, изображения, аудио
- API со скидкой 50%: 0,58 доллара за млн входных токенов
Почти как флагман, но вчетверо меньше
Разница в один балл на индексе интеллекта при четырёхкратной разнице в размере - это событие. Artificial Analysis дополнительно отметила: ни одна open-weight модель размера Inkling Small или меньше не набрала на индексе больше.
На части тестов младшая модель старшую обходит. SWE-bench Verified: 80,2% против 77,6%. Terminal Bench 2.1: 64,7% против 63,8%. Впереди она и на SciCode, Humanity's Last Exam, GPQA Diamond и CritPt.
Слабые места тоже есть. На фактологических задачах флагман держится увереннее: τ³-Banking 15,5% против 23,7%. Omniscience-показатель у Inkling Small отрицательный, то есть фактов модель знает меньше, хотя галлюцинирует чуть реже.
Для бизнеса это рабочий компромисс. Под кодинг-ассистентов, работу с инструментами, RAG и разбор документов модель подходит. Там, где цена ошибки в фактах высока, понадобятся поиск, проверка и человек в цикле.
Как 276 млрд параметров работают по 12 млрд за раз
Inkling Small построена на разреженной архитектуре Mixture-of-Experts. Декодер из 42 слоёв направляет каждый токен в шесть из 256 специализированных экспертов плюс два общих, которые активны всегда. Отсюда и разница между 276 млрд параметров в модели и 12 млрд активных на каждом шаге.
Модель нативно мультимодальная. Текст, изображения и аудио переводятся в общее представление и обрабатываются декодером вместе, без отдельных внешних систем. Компания рекомендует модель для кодинг-ассистентов, агентных приложений, чат-ботов и RAG-систем.
Есть настройка усилий рассуждения: разработчик сам решает, сколько вычислительной мощности потратить на задачу. Это прямой способ балансировать качество, скорость и стоимость на разных нагрузках.
Маленькая, но не для ноутбука
Название обманчиво. Inkling Small - это не потребительская модель. Стандартный BF16-чекпоинт требует минимум 600 ГБ памяти GPU: четыре NVIDIA B300 или восемь H200. Квантованный NVFP4 снижает требование до 180 ГБ, тогда хватает одной B300 в режиме W4A4 или двух H200 в W4A16.
Ноутбуки, MacBook и игровые ПК отпадают. Целевые сценарии - серверные парки, облачные кластеры и специализированные провайдеры инференса. «Маленькая» здесь означает относительно Inkling, а не относительно локальных моделей.
Сокращение при этом ощутимое. Модель, которая почти догоняет флагман и требует заметно меньше памяти, дешевле в хостинге, проще в планировании мощностей и доступна большему числу компаний, готовых держать её у себя.
Apache 2.0 - золотой стандарт для бизнеса
Лицензия здесь не менее важна, чем бенчмарки. Apache 2.0 разрешает использовать модель, менять, дообучать, распространять и встраивать в коммерческие продукты, включая проприетарные, с соблюдением уведомлений об авторстве.
Контраст с Moonshot показателен: веса Kimi K3 на этой неделе вышли под кастомной лицензией с дополнительными коммерческими условиями. Для юридических, закупочных и платформенных команд Apache 2.0 упрощает жизнь: отправная точка понятна, а проверка acceptable-use политик, происхождения данных и регуляторных рисков остаётся на стороне компании.
Конвейер вместо разового проекта
Исследователь Thinking Machines Хорас Хе сравнил два релиза в X: «На выпуск Inkling ушла целая деревня, Inkling Small вышел буднично. Мы взяли тот же конвейер, подали модель поменьше, и получилась новая. Плюс пара мелких улучшений, а в запасе ещё много».
За словами стоит смена подхода. Компания больше не делает каждую модель отдельным научным проектом: предобучение, постобучение, RL и релиз собираются в повторяемый конвейер. Inkling Small выросла из улучшенной смеси данных для предобучения и дистилляции, где учителем выступала сама Inkling, а агентный RL на кодинге продолжался две недели.
Мира Мурати повторила ту же мысль: модель сравнима с Inkling при четверти размера, веса открыты и доступны для дообучения через Tinker сразу.
Что это значит для бизнеса
Inkling Small - аргумент для компаний, которые выбирают между гигантским флагманом и моделью поменьше. Почти та же измеренная производительность, сильнее на кодинге и рассуждениях, дешевле токены, меньше железа, лицензия без подводных камней.
Для бизнеса на Дальнем Востоке, включая Владивосток, это практичный вариант: open weights модели позволяют держать данные внутри периметра, дообучать модель под свои процессы и не зависеть от API-провайдеров. Внедрение искусственного интеллекта с открытыми весами часто обходится предсказуемее, чем аренда чужих моделей.
И шире: Thinking Machines показывает, что выпуск моделей становится рутиной. Семейство сжимается, конвейер отлаживается, и open source ИИ выходит на регулярный ритм, который бизнесу стоит закладывать в свои планы.