15 июля Thinking Machines — стартап, основанный экс-CTO OpenAI Мирой Мурати, — выпустил Inkling: первую собственную мультимодальную модель под лицензией Apache 2.0. 975 млрд параметров, архитектура Mixture-of-Experts с 41 млрд активных, 1 млн токенов контекста — и нативное понимание текста, изображений и аудио.
Inkling — ответ компании на запрос бизнеса, который хочет контролировать свои AI-модели, а не арендовать их у облачных гигантов. Полностью открытая лицензия Apache 2.0 означает: разработчики могут скачать веса, модифицировать их, встроить в продукт и даже продавать — без лицензионных отчислений.
Ключевые цифры Inkling:
- 975 млрд параметров, 41 млрд активных за шаг генерации
- 1 млн токенов контекстного окна
- Apache 2.0 — полная открытость для коммерции
- SWE-bench Verified: 77.6% (бьёт Nemotron 3 Ultra)
- VoiceBench: 91.4% на высокой сложности
- AIME 2026: 97.1% (математика)
Контролируемое мышление: два режима цены на один запрос
Главная техническая находка Inkling — механизм «controllable thinking effort». Разработчик выставляет параметр от 0.2 до 0.99, регулируя, сколько модель будет «думать» перед ответом. Простые задачи — минимум токенов, дешёво. Сложные многошаговые рассуждения — максимум ресурса, дорого, но точно.
«Inkling's continuous thinking effort lets you pick your point on the cost/performance curve — reaching the same score with a fraction of the tokens», — объясняют в Thinking Machines.
Для бизнеса это значит: одна модель закрывает и оперативные запросы в поддержке, и глубокий анализ документов. Не нужно держать две разные модели под разные задачи — можно варьировать глубину обработки программно, внутри одного пайплайна.
Во время обучения на 30 млн роллаутов подкрепления исследователи заметили неожиданный эффект — «chain of thought condensation». Inkling сама научилась сжимать внутренние рассуждения, убирая грамматический мусор и сохраняя точность. Результат: резкое снижение задержки при сохранении качества ответа.
Бенчмарки: сильный середняк, который не стесняется своего места
Inkling не пытается быть «богомоделью» и не обходит закрытые системы вроде Claude Fable 5 или GPT 5.6 Sol на чистом кодинге. Её позиция — лучшая открытая модель для бизнеса, которая держит удар на мультимодальных задачах.
Против китайских open-weight конкурентов:
- GLM 5.2 сильнее на чистом кодинге (62.1% против 54.3% на SWEBench Pro) и сложных рассуждениях (40.1% против 30.0% на HLE)
- DeepSeek V4 Pro побеждает на SWEBench Verified (80.6% против 77.6%), но Inkling берёт математику (97.1% против 96.7% на AIME 2026)
- Kimi K2.6 сильнее на GPQA Diamond (91.1% против 87.9%), но Inkling лучше следует инструкциям в чатах (79.8% против 76.0% на IFBench)
Против американских open-weight моделей Inkling чувствует себя уверенно: Nemotron 3 Ultra проигрывает по всем фронтам — 97.1% против 94.2% на AIME, 77.6% против 70.7% на SWEBench, и значительный отрыв на агентных задачах MCP Atlas (74.1% против 44.7%).
Сопротивление цензуре: AI, который отвечает прямо
Thinking Machines специально тренировали Inkling так, чтобы она отвечала на политически чувствительные темы — без идеологических шаблонов и отписок. На тесте Propaganda and Censorship Eval от Cognition модель показала «стойкое несоблюдение цензуры». При этом на опасные запросы (оружие, кибератаки, насилие) Inkling отказывает в 78% случаев — почти как закрытые фронтальные модели.
Для бизнеса, который работает с реальными данными — юридическими документами, медицинскими отчётами, финансовой аналитикой — это принципиально. Модель не будет отказываться отвечать на законный вопрос только потому, что тема попала в список «чувствительных».
Архитектура: без внешних энкодеров
Inkling использует encoder-free early fusion — обрабатывает текст, изображения и аудио в едином скрытом пространстве без внешних кодировщиков. Звук превращается в dMel-спектрограммы, картинки — в патчи 40x40 пикселей через иерархический MLP. Это не «натянутая» мультимодальность, а нативная — модель с рождения видит все три модальности.
Отдельное достижение — совместимость с основными open-source библиотеками инференса: SGLang, vLLM, TokenSpeed, llama.cpp. Для Blackwell систем есть родной NVFP4 квантизированный чекпойнт.
Сообщество уже оценило усилия. Хьюго Ларок из Hugging Face показал: одна замена attention на FlashAttention-4 дала +11% пропускной способности. Ещё +4% — замена Conv1D на causal-conv1d. 15% прироста без переобучения модели.
Что это значит для бизнеса
Inkling выходит в момент, когда рынок open-source моделей стал жёстким и конкурентным. Китайские GLM 5.2, DeepSeek V4 Pro и Kimi K2.6 давят качеством на узких задачах. Но у Inkling есть козырь, которого нет у китайских моделей: Apache 2.0 без ограничений экспортного контроля.
Для компаний, которые хотят внедрение искусственного интеллекта без привязки к одному вендору, Inkling — не просто ещё одна модель, а архитектурный шаблон: контролируемая стоимость, полная открытость, нативная мультимодальность. На Дальнем Востоке и во Владивостоке, где бизнесу часто нужны автономные решения без постоянного доступа к облаку, такие модели набирают обороты.
Владивостокские компании, работающие с юридическими и бухгалтерскими документами, могут запустить Inkling локально — на собственном сервере или VPC, — получая ту же глубину анализа, что у облачных гигантов, но без ежемесячных счетов за API. Нейросети для бизнеса перестают быть экзотикой: открытые веса, полный контроль и Apache 2.0 — это язык, на котором говорит enterprise.