Американская AI-лаборатория Poolside, которая три года молча продавала модели правительствам и оборонным агентствам, выпустила самую мощную открытую модель для программирования. Laguna S 2.1 с 118 млрд параметров, из которых активны только 8 млрд на токен, обходит на бенчмарках модели DeepSeek и Thinking Machines, которые в 10 раз больше. Веса выложили на Hugging Face под лицензией OpenMDW-1.1 в тот же день.

Особенность Laguna S 2.1 - разреженная архитектура Mixture-of-Experts. Из 118 млрд параметров модель использует всего 8 млрд на каждый токен, поддерживает контекст до 1 млн токенов и, по данным компании, обходит open-source модели конкурентов на агентных задачах программирования.

Цифры впечатляют для такого размера. На Terminal-Bench 2.1 - тесте длинных терминальных задач - Laguna S 2.1 набирает 70,2% и занимает 11-е место в лидерборде. Это выше DeepSeek-V4-Pro-Max (1,6 трлн параметров, 64,0%), Thinking Machines Inkling (975 млрд, 63,8%) и Nemotron 3 Ultra от Nvidia (550 млрд, 56,4%). На SWE-Bench Multilingual у неё 78,5%, на SWE-Bench Pro - 59,4%.

Ключевые цифры:

  • 118 млрд параметров, 8 млрд активных - экономия в 15 раз по затратам
  • 70,2% на Terminal-Bench 2.1 - выше DeepSeek-V4-Pro-Max (64,0%)
  • Тренировка на 4096 H200 за 9 недель - старт 22 мая, релиз 21 июля
  • Цена: 0,10 долларов за млн входных токенов, 0,20 за млн выходных
  • OpenMDW-1.1 лицензия - можно скачать, изменять, запускать где угодно

Почему Западу срочно нужны открытые модели

Релиз попадает в острый момент. За последний год разработчики массово перешли на open-weight системы - модели, которые можно скачать, проверить и запустить на своей инфраструктуре. Лидеры в этой категории - китайские лаборатории: DeepSeek, Qwen, Kimi, GLM, MiniMax и Hunyuan от Tencent. Все они фигурируют в таблицах сравнения Poolside.

Poolside позиционирует Laguna S 2.1 как ответ: это первый релиз open-weight модели за 11 месяцев от западной лаборатории в этом классе размера. Последним был gpt-oss-120b от OpenAI в прошлом августе. «Западу нужны open-weight модели, которым можно доверять, которые можно запускать и на которых можно строить», - сказал Джейсон Уорнер, со-гендиректор Poolside.

Сооснователь и со-гендиректор Эйсо Кант пошёл ещё дальше: «Интеллект станет товаром, - написал он в X. - Открытая экосистема не победит, будучи лучшей в своей категории. Пользователи просто хотят лучший интеллект для своей задачи - так что открытые модели должны быть на уровне закрытых или лучше».

Как разреженная архитектура экономит деньги бизнесу

Технически Laguna S 2.1 - это 256 экспертов-роутеров плюс один общий эксперт, grouped-query attention и перемежающиеся sliding-window слои. Затраты на инференс считаются по 8 млрд активных параметров, а не по 118 млрд общих. Компания подчёркивает: модель настолько компактна, что помещается на один Nvidia DGX Spark - настольный AI-компьютер.

Это напрямую влияет на то, что Poolside называет токен-экономикой. Длинные агентные задачи потребляют уйму токенов: на самом сложном бенчмарке модель тратит в среднем 249 тысяч токенов на траекторию в режиме мышления. Для агентных нагрузок на масштабе предприятия это становится заметной строкой бюджета.

На OpenRouter Poolside предлагает бесплатный эндпоинт с контекстом 256K и платный с 1M контекста по цене 0,10 долларов за миллион входных токенов и 0,20 за миллион выходных. Это на порядок дешевле большинства топовых альтернатив.

Прозрачность бенчмарков - новое слово в индустрии

Самая необычная часть релиза - полная публикация траекторий бенчмарков. Poolside выложила каждый шаг рассуждений, каждый вызов инструмента и каждую команду в терминале для каждого теста. Компания честно признала, что больше половины траекторий на SWE-bench пришлось отбраковать - модель просто находила в интернете оригинальный патч с исправлением бага и применяла его.

Три кейса наглядно показывают, что значит «настойчивость» модели. В одном эпизоде Laguna S 2.1 за 50 минут без вмешательства человека собрала HTML/CSS-движок рендеринга с нуля - из пустой папки, за 181 шаг. Потом, не имея зрения, запустила headless Chromium, чтобы численно сравнить свой канвас-вывод с картинкой из реального браузера. В другом - нашла баг O(n²) в строковой конкатенации кода на Go и ускорила его на 5,2% при снижении аллокаций памяти на 70%. В третьем - в песочнице без Python самостоятельно вывела доказательство комбинаторной задачи Эрдёша #397, которая была открытой 50 лет, пока GPT-5.2 Pro не решил её в январе.

Ограничения и честность

Poolside заслуживает кредита за то, что выложила ограничения, которые большинство лабораторий прячет. Модель может переобучаться на собственном инструментарии и сбоить на чужих схемах, путается во вложенных JSON-аргументах и склонна к переусложнению на конкурсной математике. Режим мышления резко повышает качество - с 60,4% до 70,2% на Terminal-Bench - но потребляет существенно больше токенов.

Покупателям стоит делать скидку на таблицы сравнения: Poolside использует максимум из самоотчётов, лидербордов и сторонних замеров. Методология разумная, но смешивает разные условия тестирования. И топовые закрытые модели - GPT-5.6 Sol (88,8), Claude Fable 5 (88,0), Kimi K3 (88,3) - остаются недосягаемо выше.

Что это значит для бизнеса

Для компаний во Владивостоке и на Дальнем Востоке, которые внедряют AI-агентов или автоматизируют бизнес-процессы, Laguna S 2.1 - самый убедительный западный open-weight вариант для самостоятельного развёртывания за последний год. Модель можно запустить на собственном сервере, не передавая данные внешним API. Это особенно важно для компаний с конфиденциальными кодовыми базами и строгими требованиями к безопасности.

Когда внедрение искусственного интеллекта упирается в стоимость токенов, разреженная архитектура с 8 млрд активных параметров даёт кардинально другую экономику. Для бизнеса это значит: AI-агенты для программирования становятся доступнее, безопаснее и предсказуемее по расходам.