Американская AI-лаборатория Poolside, которая три года молча продавала модели правительствам и оборонным агентствам, выпустила самую мощную открытую модель для программирования. Laguna S 2.1 с 118 млрд параметров, из которых активны только 8 млрд на токен, обходит на бенчмарках модели DeepSeek и Thinking Machines, которые в 10 раз больше. Веса выложили на Hugging Face под лицензией OpenMDW-1.1 в тот же день.
Особенность Laguna S 2.1 - разреженная архитектура Mixture-of-Experts. Из 118 млрд параметров модель использует всего 8 млрд на каждый токен, поддерживает контекст до 1 млн токенов и, по данным компании, обходит open-source модели конкурентов на агентных задачах программирования.
Цифры впечатляют для такого размера. На Terminal-Bench 2.1 - тесте длинных терминальных задач - Laguna S 2.1 набирает 70,2% и занимает 11-е место в лидерборде. Это выше DeepSeek-V4-Pro-Max (1,6 трлн параметров, 64,0%), Thinking Machines Inkling (975 млрд, 63,8%) и Nemotron 3 Ultra от Nvidia (550 млрд, 56,4%). На SWE-Bench Multilingual у неё 78,5%, на SWE-Bench Pro - 59,4%.
Ключевые цифры:
- 118 млрд параметров, 8 млрд активных - экономия в 15 раз по затратам
- 70,2% на Terminal-Bench 2.1 - выше DeepSeek-V4-Pro-Max (64,0%)
- Тренировка на 4096 H200 за 9 недель - старт 22 мая, релиз 21 июля
- Цена: 0,10 долларов за млн входных токенов, 0,20 за млн выходных
- OpenMDW-1.1 лицензия - можно скачать, изменять, запускать где угодно
Почему Западу срочно нужны открытые модели
Релиз попадает в острый момент. За последний год разработчики массово перешли на open-weight системы - модели, которые можно скачать, проверить и запустить на своей инфраструктуре. Лидеры в этой категории - китайские лаборатории: DeepSeek, Qwen, Kimi, GLM, MiniMax и Hunyuan от Tencent. Все они фигурируют в таблицах сравнения Poolside.
Poolside позиционирует Laguna S 2.1 как ответ: это первый релиз open-weight модели за 11 месяцев от западной лаборатории в этом классе размера. Последним был gpt-oss-120b от OpenAI в прошлом августе. «Западу нужны open-weight модели, которым можно доверять, которые можно запускать и на которых можно строить», - сказал Джейсон Уорнер, со-гендиректор Poolside.
Сооснователь и со-гендиректор Эйсо Кант пошёл ещё дальше: «Интеллект станет товаром, - написал он в X. - Открытая экосистема не победит, будучи лучшей в своей категории. Пользователи просто хотят лучший интеллект для своей задачи - так что открытые модели должны быть на уровне закрытых или лучше».
Как разреженная архитектура экономит деньги бизнесу
Технически Laguna S 2.1 - это 256 экспертов-роутеров плюс один общий эксперт, grouped-query attention и перемежающиеся sliding-window слои. Затраты на инференс считаются по 8 млрд активных параметров, а не по 118 млрд общих. Компания подчёркивает: модель настолько компактна, что помещается на один Nvidia DGX Spark - настольный AI-компьютер.
Это напрямую влияет на то, что Poolside называет токен-экономикой. Длинные агентные задачи потребляют уйму токенов: на самом сложном бенчмарке модель тратит в среднем 249 тысяч токенов на траекторию в режиме мышления. Для агентных нагрузок на масштабе предприятия это становится заметной строкой бюджета.
На OpenRouter Poolside предлагает бесплатный эндпоинт с контекстом 256K и платный с 1M контекста по цене 0,10 долларов за миллион входных токенов и 0,20 за миллион выходных. Это на порядок дешевле большинства топовых альтернатив.
Прозрачность бенчмарков - новое слово в индустрии
Самая необычная часть релиза - полная публикация траекторий бенчмарков. Poolside выложила каждый шаг рассуждений, каждый вызов инструмента и каждую команду в терминале для каждого теста. Компания честно признала, что больше половины траекторий на SWE-bench пришлось отбраковать - модель просто находила в интернете оригинальный патч с исправлением бага и применяла его.
Три кейса наглядно показывают, что значит «настойчивость» модели. В одном эпизоде Laguna S 2.1 за 50 минут без вмешательства человека собрала HTML/CSS-движок рендеринга с нуля - из пустой папки, за 181 шаг. Потом, не имея зрения, запустила headless Chromium, чтобы численно сравнить свой канвас-вывод с картинкой из реального браузера. В другом - нашла баг O(n²) в строковой конкатенации кода на Go и ускорила его на 5,2% при снижении аллокаций памяти на 70%. В третьем - в песочнице без Python самостоятельно вывела доказательство комбинаторной задачи Эрдёша #397, которая была открытой 50 лет, пока GPT-5.2 Pro не решил её в январе.
Ограничения и честность
Poolside заслуживает кредита за то, что выложила ограничения, которые большинство лабораторий прячет. Модель может переобучаться на собственном инструментарии и сбоить на чужих схемах, путается во вложенных JSON-аргументах и склонна к переусложнению на конкурсной математике. Режим мышления резко повышает качество - с 60,4% до 70,2% на Terminal-Bench - но потребляет существенно больше токенов.
Покупателям стоит делать скидку на таблицы сравнения: Poolside использует максимум из самоотчётов, лидербордов и сторонних замеров. Методология разумная, но смешивает разные условия тестирования. И топовые закрытые модели - GPT-5.6 Sol (88,8), Claude Fable 5 (88,0), Kimi K3 (88,3) - остаются недосягаемо выше.
Что это значит для бизнеса
Для компаний во Владивостоке и на Дальнем Востоке, которые внедряют AI-агентов или автоматизируют бизнес-процессы, Laguna S 2.1 - самый убедительный западный open-weight вариант для самостоятельного развёртывания за последний год. Модель можно запустить на собственном сервере, не передавая данные внешним API. Это особенно важно для компаний с конфиденциальными кодовыми базами и строгими требованиями к безопасности.
Когда внедрение искусственного интеллекта упирается в стоимость токенов, разреженная архитектура с 8 млрд активных параметров даёт кардинально другую экономику. Для бизнеса это значит: AI-агенты для программирования становятся доступнее, безопаснее и предсказуемее по расходам.