Nvidia выпустила два продукта сразу: открытую модель Nemotron 3.5 Lightning для массовых агентных задач и библиотеку NeMo Switchyard, которая на каждом шаге работы агента выбирает подходящую модель. В собственных тестах связка держит уровень frontier-моделей, а счёт снижает до трети стоимости работы одного Claude Opus 4.8.
Проблема, которую решает роутер
Компании с постоянно работающими AI-агентами упираются в одну и ту же развилку. Отправить каждую задачу на frontier-модель - счёт растёт быстро. Написать собственную логику маршрутизации, чтобы простые задачи уходили на дешёвые модели, - это отдельный инженерный проект, который приходится поддерживать при каждом изменении процессов.
Switchyard решает другую задачу, чем переключение между провайдерами. OpenRouter, LiteLLM и отдельные стартапы уже умеют направлять трафик между сервисами. Switchyard встраивается в них, а не заменяет их. Его ядро в том, что подходящая модель меняется по ходу задачи: агент получает результаты инструментов, сталкивается с ошибками, понимает, что шаг рутинный, и фиксированный выбор модели на всё это не реагирует.
«В этом сила системы моделей: подобрать правильную модель под каждый шаг рабочего процесса» - Кари Бриски, вице-президент Nvidia по генеративному AI.
Как маршрутизация влияет на стоимость
У Switchyard несколько стратегий: случайный роутер, роутер по состоянию агента и классификатор. Стоимость входит в решение напрямую. По словам Бриски, Switchyard оценивает многословие модели, то есть сколько токенов она обычно производит на задачу, и использует прогноз, чтобы направить работу на более дешёвый вариант до вызова.
Партнёров Nvidia разделила на две группы. Агентные фреймворки, которые вызывают Switchyard напрямую: Cognition, LangChain и Nous Research. LLM-шлюзы, которые встроили алгоритм в свои продукты: Kong, LiteLLM и OpenRouter. Kong поставляет Switchyard внутри Kong AI Gateway.
Результаты партнёров: LangChain - снижение затрат на 74% на 145 задачах при 7% вызовов к frontier-модели. Ramp - минус 58% затрат и 33% времени при том же качестве на SWE-Bench. Cognition - минус 28% средней стоимости при near-frontier качестве.
Что за модель Lightning
Nemotron 3.5 Lightning - самостоятельная открытая модель на 30 млрд параметров, построенная на гибридной архитектуре Mamba-Transformer с латентным mixture-of-experts. Она продолжает линию Nemotron 3 из декабря 2025 года и рассчитана на быстрый и дешёвый конец решения, а не на frontier.
По данным Nvidia, Lightning выдаёт результат до 4 раз быстрее моделей своего класса и решает агентные задачи на 30% быстрее Qwen3.6-35B при той же точности. На PinchBench, бенчмарке реальных агентных задач, модель сравнивается именно с Qwen3.6-35B: та же точность при меньшем времени.
Постобучение даёт больший эффект. Nvidia приводит цифры четырёх партнёров: CrowdStrike улучшил recall вредоносного контента, CodeRabbit собрал рабочего агента-роутера за 85 долларов за два часа обучения на один эпох, Harvey и Trajectory подняли выполнение юридических задач, Lila Sciences - симуляции энергии.
Что меняется на рынке
Время выхода ставит Nvidia в центр самой насыщенной волны открытых моделей за последние месяцы. Alibaba, Moonshot, Zhipu и DeepSeek выпустили конкурентные открытые модели с весны, Meta добавила Muse Glimmer. Открытые веса за несколько месяцев превратились из отличия в обязательный минимум.
Ставка Nvidia в том, что открытый исходный код сразу на двух уровнях, модели и маршрутизации, реально двигает стоимость агентного AI. Конкуренты Switchyard, Not Diamond и RouteLLM, своих моделей не выпускают. Владение обеими сторонами решения под одной открытой лицензией - то, что не может повторить ни роутер без модели, ни модель без роутера.
Что это значит для бизнеса
Для компаний, которые строят агентную инфраструктуру, видны три сдвига. Решение о маршрутизации становится динамическим вместо статического: вместо одной модели по умолчанию - выбор на каждом шаге по живым сигналам. Открытый исходный код работает как рычаг стоимости на двух уровнях сразу. И конкурентный вопрос смещается с «какая модель лучше» на «какая система лучше». Роутер, который сопоставляет модели с задачами в проде, сложнее бенчмаркать и сложнее продавать, но именно он определяет счёт.
Для бизнеса во Владивостоке и на Дальнем Востоке практический вывод: автоматизация бизнес-процессов с AI-агентами не обязана строиться на самых дорогих моделях. Внедрение искусственного интеллекта окупается быстрее, когда под простые задачи стоят дешёвые модели, а frontier подключается точечно. Посчитать экономику под ваши процессы поможет аудит.