Команда Qwen из Alibaba выпустила модель, которая переворачивает подход к обучению AI-агентов. Qwen-AgentWorld учится не действовать в среде, а предсказывать, что среда вернет в ответ на действие. И этого оказалось достаточно, чтобы агенты стали лучше на семи бенчмарках сразу.

Обычно агентов учат отвечать на вопрос: «что мне сделать дальше, учитывая то, что показала среда?». Qwen-AgentWorld отвечает на обратный: «если агент сделает X, что покажет среда?». Это называется языковой моделью мира — world model на естественном языке.

Ключевые цифры

  • 7 доменов — MCP, поиск, терминал, разработка, Android, Web, OS
  • 10 млн+ траекторий взаимодействия для обучения
  • 35B (активирует 3B) и 397B (активирует 17B) — две версии
  • +50% прирост на поисковых задачах после обучения в симуляторе
  • Apache 2.0 для версии 35B

Как это работает

Alibaba обучила обе модели в три этапа на 10 млн траекторий из реальных сессий агентов.

Первый этап: модель учится, как устроены среды — файловые системы, состояния терминала, DOM-изменения браузера, ответы API. Второй этап: рассуждение о том, что должно произойти дальше, прежде чем предсказывать. Третий: RL — подкрепление с проверками по правилам и открытой оценкой качества.

Обе модели — Mixture-of-Experts: только часть параметров активна на каждом токене. Для 35B версии это 3B активных параметров, для 397B — 17B. Поддержка контекста — 256K токенов. Для GUI-доменов (Android, Web, OS) модель работает с текстовыми деревьями доступности, а не со скриншотами.

Версия 35B и бенчмарк AgentWorldBench доступны под Apache 2.0. 397B не опубликована.

Что дало обучение в симуляторе

Результаты, которые стоит разобрать подробнее, потому что именно они показывают, почему этот подход важен.

Агентов обучали внутри контролируемого симулятора, где можно было искусственно создавать краевые случаи — то, чего реальная среда не выдаст в процессе штатного обучения. Например, частичные ответы, которые заставляют агента делать лишние шаги. Результат: MCPMark вырос с 24.6 до 33.8.

На поиске агентов тренировали на полностью вымышленных мирах — и они перенесли навыки на реальные поисковые задачи. WideSearch F1 Item поднялся с 34.02 до 50.31 — прирост почти на 50%.

Отдельный тест показал: разогрев на world model перед тонкой настройкой под агента повысил BFCL v4 с 62.29 до 71.25, а Claw-Eval с 53.60 до 64.88 — без какого-либо агент-специфичного обучения.

Что говорят исследователи

Реакция сообщества была быстрой и неоднозначной. Одни называют результат «квитанцией» — доказательством, что синтетическое обучение может заменять RL на реальных средах в масштабе. Другие указывают на риск переобучения: «симулятор слишком чистый, и агент учит модель, а не задачу».

Авторы признают проблему и приводят аргумент: результат на вымышленных поисковых мирах, перенесенный на реальные задачи, — самое сильное свидетельство против переобучения.

Для команд, которые строят агентные пайплайны, это означает появление третьего варианта между RL на реальных средах и статическими бенчмарками: контролируемая симуляция, которая создает краевые случаи, недоступные в продакшене.

Что это значит для бизнеса

Для внедрения AI-агентов в бизнес-процессы этот подход открывает новый путь. Вместо того чтобы собирать тысячи реальных сессий взаимодействия агента с системой (что дорого и медленно), можно построить симулятор, натренировать модель предсказывать среду, а затем обучать агента внутри симуляции.

Особенно это актуально для компаний во Владивостоке и на Дальнем Востоке, которые только начинают автоматизацию с помощью ИИ: симуляция позволяет безопасно тестировать агентов до того, как они коснутся реальных бизнес-процессов. А открытая 35B модель под Apache 2.0 означает, что для старта не нужен бюджет на API.