Исследователи из Coral AI Labs и нескольких университетов выложили открытую систему AgentRadio, которая позволяет AI-агентам переписываться между шагами своей работы, не останавливая её. На бенчмарке по большим кодовым базам команда из четырех агентов решила 62,1% задач, тогда как одиночный Claude Code на самой свежей модели Opus 4.8 справился с 57,2%. Прирост дала структура общения.

Почему один агент не тянет большие кодовые базы

Задачи с долгим горизонтом планирования ломают одиночные агентные системы. Агенту нужно собрать проект, запустить его, проследить пути выполнения по файлам и собрать доказательства. Контекст растёт, и первоначальный план становится трудно пересматривать. Находки, сделанные поздно, не всегда доходят до финального ответа.

«Один агент идёт по одной последовательной ветке в репозитории. Сложность в том, чтобы удерживать все обязательства, зависимости и противоречивые улики на протяжении долгого расследования» - соавторы исследования Xinxing Ren, Caelum Forder и Peter Carroll.

Бенчмарк SWE-Atlas QnA проверяет именно такие задачи: длинные вопросы по живым production-репозиториям, на которые нельзя ответить простым чтением кода. Агенту нужно запустить программу и выполнить несколько команд. Одиночный Claude Code на Opus 4.6 решает 32,3% таких задач. Переход на более новую Opus 4.8 поднимает результат до 57,2%.

Три неудачные схемы командной работы

Распределить нагрузку между несколькими агентами пробовали и раньше. Но существующие системы, по словам исследователей, попадают в одну из трех ловушек.

  • Параллельно, но изолированно. Агенты работают одновременно и вообще не общаются.
  • Параллельно, но по раундам. Общение возможно только на границах синхронизированных раундов. Агенты ждут друг друга и не могут обменяться промежуточными находками. Если агент, который изучает API, нашёл улику, опровергающую гипотезу коллеги, эта улика ждёт конца раунда, и расследование идёт по неверному пути.
  • Частичная асинхронность. Система умеет только спускать задачи сверху, но между агентами нет горизонтальных каналов и общей памяти.

Главный тормоз авторы формулируют коротко: агент, который работает, не может одновременно слушать.

Как устроен AgentRadio

AgentRadio добавляет к существующим обвязкам вроде Claude Code три примитива. create_thread открывает беседу между агентами. send_message добавляет сообщение в тред и возвращает управление, не блокируя отправителя. wait_for_mention останавливает процесс до прихода сообщения с упоминанием и отдаёт полный слепок всех тредов.

Такая тройка даёт агенту «пассивную осведомлённость»: он продолжает основную работу, а сообщения и обновления знаний идут в фоне. Код распространяется под лицензией Apache 2.0 на GitHub и не требует менять сами обвязки. Нужен только сервер сообщений и три shell-скрипта на стороне агента.

Цифры на SWE-Atlas QnA: одиночный агент на Opus 4.6 - 32,3%, одиночный агент на Opus 4.8 - 57,2%, команда с AgentRadio - 62,1%. DeepSeek V4 Pro одиночный - 29,0%, с AgentRadio - 50,8%. Тест MinIO: без асинхронной связи команда потеряла пять рубрик, с AgentRadio - 16 из 16.

Показателен кейс с MinIO. Задача требовала проверить серверные логи по каждому запросу, и агенты не заложили это в план. В конфигурации без асинхронной связи двое агентов независимо поняли, что логи нужны, но не смогли поделиться находкой. На ревью команда единогласно выбрала неверный ответ и потеряла пять рубрик. С AgentRadio один агент сразу отправил улику в общий журнал, остальные впитали её на следующем шаге, и задача превратилась в идеальные 16 из 16.

«Команде не нужен был ещё один агент или ещё один раунд ревью. Ей нужно было, чтобы находка одного агента дошла до нужных коллег, пока её операционная ценность не истекла» - исследователи AgentRadio.

Цена координации

Фиксированная команда агентов умножает расходы на токены. Средний счёт API вырос с 2,96 доллара за задачу у одиночного Opus до 19,45 доллара у полного стека AgentRadio. Но масштаб сам по себе не даёт результата: когда исследователи потратили 17,76 доллара на шесть независимых запусков Opus, те решили только 37,9% задач против 62,1% у AgentRadio. Архитектура выигрывает структурно, а не за счёт грубой силы.

Исследователи предупреждают и об обратной стороне: общение может направить агента к лучшим уликам, а может и увести с верного пути. Мультиагентная команда нужна там, где есть «точки разделения ответственности»: место, где инженер позвал бы другого человека, потому что работа пересекает границу владения, требует независимой гипотезы или несёт риск, оправдывающий отдельную проверку.

Принципы AgentRadio уже превращаются в коммерческий продукт Coral Code. Вместо жёсткого протокола для каждого тикета он добавляет контекст репозитория и специалистов только тогда, когда это оправдано emerging-уликами. Оптимизируется цена законченного проверяемого результата, а не токенов.

Что это значит для бизнеса

Для компаний, которые внедряют AI-агентов в разработку, вывод простой: менять модель не всегда выгоднее, чем менять схему взаимодействия. Команда из четырёх агентов на модели прошлого поколения обошла одиночный агент на флагмане. Это снижает планку входа: не обязательно покупать самые дорогие модели, если настроена координация.

Но экономика требует расчёта. Стоимость задачи выросла в шесть раз, и такой режим оправдан для архитектурных вопросов, разбора инцидентов, анализа безопасности и миграций. Для правки одного файла или генерации шаблона одиночный агент остаётся правильным выбором.

Внедрение искусственного интеллекта в компании начинается с вопроса, где проходит граница ответственности. Компаниям во Владивостоке и на Дальнем Востоке, которые присматриваются к AI-агентам для автоматизации бизнес-процессов, стоит смотреть не только на бенчмарки моделей, но и на оркестрацию: именно она часто решает, окупится ли проект.