Исследователи из Национального университета Сингапура разработали MRAgent - фреймворк для управления памятью AI-агентов, который сокращает расход токенов до 118 000 на запрос. Для сравнения: LangMem требует 3,26 млн, Mem0 - 632 000.

Долгие рассуждения вскрывают слабое место AI-агентов: контекстные окна забиваются быстро, а пайплайны поиска возвращают шум вместо сигнала. MRAgent решает эту проблему иначе. Он отказался от статичной схемы «найти - потом подумать» и использует активное конструирование памяти: агент сам решает, что искать на каждом шаге, исходя из уже накопленных данных.

Это не просто улучшение. На тестах LongMemEval MRAgent показал снижение потребления промпт-токенов до 118 000 на сэмпл - против 632 000 у A-Mem и 3,26 млн у LangMem. Время выполнения сократилось вдвое: с 1122 до 586 секунд.

Почему пассивный поиск не работает

В классических пайплайнах документы ищутся через векторный поиск или обход графа и передаются LLM для анализа. Такой пассивный подход создаёт три проблемы:

  • Система не может изменить стратегию поиска по ходу рассуждения. Если агент нашёл документ и понял, что ему не хватает конкретной даты или имени - он не может сделать новый запрос на основе этой находки.
  • Фиксированные оценки схожести и предопределённые расширения графа забивают контекст LLM нерелевантным шумом.
  • Жёсткие top-k результаты и статические функции релевантности не масштабируются на непредсказуемые длительные взаимодействия.

Исследователи предлагают перейти к «активному и ассоциативному процессу реконструкции» - концепции из когнитивной нейронауки. Память разворачивается последовательно, а не читается как статическая база. Система стартует с небольших триггеров из запроса пользователя (имя, действие, место) и собирает улики по одной.

Как работает MRAgent

Вместо статической базы MRAgent (Memory Reasoning Architecture for LLM Agents) обрабатывает память как интерактивную среду. На каждом шаге LLM оценивает промежуточные данные и итеративно оптимизирует поиск: выводит новые ограничения, преследует наиболее информативные пути, отсекает нерелевантные ветки.

Для эффективности фреймворк использует механизм «Cue-Tag-Content» - многослойный ассоциативный граф из трёх типов узлов:

  • Cues - тонкие ключевые слова (сущности, контекстные атрибуты), извлечённые из взаимодействия
  • Content - собственно блоки памяти, разделённые на эпизодическую (конкретные события) и семантическую (факты, предпочтения)
  • Tags - семантические мосты между Cues и Content

Например, пользователь спрашивает: «Как Нейт распорядился призовыми, когда выиграл третий турнир по видеоиграм?» MRAgent сначала извлекает cue «Нейт», «турнир», «победа». Затем смотрит на tag «Победа в турнире» (а не «Участие в турнире»), находит три эпизода, выбирает релевантный, обновляет cues и повторяет процесс, пока не соберёт ответ.

Бенчмарки и практическая эффективность

MRAgent тестировали на LoCoMo и LongMemEval - бенчмарках, проверяющих способность агентов разрешать запросы на длинных горизонтах (десятки сессий, сотни витков диалога). Базовые модели - Gemini 2.5 Flash и Claude Sonnet 4.5. MRAgent обошёл все существующие фреймворки: стандартный RAG, A-MEM, MemoryOS, LangMem и Mem0.

Ключевой для бизнеса показатель - стоимость вычислений. На тестах LongMemEval:

  • MRAgent - 118 000 токенов / 586 секунд
  • A-Mem - 632 000 токенов / 1122 секунды
  • LangMem - 3,26 млн токенов (в 27 раз больше)

Секрет эффективности - поведение по требованию. MRAgent оценивает tag'и и отсекает нерелевантные пути до того, как тратить токены на извлечение полного контента. Система сама знает, когда остановиться, и не делает лишних запросов.

Что нужно знать разработчикам

Структуру Cue-Tag-Content нужно подготовить до того, как агент начнёт её использовать. Но разработчикам не придётся размечать данные вручную - MRAgent включает автоматический пайплайн дистилляции, который обрабатывает сырые истории взаимодействий и сам заполняет граф памяти. Исходный код опубликован на GitHub.

Что это значит для бизнеса

Для компаний, которые внедряют AI-агентов для работы с большими объёмами данных, MRAgent - это прямой путь к снижению затрат. Чем меньше токенов уходит на каждый запрос, тем дешевле эксплуатация агентов. Сокращение времени выполнения вдвое означает, что те же задачи решаются быстрее.

Проблема долгой памяти для AI-агентов была одним из главных барьеров для автоматизации с помощью ии. MRAgent показывает, что решение не в увеличении контекстного окна, а в умной архитектуре доступа к данным.

Для бизнеса во Владивостоке и на Дальнем Востоке, который только начинает внедрение нейросетей для бизнеса, появление таких фреймворков означает снижение порога входа: эффективная память для агентов становится доступной без гигантских вычислительных мощностей.