Исследователи из Национального университета Сингапура разработали MRAgent - фреймворк для управления памятью AI-агентов, который сокращает расход токенов до 118 000 на запрос. Для сравнения: LangMem требует 3,26 млн, Mem0 - 632 000.
Долгие рассуждения вскрывают слабое место AI-агентов: контекстные окна забиваются быстро, а пайплайны поиска возвращают шум вместо сигнала. MRAgent решает эту проблему иначе. Он отказался от статичной схемы «найти - потом подумать» и использует активное конструирование памяти: агент сам решает, что искать на каждом шаге, исходя из уже накопленных данных.
Это не просто улучшение. На тестах LongMemEval MRAgent показал снижение потребления промпт-токенов до 118 000 на сэмпл - против 632 000 у A-Mem и 3,26 млн у LangMem. Время выполнения сократилось вдвое: с 1122 до 586 секунд.
Почему пассивный поиск не работает
В классических пайплайнах документы ищутся через векторный поиск или обход графа и передаются LLM для анализа. Такой пассивный подход создаёт три проблемы:
- Система не может изменить стратегию поиска по ходу рассуждения. Если агент нашёл документ и понял, что ему не хватает конкретной даты или имени - он не может сделать новый запрос на основе этой находки.
- Фиксированные оценки схожести и предопределённые расширения графа забивают контекст LLM нерелевантным шумом.
- Жёсткие top-k результаты и статические функции релевантности не масштабируются на непредсказуемые длительные взаимодействия.
Исследователи предлагают перейти к «активному и ассоциативному процессу реконструкции» - концепции из когнитивной нейронауки. Память разворачивается последовательно, а не читается как статическая база. Система стартует с небольших триггеров из запроса пользователя (имя, действие, место) и собирает улики по одной.
Как работает MRAgent
Вместо статической базы MRAgent (Memory Reasoning Architecture for LLM Agents) обрабатывает память как интерактивную среду. На каждом шаге LLM оценивает промежуточные данные и итеративно оптимизирует поиск: выводит новые ограничения, преследует наиболее информативные пути, отсекает нерелевантные ветки.
Для эффективности фреймворк использует механизм «Cue-Tag-Content» - многослойный ассоциативный граф из трёх типов узлов:
- Cues - тонкие ключевые слова (сущности, контекстные атрибуты), извлечённые из взаимодействия
- Content - собственно блоки памяти, разделённые на эпизодическую (конкретные события) и семантическую (факты, предпочтения)
- Tags - семантические мосты между Cues и Content
Например, пользователь спрашивает: «Как Нейт распорядился призовыми, когда выиграл третий турнир по видеоиграм?» MRAgent сначала извлекает cue «Нейт», «турнир», «победа». Затем смотрит на tag «Победа в турнире» (а не «Участие в турнире»), находит три эпизода, выбирает релевантный, обновляет cues и повторяет процесс, пока не соберёт ответ.
Бенчмарки и практическая эффективность
MRAgent тестировали на LoCoMo и LongMemEval - бенчмарках, проверяющих способность агентов разрешать запросы на длинных горизонтах (десятки сессий, сотни витков диалога). Базовые модели - Gemini 2.5 Flash и Claude Sonnet 4.5. MRAgent обошёл все существующие фреймворки: стандартный RAG, A-MEM, MemoryOS, LangMem и Mem0.
Ключевой для бизнеса показатель - стоимость вычислений. На тестах LongMemEval:
- MRAgent - 118 000 токенов / 586 секунд
- A-Mem - 632 000 токенов / 1122 секунды
- LangMem - 3,26 млн токенов (в 27 раз больше)
Секрет эффективности - поведение по требованию. MRAgent оценивает tag'и и отсекает нерелевантные пути до того, как тратить токены на извлечение полного контента. Система сама знает, когда остановиться, и не делает лишних запросов.
Что нужно знать разработчикам
Структуру Cue-Tag-Content нужно подготовить до того, как агент начнёт её использовать. Но разработчикам не придётся размечать данные вручную - MRAgent включает автоматический пайплайн дистилляции, который обрабатывает сырые истории взаимодействий и сам заполняет граф памяти. Исходный код опубликован на GitHub.
Что это значит для бизнеса
Для компаний, которые внедряют AI-агентов для работы с большими объёмами данных, MRAgent - это прямой путь к снижению затрат. Чем меньше токенов уходит на каждый запрос, тем дешевле эксплуатация агентов. Сокращение времени выполнения вдвое означает, что те же задачи решаются быстрее.
Проблема долгой памяти для AI-агентов была одним из главных барьеров для автоматизации с помощью ии. MRAgent показывает, что решение не в увеличении контекстного окна, а в умной архитектуре доступа к данным.
Для бизнеса во Владивостоке и на Дальнем Востоке, который только начинает внедрение нейросетей для бизнеса, появление таких фреймворков означает снижение порога входа: эффективная память для агентов становится доступной без гигантских вычислительных мощностей.