Попросите ИИ-агента написать скрипт для разбора одного JSON-файла - ответ придёт за секунды и будет точным. Попросите его собрать конвейер обработки данных: тысячи грязных документов, нарезка текста, оценка качества, фильтрация шума для RAG-системы. Тут тот же агент спотыкается. Исследователи из Пекинского университета, академии Чжунгуаньцунь и Шанхайского института передовых алгоритмов представили DataFlow-Harness - открытый фреймворк, который заставляет LLM-агента собирать структурированные конвейеры данных по шагам, а не писать код с нуля. На тестах он прошёл 93,3% задач и сократил расходы на API до 72,5% по сравнению с обычным Claude Code.
Одноразовые скрипты, которые никто не может проверить
LLM хорошо пишут код под одну задачу. Для сложной обработки данных они выдают свободные, одноразовые скрипты. Такие скрипты не встроены в рабочие абстракции, которыми пользуются MLOps-команды, их сложно проверить и править визуально.
Первый автор работы Жунмин Хе объяснил: «Первая стена обычно не в написании Python. Современные агенты быстро выдают правдоподобный скрипт. Сложнее привязать его к живой платформе: использовать реально установленные операторы, совпасть со схемой данных, сослаться на зарегистрированные датасеты, сохранить зависимости между этапами и оставить артефакт, который другой инженер поймёт и поправит».
Агенты галлюцинируют зависимости, тянут несуществующие операторы и устаревшие допущения. Вместо артефакта, который можно проверить, они оставляют одноразовый код.
Разрыв назвали NL2Pipeline: пользователь описывает задачу на естественном языке, а производственная среда требует структурированных и постоянных артефактов. Эксперименты показали масштаб: когда Claude Code писал свободные скрипты с доступом к кодовой базе, он проходил 94,2% задач. Когда его ограничили только готовыми блоками платформы, результат упал до 83,3%.
Четыре части, из которых агент собирает конвейер
DataFlow-Harness меняет пространство действий агента, сказал Хе. Вместо произвольного кода агент получает через MCP реестр операторов и текущее состояние конвейера, а затем вносит типизированные правки в постоянный граф.
У платформы четыре компонента:
- Data Pipeline Backend - источник истины: хранит конвейер как направленный ациклический граф (DAG) с источниками данных, модулями обработки и зависимостями
- DataFlow-Skills - markdown-файлы с правилами совместимости: как сопоставлять форматы данных, как собирать компоненты без поломки конвейера
- MCP Tools Layer - доступ агента к реестру операторов; система проверяет изменения, чтобы конвейер оставался валидным
- DataFlow-WebUI - два интерфейса: чат для описания задачи и визуальный редактор графа, где человек видит правки агента
Хе отметил: «Текущая реализация выполняет статические проверки по метаданным платформы перед принятием изменений: реестры датасетов, операторов и сервисов, поток полей, структурную валидность. Результат виден в графическом редакторе, его можно поправить вручную или поручить агенту».
93,3% прохода и минус 72,5% расходов
Фреймворк протестировали на 12 задачах из шести производственных сценариев: генерация QA-пар, ревью, нормализация схем. Моделью-основой взяли Claude Opus 4.7.
Сравнение с базовыми подходами:
- Vanilla CC - обычный Claude Code без ограничений: 91,7%
- Context-Aware CC - агент с кодовой базой DataFlow в контексте: 94,2%
- MCP-only - агент с MCP-инструментами без Skills: 83,3%
- DataFlow-Harness: 93,3%
DataFlow-Harness улучшил результат MCP-only на 10 процентных пунктов и почти догнал агента с полной кодовой базой, отстав на 0,9 пункта. При этом расходы на API упали до 0,261 доллара за задачу: на 72,5% ниже Vanilla CC и на 42,8% ниже Context-Aware CC. Генерация конвейеров ускорилась на 49,9% против Vanilla CC и на 17,6% против Context-Aware CC.
На сложной задаче извлечения QA-пар из учебника (PDF-парсинг, распознавание макета, OCR, извлечение рисунков, мультимодальность) фреймворк дал точность 97,2% и покрытие 87,3%, обойдя все базовые подходы. На очистке и синтезе математических данных конвейер DataFlow-Harness обучил модель с лучшими результатами на AIME24 и AIME25, чем данные от обычного Claude Code.
Что это значит для бизнеса
Фреймворк открыт под лицензией Apache 2.0, но готового плагина для Airflow, Prefect или Spark в нём нет. Командам придётся написать адаптер: соединить реестр, метаданные и интерфейсы исполнения своей организации с контрольным слоем агента. Для мелких разовых преобразований, где хватает простого скрипта, фреймворк избыточен.
Ценность в другом. Компании, которые строят автоматизацию бизнес-процессов на ИИ-агентах, получают способ держать работу агентов под контролем: конвейеры собираются из проверяемых блоков, видны в редакторе, их можно править и аудировать. Это ровно тот слой, которого не хватает, когда агенты начинают трогать реальные данные. На предприятиях внедрение искусственного интеллекта упирается в возможность проверить, что агенты делают с данными.
Для Владивостока и Дальнего Востока это тоже ориентир: прежде чем доверять агентам обработку документов, стоит заложить контур контроля. Нейросети для бизнеса приносят пользу, когда их работа видна и проверяема.