Исследователи Microsoft дали 19 большим языковым моделям рабочие документы из 52 профессиональных областей и попросили отредактировать их 20 раз подряд. К концу цикла фронтовые модели испортили в среднем 25% содержимого. Если считать все 19 моделей, средняя деградация дошла до 50%.

Исследование DELEGATE-52 вышло 17 апреля 2026 года. Оно показывает ошибку, которая опаснее галлюцинации: незаметную, накапливающуюся и почти невидимую для обычной вычитки. Разбираем, что именно сломали модели и как построить процесс редактирования, в котором человек держит контроль.

Главные цифры исследования

19 моделей, 52 области (от кода и кристаллографии до бухучёта и рецептов), 20 циклов правок. Фронтовые модели - Gemini 3.1 Pro, Claude 4.6 Opus, GPT 5.4 - испортили в среднем 25% содержимого документа. Средняя деградация по всем моделям: 50%. Python стал единственной областью, где большинство моделей прошло порог точности 98%, и даже лучшая модель достигла его только в 11 из 52 областей.

Ошибки редкие, но серьёзные

Исследователи называют паттерн «редкие, но серьёзные»: модели делали мало ошибок, зато каждая меняла смысл. Сдвинутая на цифру статистика, выпавшая часть предложения, тихо изменённое имя или атрибуция. Такие ошибки грамматически корректны, поэтому обычная вычитка их пропускает. Поймать их может только ревьюер, который знает, что было в оригинале.

Деградация накапливается от цикла к циклу и растёт с объёмом документа. Документы на 1000 токенов после 20 циклов держали около 91% точности, документы на 10000 токенов падали до 60%. Когда исследователи продлили тест до 100 взаимодействий, деградация продолжила расти без признаков стабилизации.

Агентный режим не спасает

Отдельный вывод для тех, кто надеется, что агентный режим решит проблему. Обёртка из агентного харнеса с доступом к файлам сделала результат на 6% хуже, а расход токенов вырос в 2-5 раз. Ответ «агентная версия справится» данными не подтверждается.

«Ошибки редкие, но серьёзные: небольшое число значимых изменений, которые читаются как грамматически корректный текст. Стандартная вычитка их не ловит. Нужен ревьюер, который знает исходный документ.»

- исследование DELEGATE-52, Microsoft Research

Три изменения в рабочем процессе

Первое: точечные правки вместо «улучши весь документ». Запрос на конкретный абзац, отдельное утверждение или один раздел даёт заметно меньше ошибок, чем открытое «приведи документ в порядок». Чем больше свободы у модели в трактовке задачи, тем больше шансов на тихую порчу смысла.

Второе: усилить человеческую проверку к концу цикла. Большинство команд относится к первому черновику с максимальным вниманием, а к финальным правкам - как к рутине. Исследование переворачивает эту логику: ошибки копятся от цикла к циклу, значит, второй, третий и четвёртый раунды правок рискованнее первого. Интенсивность проверки должна расти, а не падать.

Третье: QA-чекпоинты на типы ошибок, которые вносит модель. Обычная вычитка ловит опечатки и грамматику, но пропускает сдвинутую цифру или изменённую атрибуцию. В процессе проверки AI-контента нужны отдельные проходы по числам, именам, цитатам и ссылкам на источники.

Где риски выше всего

В низкорисковом контенте - пост в соцсети, черновик блога - сдвинутая фраза это неприятность. В трёх категориях тот же паттерн ошибок обходится дорого.

Юридические и compliance-документы. Потерянная оговорка в резюме договора или изменённое определение в сводке условий создаёт реальные правовые риски. Текст при этом читается безупречно.

Клиентские исследования и кейсы. Белая книга или кейс с атрибуцией статистики клиенту несёт репутационный риск: клиент, увидевший своё имя рядом с цифрой, которую он не давал, теряет доверие.

Публичные заявления руководства. Речи, колонки и опусы, отредактированные моделью в несколько раундов, могут уйти от исходного смысла спикера серией мелких, безобидных на вид изменений.

Что это значит для бизнеса

Вывод исследования простой: модель никогда не должна быть финальным авторитетом по документу. Для компаний, которые внедряют автоматизацию с помощью ИИ в контент-производство - от агентств во Владивостоке до отделов маркетинга по всей стране, - это практическое правило: черновики, структурные предложения и точечные правки можно доверять моделям, финальное решение по каждому изменению остаётся за редактором.

На практике это значит: заведите правило, что любой текст, прошедший через модель, проверяется человеком по числам, именам и цитатам, а открытые запросы вроде «улучши весь документ» запрещены. Дороже всего ошибка обходится там, где контент несёт репутацию: договоры, кейсы, публичные заявления.

ИИ-инструменты экономят часы на черновиках, но экономия обнуляется одной сдвинутой цифрой в клиентском отчёте. Человек с редакторским суждением, контролирующий каждое значимое изменение, - это и есть тот процесс, который исследование рекомендует.

Читайте также