Enterprise AI-команды дают агентам всё больше свободы в тот самый момент, когда доверие к автоматическому тестированию рушится. По данным июньского опроса VB Pulse среди 157 ИТ-руководителей, половина компаний запустила AI-агента, который прошёл внутренние тесты, но вызвал сбой у клиента. Каждая четвёртая - не раз.
Разрыв оценки: 66% компаний уже разрешают или строят системы, которые позволят AI-агентам уходить в продакшен без участия человека. Но только 5% полностью доверяют автоматическим оценкам, на основе которых принимаются такие решения.
Почему проходной тест не equals работающий агент
Обычное тестирование программ проверяет, выдаёт ли система ожидаемый результат на заданный вход. С AI-агентами всё сложнее: система сама выбирает последовательность действий, вызывает инструменты, получает данные, меняет состояние системы. И каждый раз реагирует по-разному.
Агент может принять несколько по отдельности разумных решений и всё равно прийти к неверному результату. Он может получить правильный счёт, но обновить не то поле. Составить корректный запрос на возврат, но отправить его без утверждения. Успешно вызвать пять инструментов, а на шестом - утечь чувствительные данные.
Самая частая причина недоверия к автоматическим оценкам - плохое соответствие реальным результатам (29%). Смещение и непоследовательность - 21%, отсутствие объяснимости - 18%, утечка данных - 17%. Компании говорят: оценка не предсказывает, что произойдёт, когда агента встретит реальный клиент.
NIST в своём профиле Generative AI делает аналогичный вывод: измерения в контролируемой среде не переносятся в продакшен, потому что поведение меняется с промптами, пользователями, контекстом и условиями работы.
Способность - это не стабильность
Один успешный запуск доказывает, что агент может выполнить задачу. Он не доказывает, что будет выполнять её стабильно. Anthropic в своём руководстве по оценке агентов проводит чёткую границу: одно дело - получается ли у системы выполнить задачу хотя бы раз из нескольких попыток, и совсем другое - получается ли каждый раз.
Эта разница критична для клиентских и операционных процессов. Модель, которая иногда даёт отличный ответ, может быть неприемлема, если та же задача непредсказуемо сбоит при следующей попытке.
Правильный подход: каждый инцидент в продакшене должен становиться постоянным регрессионным тестом. Жалобы клиентов, неудачные вызовы инструментов, ошибочные утверждения, проблемы с данными - всё это должно попадать в предрелизный набор тестов.
Автономия по риску, а не по амбициям
66% опрошенных уже позволяют AI-агентам работать без человека в том или ином виде. Но крупные компании (от 2500 сотрудников) движутся к zero-human deployment быстрее - 70% против 64% у мелких. И они же чаще выпускают агентов, которые потом подводят клиента: 54% против 48%.
Вот предупреждение для руководителей. Убирая человека из цикла, вы не убираете неопределённость. Вы превращаете неопределённость в автоматизированное производственное решение.
Низкорисковые действия - черновики внутренних отчётов, категоризация документов - могут терпеть широкую автономию. Финансовые транзакции, общение с клиентами, выкладка кода, изменения доступа, удаление данных - требуют строгих порогов, многократных проверок стабильности, политик контроля, механизмов отката и понятных путей эскалации.
Что это значит для бизнеса
Рынок будет двигаться к большей автономии AI-агентов - экономический стимул слишком силён. Но организации, которые выиграют, не те, кто уберёт людей быстрее всех. Они - те, кто относится к стабильности и регрессионному тестированию так же серьёзно, как к скорости развёртывания.
Для бизнеса во Владивостоке и по всей России: при внедрении AI-агентов в процессы первым делом стоит выстроить систему контроля качества. Автоматизация с помощью ии даёт результаты, но без оценки результатов - это ставка вслепую.
Читайте также
Внедрение искусственного интеллекта с контролем качества
Мы помогаем компаниям во Владивостоке и по всей РФ внедрять AI-агентов с правильной системой оценки и контроля. От аудита до полного внедрения.
Получить бесплатный AI-аудит