В воскресенье на VB Transform 2026 Манаси Джоши, директор инженерии Waymo, сделала заявление, которое должно услышать каждое предприятие, внедряющее AI: проект готов к запуску не тогда, когда модель хорошо работает, а когда созрели тесты вокруг неё. Waymo проехала 220 млн миль без водителя с в 17 раз меньшим числом серьёзных аварий, чем люди на той же дистанции.
Eval-центричная разработка
Waymo использует то, что Джоши называет «eval-forced development» - оценка стала ядром инженерии, а не финальной проверкой перед запуском. Компания оценивает проекты по зрелости тестов, которые их окружают.
«Стадия, на которой созревает наш проект, легко определяется по зрелости eval, которые он показывает».
Этот подход напрямую применим к предприятиям, строящим AI-агентов для поддержки клиентов, кодинга или финансов: если компания не может надёжно измерить производительность системы, она не готова запускать её в продакшен.
Оценки не заканчиваются на запуске
Джоши подчеркнула: eval - не разовая задача. Waymo проводит тестирование во время обучения модели, после обучения, в открытых и закрытых симуляциях. Для предприятий это означает: тестирование агента до запуска недостаточно. Команды должны продолжать оценивать его по мере того, как меняются базовые модели, бизнес-процессы, поведение пользователей и входящие данные.
Ключевые цифры Waymo:
- 220 млн миль полностью автономного вождения
- В 17 раз меньше серьёзных аварий, чем у людей
- Трансформеры используются с 2017 года
- Eval-цикл: обучение, после обучения, симуляции, поле
- Человеческий контроль на всех этапах релиза
Тестирование редких и опасных случаев
Иерархия оценки Waymo строится вокруг одной цели: безопасность. Компания использует собственные логи вождения, сторонние данные и симуляции с миллиардами синтетических миль. Ответственные за задачи выбирают специализированные данные и метрики для ситуаций с пешеходами, железнодорожными переездами, стройками.
Тот же принцип работает и вне автопилота: предприятиям нужно тестировать не только рутинные запросы, которые агенты успешно обрабатывают, но и нестандартные ситуации, где ошибка может стоить денег, репутации или безопасности.
Эффективность не за счёт надёжности
Waymo сталкивается с проблемой, знакомой всем enterprise AI-командам: спрос на вычисления, память и сеть растёт быстрее доступных ресурсов. Компания делает ставку на «data efficiency» - отбор самых полезных примеров для обучения вместо того, чтобы считать больший объём данных лучшим решением.
Waymo начала использовать трансформеры в 2017 году и расширилась до LLM, vision-language и vision-language-action моделей. Сегодня компания использует генеративные мультимодальные модели как часть стратегии foundation model.
У AI-агентов должны быть свои оценки
Waymo использует AI-агентов и внутри - как инструменты продуктивности для инженеров. Агенты помогают анализировать распределения данных, оценивать эффективность данных и диагностировать проблемы в телеметрии автомобилей, обучающих запусках и упавших eval-задачах.
Но Waymo также оценивает этих агентов, чтобы убедиться, что они выдают надёжные, точные результаты, а не уводят инженеров в сторону.
«Заслужить доверие чрезвычайно важно», - сказала Джоши.
Что это значит для бизнеса
Главный урок Waymo: агентный AI требует больше, чем выбора мощной модели. Организациям нужны чётко определённая цель, репрезентативные данные для оценки, непрерывное тестирование, инфраструктура, работающая эффективно, и named-ответственные за запуск.
Для компаний во Владивостоке и на Дальнем Востоке, которые рассматривают внедрение технологий искусственного интеллекта, подход Waymo даёт конкретную метрику готовности: если вы не можете измерить AI-агента, вы не готовы его запускать. Безопасность ИИ и качество оценки становятся не опцией, а необходимостью. Автоматизация с помощью ИИ должна начинаться не с выбора модели, а с создания системы измерений.