Инженер Винит Виджай год строил системы классификации на RAG в регулируемых отраслях, где цена неверного ответа это не плохой ответ чат-бота, а проваленный аудит. Его вывод: большую часть запросов вообще не нужно отправлять в языковую модель. Каскад из трёх ступеней сократил расходы на инференс в шесть раз.
Три невидимые проблемы пайплайна на LLM
Соблазн прогнать всё через языковую модель понятен: меньше деталей, быстрее итерации, модель сама разберётся с неожиданными случаями. Проблемы появляются позже, и их три.
Первая - аудируемость. Ответ «модель решила на основе извлечённого контекста» не принимается, когда решение должен восстановить человек без повторного запуска инференса. Вторая - стоимость. Если система обрабатывает десятки тысяч кейсов в день и каждый уходит в LLM с несколькими документами в контексте, счёт и задержки растут вместе с объёмом. Третья - дрейф модели на простых случаях. LLM отлично справляются с тонкими суждениями и непоследовательны там, где ответ должен быть детерминированным. Чёткое совпадение с известными критериями не должно зависеть от настроения модели.
Каскад: модель как эскалация, а не первый рубеж
Решение в том, чтобы перестать использовать LLM на передовой и сделать её путём эскалации. На практике это пайплайн из трёх ступеней.
Первая ступень детерминированная. Точные совпадения, сравнения структурированных полей и всё, что подчиняется чёткому правилу, решается здесь без вызова модели. Эта ступень снимает большую часть объёма, часто больше половины, и каждое решение полностью объяснимо: это поиск по справочнику, а не инференс.
Вторая ступень - поиск. Для случаев, которые пережили первую ступень, строится слой извлечения: предыдущие решения ревьюеров по похожим кейсам, документы, объясняющие кажущееся противоречие, прецеденты по спорным случаям. Здесь извлечение важнее генерации. Если найден не тот контекст, даже лучшая модель даст уверенный, логичный и неверный ответ.
Третья ступень - вызов LLM, и он должен видеть только остаток, который первые две ступени не смогли разрешить. Этот шаг пропускают в первой версии, а именно он даёт главный эффект по деньгам и качеству. В одной из систем автора маршрутизация только 10-15% спорных случаев в LLM сократила расходы на инференс в шесть раз относительно варианта, где всё шло через модель.
Ключевая цифра: маршрутизация только 10-15% неоднозначных случаев в LLM сократила расходы на инференс в 6 раз и подняла согласованность на детерминированном большинстве до идеальной.
Промпт с асимметричным риском
Когда кейс доходит до LLM, большинство команд использует нейтральный промпт: «Оцените, одобрить или пометить этот случай». Для классификации с высокими ставками такая формулировка неверна, потому что цена двух типов ошибок несимметрична. Пропустить случай, который требовал внимания, значит допустить реальный вред. Ложно пометить нормальный случай - потратить время ревьюера. Эти два исхода редко равноценны, а нейтральный промпт предлагает модели считать их равными.
Промпт с асимметричным риском делает этот компромисс явным. Модели говорят: неуверенность это повод эскалировать, а не снять вопрос. Приводятся калиброванные примеры обоих типов ошибок с последствиями. И вместо бинарного ответа модель выдаёт оценку уверенности. Порог по этой оценке становится второй точкой каскада: всё, что ниже порога, уходит человеку, независимо от классификации модели.
Как оценивать такую систему
Стандартные метрики RAG для этого сценария не подходят, и использовать их без адаптации значит получить ложную уверенность. Поиск нужно измерять отдельно от точности финальной классификации: система может отлично ранжировать документы и принимать плохие решения, если генерация неправильно взвешивает доказательства.
В оценочном наборе нужно намеренно перепредставить случаи, которые доходят до третьей ступени, потому что именно там проверяется суждение системы. Набор, повторяющий боевое распределение, будет dominated детерминированными случаями, которые каскад и так решает хорошо, и скроет именно те сбои, которые важнее всего.
Оценка «LLM как судья» работает, только если промпт судьи кодирует ту же асимметрию риска, что и боевой промпт. И нужна обратная связь: когда ревьюер отменяет решение модели, этот случай с правильным разрешением должен попадать в поисковый корпус. Без этого система вечно повторяет одну и ту же категорию ошибок.
Что это значит для бизнеса
Инстинкт брать самую мощную модель для каждого решения понятен. В областях, где неверный ответ имеет последствия, ценная инженерная работа это решить, что вообще не должно касаться модели. Каскадная архитектура это не обход ограничений LLM, а вид зрелой RAG-системы, у которой решения пришлось защищать перед человеком, чья работа искать изъяны в логике.
Для компаний во Владивостоке и на Дальнем Востоке, которые внедряют ИИ в документооборот, скоринг заявок или обработку обращений, схема прямая: автоматизация бизнес-процессов начинается с детерминированных правил, а нейросети для бизнеса подключаются только к спорным случаям. Внедрение искусственного интеллекта в таких системах окупается быстрее, когда 85-90% кейсов решаются без вызова LLM. Разобрать, какие решения в вашей компании должны принимать правила, а какие модель, поможет бесплатный аудит.