Когда контроль качества становится узким местом: оценку бота отдают модели
Обычно автоматизируют то, что делают люди, - ответы клиентам. В кейсе MTS автоматизировали другое: проверку этих ответов. Бот отвечает мгновенно и без выходных. А контроль за тем, что именно он отвечает, упирается в человека: он читает диалоги глазами и успевает просмотреть лишь часть.
Арифметика, которая объясняет, почему ручной контроль перестаёт работать. По данным разбора, до автоматизации команда оценивала около 3000 сессий в месяц - примерно 100 в день и 4–5 в час. Такой объём один-два специалиста ещё могут выборочно просматривать. После перехода на автоматическую оценку система обрабатывает до 100 сессий в секунду, то есть до 360 000 в час. Один час работы метрики сопоставим с тем, что раньше занимало месяцы: разрыв в порядках, а не в разы. Ручная проверка физически не может покрыть поток, а пока покрытие частичное, вы управляете качеством по ощущениям.
Второй момент: команда не взяла готовый отраслевой бенчмарк, а разработала собственную метрику на базе LLM. Качество ответа в поддержке - не «правильность» в вакууме: технически верный ответ может обещать срок, которого компания не выдержит, называть цену, которой нет в прайсе, и не решать вопрос клиента, хотя диалог формально закрыт. Внешний бенчмарк такого не измеряет: он про язык, а не про вашу коммерческую логику. Поэтому автоматическая оценка начинается не с выбора модели, а с документа, где расписано, что считается хорошим ответом именно у вас: какие обязательства можно давать, какие нельзя, когда разговор обязан уйти человеку. Метрика - оцифрованная версия ваших правил, модель здесь лишь исполнитель.
Механика ближе к схеме «модель проверяет модель». Прежние проверки работали по правилам и ключевым словам: нашли слово «гарантия» - пометили диалог, на смысл не реагировали, обойти их ничего не стоило. Метрика на базе LLM читает диалог целиком и отвечает на вопрос, который раньше задавал только человек: решён ли вопрос, соблюдены ли правила, не выдуманы ли цифры и сроки. Именно это позволило заменить ручную проверку автоматической, а не просто ускорить её. Практический вывод для компании поменьше: как только у вас есть письменный набор критериев, оценку можно поручить модели - не потому что она оценивает лучше человека, а потому что масштабируется без найма и не устаёт на тысячном диалоге.
Третье следствие - в цикле управления. Когда качество проверяется выборкой раз в месяц, системная ошибка живёт в проде месяц: бот путает два тарифа, десятки клиентов получают неверную информацию, а специалист случайно наткнётся на такой диалог в выборке. Когда оценка идёт по всему потоку, отклонение видно почти сразу и превращается в правку сценария или промпта в тот же день. Для бизнеса это не абстрактная «работа над качеством», а конверсия: неверно названная цена - потерянная сделка.
Наконец, граница применимости. Оценивать смысл диалога моделью дешевле, чем читать его человеком, но метрика - тоже модель, и её надо валидировать: сверить вердикты с разметкой специалистов на нескольких сотнях диалогов и понять, где она ошибается. Оценка отвечает на вопрос «насколько хорошо», но не «почему сломалось» - причину ищет человек. А если в диалогах есть персональные данные, прогон их через модель - отдельная ответственность по 152-ФЗ: решить, где живут данные и кто имеет к ним доступ, нужно до запуска.
- Сначала критерий, потом модель. Пример: MTS не ограничилась готовым отраслевым бенчмарком, а разработала собственную метрику под свою поддержку. Обобщение: LLM-оценка работает ровно настолько, насколько качество расписано словами - что считается решением, что нарушением, что передачей оператору.
- Оценивайте весь поток, а не выборку. Пример: 3000 сессий в месяц ещё можно просмотреть руками, 100 в секунду - нет. Обобщение: выборочная проверка даёт снимок, а не систему; сбой, не попавший в выборку, обнаруживается через месяц и по жалобам клиентов.
- Оценка - отдельный контур, а не функция бота. Пример: продукт MWS AI Клиентский сервис, вокруг которого выстроена работа с клиентским сервисом. Обобщение: метрику проектируют так же отдельно, как бота: свои критерии, своя история оценок, свои пороги для разбора.
- Человек не исчезает, а меняет роль. Пример: ручную проверку заменила автоматическая, но решения по итогам принимает команда. Обобщение: оператор не листает диалоги, а разбирает случаи с плохим баллом - работа дороже и полезнее.
- Считайте выгоду в часах ревью, а не в диалогах. Пример: масштаб оценки вырос с 3000 сессий в месяц до 100 в секунду. Обобщение: считайте, сколько человеко-часов уходило на контроль качества и сколько диалогов оставалось непроверенными: первое - деньги, второе - риск.
«От 3000 сессий в месяц до 100 в секунду»
Обсудить внедрение ИИ-агентов в вашем бизнесе
Расскажите о задаче — посчитаем, сколько часов и денег сэкономит агент.
Обсудить внедрение →