КЕЙСЫ· 4 мин чтения · 30 сентября, 19:27

Один комментарий - несколько тем: что даёт конвейер разметки, собранный из ролей, а не из одного большого промпта

Разметить обратную связь одним запросом к модели - самый быстрый путь к отчёту, которому нельзя верить. Команда Авито Рекламы разложила эту работу по ролям: языковые задачи - агентам, механические - коду, договорённости о категориях - людям.

Один комментарий клиента редко содержит одну мысль. «Доставили на день позже, курьер не позвонил, но поддержка ответила быстро» - это три темы: сроки, коммуникация курьера, качество поддержки. Если разметчик выбирает главное, в отчёте остаётся то, что громче звучит, а не то, что встречается чаще. Бизнес получает аккуратную диаграмму, чинит не ту проблему и через месяц удивляется, почему жалобы не прекратились.

Команда Авито Рекламы собрала внутренний конвейер из трёх частей. Языковую работу выполняют специализированные ИИ-агенты: каждый отвечает за свою зону, а не за «разметку вообще». Всё, что можно посчитать и проверить, вынесено в Python-помощника. Категории живут в обновляемой таксономии - отдельном словаре, который правят люди и который подключается к разметке. Ключевое свойство: конвейер сохраняет все темы комментария и применяет к ним одни и те же правила, а не переизобретает их на каждом новом тексте.

Почему один промпт перестаёт справляться. Пока категорий немного, большой запрос работает. Когда их становится много и они пересекаются, происходят три вещи. Контекст размывается: модель уверенно выбирает одну тему и молча теряет остальные. Правила противоречат друг другу, потому что живут в одном тексте, который кто-то в спешке дополнил. И невозможно понять, где именно ошибка - в словаре категорий, в формулировке задачи или в самой модели. Разделение на роли лечит не качество модели, а управляемость процесса.

Что из этого повторяет команда без инфраструктуры Авито. Первый шаг - выписать таксономию до того, как звать модель: список тем с примерами реальных фраз клиентов, а не абстрактные «качество» и «сервис». Второй - развести смысл и механику: склейку дублей, счётчики, сортировку и присвоение идентификаторов делает код, а не языковая модель, которая отвечает только за понимание текста. Третий - заранее договориться о проверке: например, раз в месяц руками размечать выборку и сравнивать с результатом конвейера. Без третьего шага система тихо деградирует: продукт меняется, категории устаревают, а заметить это некому.

  1. Таксономия - отдельный артефакт, а не строчка в промпте. В Авито категории вынесены в обновляемый словарь, который можно править без пересборки всей системы. Если ваш список тем живёт внутри текста запроса, первое же изменение продукта превратит разметку в угадывание.
  2. Считаемое считает код. В конвейере Авито механическая часть отдана Python-помощнику, языковая - агентам. Модель, которую попросили заодно посчитать частоты и склеить дубли, ошибается тихо и правдоподобно - такие ошибки хуже явных сбоев.
  3. Полнота важнее правдоподобия. Конвейер сохраняет все темы комментария, а не только главную. Проверять разметку стоит вопросом «сколько тем мы потеряли», а не «похоже ли на правду»: первое измеряется, второе - нет.
  4. Узкая зона ответственности даёт управляемость. Специализированные агенты вместо одного универсального - понятная точка отказа: видно, какая часть сломалась и что править, вместо общей фразы «модель стала отвечать хуже».
  5. Без внешней проверки система разъезжается. Любой конвейер разметки деградирует вместе с продуктом, поэтому контрольная выборка руками - часть процесса, а не разовая проверка при запуске.

«Как мы собрали ИИ-конвейер для разметки продуктового фидбэка»

— Заголовок разбора команды Авито Рекламы, Habr

Честная оговорка про цифры. В опубликованном разборе нет измерения выгоды: сколько часов команда экономит, сколько стоят прогоны, как изменилась точность разметки до и после. Это не отменяет ценности кейса - архитектурные решения описаны достаточно, чтобы их повторить. Но считать эффект придётся вам самим: простая рамка - сколько времени уходит на разметку сейчас, сколько тем в среднем содержит один комментарий, как часто выводы из фидбэка меняли план работ. Через месяц после внедрения сравните эти три числа - они и будут вашей выгодой.

Состав конвейера3 части: специализированные ИИ-агенты, Python-помощник, обновляемая таксономия
Правило разметкисохраняются все темы комментария, а не только главная
Цифры экономии и точности в опубликованном кейсене раскрыты
✦ ProAgent AI

Обсудить внедрение ИИ-агентов в вашем бизнесе

Расскажите о задаче — посчитаем, сколько часов и денег сэкономит агент.

Обсудить внедрение →