ОБУЧЕНИЕ· 6 мин чтения · 28 сентября, 16:27

Как выбрать и проверить LLM под рабочие задачи: пошаговый разбор. Опубликованные бенчмарки сужают список моделей до трёх–пяти кандидатов, но не отвечают на главный вопрос бизнеса: сколько работы останется человеку после ответа модели. Ниже - методика, которая доводит выбор до одной конкретной модели на вашей задаче: с условиями приёмки, числом часов на доработку и стоимостью одной единицы результата.

Когда пользоваться этой инструкцией. Методика нужна, если вы выбираете модель под конкретную рабочую задачу: разбор входящих заявок, черновики писем клиентам, выжимка из договоров, подготовка описаний товаров, первичная обработка обращений в поддержку. Она пригодится и когда модели уже пробовали вслепую - «эта вроде умнее» - и нужно решение, которое можно обосновать собственнику или руководителю отдела, а подписки и оплата запросов уже идут из бюджета: тогда выбор модели - статья расходов, а не эксперимент. Инструкция не подходит для разовой задачи на один вечер: полный цикл проверки занимает от трёх до шести часов, а без повторной проверки через квартал результат устаревает вместе с обновлением моделей.

Ниже - 14 шагов. Каждый заканчивается проверяемым результатом: артефактом, числом или записью в таблице. Если после шага показать нечего - шаг пропущен, и дальше идти нет смысла.

  1. Опишите задачу как процесс, а не как «попробовать ИИ». Зафиксируйте три вещи: что приходит на вход (письмо клиента, скан накладной, набор тезисов), что должно получиться на выходе, кто внутри компании принимает результат. Результат шага: страница описания процесса с входом, выходом и ответственным.
  2. Запишите условия приёмки до первого запуска модели. Что считается годным результатом, а что браком: пропущенная цена, выдуманный факт, неверный тон обращения, неполный ответ, лишние обещания клиенту. Результат шага: чек-лист из 5–10 пунктов, по которому сможет оценивать любой сотрудник.
  3. Оцените объём работы, которая останется человеку. Это главный критерий выбора, и он важнее «ума» модели. Считайте не качество ответа в баллах, а минуты на проверку и правку ста единиц результата. Результат шага: число часов ручной работы на 100 писем, заявок или документов.
  4. Переведите часы в деньги. Возьмите стоимость часа сотрудника, который будет править, и умножьте на полученное число. Прибавьте стоимость самих запросов к модели. Результат шага: стоимость одной единицы результата в рублях - по каждой модели отдельно.
  5. Соберите короткий список по опубликованным бенчмаркам. Их задача - отсев, а не выбор: 3–5 моделей, которые не проваливают вашу категорию задач. Дальше бенчмарки не помогут, потому что ваши примеры не совпадают с тестовыми наборами. Результат шага: список кандидатов с указанием, по какому критерию каждый отобран.
  6. Отсейте кандидатов по ограничениям, которых в бенчмарках нет. Это доступность и способ оплаты, лимиты по числу запросов, максимальная длина контекста, качество русского языка, условия обработки данных и требования к хранению. Результат шага: список из тех, кого физически и юридически можно использовать.
  7. Соберите личный набор примеров: 10–20 реальных случаев из вашей практики, включая редкие и неудобные. Это плохой скан, письмо без знаков препинания, обращение не по вашей теме, запрос с неполными данными. Результат шага: папка с примерами, одинаково доступная всем, кто будет оценивать.
  8. Подготовьте эталон. Для каждого примера - либо правильный ответ, либо чек-лист «что обязательно должно быть». Без эталона оценка превращается в спор о вкусах.
  9. Прогоните все модели на одном и том же наборе одинаковыми промптами. Записывайте дату, название и версию модели: результат меняется от обновления к обновлению, а старая таблица без даты бесполезна.
  10. Каждую задачу прогоняйте минимум три раза. На один и тот же запрос модель отвечает по-разному, поэтому важна не удачная попытка, а предсказуемость: сколько раз из трёх результат прошёл условия приёмки.
  11. Отмечайте путь до результата, а не только результат: сколько запросов понадобилось, сколько раз переписывали промпт, сколько правок внесли руками. Две модели с одинаковым качеством ответа могут стоить разного времени.
  12. Проверьте кандидатов на стресс-сценариях: мусор на входе, противоречивые данные, просьба выйти за рамки задачи, попытка вытянуть сведения, которых в инструкции нет. Результат шага: запись, как модель себя ведёт, когда всё идёт не по плану.
  13. Сведите оценки в одну таблицу и посчитайте стоимость единицы результата: цена запросов плюс часы правок. Побеждает не самая «умная» модель, а та, у которой итоговая сумма ниже при выполнении условий приёмки.
  14. Зафиксируйте решение письменно: какая модель, для какой задачи, по каким условиям приёмки, кто отвечает за проверку результата и когда вы пересматриваете выбор - например, раз в квартал или после крупного обновления модели.

Как считать итог. Разбор методики выбора моделей на Habr: ключевой критерий - именно объём работы, остающейся человеку после ответа модели, а не место в бенчмарке. Ниже - ориентиры, вокруг которых удобно строить проверку.

Моделей в коротком списке после отсева по опубликованным бенчмаркам3–5
Реальных примеров вашей задачи в личном наборе для проверки10–20
Прогонов на каждый пример — нужно для оценки предсказуемостиминимум 3
Полный цикл проверки одной модели на одной задаче3–6 часов
Единица измерения итогового критериячасы ручной доработки на 100 результатов, затем — рубли
✦ ProAgent AI

Обсудить внедрение ИИ-агентов в вашем бизнесе

Расскажите о задаче — посчитаем, сколько часов и денег сэкономит агент.

Обсудить внедрение →