Качество ИИ нельзя оценивать по пяти удачным примерам. Перед запуском нужно собрать фиксированный набор реальных случаев, заранее записать правильные результаты и посчитать ошибки. Такая проверка покажет, с какими задачами система справляется самостоятельно, а какие необходимо направлять сотруднику.
Соберите тестовый набор
Для небольшой проверки достаточно 30–50 примеров:
обычные случаи;
документы плохого качества;
неполные данные;
редкие исключения;
похожие формулировки с разным смыслом;
случаи с высокой ценой ошибки.
Для каждого примера человек заранее готовит правильный ответ. Это будет эталон для сравнения.
Что измерять
Полезно считать:
долю полностью правильных результатов;
количество исправлений сотрудника;
критические ошибки;
время обработки;
долю случаев, переданных человеку;
стоимость одной операции.
Ошибка в оформлении черновика и ошибка в сумме платежа должны учитываться по-разному. Поэтому одного показателя «точность 90%» недостаточно.
Когда тест нужно повторять
Проверку проводят заново, если компания:
меняет модель;
редактирует промпт;
добавляет новый тип документов;
подключает другой источник данных;
меняет бизнес-правила;
расширяет полномочия системы.
ИИ-проект готов к запуску не тогда, когда модель однажды дала хороший ответ, а когда компания знает границы ее надежности и умеет обрабатывать ошибки.
В Telegram я разбираю тестирование, пилоты и перевод ИИ в промышленную эксплуатацию.
Роман Ткачев — эксперт по автоматизации корпоративных процессов и практическому применению ИИ в работе корпоративных служб.


