ПРАКТИЧЕСКИЙ КЕЙС · 10
Как узнать, что AI-агент стал лучше, а не просто звучит увереннее
После изменения модели ответы могут выглядеть красивее, но чаще путать маршруты, дублировать операции или дороже обходиться.
Ситуация
Соберите реальные сценарии: обычный запрос, неоднозначный запрос, файл, дубль, опасное действие и ошибка внешнего сервиса. Для каждого запишите ожидаемое поведение, а не только красивый ответ.
Что делать
Считайте точность маршрутизации, долю дублей, стоимость, задержку, число ручных исправлений и нарушения approval. После каждого изменения запускайте тот же набор.
Проверка результата
Проверка: сравните две версии на одинаковых входах. Новая версия проходит только если не ухудшила безопасность и ключевые метрики, даже если её ответы стали длиннее.
Что обычно ломается
Тест без ожидаемого результата ничего не доказывает. А ручная проверка одного удачного диалога не заменяет регрессию.