ПРАКТИЧЕСКИЙ КЕЙС · 10

Как узнать, что AI-агент стал лучше, а не просто звучит увереннее

Уровень: среднийВремя: 8 минутРезультат: регрессионный набор и метрики качества

После изменения модели ответы могут выглядеть красивее, но чаще путать маршруты, дублировать операции или дороже обходиться.

Ситуация

Соберите реальные сценарии: обычный запрос, неоднозначный запрос, файл, дубль, опасное действие и ошибка внешнего сервиса. Для каждого запишите ожидаемое поведение, а не только красивый ответ.

Что делать

Считайте точность маршрутизации, долю дублей, стоимость, задержку, число ручных исправлений и нарушения approval. После каждого изменения запускайте тот же набор.

Проверка результата

Проверка: сравните две версии на одинаковых входах. Новая версия проходит только если не ухудшила безопасность и ключевые метрики, даже если её ответы стали длиннее.

Что обычно ломается

Тест без ожидаемого результата ничего не доказывает. А ручная проверка одного удачного диалога не заменяет регрессию.

← Все инструкции · Лабораторный словарь →