工程实践 · 02

如何测试 LLM 应用的回归问题

难度:中级阅读:8 分钟结果:一套可重复的评估流程

更换模型或修改一条系统指令,可能让演示案例变好,却让几十个真实场景变差。只测试一个成功案例,不能证明应用安全。

建立真实案例集

从真实请求中选出不同类型的样本:正常请求、模糊请求、重复请求、带文件的请求、危险动作和外部服务错误。每个样本都要记录预期行为,而不只是期望的文字答案。

测量什么

至少记录路由是否正确、工具是否重复调用、响应延迟、输入和输出成本、人工修改次数以及权限违规次数。相同输入必须在每个版本上运行。

通过标准

新版本只有在关键场景不退化时才算通过。答案更漂亮、字数更多或语气更自信,都不能替代结果验证。

常见错误

没有预期结果的测试只能说明模型输出了某些文字。人工检查一次成功对话,也不能代替持续回归测试。

← 返回中文首页 · 阅读英文版 →