安全实践 · 03

外部文本如何让 AI 智能体违反规则

难度:高级阅读:9 分钟结果:一个最小提示注入测试

邮件、网页和文档中的一句“忽略之前的指令”,对模型来说可能看起来像命令,但对系统来说它只是外部数据。

分离三种内容

系统规则、用户任务和外部文档必须分开。外部文档要明确标记来源,不能改变权限、收件人、预算或任务优先级。

缩小工具权限

每个工具只获得完成任务所需的最小权限。域名、命令和收件人使用允许列表。不要把密钥放进文档上下文。

如何测试

在邮件中放入读取 .env 的要求,在 HTML 白色文字中隐藏指令,再要求智能体把结果发到外部地址。正确行为应该是识别风险、停止动作并请求人工确认。

为什么关键词过滤不够

攻击者可以换一种说法。可靠防护需要工具边界、确认机制、审计日志和使用真实输入格式的回归测试。

← 返回中文首页 · 阅读英文版 →