安全实践 · 03
外部文本如何让 AI 智能体违反规则
邮件、网页和文档中的一句“忽略之前的指令”,对模型来说可能看起来像命令,但对系统来说它只是外部数据。
分离三种内容
系统规则、用户任务和外部文档必须分开。外部文档要明确标记来源,不能改变权限、收件人、预算或任务优先级。
缩小工具权限
每个工具只获得完成任务所需的最小权限。域名、命令和收件人使用允许列表。不要把密钥放进文档上下文。
如何测试
在邮件中放入读取 .env 的要求,在 HTML 白色文字中隐藏指令,再要求智能体把结果发到外部地址。正确行为应该是识别风险、停止动作并请求人工确认。
为什么关键词过滤不够
攻击者可以换一种说法。可靠防护需要工具边界、确认机制、审计日志和使用真实输入格式的回归测试。