智能体安全相关论文阅读
Not what you’ve signed up for: Compromising Real-World LLM-Integrated Applications with Indirect Prompt Injection
间接提示词注入 (IPI), 把攻击内容放在检索数据中, 模型很难防御.
威胁:
- 信息窃取: 通过说服模型构造搜索请求, 拼接 URL, 调用 API, 获取用户信息.
- 诈骗: 伪造假信息.
- 恶意软件传播: AI worm
- 系统入侵: 远程控制, 持久化感染, API 操控, 代码补全污染, 能达到很接近传统后门的行为.
- 生成内容操控.
- 可用性攻击: 让模型执行耗时任务, 破坏 query, 插入零宽连接符, 禁止调用 API 等.
隐藏注入技术:
- 多阶段注入: 小注入触发模型下载更大的 payload.
- 编码注入: 如 base64 编码 prompt, 即使没有明确指示, 模型也会解码.
作者还注意到了三点:
- 攻击者可以仅仅概括攻击目标, 模型可能会自主执行 (什么内鬼).
- 可以通过与主题边缘相关的上下文操纵模型生成内容.
- 模型可能会发出受注入提示影响并加强的后续 API 调用, 这对智能体尤其危险.

