跳到主内容
智联观察
← 返回资料库

从 A2A 攻击到信封层防御:LLM 智能体红队评估与三层同构攻防模型

Yuelin Han

论文 2026 原文 2026-09-30 arXiv preprint (cs.CR) arXiv:2610.00392 收录 2026-10-05 A2AACPprompt-injectionred-teamingagent-securityenvelope-layer

摘要

智能体交互协议(如 ACP、A2A)把基于大模型的智能体推向多智能体协作,也带来新的安全威胁:经 A2A 由远端对端发来的任务会被当作合法请求,成为间接提示注入的天然通道。现有智能体安全评估多依赖单一指标——攻击成功率(ASR),无法区分攻击失败是因为大模型识别出了恶意内容,还是因为智能体层某机制阻断了执行。为此提出攻击原理 A2A-TIBA,把间接提示注入与绕过规避结合:通过「植入—命令—外泄」步骤诱导目标智能体部署回调交互程序,随后攻击者绕过智能体下发指令。为更细粒度地评估防御,设计了红队测试台方法 GDA Measurement(经 LLM 网关做原始上下文捕获、双份数据留存、基于智能体的自主评判),并提出 A/B/C/D 四类攻击结果,把 ASR 扩展为语义拒答率、语义突破率、拦截率与穿透率。实验揭示「信封层」——恶意内容进入智能体的通道——是一个新的防御维度,据此提出ELA-ITL 三层同构攻防模型:防御分为信封打包、LLM 识别、智能体拦截,攻击分为植入通道、提示优化、执行机制。在 15 组「智能体前端 × LLM 后端」组合上测试并构建 1000 例数据集,验证了 A2A-TIBA 的攻击有效性、GDA Measurement 的评估有效性,并确认在 A2A、工具、记忆等信封打包通道中加入恶意提示标注,可显著提升大模型对恶意内容的识别。

引用本文条目

GB/T 7714-2015

Yuelin Han. From A2A Attacks to Envelope-Layer Defense: Red-Teaming Evaluation of LLM Agents and a Three-Layer Isomorphic Attack-Defense Model[EB/OL]. arXiv preprint (cs.CR), 2026(2026-09-30)[2026-10-05]. https://arxiv.org/abs/2610.00392.

BibTeX

@misc{han2026,
  author = {Yuelin Han},
  title = {From A2A Attacks to Envelope-Layer Defense: Red-Teaming Evaluation of LLM Agents and a Three-Layer Isomorphic Attack-Defense Model},
  year = {2026},
  organization = {arXiv preprint (cs.CR)},
  howpublished = {\url{https://arxiv.org/abs/2610.00392}},
}

查看原文 ↗

本条目为「智联观察」资料库收录,引用时请注明来源与本页链接。