人工智能

研究者披露 MCP 信任缺陷攻击概念验证

攻击利用内部 AI 代理之间的信任,将恶意指令从单个代理传播至其他代理,属提示注入变种。

一名独立研究者披露了一组概念验证攻击,利用 Model Context Protocol (MCP) 中的信任缺陷,使恶意指令在组织内部的 AI 代理之间传播。该研究者的测试对象包括谷歌、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字事务局以及美国联邦政府的代理。

该技术属于提示注入的一种形式,攻击目标为特定代理而非大语言模型本身。在许多情况下,精心构造的提示会导致服务端请求伪造。

研究者 Syed Anas Mohiuddin 演示了这些攻击。攻击利用内部 AI 代理之间的信任关系,将有害指令从一个代理扩散至其他代理。

背景

过去五个月中,谷歌及其他四家机构已确认存在漏洞,攻击者可利用目标网络中的一个代理,将有害指令传播至其他内部代理。

快速问答

什么是 MCP 信任缺陷攻击?

一种利用内部 AI 代理之间信任关系传播恶意指令的提示注入形式,目标是特定代理而非大语言模型本身。

哪些组织的代理被测试?

谷歌、JP Morgan Chase、Weviate、Rapid7、法国政府跨部门数字事务局以及美国联邦政府的代理。

来源