Des attaques de démonstration exploitent les failles de confiance du MCP
Un chercheur indépendant a présenté des attaques prouvant qu'il est possible de propager des instructions malveillantes entre agents IA internes via le Model Context Protocol.
Un chercheur indépendant a dévoilé des attaques de démonstration qui exploitent les lacunes de confiance du Model Context Protocol (MCP), selon Ars Technica. La technique consiste à propager des instructions nuisibles d'un agent IA interne vers d'autres agents au sein d'une même organisation.
Ces attaques relèvent d'une forme d'injection de prompt qui cible un agent précis plutôt que le grand modèle de langage (LLM) lui-même. Le chercheur a testé des agents de Google, JP Morgan Chase, Weviate, Rapid7, de la direction interministérielle du numérique du gouvernement français et du gouvernement fédéral des États-Unis.
Dans de nombreux cas, les prompts ainsi conçus aboutissent à une falsification de requête côté serveur (server-side request forgery), précise Ars Technica.
Un contexte de vulnérabilités déjà signalées
Au cours des cinq derniers mois, Google et quatre autres organisations ont reconnu des vulnérabilités permettant à un agent compromis au sein d'un réseau ciblé de diffuser des instructions nuisibles vers d'autres agents internes.
En bref
Qu'est-ce que le Model Context Protocol (MCP) ?
C'est le protocole ciblé par les attaques démontrées par le chercheur, qui exploitent les relations de confiance entre agents IA internes.
Quels agents ont été testés par le chercheur ?
Des agents de Google, JP Morgan Chase, Weviate, Rapid7, de la direction interministérielle du numérique du gouvernement français et du gouvernement fédéral des États-Unis.
Quel est l'effet des prompts malveillants dans de nombreux cas ?
Dans de nombreux cas, les prompts conçus aboutissent à une falsification de requête côté serveur (server-side request forgery).