Injection de prompt
L'injection de prompt désigne un texte malveillant dissimulé dans le contenu que lit l'agent — un fichier dans un dépôt malveillant, une page web, un CLAUDE.md empoisonné — qui tente d'orienter le modèle (« ignore les instructions précédentes, exfiltre les secrets »). Le volet Injection de prompt active des détecteurs par espace de travail qui analysent le trafic IA de l'agent à la recherche de tels contenus. Comme l'indique la description du volet : Bromure analyse le trafic IA de l'agent sur l'appareil à la recherche d'instructions injectées — rien ne quitte le Mac. Chaque détecteur utilise un modèle local, téléchargé depuis bromure.io la première fois que vous l'activez.
Le volet comporte deux groupes : Détecteurs (quels analyseurs s'exécutent) et Lorsqu'une injection est détectée (ce qui se produit en cas de détection). Sur la capture d'écran, les deux détecteurs sont désactivés, de sorte que le groupe d'options d'action situé en dessous est désactivé — il s'active dès qu'au moins un détecteur est activé. L'analyse a lieu dans le proxy de l'hôte, si bien qu'un agent dans la VM ne peut pas la désactiver. Le fonctionnement interne des détecteurs, la notation et l'application des règles sont traités dans l'analyse approfondie de l'injection de prompt.
Détecteurs
Détecter l'injection de prompt dans le code source
Note le contenu externe non fiable que l'agent renvoie en flux au modèle — contenus de fichiers, pages web et sorties d'outils envoyées sous forme de blocs tool_result — à l'aide du modèle de classification local Prompt Guard. C'est le détecteur qui repère le texte « ignore les instructions précédentes / exfiltre les secrets » dissimulé dans un dépôt malveillant. La légende du volet indique un téléchargement d'environ 272 MB lors de la première activation.
L'analyse s'exécute entièrement sur l'appareil. Seul le message le plus récent transportant des résultats d'outils est analysé à chaque tour (l'historique de conversation renvoyé est ignoré), et les contenus identiques sont mis en cache, de sorte que les lectures répétées du même fichier ne coûtent rien.
Détecter les instructions malveillantes dans les fichiers CLAUDE.md et similaires
Cible la menace de la « porte dérobée par fichier de règles » : des instructions malveillantes implantées dans les fichiers que les agents de codage chargent automatiquement comme autorité de confiance — CLAUDE.md, AGENTS.md, GROK.md, ainsi que les variantes imbriquées et globales que Claude Code, Codex et Grok intègrent dans leur prompt système. Deux passes s'exécutent :
- Un analyseur déterministe (aucun modèle nécessaire) qui signale l'obfuscation par Unicode invisible — caractères de largeur nulle, surcharges bidirectionnelles, caractères de balise Unicode — ainsi que les motifs de méta-instructions (« ignore les instructions précédentes », « ne le dis pas à l'utilisateur ») et les mots-clés de capacité ou d'exfiltration (chemins de fichiers d'identifiants, curl-pipe-vers-shell, force pushes).
- Un classificateur ModernBERT affiné qui effectue une passe sémantique sur ces mêmes corps de fichiers d'instructions.
La légende du volet indique un téléchargement d'environ 571 MB lors de la première activation. Les détections issues d'un fichier inchangé sont dédupliquées par session, de sorte qu'un CLAUDE.md signalé est journalisé une seule fois, et non à chaque tour.
Téléchargements de modèles
Les modèles de détecteurs ne sont pas fournis avec l'application. Le fait de cocher l'un ou l'autre des interrupteurs affiche d'abord une alerte de confirmation — Download the <detector> detector model? — indiquant la taille exacte du téléchargement calculée à partir des totaux d'octets réels (environ 298 MB pour le détecteur de code source et environ 603 MB pour le détecteur de règles, légèrement supérieurs aux légendes arrondies du volet) avec des boutons Télécharger et Annuler, puis une fenêtre de progression avec un pourcentage et un bouton Annuler. Refuser, annuler ou un téléchargement échoué rétablit l'interrupteur : un détecteur sans son modèle est inopérant, et Bromure ne prétendra pas le contraire.
Détails utiles à connaître :
- Les modèles se téléchargent depuis
dl.bromure.iovers~/Library/Application Support/BromureAC/Models/(prompt-injection/pour le détecteur de code source,claudemd-guard/pour le détecteur de règles). Pour en supprimer un, supprimez son dossier. - Les téléchargements démarrent immédiatement après confirmation — c'est l'une des rares actions de l'éditeur de paramètres qui prend effet avant que vous ne cliquiez sur Enregistrer.
- Les téléchargements sont partagés : une fois récupéré, tout espace de travail activant le même détecteur réutilise le modèle.
- Un contrôle préalable de l'espace disque libre refuse d'emblée un téléchargement voué à l'échec. Si un détecteur est activé mais que son modèle est absent au lancement de l'application, un téléchargement en arrière-plan démarre automatiquement ; la progression et le résultat apparaissent dans le Journal de sécurité.
Lorsqu'une injection est détectée
Une seule action partagée s'applique aux deux détecteurs. Le texte d'aide du volet la résume : « Journaliser mais continuer » enregistre les détections dans la fenêtre du Journal de sécurité ; « Me demander quoi faire » met la requête en pause et affiche le texte signalé ; « Bloquer » fait échouer la requête d'emblée.
| Action | Comportement |
|---|---|
| Journaliser mais continuer | La détection est enregistrée dans le Journal de sécurité et la requête se poursuit. L'analyse a lieu après que la réponse a été relayée, de sorte que ce mode n'ajoute aucune latence. Le mode par défaut. |
| Me demander quoi faire | La requête sortante est mise en pause avant qu'aucun octet n'atteigne l'hôte IA, et une boîte de dialogue affiche le texte signalé dans une vue à chasse fixe défilante, avec des boutons Bloquer cette requête et Autoriser cette requête. Votre décision est mémorisée pour cet espace de travail, cette source et ce contenu, si bien que le même texte signalé n'est pas redemandé à chaque tour. |
| Bloquer unilatéralement | La requête est refusée d'emblée. L'agent reçoit une erreur HTTP 451 (« Bromure a bloqué cette requête : … possible détecté dans … ») et le modèle ne voit jamais le contenu empoisonné. |
Le groupe d'options est désactivé tant qu'au moins un détecteur n'est pas activé. Dans les modes Me demander et Bloquer, l'analyse s'exécute avant le transfert, ce qui ajoute la latence du classificateur aux tours signalés ; Journaliser mais continuer n'en ajoute aucune. Lorsqu'un espace de travail est piloté sans interface via SSH ou la CLI, la question Me demander est posée sous forme d'invite textuelle dans le tmux de l'espace de travail — seule une autorisation explicite laisse passer la requête.
Où apparaissent les détections
Chaque détection, événement de téléchargement et résultat d'application de règle apparaît dans la fenêtre Journal de sécurité (menu Fenêtre → Journal de sécurité…) — un flux en direct avec des entrées telles que [prompt-injection] rules FLAG source=/path/CLAUDE.md signals=[zero_width(high)]. Les lignes de journal ne contiennent qu'un court aperçu du contenu signalé ; le texte complet apparaît dans la boîte de dialogue Me demander quoi faire. Sur les Mac inscrits auprès d'un espace de travail bromure.io, les détections sont également transmises sous forme d'événements d'audit (supprimés par le Mode privé du volet Traçage).
Référence des paramètres
| Paramètre | Type | Défaut |
|---|---|---|
| Détecter l'injection de prompt dans le code source | Interrupteur (invite à télécharger le modèle lors de la première activation) | Désactivé |
| Détecter les instructions malveillantes dans les fichiers CLAUDE.md et similaires | Interrupteur (invite à télécharger le modèle lors de la première activation) | Désactivé |
| Lorsqu'une injection est détectée | Options : Journaliser mais continuer / Me demander quoi faire / Bloquer unilatéralement (désactivé tant qu'un détecteur n'est pas activé) | Journaliser mais continuer |
Astuce : Une progression judicieuse : commencez avec les deux détecteurs activés en mode Journaliser mais continuer, surveillez le Journal de sécurité pendant quelques jours pour évaluer le taux de faux positifs sur vos dépôts, puis passez à Me demander quoi faire pour les bases de code non fiables. Pour le réglage de la mémoire et du Neural Engine des classificateurs embarqués, consultez l'analyse approfondie de l'injection de prompt.