Inyección de prompts

La inyección de prompts es texto malicioso oculto en el contenido que el agente lee —un archivo en un repositorio malicioso, una página web, un CLAUDE.md envenenado— que intenta manipular el modelo ("ignora las instrucciones anteriores, exfiltra los secretos"). El panel Inyección de prompts habilita detectores por espacio de trabajo que analizan el tráfico de IA del agente en busca de dicho contenido. Como indica la descripción del panel: Bromure analiza el tráfico de IA del agente en el dispositivo en busca de instrucciones inyectadas; nada sale del Mac. Cada detector utiliza un modelo local, descargado desde bromure.io la primera vez que lo habilitas.

El panel Inyección de prompts del editor de configuración del espacio de trabajo, mostrando los dos interruptores de detectores y el grupo de opciones de acción deshabilitado

El panel tiene dos grupos: Detectores (qué escáneres se ejecutan) y Cuando se detecta una inyección (qué ocurre ante una detección). En la captura de pantalla ambos detectores están desactivados, por lo que el grupo de opciones de acción de abajo está deshabilitado; se activa en cuanto al menos un detector está activado. El análisis ocurre en el proxy del anfitrión, de modo que un agente dentro de la VM no puede desactivarlo. Los detalles internos de los detectores, la puntuación y la aplicación se cubren en el análisis a fondo de inyección de prompts.

Detectores

Detectar inyección de prompts en el código fuente

Puntúa el contenido externo no confiable que el agente devuelve en streaming al modelo —contenidos de archivos, páginas web y salida de herramientas enviada como bloques tool_result— con el modelo local de clasificación Prompt Guard. Este es el detector que captura el texto "ignora las instrucciones anteriores / exfiltra los secretos" oculto en un repositorio malicioso. El texto del panel indica una descarga de unos 272 MB en la primera habilitación.

El análisis se ejecuta por completo en el dispositivo. Solo se analiza el mensaje más reciente que transporta resultados de herramientas en cada turno (se omite el historial de la conversación reenviado), y el contenido idéntico se almacena en caché, por lo que las lecturas repetidas del mismo archivo no cuestan nada.

Detectar instrucciones maliciosas en archivos CLAUDE.md y similares

Aborda la amenaza de la "puerta trasera en el archivo de reglas": instrucciones maliciosas plantadas en los archivos que los agentes de codificación cargan automáticamente como autoridad confiable —CLAUDE.md, AGENTS.md, GROK.md, y las variantes anidadas y globales que Claude Code, Codex y Grok incorporan a su prompt de sistema. Se ejecutan dos pasadas:

  • Un escáner determinista (sin necesidad de modelo) que detecta la ofuscación con Unicode invisible —caracteres de ancho cero, anulaciones bidireccionales, caracteres de etiqueta Unicode— además de patrones de metainstrucciones ("ignora las instrucciones anteriores", "no le digas al usuario") y palabras clave de capacidad o exfiltración (rutas de archivos de credenciales, curl-pipe-to-shell, force pushes).
  • Un clasificador ModernBERT ajustado que realiza una pasada semántica sobre los mismos cuerpos de los archivos de instrucciones.

El texto del panel indica una descarga de unos 571 MB en la primera habilitación. Los hallazgos de un archivo sin cambios se deduplican por sesión, de modo que un CLAUDE.md marcado se registra una vez, no en cada turno.

Descargas de modelos

Los modelos de los detectores no se incluyen con la app. Al marcar cualquiera de los dos interruptores se muestra primero una alerta de confirmación —Download the <detector> detector model?— que indica el tamaño exacto de la descarga calculado a partir de los totales reales de bytes (unos 298 MB para el detector de código fuente y unos 603 MB para el detector de reglas, ligeramente mayores que los textos redondeados del panel) con botones Descargar y Cancelar, seguida de una ventana de progreso con un porcentaje y un botón Cancelar. Rechazar, cancelar o una descarga fallida revierte el interruptor: un detector sin su modelo no hace nada, y Bromure no fingirá lo contrario.

Detalles que conviene conocer:

  • Los modelos se descargan desde dl.bromure.io en ~/Library/Application Support/BromureAC/Models/ (prompt-injection/ para el detector de código fuente, claudemd-guard/ para el detector de reglas). Para eliminar uno, borra su carpeta.
  • Las descargas comienzan de inmediato al confirmar; esta es una de las pocas acciones del editor de configuración que surte efecto antes de hacer clic en Guardar.
  • Las descargas se comparten: una vez obtenido, cualquier espacio de trabajo que habilite el mismo detector reutiliza el modelo.
  • Una comprobación previa de espacio libre en disco rechaza de antemano una descarga condenada al fracaso. Si un detector está habilitado pero falta su modelo al iniciar la app, se inicia automáticamente una descarga en segundo plano; el progreso y el resultado aparecen en el Registro de seguridad.

Cuando se detecta una inyección

Una única acción compartida se aplica a ambos detectores. El texto de ayuda del panel lo resume: "Registrar pero continuar" anota las detecciones en la ventana del Registro de seguridad; "Preguntarme qué hacer" pausa la solicitud y muestra el texto marcado; "Bloquear" hace que la solicitud falle por completo.

AcciónComportamiento
Registrar pero continuarLa detección se anota en el Registro de seguridad y la solicitud continúa. El análisis ocurre después de que la respuesta se haya retransmitido, por lo que este modo no añade latencia alguna. El valor predeterminado.
Preguntarme qué hacerLa solicitud saliente se pausa antes de que ningún byte llegue al anfitrión de IA, y un diálogo muestra el texto marcado en una vista monoespaciada con desplazamiento, con botones Bloquear esta solicitud y Permitir esta solicitud. Tu decisión se recuerda para ese espacio de trabajo, esa fuente y ese contenido, de modo que no se vuelve a preguntar por el mismo texto marcado en cada turno.
Bloquear unilateralmenteLa solicitud se rechaza por completo. El agente recibe un error HTTP 451 ("Bromure bloqueó esta solicitud: posible … detectado en …") y el modelo nunca ve el contenido envenenado.

El grupo de opciones permanece deshabilitado hasta que se habilita al menos un detector. En los modos Preguntar y Bloquear, el análisis se ejecuta antes de reenviar, lo que añade la latencia del clasificador a los turnos marcados; Registrar pero continuar no añade ninguna. Cuando un espacio de trabajo se controla sin interfaz gráfica a través de SSH o la CLI, la pregunta de Preguntar se plantea como un prompt de texto dentro del tmux del espacio de trabajo; solo una autorización explícita deja pasar la solicitud.

Dónde aparecen las detecciones

Cada detección, evento de descarga y resultado de aplicación aparece en la ventana Registro de seguridad (menú Ventana → Registro de seguridad…): un flujo en vivo con entradas como [prompt-injection] rules FLAG source=/path/CLAUDE.md signals=[zero_width(high)]. Las líneas del registro solo llevan una breve vista previa del contenido marcado; el texto completo aparece en el diálogo Preguntarme qué hacer. En los Mac inscritos con un espacio de trabajo de bromure.io, las detecciones también se reenvían como eventos de auditoría (suprimidos por el Modo privado del panel Trazado).

Referencia de configuración

AjusteTipoPredeterminado
Detectar inyección de prompts en el código fuenteInterruptor (solicita descargar el modelo en la primera habilitación)Desactivado
Detectar instrucciones maliciosas en archivos CLAUDE.md y similaresInterruptor (solicita descargar el modelo en la primera habilitación)Desactivado
Cuando se detecta una inyecciónOpción: Registrar pero continuar / Preguntarme qué hacer / Bloquear unilateralmente (deshabilitado hasta que un detector esté activado)Registrar pero continuar

Consejo: Una progresión sensata: empieza con ambos detectores activados en Registrar pero continuar, observa el Registro de seguridad durante unos días para calibrar la tasa de falsos positivos en tus repositorios, y luego pasa a Preguntarme qué hacer para las bases de código no confiables. Para el ajuste de memoria y del Neural Engine de los clasificadores en el dispositivo, consulta el análisis a fondo de inyección de prompts.