El harness encontró el bug
El 30 de julio de 2026, Google informó que Chrome 149 y 150 entregaron 1.072 correcciones de seguridad — más que los 23 hitos anteriores juntos — y que un agente encontró un escape de sandbox que llevaba 13 años en el código. El cambio de este año es el harness, no un modelo nuevo: una base de conocimiento, agentes críticos y un entorno lo bastante cerrado como para que los agentes corrieran sin supervisión a escala — sin internet general, cada petición de red verificada contra una lista de permitidos, agentes acotados al árbol de código fuente. Bromure Agentic Coding entrega ese entorno para tu portátil: una VM desechable, consentimiento de salida por destino en el proxy del host, credenciales señuelo y guardrails — la licencia para dejar correr a tu agente.
El bug tenía trece años. Sobrevivió a una década de fuzzers, cazadores de recompensas y algunos de los mejores ingenieros de seguridad del mundo — y cayó ante un agente al que dejaron correr: un harness construido a su alrededor y un entorno en el que sus operadores confiaban lo suficiente como para alejarse.
El 30 de julio de 2026, Google publicó cifras que hace un año habrían sonado a errata: Chrome 149 y 150 entregaron entre los dos 1.072 correcciones de seguridad — más que los 23 hitos anteriores juntos — y 2026 ya ha cruzado las 1.800, con Chrome 151 añadiendo otras 370. SecurityWeek y BleepingComputer destacaron la pieza estrella: CVE-2026-3545, un fallo con CVSS 9.8 en el código de navegación de Chrome que permitía a un renderer comprometido engañar al navegador para leer archivos locales — un escape de sandbox. Llevaba trece años en el código. Un agente lo encontró, y Google lo parcheó en Chrome 145 allá por mayo.
Google lleva años con modelos potentes. Su propia cronología recorre el fuzzing asistido por LLM en 2023, Naptime de Project Zero en 2024, Big Sleep encontrando bugs reales en V8 en 2025. La cifra de cuatro dígitos llegó a principios de 2026, cuando construyeron un harness de agentes alrededor de esos modelos — y el harness es la parte que merece estudio, porque el harness es la parte que tú puedes tener.
Anatomía del harness
Reduce el anuncio a su mecánica y obtienes una arquitectura.
El harness alimenta a los agentes con una base de conocimiento construida a
partir de cada CVE previa de Chrome y del historial git completo del
repositorio. Un agente crítico, con su propio contexto separado, lee los
archivos SECURITY.md y cuestiona lo que el buscador propone. El harness
ejecuta varias pasadas sobre el mismo código, con la teoría de que un modelo
no determinista en una ejecución se vuelve exhaustivo en diez. Cuando un bug
se confirma, un agente corrector redacta parches candidatos, el crítico
rebate, y los dos iteran en un bucle que Google describe como una imitación
de la revisión de código — luego agentes escritores de tests producen
cobertura para cada plataforma de Chrome, y solo entonces lo mira un
desarrollador humano. El triaje recibió el mismo tratamiento: los agentes
reproducen la prueba de concepto de un informe entrante, fechan la
introducción del bug, califican la severidad y lo encaminan a un
responsable — trabajo que costaba de cinco a treinta minutos de ingeniero
por informe, a una escala de cientos de horas al mes.
El humano de ese bucle se sienta en el merge, revisando una corrección candidata terminada y con tests adjuntos, en lugar de junto al agente aprobando cada comando. La ejecución en sí es autónoma. Mil correcciones en dos versiones es una flota corriendo de madrugada, con el juicio humano aplicado una vez, a lo que la flota trae de vuelta.
Lee la lista de restricciones dos veces
El post de Google dice qué les valió a los agentes esa libertad, en la parte que la mayoría de la cobertura se saltó. Los agentes analizan el código fuente estrictamente en reposo. Corren en máquinas cerradas que no tienen acceso general a internet. Un montaje dedicado intercepta cada petición de red y la verifica contra una lista de permitidos estricta. Los subagentes tienen prohibido modificar el sistema local o leer nada fuera de los directorios de código fuente.
Esa lista es la precondición del logro. La autonomía es lo que produce escala, y la autonomía es lo que no puedes conceder mientras la frontera viva en tu atención — mientras lo único entre el agente y tu máquina, tus claves y el internet abierto seas tú, mirando. Google puso la frontera en el cable: una red que rechaza por defecto, una valla en el sistema de archivos, un entorno que sostiene las reglas para que los operadores no tengan que hacerlo. Luego apuntaron los agentes a una de las mayores bases de código del planeta y los dejaron correr.
Esa lista de restricciones es un perfil de Bromure, descrito desde fuera.
El mismo entorno, en tu portátil
Bromure Agentic Coding parte de la misma premisa que el harness de Google: el agente se gana la autonomía por el entorno en el que corre. Cada perfil ejecuta su agente dentro de una VM Linux desechable sobre Apple Silicon, a un hipervisor de macOS, y cada petición saliente cruza el proxy del host, donde el destino se coteja con la lista que tú aprobaste. La red rechaza por defecto, igual que la de Google. Esa es la licencia para dejar correr al agente — lanzar una tarea, cerrar la tapa, leer el diff por la mañana — porque las reglas se sostienen estés mirando o no.
Y eso hace que el propio trabajo de seguridad sea seguro de delegar, porque el trabajo de seguridad tiene forma de atacante. Los agentes de triaje de Google reproducen la prueba de concepto de los informes de bugs entrantes — ejecutan el exploit para ver si es real. Prueba eso en un portátil desnudo y el informe de bug ejecuta el comando en la máquina que guarda tus claves. En un perfil de Bromure, la PoC detona dentro de la VM desechable, donde las credenciales que puede recolectar son señuelos del broker — los valores reales viven en el host y se inyectan solo en el cable, solo para destinos aprobados — y cualquier sitio al que el payload intente llamar es una conexión que el proxy nunca deja salir. Puedes apuntar un agente a tus propios informes de crash, decirle que los reproduzca, y decirlo en serio.
La escala, la otra mitad de la cifra de Google, es trabajo de flota — pasadas múltiples, agentes en paralelo — y el producto trata la flota como una primitiva. Escribe el nombre de una tarea y un perfil de git worktree le da a esa tarea su propia rama, su propio checkout y su propio agente en su propia pestaña, cada uno dentro de su VM; la pasada nocturna de barrer la base de código en busca de bugs y el recado de perseguir el test inestable no comparten árbol de trabajo ni radio de explosión. Y para el bug difícil — el que merece una segunda opinión — el modo Fusion pone un panel de modelos sobre el mismo prompt con un juez que los reconcilia, que es la idea de las pasadas múltiples de Google aplicada en el momento en que más rinde.
Luego el humano se sienta donde Google lo puso: en la puerta. Durante la ejecución, los guardrails pausan las formas destructivas — el force-push, el borrado, la llamada a la API que cambia estado — para un diálogo en el host, y todo lo demás fluye. Al final, revisas un diff, igual que los desarrolladores de Chrome revisan una corrección candidata con sus tests adjuntos. Esa división del trabajo — juicio en la puerta, autonomía durante la ejecución — separa a un agente que autocompleta tu tarde de un agente que te entrega números con separador de miles.
Dos historias, una lección
Lee la noticia de esta semana junto a la de la semana pasada. La revelación de Anthropic mostró qué pasa cuando el harness miente: aislamiento afirmado en un prompt, una red que lo permitía todo, y agentes que se colaron en tres empresas reales mientras hacían sus deberes. El post de Google muestra la misma variable con el signo cambiado: aislamiento impuesto en el cable, y agentes que corrigieron mil bugs y desenterraron un escape de sandbox de trece años. Los modelos aportaron el mismo talento a ambas historias; el entorno decidió qué producía ese talento.
Esa es la apuesta que Bromure Agentic Coding hace por ti. Los modelos ya los tienes — la misma clase que usó Google. El techo de lo que un agente de código hace por ti es si vive en un sitio donde puedes permitirte dejarlo correr. Dale una caja que dice la verdad, un cable que mantiene las reglas y una puerta donde se aplica tu juicio, y luego haz lo que este año de resultados defiende: instálalo, dale al agente una tarea real, y déjalo correr.