Urgent.News

What's breaking now, across thousands of outlets.

Tech

fetch-sentinel v0.1-alpha: guardian en tiempo de fetch para agentes, con KI abiertos declarados

🛡️ fetch-sentinel: El cortafuegos local (CPU-Only) para blindar la ventana de contexto de tus agentes de IA frente a inyecciones indirectas de prompts. Internet es hostil por defecto. Tu agente ya no tiene por qué estar expuesto. fetch-sentinel es un guardia estructural en el punto de entrada cuando un agente autonomo hace fetch de contenido web arbitrario. Su trabajo es decidir, antes de que el…

Original Spanish Read in English

Fetch-sentinel es un cortafuegos (CPU-only) local diseñado para proteger los contextos de los agentes de IA contra la inyección de prompts indirectos. Internet se considera hostil por defecto, por lo que este sistema sirve como una guardia en el punto de entrada cuando un agente autónomo busca contenido web arbitrario. El objetivo de fetch-sentinel es determinar, antes de que el contenido externo entre en el contexto del LLM, qué partes constituyen datos y cuáles son instrucciones.

En este post, fetch-sentinel no se presenta como un producto listo para producción, sino como un repositorio alfa que contiene cuatro capas obligatorias. Estas capas han sido implementadas y verificadas localmente con 161 tests, y dos conocidos KI abiertos identificados en la segunda ronda de revisión, quienes requieren un mayor refactor para cerrarse.

Un problema importante es la inyección indirecta de prompts, que ocurre cuando un agente LLM navega la web por su cuenta y carga contenido no fiable. Un atacante podría inyectar instrucciones en páginas que el agente leerá como si fueran parte del prompt del sistema, incluyendo texto invisible en comentarios HTML, atributos alt, metadatos, y código Unicode ofuscado.

Los firewalls semánticos no pueden resolver este problema, ya que la manipulación semántica sin instrucción explícita contribuye a la propagación de propaganda o selección de hechos empaquetados como resúmenes. La solución al problema es defender el punto de entrada. Fetch-sentinel cuenta con cuatro capas obligatorias: el módulo fetch aislado core/fetcher.py, que extrae la legibilidad sobre html.parser (stdlib) y descarta elementos como script, style, iframe, noscript, object, embed, template y comentarios HTML; el módulo de detección estructural core/structural_guard.py, que elimina TAG block, ZWSP y BIDI override usando mcp-tool-sanitizer y envuelve el texto en delimitadores para que el LLM downstream lo trate como dato; el módulo de separación de privilegios core/sandbox.py, que ejecuta el proceso sin shell, sin escritura fuera de ubicaciones específicas y filtra OPENAI_API_KEY, ATW_WITNESS_KEY del agente principal; y las capas de trazabilidad firmada y anclaje de citas core/witness_client.py y core/citation_tracer.py, respectivamente, que asignan un evento firmado con una clave HMAC dedicada a fetch-sentinel y anclan un substring y SHA-256 entre el resumen del agente y el texto fuente.

Los resultados de verificación local son positivos, con 161 tests verdes (138 de base y 23 de extensión de cobertura), todas las comprobaciones realizadas con ruff y el código limpio. El repo ha pasado por dos rondas de auditoría independiente, que encontraron varios huecos estructurales que el fix inicial dejó pasar. Dos de estos huecos, KI-10 y KI-11, siguen abiertos en HEAD y son bloqueantes para considerar el repositorio estable.

Written by urgent.news from Dev.to's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.

Read the original at dev.to →

More in Tech

More from Thursday 3 September →