Skip to main content
Las páginas web, los correos electrónicos y los documentos pueden ocultar instrucciones dirigidas a tu agente, como un comentario que le indica enviar tu lista de clientes a otro lugar. Filtra el contenido no confiable con GLiDE antes de que llegue al contexto del agente y descarta o pon en cuarentena todo lo que intente dar órdenes.

Solicitud

Pasa el contenido y las herramientas que el agente podría usar indebidamente. Enumerar las herramientas ayuda a GLiDE a valorar cuánto daño podría causar el contenido.

Esquema de la solicitud

Respuesta

Medida contra https://api.fastino.ai. Los valores de confianza varían ligeramente entre llamadas.
risk.score es 3, el cuarto nivel contando desde 0: “Critical: private data could leave the company”.

Esquema de la respuesta

Actúa según la respuesta

El listón para dejar pasar contenido es alto a propósito. Una falsa alarma cuesta una página; una inyección no detectada puede filtrar datos.

Adáptala

  • Filtra todas las fuentes no confiables: páginas obtenidas, correo entrante, archivos subidos y resultados de herramientas.
  • Envía el texto oculto además del visible. Los comentarios HTML, el texto alternativo y el texto blanco sobre fondo blanco son escondites habituales.
  • Enumera las herramientas reales del agente en state.agent_tools para que risk refleje lo que el agente podría hacer realmente.
  • Añade una ruta phishing si hay personas que leen el mismo contenido y envíala a tu equipo de seguridad.
El filtrado reduce el riesgo de inyección, pero no lo elimina. Limita también los permisos del agente y exige confirmación antes de que envíe datos o dinero.

Guía de políticas y seguridad

Diseña compuertas que fallen de forma segura ante la incertidumbre.

Referencia de la API de GLiDE

Todos los campos, límites y errores de POST /v1/systemone.