Skip to main content
Les pages web, les e-mails et les documents peuvent dissimuler des instructions destinées à votre agent, comme un commentaire lui demandant d’envoyer votre liste de clients quelque part. Filtrez le contenu non fiable avec GLiDE avant qu’il n’atteigne le contexte de l’agent, et supprimez ou mettez en quarantaine tout ce qui tente de donner des ordres.

Requête

Transmettez le contenu et les outils dont l’agent pourrait faire un mauvais usage. Lister les outils aide GLiDE à estimer l’ampleur des dégâts que le contenu pourrait causer.

Schéma de la requête

Réponse

Mesurée sur https://api.fastino.ai. Les valeurs de confiance varient légèrement d’un appel à l’autre.
risk.score vaut 3, soit le quatrième niveau en comptant à partir de 0 : « Critical: private data could leave the company ».

Schéma de la réponse

Exploiter la réponse

Le seuil pour laisser passer le contenu est volontairement élevé. Une fausse alerte coûte une page ; une injection manquée peut entraîner une fuite de données.

L’adapter

  • Filtrez chaque source non fiable : pages récupérées, e-mails entrants, fichiers téléversés et résultats d’outils.
  • Envoyez le texte caché en plus du texte visible. Les commentaires HTML, les textes alternatifs et le texte blanc sur fond blanc sont des cachettes courantes.
  • Listez les vrais outils de l’agent dans state.agent_tools, afin que risk reflète ce que l’agent pourrait réellement faire.
  • Ajoutez une voie phishing si des personnes lisent le même contenu, et transmettez ces cas à votre équipe de sécurité.
Le filtrage réduit le risque d’injection sans l’éliminer. Limitez aussi les autorisations de l’agent et exigez une confirmation avant qu’il n’envoie des données ou de l’argent.

Guide politique et sécurité

Concevez des garde-fous qui échouent de façon sûre en cas d’incertitude.

Référence de l'API GLiDE

Chaque champ, limite et erreur de POST /v1/systemone.