Skip to main content
Webseiten, E-Mails und Dokumente können Anweisungen an Ihren Agenten verbergen, etwa einen Kommentar, der ihn auffordert, Ihre Kundenliste an eine fremde Adresse zu senden. Prüfen Sie nicht vertrauenswürdige Inhalte mit GLiDE, bevor sie in den Kontext des Agenten gelangen, und verwerfen oder isolieren Sie alles, was Befehle zu erteilen versucht.

Anfrage

Übergeben Sie den Inhalt und die Tools, die der Agent missbrauchen könnte. Die Liste der Tools hilft GLiDE einzuschätzen, wie viel Schaden der Inhalt anrichten könnte.

Anfrageschema

Antwort

Gemessen gegen https://api.fastino.ai. Konfidenzwerte schwanken zwischen Aufrufen geringfügig.
risk.score ist 3, die vierte Stufe gezählt ab 0: „Critical: private data could leave the company“.

Antwortschema

Auf die Antwort reagieren

Die Hürde, Inhalte durchzulassen, ist absichtlich hoch. Ein Fehlalarm kostet eine Seite; eine übersehene Injection kann Daten preisgeben.

Anpassen

  • Prüfen Sie jede nicht vertrauenswürdige Quelle: abgerufene Seiten, eingehende E-Mails, hochgeladene Dateien und Tool-Ergebnisse.
  • Senden Sie neben dem sichtbaren auch den versteckten Text. HTML-Kommentare, Alt-Texte und weißer Text auf weißem Grund sind häufige Verstecke.
  • Führen Sie die tatsächlichen Tools des Agenten in state.agent_tools auf, damit risk widerspiegelt, was der Agent wirklich tun könnte.
  • Ergänzen Sie einen phishing-Pfad, wenn auch Personen dieselben Inhalte lesen, und leiten Sie ihn an Ihr Sicherheitsteam weiter.
Die Prüfung verringert das Injection-Risiko, beseitigt es aber nicht. Beschränken Sie zusätzlich die Berechtigungen des Agenten und verlangen Sie eine Bestätigung, bevor er Daten oder Geld versendet.

Leitfaden zu Richtlinien und Sicherheit

Gestalten Sie Gates, die bei Unsicherheit sicher reagieren.

GLiDE-API-Referenz

Alle Felder, Grenzen und Fehler für POST /v1/systemone.