Ein Bewertungs-Prompt für ein universelles LLM fordert das Modell auf, eine Zahl zu generieren oder strukturierte Ausgabe zurückzugeben. Mit GLiDE geben Sie eine geordnete Rubrik vor und erhalten eine Wahrscheinlichkeitsverteilung über deren Stufen.
Verwenden Sie dieses Muster für Dringlichkeit, Schweregrad, Qualität, Stimmungsintensität, Risiko und andere geordnete Urteile.
Die Dringlichkeit von Support-Anfragen bewerten
score ist der ganzzahlige Index der wahrscheinlichsten Stufe. Verwenden Sie expected_level, wenn Sie einen kontinuierlichen Wert zwischen den Stufen benötigen. Die Antwort enthält außerdem legend, das die String-Indexschlüssel wieder den von Ihnen angegebenen Beschreibungen zuordnet.
Behandeln Sie score nicht als kontinuierlichen Wert. Ein Wert wie 2.999 gehört beispielsweise zu expected_level; score wäre die gewinnende ganzzahlige Stufe, etwa 3.
Den Score in eine Aktion umsetzen
Passen Sie die Schwellenwerte anhand gelabelter Beispiele aus Ihrer Anwendung an. confidence misst den Abstand zwischen den beiden wahrscheinlichsten Stufen; es ist nicht derselbe Wert wie der kontinuierliche Score.
Was sich gegenüber der Bewertung mit einem LLM ändert
- Die Ausgabe ist auf Ihre geordnete Rubrik beschränkt; es gibt keine generierte Zahl, die Sie validieren müssen.
- Sie erhalten sowohl die gewinnende Stufe als auch eine wahrscheinlichkeitsgewichtete kontinuierliche Position.
- Die vollständige Verteilung zeigt, ob die Eingabe eindeutig auf einer Stufe oder zwischen Stufen liegt.
- Ihre Kriterien bleiben in der
legend der Antwort erhalten, sodass die Interpretation des Scores explizit ist.
Informationen zu Authentifizierung, Limits, Fehlern und dem vollständigen Antwortvertrag finden Sie unter GLiDE-Inferenz.