Diese Seite dokumentiert im Folgenden den rohen HTTP-Vertrag von
/v1/chat/completions. Die nativen
/v1/gliner-2-Schemas sind im
OpenAPI-Dokument veröffentlicht. SDK-Nutzung, Modelltraining,
Evaluation, Inferenz-Historie und Feedback liegen außerhalb des Umfangs dieser Seite.
Endpunkt
Authentifizierung
Senden Sie einen Fastino-API-Schlüssel als Bearer-Token:Anfrage
string
erforderlich
Eine inferenzfähige Basismodell-ID oder die UUID eines abgeschlossenen, bereitstellbaren
Fastino-Trainingsjobs.
object[]
erforderlich
Eine nicht leere Liste von Nachrichten. Für die GLiNER-Inferenz platzieren Sie den zu
analysierenden Text im
content einer Benutzernachricht.object
Definiert benutzerdefinierte Encoder-Aufgaben. Geben Sie ein Dictionary an, das einen oder
mehrere der Schlüssel
entities, classifications, structures oder relations enthält.
Lassen Sie es nur weg, wenn das ausgewählte Modell eine konfigurierte Standardaufgabe hat.Ein flaches Array von Entitätslabels ist veraltet. Verwenden Sie immer die Dictionary-Form.number
Standard:"0.5"
Konfidenzschwelle von
0 bis 1. Niedrigere Werte begünstigen Recall; höhere Werte
begünstigen Precision.boolean
Standard:"true"
Konfidenzwerte in extrahierten Ergebnissen enthalten.
boolean
Standard:"true"
Halboffene Zeichen-Offsets (
start, end) in Entitätsergebnissen enthalten.boolean
Standard:"true"
Die Inferenz persistieren. Setzen Sie den Wert auf
false, um dies abzulehnen.Entitäts-Schema
Verwenden Sie nach Möglichkeit beschreibende Entitätsdefinitionen:Klassifikations-Schema
Schema für strukturierte Extraktion
Strukturfelder verwendenfield::type::description-Spezifikationen:
Relations-Schema
Das einfachste Relations-Schema ist eine flache Liste von Relationsnamen:Kombiniertes Schema
Führen Sie mehrere Aufgaben über denselben Text aus, indem Sie die Schlüssel kombinieren:task noch task_type.
Beispiel
model muss aktuell gehostete Inferenz unterstützen. Verwenden Sie den
Live-Modellkatalog, statt anzunehmen, dass jedes Hugging-Face-Checkpoint verfügbar ist:
Antwort
Der Endpunkt gibt einen Chat-Completion-Umschlag zurück. Das GLiNER-Ergebnis wird als JSON-String inchoices[0].message.content serialisiert:
choices[0].message.content als JSON, bevor Sie die Aufgabenergebnisse lesen. Wenn
store=true, identifiziert x_pioneer.inference_id die persistierte Inferenz.
Wiederholte Eingaben
Der Endpunkt akzeptiert eine Konversation pro Anfrage. Die entfernte native Batch-Formtext: string[] wird nicht unterstützt. Senden Sie bei mehreren Eingaben separate Anfragen
gleichzeitig.
Kaltstarts und Wiederholungsversuche
Ein inaktives oder neu bereitgestelltes Modell kann einen Kaltstart durchführen. Verwenden Sie ein Lese-Timeout von mindestens 300 Sekunden und wiederholen Sie Antworten mit den Statuscodes425, 429 und 503. Beachten Sie den Antwort-Header Retry-After, sofern
vorhanden.
Eine Anfrage, die in einen Timeout gelaufen ist, kann die Bereitstellung dennoch aufwärmen,
sodass die nächste Anfrage erfolgreich sein kann. Wiederholen Sie Fehler bei Authentifizierung,
Abrechnung, Validierung, unbekanntem Modell oder nicht bereitstellbarem Job nicht, ohne das
zugrunde liegende Problem zu beheben.

