Skip to main content
Fastino bietet zwei synchrone Schnittstellen für die GLiNER-Inferenz. Wählen Sie die Schnittstelle, die zu Ihrem Modell und Ihren Payload-Anforderungen passt:
Beginnen Sie mit /v1/chat/completions, um eine einheitliche API für Basis- und feinabgestimmte Modelle zu erhalten. Verwenden Sie /v1/gliner-2, wenn Sie gezielt den nativen Vertrag des festen GLiNER2-Basismodells, Batch-Eingaben oder asynchrone Verarbeitung benötigen.
Diese Seite dokumentiert im Folgenden den rohen HTTP-Vertrag von /v1/chat/completions. Die nativen /v1/gliner-2-Schemas sind im OpenAPI-Dokument veröffentlicht. SDK-Nutzung, Modelltraining, Evaluation, Inferenz-Historie und Feedback liegen außerhalb des Umfangs dieser Seite.
POST /inference wurde entfernt. Senden Sie keine veralteten Felder wie model_id, text, task, format_results oder is_warmup.

Endpunkt

Authentifizierung

Senden Sie einen Fastino-API-Schlüssel als Bearer-Token:

Anfrage

string
erforderlich
Eine inferenzfähige Basismodell-ID oder die UUID eines abgeschlossenen, bereitstellbaren Fastino-Trainingsjobs.
object[]
erforderlich
Eine nicht leere Liste von Nachrichten. Für die GLiNER-Inferenz platzieren Sie den zu analysierenden Text im content einer Benutzernachricht.
object
Definiert benutzerdefinierte Encoder-Aufgaben. Geben Sie ein Dictionary an, das einen oder mehrere der Schlüssel entities, classifications, structures oder relations enthält. Lassen Sie es nur weg, wenn das ausgewählte Modell eine konfigurierte Standardaufgabe hat.Ein flaches Array von Entitätslabels ist veraltet. Verwenden Sie immer die Dictionary-Form.
number
Standard:"0.5"
Konfidenzschwelle von 0 bis 1. Niedrigere Werte begünstigen Recall; höhere Werte begünstigen Precision.
boolean
Standard:"true"
Konfidenzwerte in extrahierten Ergebnissen enthalten.
boolean
Standard:"true"
Halboffene Zeichen-Offsets (start, end) in Entitätsergebnissen enthalten.
boolean
Standard:"true"
Die Inferenz persistieren. Setzen Sie den Wert auf false, um dies abzulehnen.

Entitäts-Schema

Verwenden Sie nach Möglichkeit beschreibende Entitätsdefinitionen:

Klassifikations-Schema

Schema für strukturierte Extraktion

Strukturfelder verwenden field::type::description-Spezifikationen:

Relations-Schema

Das einfachste Relations-Schema ist eine flache Liste von Relationsnamen:
Sie können auch ein Dictionary verwenden, um Beschreibungen oder eine relationsspezifische Konfiguration hinzuzufügen:
Senden Sie keine Relationsobjekte, die Head- und Tail-Definitionen enthalten.

Kombiniertes Schema

Führen Sie mehrere Aufgaben über denselben Text aus, indem Sie die Schlüssel kombinieren:
Das Schema erkennt die Operation automatisch. Senden Sie weder task noch task_type.

Beispiel

Der Wert von model muss aktuell gehostete Inferenz unterstützen. Verwenden Sie den Live-Modellkatalog, statt anzunehmen, dass jedes Hugging-Face-Checkpoint verfügbar ist:

Antwort

Der Endpunkt gibt einen Chat-Completion-Umschlag zurück. Das GLiNER-Ergebnis wird als JSON-String in choices[0].message.content serialisiert:
Parsen Sie choices[0].message.content als JSON, bevor Sie die Aufgabenergebnisse lesen. Wenn store=true, identifiziert x_pioneer.inference_id die persistierte Inferenz.

Wiederholte Eingaben

Der Endpunkt akzeptiert eine Konversation pro Anfrage. Die entfernte native Batch-Form text: string[] wird nicht unterstützt. Senden Sie bei mehreren Eingaben separate Anfragen gleichzeitig.

Kaltstarts und Wiederholungsversuche

Ein inaktives oder neu bereitgestelltes Modell kann einen Kaltstart durchführen. Verwenden Sie ein Lese-Timeout von mindestens 300 Sekunden und wiederholen Sie Antworten mit den Statuscodes 425, 429 und 503. Beachten Sie den Antwort-Header Retry-After, sofern vorhanden. Eine Anfrage, die in einen Timeout gelaufen ist, kann die Bereitstellung dennoch aufwärmen, sodass die nächste Anfrage erfolgreich sein kann. Wiederholen Sie Fehler bei Authentifizierung, Abrechnung, Validierung, unbekanntem Modell oder nicht bereitstellbarem Job nicht, ohne das zugrunde liegende Problem zu beheben.

Fehler

Migration veralteter Anfragen