Skip to main content
Fastino ofrece dos interfaces síncronas para la inferencia GLiNER. Elige la interfaz que se ajuste a tu modelo y a los requisitos de tu carga útil:
Empieza con /v1/chat/completions para disponer de una API coherente entre modelos base y ajustados. Usa /v1/gliner-2 cuando necesites específicamente el contrato nativo del modelo base fijo GLiNER2, la entrada por lotes o el procesamiento asíncrono.
Esta página documenta a continuación el contrato HTTP en crudo de /v1/chat/completions. Los esquemas nativos de /v1/gliner-2 se publican en el documento OpenAPI. El uso del SDK, el entrenamiento de modelos, la evaluación, el historial de inferencia y el feedback quedan fuera del alcance de esta página.
POST /inference se ha eliminado. No envíes sus campos heredados como model_id, text, task, format_results o is_warmup.

Endpoint

Autenticación

Envía una clave de API de Fastino como bearer token:

Solicitud

string
requerido
Un ID de modelo base con capacidad de inferencia o el UUID de un trabajo de entrenamiento de Fastino completado y desplegable.
object[]
requerido
Una lista de mensajes no vacía. Para la inferencia GLiNER, coloca el texto a analizar en el content de un mensaje de usuario.
object
Define tareas personalizadas del codificador. Proporciona un diccionario que contenga una o varias de las claves entities, classifications, structures o relations. Omítelo solo cuando el modelo seleccionado tenga una tarea predeterminada configurada.Una lista plana de etiquetas de entidad está obsoleta. Utiliza siempre la forma de diccionario.
number
predeterminado:"0.5"
Umbral de confianza de 0 a 1. Los valores más bajos favorecen la exhaustividad; los más altos favorecen la precisión.
boolean
predeterminado:"true"
Incluye los valores de confianza en los resultados extraídos.
boolean
predeterminado:"true"
Incluye los desplazamientos de caracteres semiabiertos (start, end) en los resultados de entidades.
boolean
predeterminado:"true"
Persiste la inferencia. Establécelo en false para no guardarla.

Esquema de entidades

Utiliza definiciones de entidades descriptivas cuando sea posible:

Esquema de clasificación

Esquema de extracción estructurada

Los campos de estructura usan especificaciones field::type::description:

Esquema de relaciones

El esquema de relaciones más simple es una lista plana de nombres de relación:
También puedes usar un diccionario para añadir descripciones o configuración por relación:
No envíes objetos de relación que contengan definiciones de head y tail.

Esquema combinado

Ejecuta varias tareas sobre el mismo texto combinando claves:
El esquema identifica la operación automáticamente. No envíes task ni task_type.

Ejemplo

El valor de model debe soportar actualmente la inferencia alojada. Usa el catálogo de modelos en vivo en lugar de asumir que todos los checkpoints de Hugging Face están disponibles:

Respuesta

El endpoint devuelve un envoltorio de chat completion. El resultado GLiNER se serializa como una cadena JSON en choices[0].message.content:
Analiza choices[0].message.content como JSON antes de leer los resultados de la tarea. Cuando store=true, x_pioneer.inference_id identifica la inferencia persistida.

Entradas repetidas

El endpoint acepta una conversación por solicitud. No soporta la forma de lote text: string[] del endpoint nativo eliminado. Envía solicitudes separadas de forma concurrente cuando proceses varias entradas.

Arranques en frío y reintentos

Un modelo inactivo o recién desplegado puede tener un arranque en frío. Usa un tiempo de espera de lectura de al menos 300 segundos y reintenta las respuestas 425, 429 y 503. Respeta la cabecera de respuesta Retry-After cuando esté presente. Una solicitud que agota el tiempo aún puede calentar el despliegue, lo que permite que la siguiente solicitud tenga éxito. No reintentes errores de autenticación, facturación, validación, modelo desconocido ni de trabajo no desplegable sin corregir el problema subyacente.

Errores

Migración de solicitudes heredadas