Esta página documenta a continuación el contrato HTTP en crudo de
/v1/chat/completions. Los
esquemas nativos de /v1/gliner-2 se publican en el
documento OpenAPI. El uso del SDK, el entrenamiento de
modelos, la evaluación, el historial de inferencia y el feedback quedan fuera del alcance de esta página.
Endpoint
Autenticación
Envía una clave de API de Fastino como bearer token:Solicitud
string
requerido
Un ID de modelo base con capacidad de inferencia o el UUID de un trabajo de entrenamiento
de Fastino completado y desplegable.
object[]
requerido
Una lista de mensajes no vacía. Para la inferencia GLiNER, coloca el texto a analizar en
el
content de un mensaje de usuario.object
Define tareas personalizadas del codificador. Proporciona un diccionario que contenga una
o varias de las claves
entities, classifications, structures o relations. Omítelo
solo cuando el modelo seleccionado tenga una tarea predeterminada configurada.Una lista plana de etiquetas de entidad está obsoleta. Utiliza siempre la forma de diccionario.number
predeterminado:"0.5"
Umbral de confianza de
0 a 1. Los valores más bajos favorecen la exhaustividad; los más
altos favorecen la precisión.boolean
predeterminado:"true"
Incluye los valores de confianza en los resultados extraídos.
boolean
predeterminado:"true"
Incluye los desplazamientos de caracteres semiabiertos (
start, end) en los resultados
de entidades.boolean
predeterminado:"true"
Persiste la inferencia. Establécelo en
false para no guardarla.Esquema de entidades
Utiliza definiciones de entidades descriptivas cuando sea posible:Esquema de clasificación
Esquema de extracción estructurada
Los campos de estructura usan especificacionesfield::type::description:
Esquema de relaciones
El esquema de relaciones más simple es una lista plana de nombres de relación:Esquema combinado
Ejecuta varias tareas sobre el mismo texto combinando claves:task ni task_type.
Ejemplo
model debe soportar actualmente la inferencia alojada. Usa el catálogo de modelos
en vivo en lugar de asumir que todos los checkpoints de Hugging Face están disponibles:
Respuesta
El endpoint devuelve un envoltorio de chat completion. El resultado GLiNER se serializa como una cadena JSON enchoices[0].message.content:
choices[0].message.content como JSON antes de leer los resultados de la tarea. Cuando
store=true, x_pioneer.inference_id identifica la inferencia persistida.
Entradas repetidas
El endpoint acepta una conversación por solicitud. No soporta la forma de lotetext: string[]
del endpoint nativo eliminado. Envía solicitudes separadas de forma concurrente cuando proceses
varias entradas.
Arranques en frío y reintentos
Un modelo inactivo o recién desplegado puede tener un arranque en frío. Usa un tiempo de espera de lectura de al menos 300 segundos y reintenta las respuestas425, 429 y 503. Respeta la
cabecera de respuesta Retry-After cuando esté presente.
Una solicitud que agota el tiempo aún puede calentar el despliegue, lo que permite que la
siguiente solicitud tenga éxito. No reintentes errores de autenticación, facturación, validación,
modelo desconocido ni de trabajo no desplegable sin corregir el problema subyacente.

