本页下文记录
/v1/chat/completions 的原始 HTTP 契约。原生 /v1/gliner-2 的 schema
发布在 OpenAPI 文档中。SDK 使用、模型训练、
评估、推理历史和反馈不在本页范围内。
端点
身份验证
将 Fastino API 密钥作为 bearer token 发送:请求
string
必填
支持推理的基础模型 ID,或已完成、可部署的 Fastino 训练作业的 UUID。
object[]
必填
非空消息列表。对于 GLiNER 推理,请将待分析的文本放入用户消息的
content 中。object
定义自定义编码器任务。提供一个包含
entities、classifications、structures 或 relations
中一个或多个键的字典。仅当所选模型已配置默认任务时才可省略。已弃用扁平的实体标签数组,请始终使用字典形式。number
默认值:"0.5"
置信度阈值,取值范围为
0 到 1。较低的值更偏向召回率;较高的值更偏向精确率。boolean
默认值:"true"
在提取结果中包含置信度值。
boolean
默认值:"true"
在实体结果中包含半开区间的字符偏移(
start、end)。boolean
默认值:"true"
持久化本次推理。设置为
false 可选择不保存。实体 schema
尽量使用带描述的实体定义:分类 schema
结构化提取 schema
结构字段使用field::type::description 规范:
关系 schema
最简单的关系 schema 是关系名称的扁平列表:组合 schema
通过组合键在同一段文本上运行多个任务:task 或 task_type。
示例
model 值必须当前支持托管推理。请使用实时模型目录,而不要假设每个 Hugging Face 检查点都可用:
响应
该端点返回聊天补全信封。GLiNER 结果以 JSON 字符串形式序列化在choices[0].message.content 中:
choices[0].message.content 解析为 JSON。当 store=true 时,
x_pioneer.inference_id 标识已持久化的推理。
重复输入
该端点每个请求接受一段会话。它不支持已移除的原生端点的text: string[] 批量形式。
处理多个输入时,请并发发送多个独立请求。
冷启动与重试
空闲或新部署的模型可能会冷启动。请将读取超时设置为至少 300 秒,并对425、429 和 503
响应进行重试。当响应头中包含 Retry-After 时,请遵循该值。
已超时的请求仍可能预热部署,从而让下一次请求成功。对于身份验证、计费、校验、未知模型或
不可部署作业等错误,请在解决根本问题之前不要重试。

