fastino/GLiNER-2.5-Decide 的确切 classifications schema。仅在两次评估运行之间更改标签或任务设置,以确保结果可比。
评估 Decide schema
从一个固定任务开始:- 每个标签的正例和反例
- 应返回多个标签的输入
- 没有任何标签应达到阈值的输入
- 模糊文本和域外文本
POST /v1/chat/completions 发送每个示例。在对任务结果评分之前,先解析 choices[0].message.content 中的 JSON 字符串。
对于单标签 Decide 任务,衡量 top-1 准确率以及每个标签的混淆情况。对于多标签任务,衡量每个标签及整个任务的精确率、召回率和 F1。如果一个请求包含多个任务,请分别评估每个任务,因为 Decide 不会强制规定它们之间的关系。
选择 cls_threshold
cls_threshold 仅影响 multi_label: true 的任务。Decide 会返回达到阈值的标签,并省略其余标签:
- 提高阈值会返回更少的标签,通常更偏向精确率。
- 降低阈值会返回更多的标签,通常更偏向召回率。
- 单标签任务始终返回得分最高的标签。
- 阈值只影响推理,不会改变训练。
0.5 视为通用默认值。对于会触发重大操作的标签,应要求更严格的阈值,或将低置信度结果交由人工复核。
训练 GLiNER 2.5 Decide
只有在明确标签分类体系并调整多标签阈值之后,基础模型仍然无法正确处理你的领域时,才进行训练。 当前的在线基础模型目录提供以下信息:GET /v1/base-models?supports_training=true,因为目录中的可用模型可能会发生变化。使用 fastino/GLiNER-2.5-Decide 作为 base_model,使用 lora 作为 training_type。
准备 Decide 分类数据
使用公开的分类 JSONL 格式。每一行都包含text,以及一个 label 或多个 labels:
上传分类数据集
创建、上传、处理用于 Decide 训练作业的 JSONL 数据集,并对其进行版本管理。
创建 Decide 训练作业
将准备好的数据集提交给 Decide 基础模型:比较并部署
使用相同的classifications schema,在同一个留出集上运行基础模型和训练后的检查点。比较:
- 单标签任务中每个标签的错误
- 多标签任务中每个标签的精确率、召回率和 F1
- 空结果和标签选择过多的多标签结果
- 每个任务所需的阈值
训练作业
监控 Decide 作业、检查点和可部署状态。
训练 API 参考
查看准确的数据集和训练作业契约。

