Skip to main content
GLiDE 评估调用方定义的结果,而不是生成文本。本页总结其技术行为和边界。如需发送第一个请求,请从调用 GLiDE 开始。

决策功能

  • 评估作为共享 state 提供的字符串、对象或数组。
  • 针对该 state 提出一个或多个具名问题。
  • 使用 Noul 获取是/否概率。
  • 使用 Choice 从调用方定义的集合中选择一个无序选项。
  • 使用 Score 从有序评分标准中选择一个等级。
  • 获取每个答案的概率和置信度。
  • 对所提供 state 中的算术、代码执行轨迹、日期、政策、例外和相关事实进行推理。
GLiDE 会先快速评估,再为不确定的决策投入额外推理。每个问题都会针对同一个 state 独立评估。

置信度与不确定性

答案告诉你 GLiDE 得出了什么结论。confidence 告诉你领先结果与其他结果的区分程度。 低置信度答案不一定错误,而是表示概率质量分散在多个结果上。请使用代表性数据调整操作和后备阈值,而不要假定存在通用的临界值。

限制

  • 每个渲染后的提示词(state 加一个问题)必须控制在 40,000 个 token 以内。
  • Choice 要求 2 到 255 个选项。
  • Score 最多接受 255 个等级。
  • 每个问题都是单标签的,不存在多标签基本类型。
  • 一个请求评估一个共享的 state;多个问题应放在 questions 下。
  • usage.input_tokens 会累加所有问题的内部推理轮次,因此即使每个渲染后的提示词都符合限制,该值也可能超过 40,000。

不支持的请求结构

  • /v1/systemone 不支持流式传输。
  • 它不接受一批相互独立的 state。
  • 它目前不接受微调部署 ID。
  • 额外的顶层请求字段会被拒绝。
  • Choice 不能只包含一个选项。

评估

在 Decision Index 0.2.1 上,GLiDE 得分为 64.81,高于 Jev 公布的 57.91,并在全部五个评估领域以及 38 项基准中的 31 项领先。

调用 GLiDE

查看完整的请求、响应、错误处理和迁移指南。