Jev 101
简体中文 ▾
简体中文English
文档/让结果可靠

看懂概率、置信度与人工回退

类型正确不等于结论正确;门槛应由真实标注数据决定。

三件事不要混淆

Answer probability 是候选答案的概率信号。Confidence 是 Choice / Score 从分布得到的派生信号。实际正确率 要靠有标签的数据测出来,不能直接从某个字段读到。

Noul 返回“是”的概率,没有独立 confidence。Score 是量表上的数值,不应自动显示为百分比。

用预设数据理解门槛

下面四条记录与数值都是本站手写的教学样本,不来自真实 API,也不是推荐生产门槛。拖动只会改变本地规则。

门槛怎样影响流转四条虚构样本 · 非真实评测
明确物流问题 · 0.96候选通过
可能退款意图 · 0.82送人工复核
信息不足 · 0.61送人工复核
多意图冲突 · 0.43送人工复核
通过只表示满足演示规则,不代表答案正确,更不代表获准执行真实动作。

门槛怎么来

先定义可接受错误及其代价,用一份标注数据调问题与门槛,再在独立测试集看覆盖率和错误率。提高门槛可能减少自动处理,也可能在新数据上仍然出错;不能由“0.9 看起来很高”决定。

回退要有具体去处

人工队列必须记录原始输入的授权引用、模型版本、问题版本、答案、触发原因和下一位处理者。超时、错误、证据不足与高影响动作也要走明确分支,不是只管一个数字。

最容易漏的关卡

不要把模型的“可以做”当成系统权限;不要用置信度绕过审批;不要在所有候选都差时强行选择第一名。批量任务也要限制自动动作数量并提供停止开关。

本页来源与验证边界

核对日期:2026-09-19。文档整理,不代表本站完成了真实 API 或业务效果测试。

TypeSafe · Confidence →TypeSafe · Noul →TypeSafe · Score →TypeSafe · Jev 1.13 limitations →
阅读进度只保存在当前浏览器