看懂概率、置信度与人工回退
类型正确不等于结论正确;门槛应由真实标注数据决定。
三件事不要混淆
Answer probability 是候选答案的概率信号。Confidence 是 Choice / Score 从分布得到的派生信号。实际正确率 要靠有标签的数据测出来,不能直接从某个字段读到。
Noul 返回“是”的概率,没有独立 confidence。Score 是量表上的数值,不应自动显示为百分比。
用预设数据理解门槛
下面四条记录与数值都是本站手写的教学样本,不来自真实 API,也不是推荐生产门槛。拖动只会改变本地规则。
门槛怎么来
先定义可接受错误及其代价,用一份标注数据调问题与门槛,再在独立测试集看覆盖率和错误率。提高门槛可能减少自动处理,也可能在新数据上仍然出错;不能由“0.9 看起来很高”决定。
回退要有具体去处
人工队列必须记录原始输入的授权引用、模型版本、问题版本、答案、触发原因和下一位处理者。超时、错误、证据不足与高影响动作也要走明确分支,不是只管一个数字。
最容易漏的关卡
不要把模型的“可以做”当成系统权限;不要用置信度绕过审批;不要在所有候选都差时强行选择第一名。批量任务也要限制自动动作数量并提供停止开关。
本页来源与验证边界
核对日期:2026-09-19。文档整理,不代表本站完成了真实 API 或业务效果测试。
TypeSafe · Confidence →TypeSafe · Noul →TypeSafe · Score →TypeSafe · Jev 1.13 limitations →阅读进度只保存在当前浏览器

