在三个带标签的分类任务上,独立对比 Jev 与 GPT-5.6 Terra,报告准确率、校准、延迟和成本。
查看英文原文
Independent Jev versus GPT-5.6 Terra comparison on three labeled classification tasks, reporting accuracy, calibration, latency, and cost.
结果只适用于各项目的数据集、提示词、模型版本和测量设置。收录表示证据可检查,不代表本站或原清单独立重跑了基准。
收录与研究来源
以下保留前版来源,不代表本版重新安装或审计了此项目。
cobanov/awesome-jev →原审查固定 README · dc3937c →原审查实现文件 · evaljev/runners.py →
