【定位】Jevals.com 是一个独立第三方排行榜,让 TypeSafe 的 Jev 决策模型与 6 个大语言模型回答同一组决策问题,产出可直接对比的结果。

【功能】每道题都采用 Jev 原生支持的 Noul、Choice、Score 类型化问题格式,6 个大语言模型与 Jev 同题作答,并以 PubMedQA、Banking77、HelpSteer2 的人类标签作为对照来打分。站点以 CC BY 4.0 许可公开榜单背后每次决策的原始概率数据,读者可以自行重算汇总分数或做自己的分析,而不必照单全收榜单的结论数字。

【特点】榜单在发布时仍处于扩充中,任务覆盖与排名都会随时间变化。首份结论(2026-09-18 发布,独立第三方来源)称:在 Noul 类问题上,Jev 与受测的最强 LLM 统计上打平,价格约为后者的 1/28。引用任何数字时都应把它与站点当前版本和更新日期绑定,而不是当作固定结论。

【适用】适合需要 Jev 与主流 LLM 同题对比数据、或需要逐决策概率数据做二次分析的读者,也可作为自建类型化问题评测的参照来源。引用前应先核对数字对应的站点版本与更新日期,避免沿用已变动的排名。