快捷键

⌘ / Ctrl K
搜索文档
D
切换明暗模式
L
切换语言
H
返回首页
M
复制文章 Markdown
Esc
关闭弹窗

WHAT-THE-JEV / RESOURCES

评测与校准

决策模型,以及围绕它们生长的工具与应用。

评测与校准

01

classifier-benchmark(jabr)

覆盖 choice/noul/score 的 System One 风格分类模型 head-to-head 基准,含两套哈希锁定用例。

↗
02

System One Mosaic Benchmark(S1MB)

跨 100 多个基准比较 Jev 与开源决策模型的排行榜项目。

↗
03

jev-rerank-bench(anessbelbati)

14 数据集上把 Jev 当重排器,对比 Cohere、ZeroEntropy 与开源模型。

↗
04

jev-sec-bench(Gaurav-Gosain)

面向 Jev 的提示词注入与漏洞代码双项盲测安全基准。

↗
05

Jevals.com

独立排行榜:Jev 与六个 LLM 同答类型化决策题,公开逐决策概率数据。

↗
06

jev-bench(PavelRavich)

个人独立基准:Jev 对比两款 GPT-6 模型,报告校准、成本与延迟指标。

↗
07

JevBench(Benchmark Heaven)

Benchmark Heaven 的 Jev 级决策模型榜单,四轴几何平均计分,引用须带版本号。

↗
08

Decision Index

类型化决策引擎基准,含复现套件与公私混合题集,按 edition 引用。

↗
09

evals.typesafe.ai

TypeSafe 官方工作流评测站点,数字为厂商自报,工作流代码已开源。

↗