快捷键

⌘ / Ctrl K
搜索文档
D
切换明暗模式
L
切换语言
H
返回首页
M
复制文章 Markdown
Esc
关闭弹窗

WHAT-THE-JEV / EXPERIMENTS

实验

可复现的基准测试与探索,包含数据、结果与分析。

一、LLM benchmark:学科能力

01

GPQA Diamond 研究生级科学题

探索 JEV 在 GPQA Diamond 研究生级科学题上的表现。

198 个样本费用 $0.004594548
↗
02

GSM8K 小学数学应用题

探索 JEV 在 GSM8K 小学数学应用题上的表现。

1,319 个样本费用 $0.025092774
↗
03

MMLU-Pro 多学科知识问答

探索 JEV 在 MMLU-Pro 覆盖 14 个学科的大学水平题目上的表现。

12,032 个样本费用 $0.279330744
↗

二、LLM benchmark:社会常识与偏见

04

BBQ 偏见敏感问答

探索 JEV 在 BBQ 偏见敏感问答题上的表现,以及是否会偏向刻板印象。

58,492 个样本费用 $0.921154332
↗
05

SocialIQA 社会常识

探索 JEV 在 SocialIQA 社会常识题上的表现。

2,224 个样本费用 $0.035755734
↗

三、论文问答系统

06

论文分类

探索 JEV 能否按研究偏好判断一篇 arXiv 论文该不该收入论文库,并归入正确的主题。

400 个样本费用 $0.016174452
↗
07

论文问答

探索 JEV 能否基于原文回答关于该论文的问题。

240 个样本费用 $0.066836868
↗
08

提示词路由

探索 JEV 能否仅凭提问文本,判断提问该走 JEV 快路径还是 LLM 慢路径。

480 个样本费用 $0.019004748
↗

四、经典机器学习预测:回归与分类

09

波士顿房价:预测与比较

探索 JEV 能否预测波士顿社区的房价,并比较不同社区的房价高低。

1,106 个样本费用 $0.043098972
↗
10

泰坦尼克号生还预测

探索 JEV 能否根据乘客记录预测乘客是否生还,并比较结构化字段与自然语言文本两种输入下的表现。

1,782 个样本费用 $0.040420086
↗

五、LLM 后训练标注

11

DPO 训练数据偏好标注

探索 JEV 在 DPO 训练数据偏好标注上的表现。

300 个样本费用 $0.0300741
↗
12

GRPO 奖励分配

探索 JEV 在 GRPO 轨迹奖励分配上的表现。

300 个样本费用 $0.085096116
↗

六、技能路由

13

skill路由

探索 JEV 能否把用户任务路由到 126 个真实 Agent Skill 中的正确技能、技能组合或 none。

500 个样本费用 $0.214509582
↗