摘要

本实验考察 JEV 能否解答各学科的大学水平题目。场景取 MMLU-Pro 测试集的全部 12,032 道题,覆盖 14 个类别,每题以单选作答,以十选一为主。JEV 答对 82.57%(95% 置信区间 81.89%–83.25%),远高于约 10% 的随机猜测水平。准确率随类别而变:生物学最高 91.35%,法律最低 76.20%。JEV 给每道题标的 confidence 与准确率一致:confidence 不低于 0.85 的作答占 61.1%,准确率 94.15%;全部错误的 61.0% 落在低置信档。全部作答消耗输入 6,650,732 token、输出 1,002,474 token,总费用 0.2793 美元。结论是 JEV 能稳定解答多学科知识题,它的 confidence 能区分可信的作答与需要复核的作答。

1 实验目的

本实验回答一个问题:题目可能来自任意学科时,JEV 的知识覆盖有多广、作答有多可靠。MMLU-Pro 是测这项能力的标准基准。它覆盖 14 个大学水平学科,十选一的形式使随机猜测很难得分,本实验因此选它作场景。JEV 还会给每道题标一个 confidence 值,本实验一并考察这个值能否用于判断一条作答是否可信。

2 数据集

MMLU-Pro 是英文多学科基准,是 MMLU 的加强版。本实验用 Hugging Face 上 TIGER-Lab/MMLU-Pro 固定修订版本的全部测试集:12,032 道题。

每道题以单选形式给出:题干加一组选项。十选一为主(9,981 题,占 83.0%),其余 2,051 题有三到九个选项。十个选项时,随机作答的期望准确率约 10%,是该题型的下限。

每道题带数据集自带的类别标签,共 14 类,题量从数学的 1,351 题到历史的 381 题不等。

3 最小示例

本节取数据集中的一题,展示一次完整的输入与输出。发给模型的输入如下(省略 model 字段):

{
  "state": "计算 $\\log_3 81$ 的值。",
  "questions": {
    "answer": {
      "type": "choice",
      "instructions": "选出正确选项。",
      "criteria": {
        "A": "9",
        "B": "-1",
        "C": "0.25",
        "D": "2",
        "E": "4",
        "F": "-4",
        "G": "81",
        "H": "3",
        "I": "27",
        "J": "0.75"
      }
    }
  }
}

模型输出如下(仅保留关键字段):

{
  "answers": {
    "answer": {
      "type": "choice",
      "choice": "E",
      "probabilities": {"A": 0, "B": 0, "C": 0, "D": 0, "E": 0.99, "F": 0, "G": 0, "H": 0.01, "I": 0, "J": 0},
      "confidence": 0.99
    }
  },
  "usage": {"input_tokens": 420, "output_tokens": 87, "cost": 0.00001764}
}

JEV 选择 E(即 4),为正确答案。

4 结果

整体结果

12,032 题全部拿到有效作答,没有失败记录。以数据集提供的标准答案为判据,JEV 答对 9,935 题,准确率 82.57%,95% 置信区间 81.89%–83.25%。十个选项下随机作答的期望准确率约 10%。

分组结果

准确率随类别而变,但都落在较窄的区间内(图 1):

类别 题数 准确率
biology(生物学) 717 91.35%
economics(经济学) 844 87.80%
math(数学) 1,351 87.42%
computer science(计算机科学) 410 87.32%
psychology(心理学) 798 86.34%
philosophy(哲学) 499 83.37%
physics(物理) 1,299 83.06%
health(健康) 818 81.66%
other(其他) 924 80.84%
chemistry(化学) 1,132 80.30%
business(商业) 789 78.58%
history(历史) 381 77.17%
engineering(工程) 969 76.26%
law(法律) 1,101 76.20%

分类别准确率

图 1:14 个类别的准确率都落在 76% 到 91% 之间,生物学、经济学、数学领先,法律、工程、历史最低,全部远高于随机猜测水平。

置信关系

JEV 对每题给出一个 confidence 值。confidence 每升一档,准确率随之提高(图 2):

Confidence 题数 占比 准确率
< 0.6 2,769 23.0% 53.81%
0.6–0.85 1,908 15.9% 79.66%
≥ 0.85 7,355 61.1% 94.15%

按 confidence 分档的准确率

图 2:作答集中在最高置信档,confidence 越高准确率越高;虚线为约 10% 的随机猜测水平。

行为统计

错误集中在低置信作答:<0.6 档只占作答的 23.0%,却占了 2,097 道错题的 61.0%。输出有两类少量瑕疵:294 条作答(2.44%)的选项概率加起来是 0.99 而不是 1;16 条作答(0.13%)所选项的概率低于最高项。另有 53 条作答有多个选项并列最高,choice 取其中之一;4 条只是浮点末位与最高项不同。后两类都不算不一致。

调用成本

本次实验共消耗输入 6,650,732 token、输出 1,002,474 token,总费用 0.2793 美元。

能力定位

对照公开榜单,可以判断 JEV 所处的位置。Hugging Face MMLU-Pro 榜单快照收录 141 条结果,分数从 0.65 到 88.12,中位数 55.99。JEV 的 82.57 接近顶部:高于它的有 27 条,JEV 在 142 个结果中排第 28(图 3)。榜单上的模型大多自由生成文字作答,常常先写一段较长的推理,JEV 则直接选出一个选项。两者作答形式不同,这一对比只作量级参照。

JEV 在 MMLU-Pro 榜单中的位置

图 3:在 141 条上榜结果加 JEV 共 142 个结果中,JEV 排第 28,远高于中位数。

5 结论

相对约 10% 的随机猜测水平,JEV 答对了约八成的 MMLU-Pro 题目,且没有任何类别接近这一水平。分数之外,有两点判断更为有用。confidence 可以直接用来筛选作答:接受不低于 0.85 的作答,大部分题目能保持 94.15% 的准确率;低置信档只占很小的份额,却集中了大部分错误。学科之间的差距(生物学 91.35% 对法律 76.20%)说明,额外核验应优先投向偏弱的学科。

相关资料