摘要

本实验测试 JEV 回答日常社会情境问题的能力。场景是 SocialIQA 测试集的全部 2,224 题,每题一段社会情境、三个候选答案。JEV 答对 80.58%(95% 置信区间 78.93%–82.22%),远高于 33.3% 的随机水平,且在九个 ATOMIC 维度上近乎均衡(78.11%–84.66%)。JEV 给出的 confidence 可靠:均值 0.803 与实际准确率持平;confidence 不低于 0.85 的作答占 61.2%、答对 93.24%;低于 0.6 的作答准确率降至 50.96%。全部作答消耗输入 851,327 token、输出 84,512 token,总费用 0.0358 美元。结论是 JEV 对各种社会常识问题表现稳定,confidence 可直接用于判断哪些作答可采信。

1 实验目的

本实验回答一个问题:JEV 能否对日常社会情境作出推理,例如人们为什么这样做、需要什么、有什么感受,以及接下来会发生什么。SocialIQA 是这类社会常识的标准基准,本实验因此选用它。题目以三选一作答,JEV 对每题给出 confidence,本实验同时检验这个 confidence 能否用来判断一条作答是否可信。

2 数据集

SocialIQA 是英文社会常识推理基准。每题给出一段描述日常社会事件的情境,就该情境提问,并提供三个候选答案。本实验使用官方带维度标注的 SocialIQA v1.4 版本,其压缩包存档于 preparation/raw/;实验取其测试集的全部 2,224 道题。

每道题以三选一单选的形式发给 JEV,三个选项保持数据集的原始顺序。正确答案在三个位置上分布近乎均匀(A 720 题、B 754 题、C 750 题),按位置猜测无法提高准确率。

该版本为每道题标注了所考察的 ATOMIC 维度,这些标签由数据集提供。六个维度围绕事件当事人:为何这样做(xIntent)、事先需要什么(xNeed)、如何描述当事人(xAttr)、事后感受(xReact)、对当事人的影响(xEffect)、接下来想做什么(xWant);三个维度围绕在场的他人:他人的感受(oReact)、对他人的影响(oEffect)、他人想做什么(oWant)。

3 最小示例

本节取数据集中的一题,展示一次完整的输入与输出。发给模型的输入如下(省略 model 字段;原题为英文,此处译为中文):

{
  "state": {
    "context": "Bailey 为人友善,所以她把全家人召集到一起。",
    "question": "其他人会发生什么?"
  },
  "questions": {
    "answer": {
      "type": "choice",
      "instructions": "根据情境和日常社会常识,选出该问题最合理的答案。只选一个选项。",
      "criteria": {
        "A": "和家人谈谈",
        "B": "讨厌 Bailey",
        "C": "感谢 Bailey"
      }
    }
  }
}

模型输出如下(仅保留关键字段):

{
  "answers": {
    "answer": {
      "type": "choice",
      "choice": "C",
      "probabilities": {"A": 0.41, "B": 0, "C": 0.59},
      "confidence": 0.38
    }
  },
  "usage": {"input_tokens": 375, "output_tokens": 38, "cost": 0.00001575}
}

JEV 选择了 C,即正确答案。

4 结果

整体结果

2,224 题全部获得有效作答,无失败记录。以数据集提供的标准答案为判据,JEV 答对 1,792 题,准确率 80.58%,95% 置信区间 78.93%–82.22%。三选一随机作答的期望准确率为 33.3%。

置信关系

JEV 对每题返回一个 confidence 值。全部作答的 confidence 均值为 0.803,与实际准确率几乎持平。准确率随 confidence 稳定上升(图 1):

confidence 题数 占比 准确率
< 0.6 467 21.0% 50.96%
0.6–0.85 396 17.8% 71.97%
≥ 0.85 1,361 61.2% 93.24%

按 confidence 分档的准确率

图 1:作答集中在高 confidence 档,准确率随 confidence 稳定上升;虚线为 33.3% 随机水平。

行为统计

3 条作答(0.13%)的选项概率合计为 0.99,而非 1。8 条作答(0.36%)中两个选项并列最高概率,所选项是并列的两个之一;没有任何一条所选项的概率低于最高项。两类互不重叠,其余 2,213 条作答都不属于这两种情况。

调用成本

本次实验共消耗输入 851,327 token、输出 84,512 token,总费用 0.0358 美元。

分维度结果

九个 ATOMIC 维度上的准确率近乎均衡(图 2):

维度 所问内容 题数 准确率
xWant 当事人想做什么 339 84.66%
xNeed 当事人事先需要什么 277 81.23%
xIntent 当事人为何这样做 297 80.47%
oReact 他人的感受 223 80.27%
oEffect 对他人的影响 159 79.87%
oWant 他人想做什么 252 79.76%
xEffect 对当事人的影响 103 79.61%
xReact 当事人事后感受 277 79.42%
xAttr 如何描述当事人 297 78.11%

按 ATOMIC 维度分组的准确率

图 2:九个维度的准确率都落在 78.11%–84.66% 的窄带内,未见明显落后的维度。

5 结论

JEV 能答对约五分之四的社会常识题,且在九类问题上表现均衡,没有明显落后的维度。这里最可用的是 confidence:均值与准确率持平,能把接近全对的作答与准确率较低的作答分开。只采信 confidence 不低于 0.85 的作答,可覆盖超过六成题目且准确率超过九成;其余作答仍明显高于随机水平,应转交复核,而非直接弃用。

相关资料