e5_report.md 2.4 KB

E5 实验报告:RS_cross 作为文本难度代理(分组方法)

实验时间:2026-03-19T23:10:12.638234

实验配置

  • 数据集:bigbench
  • 文本数量:50
  • 分组数:5
  • 模型数量:5
  • 模型列表:llama3.2-3b-instruct, Mistral-7B-v0.3, llama3-8b, Qwen2.5-7B-Instruct, gemma-2-9b-it

方法说明

由于单条文本无法计算有意义的 RS_cross(N=1 时协方差矩阵退化), 本实验采用分组难度分析方法:

  1. 将数据集按文本长度分组(假设:长文本 = 更复杂 = 更难)
  2. 在每个组内计算跨模型 RS_cross
  3. 分析 RS_cross 随文本长度的变化趋势

RS_cross 统计

统计量
均值 0.1759
标准差 0.1427
最小值 0.0510
最大值 0.4316

分组结果(按 RS_cross 排序)

组名 文本数 平均长度 RS_cross 平均 r_eff
group0(最短) 10 329.6 0.4316 2.59
group1(较短) 10 446.0 0.2327 2.34
group2(中等) 10 555.8 0.0865 2.17
group4(最长) 10 859.0 0.0778 2.40
group3(较长) 10 684.8 0.0510 2.31

相关性分析

RS_cross vs 文本长度

  • Spearman ρ: -0.9000 (p=0.0374)
  • 样本数:5
  • 解释:正相关表示长文本(复杂)导致更高 RS_cross

相关性强度: 强相关 ✓

RS_cross 随文本长度组的变化趋势

  • Spearman ρ: -0.9000 (p=0.0374)
  • 解释:正相关表示 RS_cross 随文本长度增加而上升

结论

假设未获支持:RS_cross 与文本长度几乎不相关 (ρ=-0.9000, p=0.0374)。

可能需要重新审视'文本长度=难度'的假设,或使用其他难度指标(如模型准确率)。

局限性

  1. 文本长度≠难度: 文本长度只是难度的粗糙代理,有些短文本可能很难(如数学证明),有些长文本可能很简单(如重复叙述)
  2. 分组数量少: 仅 5 组,相关性统计检验力有限
  3. 单数据集: 仅在 bigbench 上验证,需要更多数据集验证普适性

未来改进方向

  1. 使用真实难度标注: 用模型在题目上的实际准确率作为难度标签
  2. 滑动窗口: 使用滑动窗口代替硬分组,获得更平滑的难度曲线
  3. 多维度难度: 考虑文本的多维度难度(推理、知识、语言复杂度等)