E5 实验报告:RS_cross 作为文本难度代理(分组方法)
实验时间:2026-03-19T23:10:12.638234
实验配置
- 数据集:bigbench
- 文本数量:50
- 分组数:5
- 模型数量:5
- 模型列表:llama3.2-3b-instruct, Mistral-7B-v0.3, llama3-8b, Qwen2.5-7B-Instruct, gemma-2-9b-it
方法说明
由于单条文本无法计算有意义的 RS_cross(N=1 时协方差矩阵退化),
本实验采用分组难度分析方法:
- 将数据集按文本长度分组(假设:长文本 = 更复杂 = 更难)
- 在每个组内计算跨模型 RS_cross
- 分析 RS_cross 随文本长度的变化趋势
RS_cross 统计
| 统计量 |
值 |
| 均值 |
0.1759 |
| 标准差 |
0.1427 |
| 最小值 |
0.0510 |
| 最大值 |
0.4316 |
分组结果(按 RS_cross 排序)
| 组名 |
文本数 |
平均长度 |
RS_cross |
平均 r_eff |
| group0(最短) |
10 |
329.6 |
0.4316 |
2.59 |
| group1(较短) |
10 |
446.0 |
0.2327 |
2.34 |
| group2(中等) |
10 |
555.8 |
0.0865 |
2.17 |
| group4(最长) |
10 |
859.0 |
0.0778 |
2.40 |
| group3(较长) |
10 |
684.8 |
0.0510 |
2.31 |
相关性分析
RS_cross vs 文本长度
- Spearman ρ: -0.9000 (p=0.0374)
- 样本数:5
- 解释:正相关表示长文本(复杂)导致更高 RS_cross
相关性强度: 强相关 ✓
RS_cross 随文本长度组的变化趋势
- Spearman ρ: -0.9000 (p=0.0374)
- 解释:正相关表示 RS_cross 随文本长度增加而上升
结论
✗ 假设未获支持:RS_cross 与文本长度几乎不相关 (ρ=-0.9000, p=0.0374)。
可能需要重新审视'文本长度=难度'的假设,或使用其他难度指标(如模型准确率)。
局限性
- 文本长度≠难度: 文本长度只是难度的粗糙代理,有些短文本可能很难(如数学证明),有些长文本可能很简单(如重复叙述)
- 分组数量少: 仅 5 组,相关性统计检验力有限
- 单数据集: 仅在 bigbench 上验证,需要更多数据集验证普适性
未来改进方向
- 使用真实难度标注: 用模型在题目上的实际准确率作为难度标签
- 滑动窗口: 使用滑动窗口代替硬分组,获得更平滑的难度曲线
- 多维度难度: 考虑文本的多维度难度(推理、知识、语言复杂度等)