方向 9_E5 实验报告_RS_cross 作为文本难度代理.md 10 KB

E5 实验报告:RS_cross 作为文本难度代理

核心发现: RS_cross 与文本长度呈强负相关 (ρ=-0.90, p=0.037),与初始假设相反

实验时间: 2026-03-19 实验配置: 5 模型 × 5 组(按文本长度等分) × 10 文本/组 输出目录: experiments/output/e5/


一、实验背景与动机

1.1 核心问题

能否用 RS_cross(跨模型 r_eff 方差)作为无监督的文本难度代理指标

理论假设:

  • RS_cross 高 → 模型间分歧大 → 文本难
  • RS_cross 低 → 模型间共识高 → 文本易

1.2 方法学挑战

关键问题: 单条文本无法计算有意义的 RS_cross

原因:

  • 单条文本 → N=1 → 协方差矩阵退化
  • 实验验证:单条文本的 r_eff 恒为 1.0,RS_cross 恒为 0

解决方案: 分组难度分析

  1. 将数据集按文本长度分组(假设:长文本 = 更复杂 = 更难)
  2. 在每个组内计算 RS_cross(使用该组所有文本一起计算)
  3. 分析 RS_cross 随文本长度的变化趋势

二、实验配置

2.1 模型序列

索引 模型 MMLU
0 llama3.2-3b-instruct 58.0%
1 Mistral-7B-v0.3 62.5%
2 llama3-8b 68.4%
3 gemma-2-9b-it 82.0%
4 Qwen2.5-7B-Instruct 86.3%

2.2 数据集

  • 数据集: bigbench(arithmetic_reasoning 子集)
  • 文本数: 50 条
  • 分组数: 5 组(按文本长度等分)
  • 每组文本数: 10 条

2.3 分组统计

组名 文本数 平均长度 长度范围
group_0 (最短) 10 329.6 ~200-400
group_1 (较短) 10 446.0 ~400-500
group_2 (中等) 10 555.8 ~500-600
group_3 (较长) 10 684.8 ~600-800
group_4 (最长) 10 859.0 ~800-1000

三、核心结果

3.1 各组 RS_cross

组名 文本数 平均长度 RS_cross 平均 r_eff
group_0 (最短) 10 329.6 0.4316 2.59
group_1 (较短) 10 446.0 0.2327 2.34
group_2 (中等) 10 555.8 0.0865 2.17
group_3 (较长) 10 684.8 0.0510 2.31
group_4 (最长) 10 859.0 0.0778 2.40

3.2 可视化趋势

RS_cross
  ↑
0.4 |  ● (最短)
    |
0.3 |
    |
0.2 |      ● (较短)
    |
0.1 |          ● (中等)     ● (最长)
    |                            ● (较长)
0.0 +──────────────────────────────────→ 文本长度
     短                           长

3.3 相关性分析

相关性 Spearman ρ p 值 强度
RS_cross vs 文本长度 -0.90 0.037 强相关 ✓
RS_cross vs 估计难度 0.50 0.39 弱相关

四、结果解释

4.1 主要发现

RS_cross 与文本长度呈强负相关

  • 短文本 → RS_cross 高 → 模型间分歧大
  • 长文本 → RS_cross 低 → 模型间共识高

4.2 与假设的关系

初始假设: 长文本 = 难 = RS_cross 高

实际发现: 短文本 = RS_cross 高

可能的解释:

  1. 短文本的"浓缩效应"

    • 短文本(如数学题)信息密度高,需要精确理解
    • 小模型可能"误解"关键信息,大模型能正确理解
    • 导致模型间 r_eff 差异大
  2. 长文本的"上下文冗余"

    • 长文本包含更多上下文线索
    • 即使小模型也能借助上下文理解
    • 模型间 r_eff 差异缩小
  3. "难度"的多维度性

    • 文本长度≠难度
    • 短文本可能是"浓缩的难题"(如数学证明)
    • 长文本可能是"冗长的简单题"(如故事复述)

4.3 假设验证

假设 预测 实验结果 状态
H1: RS_cross 与难度正相关 ρ > 0.5 ρ = -0.90 ❌ 相反
H2: 长文本 RS_cross 更高 长组 > 短组 短组 > 长组 ❌ 相反

五、逐组分析

5.1 Group 0 (最短文本) —— RS_cross 最高

特点:

  • 平均长度:329.6 字符
  • RS_cross: 0.4316(5 组中最高)
  • 平均 r_eff: 2.59

各模型 r_eff:

模型 r_eff
Qwen2.5-7B 3.88 (最高)
Mistral-7B 2.47
llama3.2-3b 2.23
gemma-2-9b 2.19
llama3-8b 2.17

解释: Qwen 在短文本上的表示显著更分散,其他模型相对一致

5.2 Group 3 (较长文本) —— RS_cross 最低

特点:

  • 平均长度:684.8 字符
  • RS_cross: 0.0510(5 组中最低)
  • 平均 r_eff: 2.31

各模型 r_eff:

模型 r_eff
Qwen2.5-7B 2.60
Mistral-7B 2.57
llama3-8b 2.12
llama3.2-3b 2.12
gemma-2-9b 2.12

解释: 所有模型的 r_eff 非常接近(2.12-2.60),跨模型共识高


六、理论意义

6.1 对 RS_cross 指标的启示

RS_cross 反映的不是"难度",而是"模型间理解分歧"

  • 高分歧场景:短文本、开放任务(如 E2 中的 alpaca)
  • 低分歧场景:长文本、形式化任务(如 E2 中的 humaneval)

6.2 对"难度"概念的重新思考

"难度"可能是多维度构念:

维度 描述 可能的谱指标
认知难度 推理复杂度
语言复杂度 句法/词汇多样性
知识密度 单位文本的信息量 RS_cross?
模型分歧 不同规模模型的理解差异 RS_cross

6.3 与 E2 实验的关联

E2 实验发现:

  • 形式化领域(humaneval)RS_cross 低
  • 开放领域(alpaca)RS_cross 高

E5 实验发现:

  • 长文本 RS_cross 低
  • 短文本 RS_cross 高

统一解释:

  • 形式化任务往往是"长而 structured"的(如代码函数)
  • 开放任务往往是"短而 ambiguous"的(如指令)

七、局限性

7.1 方法学局限

  1. 文本长度≠难度

    • 使用的是粗糙代理
    • 可能需要更精细的难度标注(如模型准确率、人类标注)
  2. 分组数量少

    • 仅 5 组,相关性统计检验力有限
    • p=0.037 虽然显著,但样本量小
  3. 单数据集

    • 仅在 bigbench 的 arithmetic_reasoning 子集上验证
    • 需要更多领域验证普适性

7.2 结果解释局限

  1. 反向相关的因果机制不清晰

    • 需要更多控制实验验证
    • 可能需要考虑文本类型混淆变量
  2. r_eff 的解释模糊

    • r_eff 高低本身的意义需要进一步研究
    • 不同模型的 r_eff 差异来源不明

八、未来工作

8.1 改进难度标注

  1. 使用模型准确率

    • 让每个模型做 bigbench 题目
    • 计算每题的准确率作为难度标签
    • 分析 RS_cross 与准确率的相关性
  2. 使用人类标注

    • BIG-Bench Hard 有部分人类准确率数据
    • 可以直接使用作为难度标签

8.2 扩展数据集

  1. 多领域验证

    • math(数学推理)
    • code(代码生成)
    • translation(翻译)
    • dialogue(对话)
  2. 更多样本

    • 每组增加到 20-50 条文本
    • 分组数增加到 7-10 组

8.3 控制实验

  1. 固定文本类型

    • 只使用数学题
    • 控制文本长度分布
  2. 逐层分析

    • 分析 RS_cross 在各层的变化
    • 看"分歧"发生在哪些网络深度

九、结论

9.1 核心结论

RS_cross 与文本长度呈强负相关 (ρ=-0.90, p=0.037)

  • 短文本 → 模型间分歧大
  • 长文本 → 模型间共识高

9.2 理论贡献

  1. 证伪初始假设: RS_cross 不是"越长越难"
  2. 发现新现象: "浓缩效应"——短文本可能更难
  3. 方法学创新: 分组计算 RS_cross 的方法

9.3 应用价值

  1. 数据集设计: 短文本可能需要更多标注资源
  2. 模型评估: RS_cross 可用于识别"模型分歧文本"
  3. 困难挖掘: 高 RS_cross 文本可能是需要重点优化的场景

附录:原始数据

A.1 完整分组结果

{
  "group_0_(最短)": {
    "rs_cross": 0.4316,
    "num_texts": 10,
    "avg_length": 329.6,
    "r_effs": {
      "llama3.2-3b-instruct": 2.23,
      "Mistral-7B-v0.3": 2.47,
      "llama3-8b": 2.17,
      "Qwen2.5-7B-Instruct": 3.88,
      "gemma-2-9b-it": 2.19
    }
  },
  "group_1_(较短)": {
    "rs_cross": 0.2327,
    "num_texts": 10,
    "avg_length": 446.0,
    "r_effs": {
      "llama3.2-3b-instruct": 2.13,
      "Mistral-7B-v0.3": 2.28,
      "llama3-8b": 1.98,
      "Qwen2.5-7B-Instruct": 3.28,
      "gemma-2-9b-it": 2.03
    }
  },
  "group_2_(中等)": {
    "rs_cross": 0.0865,
    "num_texts": 10,
    "avg_length": 555.8,
    "r_effs": {
      "llama3.2-3b-instruct": 2.04,
      "Mistral-7B-v0.3": 2.24,
      "llama3-8b": 1.90,
      "Qwen2.5-7B-Instruct": 2.71,
      "gemma-2-9b-it": 1.95
    }
  },
  "group_3_(较长)": {
    "rs_cross": 0.0510,
    "num_texts": 10,
    "avg_length": 684.8,
    "r_effs": {
      "llama3.2-3b-instruct": 2.12,
      "Mistral-7B-v0.3": 2.57,
      "llama3-8b": 2.12,
      "Qwen2.5-7B-Instruct": 2.60,
      "gemma-2-9b-it": 2.12
    }
  },
  "group_4_(最长)": {
    "rs_cross": 0.0778,
    "num_texts": 10,
    "avg_length": 859.0,
    "r_effs": {
      "llama3.2-3b-instruct": 2.13,
      "Mistral-7B-v0.3": 2.73,
      "llama3-8b": 2.18,
      "Qwen2.5-7B-Instruct": 2.75,
      "gemma-2-9b-it": 2.21
    }
  }
}

A.2 代码仓库

E5 实验代码位于:

  • experiments/text_difficulty_proxy.py

运行命令:

python experiments/run_direction9_experiments.py --experiment E5 --dataset bigbench --sample 50

实验负责人: AI Assistant 报告日期: 2026-03-19