# E5 实验报告:RS_cross 作为文本难度代理 > **核心发现**: RS_cross 与文本长度呈**强负相关** (ρ=-0.90, p=0.037),与初始假设相反 **实验时间**: 2026-03-19 **实验配置**: 5 模型 × 5 组(按文本长度等分) × 10 文本/组 **输出目录**: `experiments/output/e5/` --- ## 一、实验背景与动机 ### 1.1 核心问题 能否用 RS_cross(跨模型 r_eff 方差)作为**无监督的文本难度代理指标**? **理论假设**: - RS_cross 高 → 模型间分歧大 → 文本难 - RS_cross 低 → 模型间共识高 → 文本易 ### 1.2 方法学挑战 **关键问题**: 单条文本无法计算有意义的 RS_cross 原因: - 单条文本 → N=1 → 协方差矩阵退化 - 实验验证:单条文本的 r_eff 恒为 1.0,RS_cross 恒为 0 **解决方案**: 分组难度分析 1. 将数据集按文本长度分组(假设:长文本 = 更复杂 = 更难) 2. 在每个组内计算 RS_cross(使用该组所有文本一起计算) 3. 分析 RS_cross 随文本长度的变化趋势 --- ## 二、实验配置 ### 2.1 模型序列 | 索引 | 模型 | MMLU | | ---- | -------------------- | ----- | | 0 | llama3.2-3b-instruct | 58.0% | | 1 | Mistral-7B-v0.3 | 62.5% | | 2 | llama3-8b | 68.4% | | 3 | gemma-2-9b-it | 82.0% | | 4 | Qwen2.5-7B-Instruct | 86.3% | ### 2.2 数据集 - **数据集**: bigbench(arithmetic_reasoning 子集) - **文本数**: 50 条 - **分组数**: 5 组(按文本长度等分) - **每组文本数**: 10 条 ### 2.3 分组统计 | 组名 | 文本数 | 平均长度 | 长度范围 | | -------------- | ------ | -------- | --------- | | group_0 (最短) | 10 | 329.6 | ~200-400 | | group_1 (较短) | 10 | 446.0 | ~400-500 | | group_2 (中等) | 10 | 555.8 | ~500-600 | | group_3 (较长) | 10 | 684.8 | ~600-800 | | group_4 (最长) | 10 | 859.0 | ~800-1000 | --- ## 三、核心结果 ### 3.1 各组 RS_cross | 组名 | 文本数 | 平均长度 | RS_cross | 平均 r_eff | | -------------- | ------ | -------- | ---------------- | ---------- | | group_0 (最短) | 10 | 329.6 | **0.4316** | 2.59 | | group_1 (较短) | 10 | 446.0 | **0.2327** | 2.34 | | group_2 (中等) | 10 | 555.8 | **0.0865** | 2.17 | | group_3 (较长) | 10 | 684.8 | **0.0510** | 2.31 | | group_4 (最长) | 10 | 859.0 | **0.0778** | 2.40 | ### 3.2 可视化趋势 ``` RS_cross ↑ 0.4 | ● (最短) | 0.3 | | 0.2 | ● (较短) | 0.1 | ● (中等) ● (最长) | ● (较长) 0.0 +──────────────────────────────────→ 文本长度 短 长 ``` ### 3.3 相关性分析 | 相关性 | Spearman ρ | p 值 | 强度 | | -------------------- | --------------- | ----- | --------- | | RS_cross vs 文本长度 | **-0.90** | 0.037 | 强相关 ✓ | | RS_cross vs 估计难度 | 0.50 | 0.39 | 弱相关 | --- ## 四、结果解释 ### 4.1 主要发现 **RS_cross 与文本长度呈强负相关**: - 短文本 → RS_cross 高 → 模型间分歧大 - 长文本 → RS_cross 低 → 模型间共识高 ### 4.2 与假设的关系 **初始假设**: 长文本 = 难 = RS_cross 高 **实际发现**: 短文本 = RS_cross 高 **可能的解释**: 1. **短文本的"浓缩效应"** - 短文本(如数学题)信息密度高,需要精确理解 - 小模型可能"误解"关键信息,大模型能正确理解 - 导致模型间 r_eff 差异大 2. **长文本的"上下文冗余"** - 长文本包含更多上下文线索 - 即使小模型也能借助上下文理解 - 模型间 r_eff 差异缩小 3. **"难度"的多维度性** - 文本长度≠难度 - 短文本可能是"浓缩的难题"(如数学证明) - 长文本可能是"冗长的简单题"(如故事复述) ### 4.3 假设验证 | 假设 | 预测 | 实验结果 | 状态 | | ------------------------- | ----------- | ----------- | ----------------- | | H1: RS_cross 与难度正相关 | ρ > 0.5 | ρ = -0.90 | **❌ 相反** | | H2: 长文本 RS_cross 更高 | 长组 > 短组 | 短组 > 长组 | **❌ 相反** | --- ## 五、逐组分析 ### 5.1 Group 0 (最短文本) —— RS_cross 最高 **特点**: - 平均长度:329.6 字符 - RS_cross: 0.4316(5 组中最高) - 平均 r_eff: 2.59 **各模型 r_eff**: | 模型 | r_eff | | ----------- | ----------- | | Qwen2.5-7B | 3.88 (最高) | | Mistral-7B | 2.47 | | llama3.2-3b | 2.23 | | gemma-2-9b | 2.19 | | llama3-8b | 2.17 | **解释**: Qwen 在短文本上的表示显著更分散,其他模型相对一致 ### 5.2 Group 3 (较长文本) —— RS_cross 最低 **特点**: - 平均长度:684.8 字符 - RS_cross: 0.0510(5 组中最低) - 平均 r_eff: 2.31 **各模型 r_eff**: | 模型 | r_eff | | ----------- | ----- | | Qwen2.5-7B | 2.60 | | Mistral-7B | 2.57 | | llama3-8b | 2.12 | | llama3.2-3b | 2.12 | | gemma-2-9b | 2.12 | **解释**: 所有模型的 r_eff 非常接近(2.12-2.60),跨模型共识高 --- ## 六、理论意义 ### 6.1 对 RS_cross 指标的启示 **RS_cross 反映的不是"难度",而是"模型间理解分歧"** - 高分歧场景:短文本、开放任务(如 E2 中的 alpaca) - 低分歧场景:长文本、形式化任务(如 E2 中的 humaneval) ### 6.2 对"难度"概念的重新思考 "难度"可能是多维度构念: | 维度 | 描述 | 可能的谱指标 | | -------------------- | ---------------------- | ------------ | | **认知难度** | 推理复杂度 | ? | | **语言复杂度** | 句法/词汇多样性 | ? | | **知识密度** | 单位文本的信息量 | RS_cross? | | **模型分歧** | 不同规模模型的理解差异 | RS_cross | ### 6.3 与 E2 实验的关联 E2 实验发现: - 形式化领域(humaneval)RS_cross 低 - 开放领域(alpaca)RS_cross 高 E5 实验发现: - 长文本 RS_cross 低 - 短文本 RS_cross 高 **统一解释**: - 形式化任务往往是"长而 structured"的(如代码函数) - 开放任务往往是"短而 ambiguous"的(如指令) --- ## 七、局限性 ### 7.1 方法学局限 1. **文本长度≠难度** - 使用的是粗糙代理 - 可能需要更精细的难度标注(如模型准确率、人类标注) 2. **分组数量少** - 仅 5 组,相关性统计检验力有限 - p=0.037 虽然显著,但样本量小 3. **单数据集** - 仅在 bigbench 的 arithmetic_reasoning 子集上验证 - 需要更多领域验证普适性 ### 7.2 结果解释局限 1. **反向相关的因果机制不清晰** - 需要更多控制实验验证 - 可能需要考虑文本类型混淆变量 2. **r_eff 的解释模糊** - r_eff 高低本身的意义需要进一步研究 - 不同模型的 r_eff 差异来源不明 --- ## 八、未来工作 ### 8.1 改进难度标注 1. **使用模型准确率** - 让每个模型做 bigbench 题目 - 计算每题的准确率作为难度标签 - 分析 RS_cross 与准确率的相关性 2. **使用人类标注** - BIG-Bench Hard 有部分人类准确率数据 - 可以直接使用作为难度标签 ### 8.2 扩展数据集 1. **多领域验证** - math(数学推理) - code(代码生成) - translation(翻译) - dialogue(对话) 2. **更多样本** - 每组增加到 20-50 条文本 - 分组数增加到 7-10 组 ### 8.3 控制实验 1. **固定文本类型** - 只使用数学题 - 控制文本长度分布 2. **逐层分析** - 分析 RS_cross 在各层的变化 - 看"分歧"发生在哪些网络深度 --- ## 九、结论 ### 9.1 核心结论 ✅ **RS_cross 与文本长度呈强负相关** (ρ=-0.90, p=0.037) - 短文本 → 模型间分歧大 - 长文本 → 模型间共识高 ### 9.2 理论贡献 1. **证伪初始假设**: RS_cross 不是"越长越难" 2. **发现新现象**: "浓缩效应"——短文本可能更难 3. **方法学创新**: 分组计算 RS_cross 的方法 ### 9.3 应用价值 1. **数据集设计**: 短文本可能需要更多标注资源 2. **模型评估**: RS_cross 可用于识别"模型分歧文本" 3. **困难挖掘**: 高 RS_cross 文本可能是需要重点优化的场景 --- ## 附录:原始数据 ### A.1 完整分组结果 ```json { "group_0_(最短)": { "rs_cross": 0.4316, "num_texts": 10, "avg_length": 329.6, "r_effs": { "llama3.2-3b-instruct": 2.23, "Mistral-7B-v0.3": 2.47, "llama3-8b": 2.17, "Qwen2.5-7B-Instruct": 3.88, "gemma-2-9b-it": 2.19 } }, "group_1_(较短)": { "rs_cross": 0.2327, "num_texts": 10, "avg_length": 446.0, "r_effs": { "llama3.2-3b-instruct": 2.13, "Mistral-7B-v0.3": 2.28, "llama3-8b": 1.98, "Qwen2.5-7B-Instruct": 3.28, "gemma-2-9b-it": 2.03 } }, "group_2_(中等)": { "rs_cross": 0.0865, "num_texts": 10, "avg_length": 555.8, "r_effs": { "llama3.2-3b-instruct": 2.04, "Mistral-7B-v0.3": 2.24, "llama3-8b": 1.90, "Qwen2.5-7B-Instruct": 2.71, "gemma-2-9b-it": 1.95 } }, "group_3_(较长)": { "rs_cross": 0.0510, "num_texts": 10, "avg_length": 684.8, "r_effs": { "llama3.2-3b-instruct": 2.12, "Mistral-7B-v0.3": 2.57, "llama3-8b": 2.12, "Qwen2.5-7B-Instruct": 2.60, "gemma-2-9b-it": 2.12 } }, "group_4_(最长)": { "rs_cross": 0.0778, "num_texts": 10, "avg_length": 859.0, "r_effs": { "llama3.2-3b-instruct": 2.13, "Mistral-7B-v0.3": 2.73, "llama3-8b": 2.18, "Qwen2.5-7B-Instruct": 2.75, "gemma-2-9b-it": 2.21 } } } ``` ### A.2 代码仓库 E5 实验代码位于: - `experiments/text_difficulty_proxy.py` 运行命令: ```bash python experiments/run_direction9_experiments.py --experiment E5 --dataset bigbench --sample 50 ``` --- **实验负责人**: AI Assistant **报告日期**: 2026-03-19