核心发现: RS_cross 与文本长度呈强负相关 (ρ=-0.90, p=0.037),与初始假设相反
实验时间: 2026-03-19
实验配置: 5 模型 × 5 组(按文本长度等分) × 10 文本/组
输出目录: experiments/output/e5/
能否用 RS_cross(跨模型 r_eff 方差)作为无监督的文本难度代理指标?
理论假设:
关键问题: 单条文本无法计算有意义的 RS_cross
原因:
解决方案: 分组难度分析
| 索引 | 模型 | MMLU |
|---|---|---|
| 0 | llama3.2-3b-instruct | 58.0% |
| 1 | Mistral-7B-v0.3 | 62.5% |
| 2 | llama3-8b | 68.4% |
| 3 | gemma-2-9b-it | 82.0% |
| 4 | Qwen2.5-7B-Instruct | 86.3% |
| 组名 | 文本数 | 平均长度 | 长度范围 |
|---|---|---|---|
| group_0 (最短) | 10 | 329.6 | ~200-400 |
| group_1 (较短) | 10 | 446.0 | ~400-500 |
| group_2 (中等) | 10 | 555.8 | ~500-600 |
| group_3 (较长) | 10 | 684.8 | ~600-800 |
| group_4 (最长) | 10 | 859.0 | ~800-1000 |
| 组名 | 文本数 | 平均长度 | RS_cross | 平均 r_eff |
|---|---|---|---|---|
| group_0 (最短) | 10 | 329.6 | 0.4316 | 2.59 |
| group_1 (较短) | 10 | 446.0 | 0.2327 | 2.34 |
| group_2 (中等) | 10 | 555.8 | 0.0865 | 2.17 |
| group_3 (较长) | 10 | 684.8 | 0.0510 | 2.31 |
| group_4 (最长) | 10 | 859.0 | 0.0778 | 2.40 |
RS_cross
↑
0.4 | ● (最短)
|
0.3 |
|
0.2 | ● (较短)
|
0.1 | ● (中等) ● (最长)
| ● (较长)
0.0 +──────────────────────────────────→ 文本长度
短 长
| 相关性 | Spearman ρ | p 值 | 强度 |
|---|---|---|---|
| RS_cross vs 文本长度 | -0.90 | 0.037 | 强相关 ✓ |
| RS_cross vs 估计难度 | 0.50 | 0.39 | 弱相关 |
RS_cross 与文本长度呈强负相关:
初始假设: 长文本 = 难 = RS_cross 高
实际发现: 短文本 = RS_cross 高
可能的解释:
短文本的"浓缩效应"
长文本的"上下文冗余"
"难度"的多维度性
| 假设 | 预测 | 实验结果 | 状态 |
|---|---|---|---|
| H1: RS_cross 与难度正相关 | ρ > 0.5 | ρ = -0.90 | ❌ 相反 |
| H2: 长文本 RS_cross 更高 | 长组 > 短组 | 短组 > 长组 | ❌ 相反 |
特点:
各模型 r_eff:
| 模型 | r_eff |
|---|---|
| Qwen2.5-7B | 3.88 (最高) |
| Mistral-7B | 2.47 |
| llama3.2-3b | 2.23 |
| gemma-2-9b | 2.19 |
| llama3-8b | 2.17 |
解释: Qwen 在短文本上的表示显著更分散,其他模型相对一致
特点:
各模型 r_eff:
| 模型 | r_eff |
|---|---|
| Qwen2.5-7B | 2.60 |
| Mistral-7B | 2.57 |
| llama3-8b | 2.12 |
| llama3.2-3b | 2.12 |
| gemma-2-9b | 2.12 |
解释: 所有模型的 r_eff 非常接近(2.12-2.60),跨模型共识高
RS_cross 反映的不是"难度",而是"模型间理解分歧"
"难度"可能是多维度构念:
| 维度 | 描述 | 可能的谱指标 |
|---|---|---|
| 认知难度 | 推理复杂度 | ? |
| 语言复杂度 | 句法/词汇多样性 | ? |
| 知识密度 | 单位文本的信息量 | RS_cross? |
| 模型分歧 | 不同规模模型的理解差异 | RS_cross |
E2 实验发现:
E5 实验发现:
统一解释:
文本长度≠难度
分组数量少
单数据集
反向相关的因果机制不清晰
r_eff 的解释模糊
使用模型准确率
使用人类标注
多领域验证
更多样本
固定文本类型
逐层分析
✅ RS_cross 与文本长度呈强负相关 (ρ=-0.90, p=0.037)
{
"group_0_(最短)": {
"rs_cross": 0.4316,
"num_texts": 10,
"avg_length": 329.6,
"r_effs": {
"llama3.2-3b-instruct": 2.23,
"Mistral-7B-v0.3": 2.47,
"llama3-8b": 2.17,
"Qwen2.5-7B-Instruct": 3.88,
"gemma-2-9b-it": 2.19
}
},
"group_1_(较短)": {
"rs_cross": 0.2327,
"num_texts": 10,
"avg_length": 446.0,
"r_effs": {
"llama3.2-3b-instruct": 2.13,
"Mistral-7B-v0.3": 2.28,
"llama3-8b": 1.98,
"Qwen2.5-7B-Instruct": 3.28,
"gemma-2-9b-it": 2.03
}
},
"group_2_(中等)": {
"rs_cross": 0.0865,
"num_texts": 10,
"avg_length": 555.8,
"r_effs": {
"llama3.2-3b-instruct": 2.04,
"Mistral-7B-v0.3": 2.24,
"llama3-8b": 1.90,
"Qwen2.5-7B-Instruct": 2.71,
"gemma-2-9b-it": 1.95
}
},
"group_3_(较长)": {
"rs_cross": 0.0510,
"num_texts": 10,
"avg_length": 684.8,
"r_effs": {
"llama3.2-3b-instruct": 2.12,
"Mistral-7B-v0.3": 2.57,
"llama3-8b": 2.12,
"Qwen2.5-7B-Instruct": 2.60,
"gemma-2-9b-it": 2.12
}
},
"group_4_(最长)": {
"rs_cross": 0.0778,
"num_texts": 10,
"avg_length": 859.0,
"r_effs": {
"llama3.2-3b-instruct": 2.13,
"Mistral-7B-v0.3": 2.73,
"llama3-8b": 2.18,
"Qwen2.5-7B-Instruct": 2.75,
"gemma-2-9b-it": 2.21
}
}
}
E5 实验代码位于:
experiments/text_difficulty_proxy.py运行命令:
python experiments/run_direction9_experiments.py --experiment E5 --dataset bigbench --sample 50
实验负责人: AI Assistant 报告日期: 2026-03-19