# GLUE Benchmark 实验报告 **实验日期**: 2026-03-12 **实验类型**: LLM 有效秩谱收敛验证 **数据集**: GLUE Benchmark(5 个子集) --- ## 1. 实验目的 验证 **Platonic Representation Hypothesis**(柏拉图表示假说): > 不同大型语言模型在相同文本集上的表示是否会收敛到相似的低维子空间? 本实验使用 NLP 领域公认的标准评测基准 **GLUE**,相比之前的 MVP 实验(每领域 200 条样本),本实验使用更大量级的数据(每领域 5000 条样本)以获得更稳定的谱估计。 --- ## 2. 实验配置 ### 2.1 模型配置 | 模型名称 | 参数量 | 隐藏层维度 | |:---------|:-------|:-----------| | Qwen2.5-7B-Instruct | 7B | 3584 | | Mistral-7B-v0.3 | 7B | 4096 | | Llama-3-8B-Instruct | 8B | 4096 | ### 2.2 数据集配置 使用 GLUE Benchmark 的 5 个子集: | 领域 | 数据集 | 任务类型 | 使用样本数 | |:-----|:-------|:---------|:-----------| | glue_mnli | Multi-Genre NLI | 多段落推理 | 5,000 | | glue_qnli | Question NLI | 问答推理 | 5,000 | | glue_sst2 | Stanford Sentiment Treebank | 情感分析 | 5,000 | | glue_stsb | Semantic Textual Similarity | 语义相似度 | 3,585(全量) | | glue_cola | Corpus of Linguistic Acceptability | 语法判断 | 1,956(全量) | ### 2.3 实验参数 - **归一化方法**: `per_sample_l2`(样本级 L2 归一化) - **谱距离度量**: Wasserstein-1 距离 - **收敛阈值**: - W1 < 0.05 → 收敛 - 0.05 ≤ W1 < 0.2 → 部分收敛 - W1 ≥ 0.2 → 发散 --- ## 3. 实验结果 ### 3.1 谱有效秩统计 | 模型 | r_eff_mean | r_eff_std | r_eff_min | r_eff_max | |:-----|:-----------|:----------|:----------|:----------| | **qwen_7b** | 5.07 | 1.81 | 2.63 | 8.01 | | **mistral_7b** | 17.51 | 9.92 | 6.50 | 33.09 | | **llama3_8b** | 22.30 | 9.47 | 10.01 | 34.44 | **观察**: 1. Qwen2.5-7B 的有效秩最低(~5),表明其表示更集中于低维子空间 2. Llama-3-8B 的有效秩最高(~22),表明其表示分布更分散 3. 同规模模型(7B Mistral vs 7B Qwen)差异显著,说明 **架构和训练语料** 对谱特性影响巨大 ### 3.2 跨模型谱距离(按领域) | 领域 | 平均 W1 距离 | 标准差 | 最小值 | 最大值 | |:-----|:-------------|:-------|:-------|:-------| | glue_mnli | 46.84 | 27.79 | 7.57 | 68.07 | | glue_qnli | 56.95 | 32.77 | 10.87 | 84.26 | | glue_sst2 | 33.16 | 20.12 | 4.71 | 47.80 | | glue_stsb | 44.41 | 27.52 | 5.54 | 65.67 | | glue_cola | 21.56 | 8.10 | 12.83 | 32.35 | | **整体** | **40.58** | - | - | - | ### 3.3 收敛判断 **整体平均 W1 距离:40.58** | 阈值 | 判断 | 实际值 | 结论 | |:-----|:-----|:-------|:-----| | W1 < 0.05 | 收敛 | 40.58 | ❌ | | 0.05 ≤ W1 < 0.2 | 部分收敛 | 40.58 | ❌ | | W1 ≥ 0.2 | 发散 | 40.58 | ✅ **发散** | --- ## 4. 结果分析 ### 4.1 与 MVP 实验对比 | 指标 | MVP 实验(6 领域×200 样本) | GLUE 实验(5 领域×5000 样本) | |:-----|:--------------------------|:----------------------------| | 整体 W1 距离 | 6.06 | 40.58 | | 收敛判断 | 发散 | 发散 | | 谱估计稳定性 | 低(N=200) | 高(N≥1956) | | 数据集代表性 | 自建采样 | 标准评测基准 | **关键发现**: - 即使使用更大规模、更高质量的标准数据集,**发散结论保持一致** - GLUE 实验的 W1 距离更高(40.58 vs 6.06),可能原因: 1. 样本量增加(200→5000)导致谱估计更精确,真实差异被放大 2. GLUE 任务类型多样(推理/情感/语法),可能引入更大变异性 ### 4.2 任务类型对谱距离的影响 | 任务类型 | 领域 | W1 距离 | |:---------|:-----|:--------| | 语法判断 | glue_cola | 21.56(最低) | | 情感分析 | glue_sst2 | 33.16 | | 语义相似度 | glue_stsb | 44.41 | | 多段落推理 | glue_mnli | 46.84 | | 问答推理 | glue_qnli | 56.95(最高) | **观察**: - **语法任务**(CoLA)的谱距离最低,可能因为语法规则是普适的,不同模型学习到的表示更接近 - **推理任务**(MNLI/QNLI)的谱距离最高,可能因为推理需要更复杂的多层组合,不同架构的模型差异更大 ### 4.3 模型家族差异 ``` r_eff 对比(5 领域平均): Qwen2.5-7B: ████████░░░░░░░░░░░░░░░░ 5.07 Mistral-7B: ████████████████░░░░░░░░ 17.51 Llama-3-8B: ████████████████████░░░░ 22.30 ``` **解释**: - Qwen2.5 作为指令微调模型,可能经过对齐优化,表示更紧凑 - Mistral 和 Llama-3 作为基座模型的变体,保留了更多原始分布信息 - Llama-3 的有效秩最高,与其更大的上下文窗口和训练数据量相关 --- ## 5. 结论 ### 5.1 主要结论 **实验结果不支持 Platonic Representation Hypothesis 的强形式**。具体而言: 1. ❌ **不同模型在同一领域上的谱表示不趋同** - 整体 W1 距离 = 40.58,远超收敛阈值(0.05) 2. ❌ **增加样本量不改变发散结论** - MVP 实验(200 样本)和 GLUE 实验(5000 样本)均发散 3. ⚠️ **任务类型影响谱距离程度** - 语法任务相对收敛(W1≈21) - 推理任务高度发散(W1≈47-57) ### 5.2 研究意义 这些结果暗示: - LLM 的表示空间可能不存在通用的"吸引子" - 模型架构、训练目标和数据分布对最终表示有持久影响 - Platonic 假说可能需要弱化形式(如"在特定任务子类上收敛") --- ## 6. 下一步工作 1. **扩展模型范围**: 添加更多模型家族(Gemma、DeepSeek、InternLM) 2. **分层分析**: 按模型层数分析谱演化,观察收敛是否发生在中间层 3. **任务对齐实验**: 在指令微调前后对比谱距离变化 4. **理论分析**: 探索谱距离与模型性能(如 GLUE 得分)的相关性 --- ## 7. 附录:输出文件 实验输出位于 `experiments/output/glue/`: | 文件 | 内容 | |:-----|:-----| | `config.json` | 实验配置 | | `spectrum_results.json` | 完整谱结果(3MB) | | `summary.json` | 汇总统计 | | `distance_matrices/*.npy` | W1 距离矩阵 | | `metadata.json` | 元信息 | --- **报告生成时间**: 2026-03-12 21:45