实验日期: 2026-03-12 实验类型: MVP(最小可行实验) 实验目标: 验证 Platonic Representation Hypothesis —— 不同 LLM 在相同文本集上的谱表示是否趋同
根据 Platonic Representation Hypothesis (Huh et al., ICML 2024),不同神经网络随着模型规模增大,其表示会逐渐收敛到一个共享的"柏拉图式"结构。
本实验通过谱分析方法验证以下问题:
| 编号 | 研究问题 |
|---|---|
| Q1 | 不同 LLM 在相同文本集上的谱有效秩是否趋同? |
| Q2 | 特征值分布的整体形状是否收敛? |
| Q3 | 收敛程度是否随文本领域(新闻/代码/对话/学术)变化? |
| 平均 W1 距离 | 收敛状态 | 含义 |
|---|---|---|
| < 0.05 | 收敛 | 谱高度相似,支持 Platonic 假说 |
| 0.05 - 0.2 | 部分收敛 | 域依赖,部分领域趋同 |
| > 0.2 | 发散 | 谱差异显著 |
| 模型 | 参数量 | 隐藏层维度 | 来源 |
|---|---|---|---|
| Qwen2.5-7B-Instruct | 7B | 3584 | 魔搭 |
| Mistral-7B-v0.3 | 7B | 4096 | 魔搭 |
| Llama-3-8B-Instruct | 8B | 4096 | 魔搭 |
| 领域 | 数据来源 | 样本数 |
|---|---|---|
| news_en | CNN/DailyMail | 200 |
| news_zh | 维基百科中文 | 200 |
| academic | 维基百科科学类 | 200 |
| code | Cosmopedia | 200 |
| dialogue | OpenAssistant/oasst1 | 200 |
| literature | 维基百科人文类 | 200 |
总计: 3 模型 × 6 领域 = 18 个表示矩阵
对表示矩阵 $H$ 进行谱分析:
使用 per_sample_l2 归一化:
| 模型 | r_eff 均值 | r_eff 标准差 | r_eff 最小值 | r_eff 最大值 |
|---|---|---|---|---|
| Qwen2.5-7B | 5.48 | 2.69 | 3.49 | 11.32 |
| Llama3-8B | 9.39 | 2.51 | 5.47 | 13.57 |
| Mistral-7B | 14.11 | 5.36 | 2.35 | 18.21 |
观察:
| 领域 | Qwen↔Mistral | Qwen↔Llama3 | Mistral↔Llama3 | 平均 |
|---|---|---|---|---|
| news_en | 11.85 | 4.64 | 7.22 | 7.90 |
| news_zh | 2.16 | 3.24 | 5.60 | 3.66 |
| academic | 10.63 | 2.99 | 7.64 | 7.09 |
| code | 10.57 | 3.04 | 7.46 | 7.05 |
| dialogue | 3.47 | 1.24 | 4.24 | 2.98 |
| literature | 11.55 | 3.09 | 8.45 | 7.70 |
整体平均 W1 距离: 6.06
从最收敛到最发散:
dialogue (2.98) < news_zh (3.66) < code (7.05) < academic (7.09) < literature (7.70) < news_en (7.90)
↑ ↑ ↑ ↑ ↑ ↑
最收敛 较收敛 中等发散 中等发散 较发散 最发散
| 指标 | 预期阈值 | 实际结果 | 状态 |
|---|---|---|---|
| 整体平均 W1 | < 0.05 | 6.06 | ❌ 远超阈值 |
| 收敛判断 | 收敛 | 发散 | ❌ 不支持假说 |
结论: 当前实验结果不支持 Platonic Representation Hypothesis 的强形式
可能原因:
根据 README.md 中的收敛判断标准:
| 情形 | 条件 | 当前结果 | 符合度 |
|---|---|---|---|
| 情形 A: 高度收敛 | W1 < 0.05 | 6.06 | ❌ |
| 情形 B: 部分收敛 | 0.05 ≤ W1 ≤ 0.2 | 6.06 | ❌ |
| 情形 C: 发散 | W1 > 0.2 | 6.06 | ✅ |
当前结果属于情形 C(谱发散)
实验生成了 24 张可视化图表,位于 experiments/output/figures/ 目录:
| 类型 | 数量 | 说明 |
|---|---|---|
热力图 (heatmap_*.png) |
6 | 展示模型间谱相似性 |
有效秩柱状图 (bar_r_eff_*.png) |
6 | 对比各模型有效秩 |
谱分布曲线 (spectrum_*.png) |
6 | 展示归一化谱密度分布 |
收敛分析图 (convergence_*.png) |
6 | 多模型谱收敛对比 |
同家族模型对比:
增加样本量:
尝试其他归一化:
trace_norm: 整体归一化sample_cov: 样本协方差归一化逐层分析:
| 实验类型 | 目的 | 配置 |
|---|---|---|
| 规模效应分析 | 验证模型规模与谱收敛的关系 | Qwen 0.5B→72B |
| 对齐效应分析 | 验证 SFT/RLHF 对谱的影响 | Base vs Instruct vs DPO |
| 跨语言分析 | 验证语言对谱收敛的影响 | news_en vs news_zh |
# Python 环境
Python 3.12
PyTorch >= 2.0.0
transformers >= 4.30.0
numpy >= 1.24.0
matplotlib >= 3.6.0
seaborn >= 0.12.0
# 1. 下载模型(魔搭)
python model/download_from_modelscope.py --model llama3-8b
# 2. 提取表示
python model/extract_representations.py
# 3. 运行 MVP 实验
python -m experiments.verify --mode mvp
# 4. 生成可视化
python -m experiments.visualization --result-dir experiments/output/mvp --output-dir experiments/output/figures
experiments/output/mvp/
├── config.json # 实验配置
├── summary.json # 汇总统计
├── spectrum_results.json # 完整谱结果
├── metadata.json # 元信息
└── distance_matrices/ # 距离矩阵
├── news_en_w1_matrix.npy
├── news_zh_w1_matrix.npy
├── academic_w1_matrix.npy
├── code_w1_matrix.npy
├── dialogue_w1_matrix.npy
└── literature_w1_matrix.npy
报告生成时间: 2026-03-12 实验负责人: AI Assistant 版本: v1.0