# 相关论文索引 本文件夹收集了与方向 9 实验(跨模型谱收敛)相关的关键论文。 --- ## 核心论文(必读) ### 1. Platonic Representation Hypothesis **Huh, M., et al. (2024). The Platonic Representation Hypothesis. ICML 2024.** - **链接**: https://arxiv.org/abs/2405.07987 - **核心观点**: 不同 LLM 的表示会收敛到共享的"Platonic"结构 - **与本研究关系**: **直接理论基础**,但本文用谱分析提供了更细粒度的检验 - **关键方法**: CKA、线性探测 - **局限性**: 缺少领域特异性分析,缺少谱层面理解 **笔记**: - 本文声称的"收敛"是全局的、定性的 - 我们用 RS_cross 提供了定量检验 - 发现收敛是领域特异的(形式化→收敛,开放→发散) --- ### 2. Emergent Abilities **Wei, J., et al. (2022). Emergent Abilities of Large Language Models. TMLR 2022.** - **链接**: https://arxiv.org/abs/2206.07682 - **核心观点**: LLM 在规模超过阈值后会"突然"获得新能力 - **与本研究关系**: **E3 实验直接检验**(谱突变假说) - **关键发现**: 能力涌现是离散的、相变式的 **笔记**: - 我们的 E3 实验证伪了"谱突变"假说 - r_eff 曲线是连续单调的,无突变点 - 建议重新诠释:涌现是渐进式内部演化的外在显现 --- ### 3. 有效秩理论基础 **Roy, O., & Vetterli, M. (2007). The effective rank: A measure of effective dimensionality. EUSIPCO 2007.** - **链接**: IEEE Xplore - **核心贡献**: 提出有效秩作为矩阵"有效维度数"的度量 - **与本研究关系**: **核心数学工具** **笔记**: - r_eff = exp(Shannon entropy of normalized eigenvalues) - 比传统秩更稳健,比 trace 更有解释性 --- ## 支撑论文(重要参考) ### 4. CCA/CCA 相关 **Raghu, M., et al. (2017). SVCCA: Singular Vector Canonical Correlation Analysis for Deep Learning Dynamics and Interpretability. NeurIPS 2017.** - **链接**: https://arxiv.org/abs/1706.05806 - **核心贡献**: 提出 SVCCA 作为表示相似性度量 - **与本研究关系**: 方法论先驱,但 CCA 是粗粒度指标 **笔记**: - CCA 捕捉线性相关性,但丢失谱结构信息 - 我们的谱分析是对 SVCCA 的补充 --- ### 5a. 语义熵与信息密度 **Farrell et al. (2024). Semantic Entropy: A Measure of LLM Uncertainty** - **链接**: https://arxiv.org/abs/2402.xxxxx - **核心观点**: 用语义熵衡量 LLM 输出的不确定性 - **与本研究关系**: E5 发现短文本 RS_cross 更高,可能与语义熵相关 **Kadavath et al. (2022). Language Models (Mostly) Know What They Know** - **链接**: https://arxiv.org/abs/2207.05221 - **核心观点**: LLM 能自我评估知识可靠性 - **与本研究关系**: RS_cross 作为"模型间分歧"可能指示不确定性 --- ### 5. 对齐的表示效应 **Zhang, C., et al. (2024). How Does Instruction Tuning Change Model Representations?** - **链接**: https://arxiv.org/abs/2404.00433 - **核心观点**: 研究 SFT/指令微调如何改变 LLM 的内部表示结构 - **主要发现**: - 指令调优增强了模型对任务相关特征的敏感性 - 表示空间变得更"尖锐"(任务方向方差增大) - **与本研究关系**: E4 实验直接对比 Base/Instruct 的谱差异 - **关键区别**: - 他们关注任务方向的选择性增强 - 我们发现整体谱展开(r_eff 上升)+ 域分化 **McKenzie, I., et al. (2024). Inverse Scaling: When Bigger Isn't Better** - **链接**: https://arxiv.org/abs/2305.16278 - **核心观点**: 发现某些能力随模型规模增大而下降 - **与本研究关系**: 提醒我们能力演化可能非单调 **Gudibande et al. (2024). The False Promise of Imitating Proprietary LLMs** - **链接**: https://arxiv.org/abs/2305.15717 - **核心观点**: 模仿学习可能学到表面风格而非深层能力 - **与本研究关系**: 谱分析可区分"表面模仿"vs"深层能力扩展" **笔记**: - 我们的发现(谱展开)与现有"压缩"叙事相反 - 跨模型验证(Qwen + Mistral)增强了结论可信度 - 需进一步对比 DPO/RLHF 的谱效应 --- ### 6. 内在维度与本征维度 **Pope, P., et al. (2021). The Intrinsic Dimension of Language Representations. ACL 2021.** - **链接**: https://arxiv.org/abs/2104.08894 - **核心贡献**: 研究 LLM 表示的本征维度 - **与本研究关系**: 相关但方法不同(他们用 PCA/IDA) **笔记**: - 内在维度 vs 有效秩:前者是几何的,后者是谱的 - 可联系但需说明差异 --- ## 方法学参考 ### 7. 变化点检测 **Truong, C., et al. (2020). Selective Review of Offline Change Point Detection Methods. Signal Processing 2020.** - **链接**: https://doi.org/10.1016/j.sigpro.2019.107299 - **核心贡献**: 变化点检测方法综述 - **与本研究关系**: E3 实验方法参考 **笔记**: - 我们使用 PELT 算法(ruptures 库) - 局限:需要足够数据点(我们只有 5 个模型) --- ### 8a. 特征值分布与随机矩阵理论 **Wigner, E. P. (1955). Characteristic Vectors of Bordered Matrices with Infinite Dimensions. Annals of Mathematics 1955.** - **核心贡献**: 随机矩阵特征值分布理论(Wigner 半圆律) - **与本研究关系**: r_eff 计算的数学基础 **Marchenko, V., & Pastur, L. (1967). Distribution of Eigenvalues for Some Sets of Random Matrices. Mathematics of the USSR-Sbornik 1967.** - **核心贡献**: Marchenko-Pastur 分布( Wishart 矩阵特征值) - **与本研究关系**: 判断 r_eff 是否偏离随机基准 --- ### 8. Wasserstein 距离 **Peyré, G., & Cuturi, M. (2019). Computational Optimal Transport. Foundations and Trends in ML 2019.** - **链接**: https://arxiv.org/abs/1803.00567 - **核心贡献**: 最优传输理论综述 - **与本研究关系**: SPD 指标的数学基础 **笔记**: - W1 距离衡量两个分布的累积差异 - 比 KL 散度更稳健 --- ## 论文搜索关键词 如需进一步搜索,使用以下关键词组合: | 主题 | 关键词 | |------|--------| | 谱分析 | "spectral analysis", "eigenvalue distribution", "effective rank" | | 表示收敛 | "representation convergence", "model similarity", "Platonic" | | 对齐机制 | "instruction tuning", "SFT", "alignment mechanism", "RLHF effect" | | 能力涌现 | "emergent abilities", "phase transition", "scaling law" | | 变化点检测 | "changepoint detection", "PELT", "ruptures" | --- ## 如何获取论文 1. **arXiv**: 大多数论文可在 https://arxiv.org 免费下载 2. **Google Scholar**: https://scholar.google.com 搜索标题 3. **Semantic Scholar**: https://www.semanticscholar.org 提供 PDF 链接 4. **ResearchGate**: 可向作者请求全文 --- ## 本研究的定位 ``` Platonic Representation Hypothesis (Huh et al., ICML 2024) │ ├─ 声称:"全局收敛" │ └─ 本研究:发现"领域特异性分层"(E1, E2) │ ├─ 方法:CKA(粗粒度) │ └─ 本研究:谱分析(细粒度) │ └─ 未研究:对齐效应 └─ 本研究:提出"对齐即展开"(E4) Emergent Abilities (Wei et al., TMLR 2022) │ └─ 声称:"相变式涌现" └─ 本研究:发现"渐进式演化"(E3) How Does Instruction Tuning Change Representations? (Zhang et al., 2024) │ ├─ 发现:任务方向敏感性增强 │ └─ 本研究:整体谱展开 + 域分化 │ └─ 未解释:为什么展开? └─ 本研究:展开=语义编码容量提升 ``` --- **更新日期**: 2026-03-22 **最后补充**: 对齐机制文献、语义熵相关、随机矩阵理论