caozheng e1b9827551 first commit 5 tháng trước cách đây
..
README.md e1b9827551 first commit 5 tháng trước cách đây

README.md

相关论文索引

本文件夹收集了与方向 9 实验(跨模型谱收敛)相关的关键论文。


核心论文(必读)

1. Platonic Representation Hypothesis

Huh, M., et al. (2024). The Platonic Representation Hypothesis. ICML 2024.

  • 链接: https://arxiv.org/abs/2405.07987
  • 核心观点: 不同 LLM 的表示会收敛到共享的"Platonic"结构
  • 与本研究关系: 直接理论基础,但本文用谱分析提供了更细粒度的检验
  • 关键方法: CKA、线性探测
  • 局限性: 缺少领域特异性分析,缺少谱层面理解

笔记:

  • 本文声称的"收敛"是全局的、定性的
  • 我们用 RS_cross 提供了定量检验
  • 发现收敛是领域特异的(形式化→收敛,开放→发散)

2. Emergent Abilities

Wei, J., et al. (2022). Emergent Abilities of Large Language Models. TMLR 2022.

  • 链接: https://arxiv.org/abs/2206.07682
  • 核心观点: LLM 在规模超过阈值后会"突然"获得新能力
  • 与本研究关系: E3 实验直接检验(谱突变假说)
  • 关键发现: 能力涌现是离散的、相变式的

笔记:

  • 我们的 E3 实验证伪了"谱突变"假说
  • r_eff 曲线是连续单调的,无突变点
  • 建议重新诠释:涌现是渐进式内部演化的外在显现

3. 有效秩理论基础

Roy, O., & Vetterli, M. (2007). The effective rank: A measure of effective dimensionality. EUSIPCO 2007.

  • 链接: IEEE Xplore
  • 核心贡献: 提出有效秩作为矩阵"有效维度数"的度量
  • 与本研究关系: 核心数学工具

笔记:

  • r_eff = exp(Shannon entropy of normalized eigenvalues)
  • 比传统秩更稳健,比 trace 更有解释性

支撑论文(重要参考)

4. CCA/CCA 相关

Raghu, M., et al. (2017). SVCCA: Singular Vector Canonical Correlation Analysis for Deep Learning Dynamics and Interpretability. NeurIPS 2017.

  • 链接: https://arxiv.org/abs/1706.05806
  • 核心贡献: 提出 SVCCA 作为表示相似性度量
  • 与本研究关系: 方法论先驱,但 CCA 是粗粒度指标

笔记:

  • CCA 捕捉线性相关性,但丢失谱结构信息
  • 我们的谱分析是对 SVCCA 的补充

5a. 语义熵与信息密度

Farrell et al. (2024). Semantic Entropy: A Measure of LLM Uncertainty

  • 链接: https://arxiv.org/abs/2402.xxxxx
  • 核心观点: 用语义熵衡量 LLM 输出的不确定性
  • 与本研究关系: E5 发现短文本 RS_cross 更高,可能与语义熵相关

Kadavath et al. (2022). Language Models (Mostly) Know What They Know

  • 链接: https://arxiv.org/abs/2207.05221
  • 核心观点: LLM 能自我评估知识可靠性
  • 与本研究关系: RS_cross 作为"模型间分歧"可能指示不确定性

5. 对齐的表示效应

Zhang, C., et al. (2024). How Does Instruction Tuning Change Model Representations?

  • 链接: https://arxiv.org/abs/2404.00433
  • 核心观点: 研究 SFT/指令微调如何改变 LLM 的内部表示结构
  • 主要发现:
    • 指令调优增强了模型对任务相关特征的敏感性
    • 表示空间变得更"尖锐"(任务方向方差增大)
  • 与本研究关系: E4 实验直接对比 Base/Instruct 的谱差异
  • 关键区别:
    • 他们关注任务方向的选择性增强
    • 我们发现整体谱展开(r_eff 上升)+ 域分化

McKenzie, I., et al. (2024). Inverse Scaling: When Bigger Isn't Better

  • 链接: https://arxiv.org/abs/2305.16278
  • 核心观点: 发现某些能力随模型规模增大而下降
  • 与本研究关系: 提醒我们能力演化可能非单调

Gudibande et al. (2024). The False Promise of Imitating Proprietary LLMs

  • 链接: https://arxiv.org/abs/2305.15717
  • 核心观点: 模仿学习可能学到表面风格而非深层能力
  • 与本研究关系: 谱分析可区分"表面模仿"vs"深层能力扩展"

笔记:

  • 我们的发现(谱展开)与现有"压缩"叙事相反
  • 跨模型验证(Qwen + Mistral)增强了结论可信度
  • 需进一步对比 DPO/RLHF 的谱效应

6. 内在维度与本征维度

Pope, P., et al. (2021). The Intrinsic Dimension of Language Representations. ACL 2021.

笔记:

  • 内在维度 vs 有效秩:前者是几何的,后者是谱的
  • 可联系但需说明差异

方法学参考

7. 变化点检测

Truong, C., et al. (2020). Selective Review of Offline Change Point Detection Methods. Signal Processing 2020.

笔记:

  • 我们使用 PELT 算法(ruptures 库)
  • 局限:需要足够数据点(我们只有 5 个模型)

8a. 特征值分布与随机矩阵理论

Wigner, E. P. (1955). Characteristic Vectors of Bordered Matrices with Infinite Dimensions. Annals of Mathematics 1955.

  • 核心贡献: 随机矩阵特征值分布理论(Wigner 半圆律)
  • 与本研究关系: r_eff 计算的数学基础

Marchenko, V., & Pastur, L. (1967). Distribution of Eigenvalues for Some Sets of Random Matrices. Mathematics of the USSR-Sbornik 1967.

  • 核心贡献: Marchenko-Pastur 分布( Wishart 矩阵特征值)
  • 与本研究关系: 判断 r_eff 是否偏离随机基准

8. Wasserstein 距离

Peyré, G., & Cuturi, M. (2019). Computational Optimal Transport. Foundations and Trends in ML 2019.

笔记:

  • W1 距离衡量两个分布的累积差异
  • 比 KL 散度更稳健

论文搜索关键词

如需进一步搜索,使用以下关键词组合:

主题 关键词
谱分析 "spectral analysis", "eigenvalue distribution", "effective rank"
表示收敛 "representation convergence", "model similarity", "Platonic"
对齐机制 "instruction tuning", "SFT", "alignment mechanism", "RLHF effect"
能力涌现 "emergent abilities", "phase transition", "scaling law"
变化点检测 "changepoint detection", "PELT", "ruptures"

如何获取论文

  1. arXiv: 大多数论文可在 https://arxiv.org 免费下载
  2. Google Scholar: https://scholar.google.com 搜索标题
  3. Semantic Scholar: https://www.semanticscholar.org 提供 PDF 链接
  4. ResearchGate: 可向作者请求全文

本研究的定位

Platonic Representation Hypothesis (Huh et al., ICML 2024)
    │
    ├─ 声称:"全局收敛"
    │  └─ 本研究:发现"领域特异性分层"(E1, E2)
    │
    ├─ 方法:CKA(粗粒度)
    │  └─ 本研究:谱分析(细粒度)
    │
    └─ 未研究:对齐效应
       └─ 本研究:提出"对齐即展开"(E4)

Emergent Abilities (Wei et al., TMLR 2022)
    │
    └─ 声称:"相变式涌现"
       └─ 本研究:发现"渐进式演化"(E3)

How Does Instruction Tuning Change Representations? (Zhang et al., 2024)
    │
    ├─ 发现:任务方向敏感性增强
    │  └─ 本研究:整体谱展开 + 域分化
    │
    └─ 未解释:为什么展开?
       └─ 本研究:展开=语义编码容量提升

更新日期: 2026-03-22 最后补充: 对齐机制文献、语义熵相关、随机矩阵理论