Red Hat:Sculpting Subspaces
- 原文:Red Hat Developer
- 代码:orthogonal-subspace-learning
- 发布:2025 年 4 月
核心内容
文章用“雕刻大理石”解释 adaptive SVD:对权重矩阵做奇异值分解,将大奇异值对应方向视为承载关键知识的高秩子空间,将较小奇异值方向视为更安全的可更新容量。新任务梯度被投影到低秩、且与重要方向正交的空间。
其目标是避免三类常见代价:
- replay 需要保留旧数据;
- LoRA/adapter 可能限制表达能力并持续增加模块;
- 模型合并需要多个模型与复杂调参。
博客报告 T5-large 上 15 任务准确率 71.3%,高于文中 O-LoRA 的 69.6%;在 TRACE/Llama-2-7B-chat 上平均准确率 48.4%,高于 O-LoRA 的 41.3%,后向迁移为 7.1%。
需要警惕
“大奇异值 = 关键旧知识、小奇异值 = 可安全更新”是强假设。文章也承认 rank 估计敏感、重复 SVD 有计算开销、预分配子空间会在长任务流中遇到容量问题。博客标题中的 “solved” 应按研究宣传理解,而不是领域已经解决。
带着问题读
- 对哪些层做 SVD,结果对 rank 阈值有多敏感?
- 低奇异值方向是否真的与所有旧任务无关?
- 当新旧任务相似时,过强正交是否阻碍正迁移?
- 把 SVD、缓存和 checkpoint 成本计入后,和 replay/LoRA 是否仍公平?