continue_learning/papers/01-surveys-foundations/01-comprehensive-survey.md

title: "Continual Learning of Large Language Models: A Comprehensive Survey" source: "https://arxiv.org/abs/2404.16789" paper: "01-comprehensive-survey.pdf" status: deep-read-v1 tags: - continual-learning - large-language-models - 01-surveys-foundations - 01-comprehensive-survey


Continual Learning of Large Language Models: A Comprehensive Survey

[!abstract] 一句话结论 用“纵向能力演化 × 横向时间/领域演化”统一整理 LLM 持续预训练、领域适配和持续微调,并把评价协议与数据资源纳入同一研究框架。

TL;DR

维度 精读结论
研究问题 LLM 上线后会同时面对知识过时、领域迁移和用户需求变化,但经典持续学习分类不足以覆盖预训练—对齐的完整生命周期。
核心方法 作者先定义 vertical/horizontal continuity,再按 CPT、DAP、CFT 三个阶段梳理 replay、正则化、参数隔离、动态架构等方法,并单列评测与数据。
主要证据 这是一篇结构化综述,核心证据不是单一 SOTA 数字,而是跨 300 余篇工作的分类、比较表和研究空白;重点结论是可访问、贴近真实部署的 benchmark 仍然不足。
路线定位 综述 / 研究地图

1. 研究问题与论文定位

LLM 上线后会同时面对知识过时、领域迁移和用户需求变化,但经典持续学习分类不足以覆盖预训练—对齐的完整生命周期。

阅读这篇论文时,先确认它假设的是离线任务序列、在线数据流、知识编辑流还是跨会话智能体经验流;不同数据访问权限下,方法的可比性完全不同。

[!PDF|] 问题定义 / 摘要锚点 · 01-comprehensive-survey.pdf, p.1

2. 方法拆解

作者先定义 vertical/horizontal continuity,再按 CPT、DAP、CFT 三个阶段梳理 replay、正则化、参数隔离、动态架构等方法,并单列评测与数据。

可用四个问题检查方法本质:旧信息保存在哪里?新信息写到哪里?何时选择/路由?冲突时由哪个目标函数或验证器裁决?

[!PDF|] 方法陈述锚点 · 01-comprehensive-survey.pdf, p.2

关键图示

01-comprehensive-survey.pdf, p.2

图示用于快速恢复论文结构;若 PDF++ 显示裁剪偏移,请按该页版式微调 rect。

3. 实验与关键证据

这是一篇结构化综述,核心证据不是单一 SOTA 数字,而是跨 300 余篇工作的分类、比较表和研究空白;重点结论是可访问、贴近真实部署的 benchmark 仍然不足。

读实验表时应同时核对:最终平均性能(ACC)、后向迁移/遗忘(BWT/F)、新任务可塑性、通用能力、数据/参数/算力预算,以及推理时是否已知任务 ID。

[!PDF|] 实验或结论锚点 · 01-comprehensive-survey.pdf, p.1

4. 与相邻路线的关系

5. 局限与反例

分类框架擅长建立地图,但难以比较不同论文中不一致的数据顺序、模型规模、旧知识测试集和算力预算;读表时不能把横向名次当作严格公平实验。

建议专门寻找反例:任务顺序反转是否仍成立?新旧任务高度相似或直接冲突时怎样?不允许旧数据、不给任务 ID、固定总参数和总 token 后,优势是否保留?

[!PDF|] 局限 / 讨论锚点 · 01-comprehensive-survey.pdf, p.22

6. 复现与延伸研究

适合作为本项目的总索引;后续可沿“预训练流、指令流、编辑流、智能体经验流”分别建立统一 budget 与 forgetting/transfer 指标。

最小复现实验

  1. 先复现 naive sequential FT、等预算 replay 和一个 PEFT 基线。
  2. 固定任务顺序、总训练 token、可训练参数与推理上下文预算。
  3. 每个阶段都保存 checkpoint,画完整的适应—遗忘轨迹,而非只报最终点。
  4. 额外测通用能力、安全/对齐、延迟、显存与数据保留量。

7. 我的判断

这篇工作的主要价值位于 综述 / 研究地图。它是否值得直接用于真实系统,不只取决于论文内分数,还取决于旧数据访问、任务边界、容量增长和错误回滚是否符合你的部署约束。

[!question] 带着问题继续读 - 它实现的是知识保持、能力保持,还是仅仅保持了 benchmark 输出格式? - 方法优势来自机制本身,还是更多计算、更多参数、更多历史数据? - 如果学习流持续一年而非十个任务,哪一项资源最先耗尽?