CL Continual & Adaptive Intelligence Atlas

Offline research handbook · 2026

持续学习长期自适应智能

从灾难性遗忘、持续预训练与指令微调,到知识编辑、智能体经验闭环和多时间尺度自适应:一份可搜索、可追溯、可直接动手复现的离线研究地图。

41 篇论文逐篇精读 202 个 PDF++ 精确引用 7 条网页 / 播客

Executive synthesis

八条先行结论

它们不是对单篇论文的复述,而是把 41 篇论文与代码实现横向对齐后得到的研究判断。

01

没有脱离数据流假设的“最佳方法”

允许保存旧数据、允许保存统计量、知道任务边界、知道推理任务 ID,分别对应不同难度。论文排名必须先还原这些权限。

02

Replay 仍是最难击败的基线

从 TiC-LM 到持续指令微调,合理的数据混合常常比复杂机制更稳定。新方法至少应在相同 token、存储与隐私预算下超过 replay。

03

短期稳定性和最终性能是两件事

Stability Gap 表明模型更新初期可能暂时崩塌后恢复。只报告最后一个 checkpoint,会漏掉真实部署最危险的时间窗口。

04

参数高效不等于系统高效

LoRA、adapter 与任务模块降低可训练参数,却可能增加模块数量、路由错误、推理延迟和长期容量压力。

05

外部记忆不自动等于学习

保存轨迹或检索历史可能只是在上下文里“查到”。真正的能力学习还要经过经验选择、验证、抽象、迁移与必要时的参数内化。

06

模型编辑正在成为独立的持续学习分支

WISE 与 MEMOIR 不再把更新视为普通微调,而是显式设计主记忆、侧记忆、残差记忆和路由,直接优化可靠性、泛化与局部性。

07

智能体把问题从任务序列推向经验闭环

LifelongAgentBench、SkillLearnBench 与 LifeSkill 关注跨会话经验、可验证反馈和技能形成;错误经验也会产生长期负向复利。

08

前沿正在转向多时间尺度自适应

Nested Learning、SEAL 与 Fast–Slow Learning 试图统一上下文、记忆、优化器状态和模型参数,研究不同状态应以什么频率更新。

01 · Foundations

持续学习:概念与背景

持续学习不是某一种防遗忘算法,而是一种面向时间序列的学习范式。 它研究系统在信息持续到达、环境不断变化且历史数据受限时,如何更新自身, 同时平衡新知识吸收、旧能力保留、知识迁移与更新成本。

Working definition

什么是持续学习?

持续学习(Continual Learning, CL)是一种序列学习范式:学习者不能假定所有 数据一次性可见,而是在数据、任务、标签空间、知识或目标随时间到达和变化时 更新自身;更新后的系统既要吸收当前信息,也要保留、迁移并在必要时修正过去能力。

Mt = Update(Mt−1, Dt, Bt)

M 是系统状态,D 是当前阶段数据,B 是可访问的历史缓冲或外部记忆。 核心目标不是只优化当前损失,而是在保留、迁移、资源和风险之间取得长期平衡。

01

信息按时间到达

训练数据、任务、领域、标签空间、知识或目标不是一次性全部可见,而是形成有顺序的数据流。顺序本身会影响学习结果。

02

更新跨会话保留

系统在第 t 阶段获得的变化会进入后续状态,而不是只在一次推理请求中临时存在;更新对象可以是参数、适配器、记忆或它们的组合。

03

新旧能力联合评价

不能只看当前阶段学得多快,还要检查过去能力是否遗忘、能否正向迁移,以及通用能力和安全行为是否退化。

04

受现实约束

历史数据通常无法无限保存和反复训练,计算、存储、隐私、版权与更新时间均受限制;这些限制是问题定义的一部分。

Why now

为什么需要持续学习

静态训练假设与长期部署现实之间的五个结构性矛盾。

Non-stationarity

世界持续变化

事实知识、用户偏好、业务规则、传感器分布与任务目标都会漂移。静态模型上线后,其训练分布与现实之间的距离只会继续扩大。

Efficiency

全量重训代价过高

每次新增数据都从零训练,会重复支付巨额算力、时间和工程成本。持续学习试图把更新变成增量过程,并控制单位新知识的成本。

Data access

历史数据不可总是回放

隐私、版权、合规、存储上限或数据生命周期可能阻止旧样本长期保留。模型因此必须在有限回放甚至无回放条件下维持过去能力。

Personalization

部署后需要适应

个人助手、企业知识系统和专业模型需要吸收本地经验与反馈。这种适应既要足够快,又不能破坏基础模型已有的通用能力。

Reliability

更新必须可控

新数据可能带来遗忘、知识污染、偏差放大或安全回退。研究重点不只是让模型会变,而是让变化可衡量、可审计、可回滚。

Research history

从“遗忘”到长期更新系统

研究重点逐步从单个神经网络现象,扩展到设定、指标、系统和治理。

1980s

灾难性干扰被明确观察

神经网络学习新映射时会突然破坏旧映射,形成后来所谓的灾难性遗忘问题:共享参数上的新梯度会覆盖旧知识。

1990s–2000s

稳定性—可塑性成为核心矛盾

研究逐渐把问题表述为:系统既要保持稳定,又要对新经验保持可塑。回放、参数保护、模块化与双记忆系统等思路在这一时期奠基。

2017

现代基准方法形成

EWC 用参数重要性约束更新,GEM 用记忆样本限制梯度方向。两者分别代表正则化与经验回放路线,推动可比较实验快速增长。

2019–2022

问题设定和评价协议成熟

Task/Domain/Class-Incremental、在线、无任务边界等设定被系统区分;平均准确率、遗忘、前向与后向迁移成为常见报告指标。

2021–2024

持续学习进入大语言模型

研究对象扩展到持续预训练、持续指令微调和知识更新。模型编辑、参数高效微调、检索记忆与防遗忘训练开始被放进统一更新视角比较。

2025–2026

走向长期运行与多时间尺度

前沿问题从固定任务序列转向开放数据流:系统如何在工作记忆、外部知识库、局部参数和基础参数之间选择更新位置,并持续做版本治理。

Problem settings

六类常见学习设定

读论文时应先确认任务边界是否可见、输出空间是否变化、数据是否可回看; 同一种算法在不同设定下的难度和结论不可直接横比。

Task-IL

Task-Incremental Learning

训练流
任务依次到达,训练时知道任务边界。
测试时
推理时通常给出任务 ID,可调用任务专属输出头或模块。
辨析
相对容易;任务身份提供了额外信息。
Domain-IL

Domain-Incremental Learning

训练流
输入分布或领域随时间变化,但目标空间保持一致。
测试时
推理时不提供领域 ID,模型使用同一输出空间。
辨析
重点是分布漂移下的稳健性与旧域保持。
Class-IL

Class-Incremental Learning

训练流
新的类别分批出现,旧类样本往往不可完整访问。
测试时
需要在截至当前见过的所有类别中统一判别。
辨析
更难;常受类别偏置和表示漂移影响。
Online CL

Online / Streaming Continual Learning

训练流
样本以数据流到达,通常只看一次或只允许极少更新。
测试时
随时可能评价,需兼顾即时适应和短期稳定。
辨析
强调低延迟、有限缓存与算力预算。
Task-Free

Task-Free Continual Learning

训练流
数据流不提供清晰任务边界,变化可能渐进或重叠。
测试时
系统需自行检测漂移、切换策略或形成内部上下文。
辨析
比人工切好的任务序列更接近真实部署。
Open-World

Open-World Continual Learning

训练流
会出现未知类别、新能力需求和分布外输入。
测试时
既要识别已知内容,也要发现未知并决定是否学习。
辨析
把持续学习与新颖性检测、拒答和治理结合。
Concept boundaries

它与相邻概念有什么区别?

关键区别不在工具名称,而在更新是否持续保留、是否面对序列,以及是否评价旧能力。

相邻概念 更新持久化 显式序列 旧能力保持 与持续学习的关系
静态微调 通常否 常不评价 一次性适配;若反复顺序微调并评价遗忘,才进入持续学习问题。
迁移学习 源域 → 目标域 不一定 关注知识对新任务的帮助;持续学习还要求长期序列中的保留与迁移。
领域适应 可选 常为单次域迁移 通常非核心 Domain-IL 可视为多阶段领域适应加上旧域保持约束。
在线学习 未必 二者重叠,但在线学习可只优化当前累计损失,不一定显式研究遗忘。
测试时适应 常为临时 测试流 较少 多在部署时适应当前分布;若更新长期保留并跨阶段评价,边界会重叠。
RAG / 外部记忆 知识库可持久 可支持 参数不必改变 它是更新知识的机制而非完整学习范式;可成为持续学习系统的一层。
模型编辑 通常是 多为局部事实 以局部性衡量 强调精准修改;连续多次编辑、累积干扰与全局保持构成持续编辑问题。
元学习 学习适应规则 跨任务分布 不一定 可让模型更快持续适应,但本身不等同于部署期持续更新。
Evaluation basics

基础评价维度

一张阶段 × 任务的完整评测矩阵,比单个最终分数更能揭示学习动态。

ACC

平均最终表现

序列结束后,在所有已见任务或领域上的平均得分。

单独看 ACC 会掩盖模型何时遗忘、是否依赖大量回放。
BWT

Backward Transfer / 遗忘

后续学习对过去任务的影响;负值通常表示过去能力下降。

需保留各阶段评测矩阵,不能只记录最终一次结果。
FWT

Forward Transfer

过去经验是否让尚未专门训练的新任务获得更好的初始表现。

它区分了真正可迁移的表示与单纯记住旧任务。
STS

短期稳定性

在线更新前后输出波动、恢复时间及最近窗口内的性能变化。

对连续服务很关键,最终平均分无法反映更新瞬间的风险。
GCR

通用能力保持

专业更新后,语言、推理、安全、校准等基础能力是否退化。

LLM 评测不能只覆盖当前增量数据对应的小任务。
COST

资源与数据成本

每阶段训练算力、峰值显存、回放缓存、更新时间和存储增量。

若不报告预算,方法间的稳定性与准确率往往不可公平比较。
Local reading path

从这些本地资料开始

先读综述统一词汇,再用 EWC 与 GEM 理解两条经典路线,最后进入 LLM 设定。

2024 · 综合综述

A Comprehensive Survey of Continual Learning

用于建立统一定义、方法谱系、问题设定与评价语言。

2024 · LLM 综述

Continual Learning of Large Language Models: A Comprehensive Survey

连接传统持续学习与持续预训练、微调、知识更新和能力扩展。

2024 · 遗忘综述

Catastrophic Forgetting in Deep Learning

集中解释遗忘产生机制、衡量方式与主要缓解路线。

2017 · EWC

Overcoming Catastrophic Forgetting in Neural Networks

正则化路线代表作:保护对旧任务重要的参数。

2017 · GEM

Gradient Episodic Memory for Continual Learning

回放路线代表作:利用记忆样本约束梯度,减少旧任务损失上升。

2025 · EMNLP Tutorial

Continual Learning for Large Language Models Tutorial

以 LLM 为中心梳理设定、方法、评测和当前开放问题。

02 · Persistent adaptive intelligence

从静态模型到持久学习机器

更广义的问题不是“每隔多久微调一次”,而是让模型在运行过程中拥有跨会话、 可寻址、可增长并直接影响计算的内部状态,同时学会决定什么值得写入、何时巩固、 如何遗忘以及怎样撤销错误更新。

Working umbrella

持久自适应智能

本手册用它指代一个工作性上位框架:系统不再只是冻结参数 所定义的静态函数,而是一个运行在多时间尺度可塑状态之上的学习机器。 这不是一个已经统一命名的学术领域,也不替代严格的持续学习定义。

关键分类不再只是“参数是否更新”,而是系统中的哪些变量,以什么时间尺度, 依据什么信号,按照什么规则更新。
encodezt = Eθ(xt)
actyt = Fθ(zt, St)
learn St+1 = Uθ( St, zt, yt, εt, rt, ct)

F 决定当前如何推理;U 才决定系统如何学习。ε 是预测误差,r 是结果或奖励, c 携带来源、时间、置信度与适用上下文。

Scope map

三层研究范围,而不是一个被无限扩大的概念

越往外层,研究目标越接近长期智能系统;越需要明确证据成熟度和评测边界。

01 定义成熟

经典持续学习

任务、类别或领域按序到达;评价遗忘、迁移、旧数据访问与资源预算。

代表
Replay、EWC、GEM、Class/Domain/Task-IL
边界
是严格 CL 结论可比较的实验内核。
02 快速发展

大模型持续适应

持续预训练、指令微调、模型编辑、参数高效模块和外部记忆共同承担更新。

代表
CPT、LoRA/Adapter、Model Editing、RAG Memory
边界
把写入位置从单一参数扩展到混合系统。
03 工作性框架

持久自适应智能

系统跨会话保留可塑状态,在多个时间尺度选择性学习知识、技能与学习规则。

代表
Test-Time Learning、Neural Memory、Consolidation、Metaplasticity
边界
是研究上位框架,不是已经统一命名的学术领域。
Multi-timescale state

下一代模型可能需要的五种可塑状态

人类式学习的关键未必是单一状态足够大,而可能是快速记录、缓慢抽象和极慢 改变学习方式的多个系统共同工作。

αworking ≫ αepisodic ≫ αsemantic ≳ αprocedural
Sᵂ

工作状态

token → 秒

当前推理轨迹、注意力、临时变量和短期目标。

写入信号当前输入、上下文与中间计算。

主要失效上下文溢出、注意力稀释、会话结束即消失。

Sᴱ

情景记忆

分钟 → 天

事件、对话、来源、时间、例外和结果轨迹。

写入信号新颖性、意外程度、用户纠正和行动结果。

主要失效噪声累积、错误写入、无法从案例获得泛化。

语义记忆

天 → 月

跨事件抽取的概念、关系、规律与世界模型。

写入信号重复证据、跨情境一致性和未来预测效用。

主要失效过早抽象、覆盖时间条件、知识冲突与漂移。

Sᴾ

程序性记忆

天 → 月

技能、策略、工具调用方式和可执行子程序。

写入信号成功轨迹、奖励、验证器和复用频率。

主要失效错误技能固化、模块膨胀、路由和组合失效。

Sᴹ

元可塑状态

阶段 → 生命周期

学习率、保护度、写入门、路由和更新规则。

写入信号长期保持、迁移、干扰、成本和安全回归。

主要失效学会错误的学习策略、奖励投机与目标漂移。

Protected core + slow structure + fast state
Θt = { θroot, θslow,t, Sfast,t }
θroot
受保护根核:学习协议、状态解释和安全边界。
θslow
缓慢演化的表示、专家模块和长期技能。
Sfast
实时更新的情景、工作与局部神经状态。
Frontier signals

八条正在汇合的技术路线

这些工作提供了结构信号,但目前大多验证的是长序列建模、有限数据流或受控任务, 还不是跨月份、跨年份运行的完整终身学习系统。

基础原理 早期证据 前沿提案 研究假说
基础原理 2016

Fast Weights

在瞬时激活与慢速训练权重之间,引入快速变化的可塑变量。

已经证明证明快速权重可以存储近期模式,并为序列模型提供对过去的内容寻址。

尚未证明主要是短期序列记忆;未证明跨会话、开放世界的终身知识积累。

查看一手论文
早期证据 2024

TTT Layers

把隐藏状态变成线性模型或 MLP,并用自监督目标在测试序列上持续更新。

已经证明在 125M–1.3B 模型和长上下文语言建模中展示线性复杂度与表达性状态。

尚未证明关注单个序列内的 test-time training;跨会话保持、可信写入和长期治理仍未解决。

查看一手论文
早期证据 2024/2025

Titans

用预测误差或“意外程度”驱动测试时神经长期记忆写入,并与注意力组合。

已经证明在语言、常识、基因组和时间序列上展示长上下文建模能力。

尚未证明“长期”主要指序列上下文尺度;不等于跨月份运行的可靠语义记忆。

查看一手论文
前沿提案 2025

Nested Learning / HOPE

把模型描述为多个嵌套优化层,每层拥有独立信息流、记忆容量和更新频率。

已经证明提出 Continuum Memory 与自修改模块,并在语言建模、知识吸收和持续任务上给出初步结果。

尚未证明仍是新近预印本;更高阶自修改是否能在开放数据流中稳定扩展尚未验证。

查看一手论文
前沿提案 2026

Sleep / Consolidation

将在线短期经验暂存,周期性重放、蒸馏或“做梦”,转入更稳定结构。

已经证明两条同期工作分别探索参数级知识巩固,以及从上下文到 fast weights 的离线巩固。

尚未证明实验仍在有限轨迹和受控任务上;巩固可能同时放大模型自产错误。

查看一手论文
前沿提案 2025

Memory OS

把参数记忆、激活记忆和文本记忆作为可追踪、迁移和治理的一等资源。

已经证明MemOS 给出统一抽象、生命周期和跨记忆类型调度的系统设计。

尚未证明操作系统式治理不自动产生语义泛化;需要与学习规则和长期实证结合。

查看一手论文
早期证据 2025

Self-Adapting Models

让模型生成自己的微调数据、更新指令和优化配置,再以未来任务表现训练这种能力。

已经证明SEAL 在知识吸收和少样本泛化实验中展示自生成更新的可行性。

尚未证明仍依赖梯度微调和外部评价;自生成数据可能形成错误反馈回路。

查看一手论文
基础原理 2023

Learned Plasticity

离线用元学习获得部署期可执行的局部、稀疏或生物约束更新规则。

已经证明研究已在小规模深度网络的在线学习中发现可解释、有效的局部可塑性规则。

尚未证明距离大模型规模、多模态知识和长期安全更新仍有显著工程与理论鸿沟。

查看一手论文
Learning lifecycle

真正的长期学习不应是“输入即写入”

新经验先作为可追溯事件存在,只有经重复证据、结果反馈和未来效用验证, 才逐步进入语义、技能或慢参数层。

01

经验到达

接收输入、环境结果、用户纠正和工具反馈;输入只是证据,不自动成为事实。

02

暂定情景写入

先记录事件、来源、时间和上下文,避免一次输入直接改变稳定世界模型。

03

证据与冲突检查

估计可信度、新颖性和风险,并检索是否已有相容或矛盾记忆。

04

重复验证

利用独立来源、后续结果或可信反馈决定经验应被修正、保留还是丢弃。

05

语义与技能抽取

从多个事件中压缩可泛化规律,或从成功轨迹形成可复用程序。

06

慢速巩固

在合适窗口把稳定信息迁移到参数、专家模块或更慢的神经状态。

07

新旧能力复验

联合检查新知识、旧能力、迁移、安全、校准与资源成本。

08

压缩、遗忘与回滚

删除低价值状态、保留审计记录;污染或退化时恢复到已知安全快照。

选择性写入门: gt = g(novelty, prediction error, source reliability, repetition, future utility, reward, risk)

Capability ladder

从“记住”到“会学习”的六级能力

这是一把分析学习深度的尺,不是一条确定的产品或产业发展路线。

C1

持久召回

应当验证跨会话准确找回事件、来源与时间。

仍不代表只证明系统保存了档案,不代表模型已经学会。

C2

状态条件化行为

应当验证相同输入在不同历史状态下产生合理不同的判断和策略。

仍不代表可能只是检索提示改变输出,尚未形成可迁移结构。

C3

语义泛化

应当验证从多个具体事件抽象规律,并迁移到未见场景。

仍不代表需要排除训练泄漏和简单最近邻复述。

C4

技能获得

应当验证把轨迹压缩成可组合、可复用、可验证的程序或策略。

仍不代表技能库增长并不保证正确路由和跨技能组合。

C5

学习如何学习

应当验证根据长期结果改进写入门、学习率、课程和更新规则。

仍不代表必须在新任务分布上验证,避免只记住元训练模式。

C6

受治理的长期自治

应当验证能在来源审计、安全边界、版本和回滚机制下长期更新。

仍不代表这是系统级研究目标,不是目前模型已经普遍具备的能力。

待验证假说

状态 scaling law:容量不是唯一变量

用户材料提出了一个值得实验化的问题:下一代模型的主要 scaling 对象, 可能不只是静态参数量,还包括有效状态容量、读写带宽和更新规则质量。 目前没有被广泛验证的通用状态 scaling law

L ≈ L + aP−α + bC−β + cB−γ + dQ−δ
P

稳定核心能力

基础表示、计算和解释可变状态的能力。

核心太弱时,再大的状态也可能无法被正确寻址和利用。
C

有效状态容量

可持久保存且能被可靠区分的信息、技能与程序容量。

物理容量不等于有效容量;干扰和检索错误会迅速侵蚀收益。
B

状态读写带宽

每个学习步骤能准确读取和局部修改多少相关状态。

仓库变大但带宽不变,可能只会让可达信息比例继续下降。
Q

更新规则质量

写入门、寻址、压缩、巩固、冲突处理与遗忘策略的质量。

Q 决定容量增长带来知识还是噪声,是最难直接量化的因素。
Falsifiable experiment

怎样检验,而不是只讨论愿景

  1. 冻结同一主干模型,在多个中间层插入可持久化的神经状态模块。
  2. 分别控制状态容量 C、每步读写带宽 B 和更新规则质量 Q。
  3. 用完整生命周期轨迹训练,让“未来性能改善”决定记忆价值。
  4. 跨任务流测保持、迁移、干扰、寻址精度、成本与错误恢复。
  5. 只有在多种数据流上出现稳定可预测趋势,才支持 scaling 假说。
Safety & governance

可恢复性是学习机制,不是外围运维

对静态模型,错误通常止于一次输出;对持久学习系统,错误可能成为下一轮推理 和训练的输入。来源、版本、隔离、回滚与遗忘必须进入架构。

持久记忆投毒

恶意输入、提示注入或伪造反馈一旦跨会话保留,会形成长期行为偏置或后门。

架构控制隔离区、来源签名、写入门、红队数据流和选择性删除。

错误自我强化

模型把自己的猜测重新当作训练数据,错误会在反复重放和自蒸馏中放大。

架构控制区分观察与推断,要求外部结果或独立证据后再巩固。

目标与安全漂移

局部成功反馈可能逐步改变原始目标、拒答边界和价值约束。

架构控制受保护根核、不可变安全测试、更新权限分级和定期基准回归。

不可逆自修改

参数、路由和更新规则同时变化时,污染来源难定位,撤销单次更新也未必能恢复。

架构控制版本化状态、因果日志、原子更新、快照与依赖感知回滚。

容量无界增长

保存所有事件会带来成本、延迟、隐私风险和检索质量下降。

架构控制未来效用估计、摘要压缩、过期策略、可重构性判断和遗忘预算。

评价被短期收益欺骗

系统可能提高近期任务得分,却破坏长期可塑性、通用能力或校准。

架构控制生命周期轨迹评测、延迟评价、跨分布迁移与总资源账本。
Primary sources

前沿阅读入口

优先读一手论文,并始终把“长上下文效果”“受控持续任务”与“开放世界终身学习” 三种结论分开。

2024

Learning to (Learn at Test Time): RNNs with Expressive Hidden States

把隐藏状态模型化,并在每个 token 上执行自监督测试时训练

2025

Nested Learning: The Illusion of Deep Learning Architecture

按上下文流与更新频率组织嵌套优化、多时间尺度记忆和自修改模块

2026

Learning, Fast and Slow: Towards LLMs That Adapt Continually

以优化文本作为快权重、模型参数作为慢权重的协同后训练

2026

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

在离线睡眠期通过 Knowledge Seeding 与 Dreaming 巩固快经验

2023

Organizing Memories for Generalization in Complementary Learning Systems

快速情景记忆与慢速泛化系统之间的停止巩固准则

2023

Meta-Learning Biologically Plausible Plasticity Rules with Random Feedback Pathways

用元学习发现稀疏、共享、可解释的在线局部可塑性规则

03 · Mechanisms & scope

持续学习机制与边界

本章只讨论经验如何跨时间持久写入,以及系统如何在吸收新知识的同时保持旧能力。临时上下文适应、单次推理或工具调用,只有在形成可保留的记忆、技能或参数变化后,才进入持续学习研究范围。

严格判据:数据、任务或环境按时间连续到来;系统发生可跨会话保留的变化;评价同时覆盖新知识获取、旧能力保持、迁移和遗忘。仅仅“这次回答得更好”并不等于持续学习。

Learning depth

从临时适应到持久学习

现实系统可能混合多个层级,但需要明确经验写到哪里、能保存多久、是否改变未来行为,以及更新失败时能否追溯和撤销。

L0

上下文适应

Prompt、in-context examples、临时工作记忆

持久:上下文结束即消失 优势:最快、无需训练 风险:窗口有限,无法形成稳定能力
L1

外部记忆

RAG、情景记忆、对话与轨迹库

持久:跨会话保存 优势:可追溯、易删除和更新 风险:检索到不等于真正学会,错误与噪声会累积
L2

技能与模块积累

代码技能、工具策略、LoRA、adapter

持久:可复用的程序或参数模块 优势:低干扰、容易组合 风险:模块增长、路由错误和推理延迟
L3

持续参数更新

持续预训练、微调、编辑和稀疏写入

持久:进入共享模型能力 优势:紧凑、泛化潜力高 风险:灾难性遗忘、污染扩散和难以撤销
L4

元学习控制

学习目标、课程、数据生成、更新规则与验证器

持久:改变系统如何学习 优势:自动选择何时、用什么方式更新 风险:奖励投机、错误自增强和目标漂移

重要区分:外部记忆让系统“以后还能查到”,参数或技能更新更接近“以后本身就会”。前者更易审计和撤销,后者可能拥有更强泛化能力,也承担更高的遗忘与污染风险。

Update loop

从新经验到可验证的持久更新

可靠的持续学习不能直接把所有反馈写入系统。它需要先识别学习信号、选择写入层级、验证候选更新,并在写入后重新检查新旧能力。

01

接收新经验

持续接收按时间到来的数据、任务、反馈和知识变化。

02

识别学习信号

区分真正的新知识、分布漂移、偶发噪声和重复样本。

03

选择写入位置

决定保留在上下文、外部记忆、技能模块还是模型参数中。

04

验证更新候选

检查来源、正确性、安全性、可复用性和潜在冲突。

05

执行持久更新

通过记忆写入、模块训练、重放或受约束参数更新保存经验。

06

复验与回滚

同时测量新能力和旧能力,发现遗忘或污染时撤销更新。

Primary sources

直接相关的一手研究入口

这里只保留直接讨论大模型持续学习、长期智能体学习或受控持久适应的研究。链接仅在主动点击时联网打开,手册本身不会加载外部资源。

04 · Field map

领域地图

用“写到哪里”和“何时更新”理解方法,比只按论文名称分类更接近真实系统。

Replay 通用

数据重放

直接近似旧分布,简单且基线强

写入位置训练数据流
旧数据需要,或生成替代样本
容量增长
主要风险隐私、存储、采样偏差、上下文膨胀
Protect 训练更新

正则化与梯度约束

额外推理结构少,机制清晰

写入位置原模型参数,但限制方向/幅度
旧数据EWC 不需要;GEM 需要记忆
容量增长保存重要性或梯度摘要
主要风险重要性近似粗糙,强约束损害可塑性
Isolate 持续微调

PEFT 与子空间隔离

训练经济,适合大模型

写入位置低秩或任务相关参数子空间
旧数据可做到无重放
容量增长按任务或模块增长
主要风险方向耗尽、路由错误、阻碍正迁移
Expand 预训练 / 微调

模型扩展与路由

旧主干稳定,新容量可塑

写入位置新增宽度、模块或专家
旧数据可选
容量增长显式增长
主要风险容量无界、路由成本、部署复杂
Schedule 持续预训练

数据调度与优化动态

系统改动小,计算收益可观

写入位置全模型参数与优化器状态
旧数据通常混合少量旧数据
容量增长
主要风险对数据分布、学习率和状态复用敏感
Edit 知识更新

模型编辑与参数记忆

细粒度写入,显式优化局部性

写入位置侧记忆、残差记忆或局部参数
旧数据通常不需要完整旧数据
容量增长侧记忆随编辑增长
主要风险路由错判、记忆碰撞、冲突编辑
Remember 长期交互

外部记忆与智能体技能

更新快、可解释、易回滚

写入位置轨迹、经验、技能库、上下文
旧数据以经验记忆形式保留
容量增长上下文或技能库增长
主要风险检索噪声、错误经验、未真正内化
Adapt 新范式

自适应与多时间尺度学习

统一短期适应和长期积累

写入位置上下文快权重 + 参数慢权重 + 多级记忆
旧数据由在线经验和验证反馈决定
容量增长依架构而定
主要风险外循环昂贵、奖励投机、错误自修改

Guided reading

三条阅读路线

按目标进入资料库,而不是机械地从第 1 篇读到第 41 篇。

10–14 天 第一次系统进入持续学习

路线 A:建立研究地图

  1. 01 综合综述:建立 CPT / DAP / CFT 全景
  2. 06 灾难性遗忘综述:掌握稳定性—可塑性
  3. 07 EWC 与 08 GEM:理解保护参数和梯度约束
  4. 17 TRACE:理解 LLM 持续学习为何需要新 benchmark

产出:形成术语表、指标字典和方法谱系图。

3–4 周 关心模型知识更新与训练基础设施

路线 B:持续预训练与系统

  1. 11 Re-warming:拆解学习率和优化器状态
  2. 12 Investigating CPT:学习受控实验设计
  3. 13 TiC-LM:进入真实时间网页流
  4. 14 Stability Gap:加入完整更新轨迹
  5. 15 Sparse Memory 与 16 SCALE:比较稀疏写入和容量扩展

产出:得到等 token、等 FLOPs、等旧数据预算的 CPT 实验方案。

4–6 周 关心 agent、memory、skill 和 self-improvement

路线 C:长期智能体与自适应

  1. 04 Roadmap:区分记忆、行动、反思与内化
  2. 27 LifelongAgentBench:研究跨会话经验
  3. 29 SkillLearnBench 与 30 LifeSkill:研究 verifier 和技能
  4. 32 SEAL:研究自编辑策略
  5. 31 Nested Learning 与 33 Fast–Slow:研究多时间尺度更新

产出:形成可验证、可回滚、区分快速记忆与慢速内化的 agent 方案。

05 · Evaluation

先统一评价协议

所有横向比较都应先公开任务边界、旧数据权限、总 token、额外参数、推理成本与评价时间点。

最终平均性能 ACC

所有任务学习结束后,系统总体还能做多好?

陷阱:平均值会掩盖关键任务和短期崩塌。

旧能力保持 Forgetting / BWT

学完后续任务后,早期任务相对最佳点下降多少?

陷阱:输出格式或提示敏感性可能被误判为能力丢失。

新任务可塑性 Forward Transfer

旧知识是否帮助新任务更快、更少样本地学会?

陷阱:过强保护会得到低遗忘、低学习的假稳定。

知识编辑可靠性 Reliability

目标输入是否稳定产生新的正确答案?

陷阱:记住一个表述不代表理解同一事实。

改写泛化 Generalization

同一知识的改写、推理和 OOD 查询能否触发更新?

陷阱:宽泛触发可能以牺牲局部性为代价。

无关输入局部性 Locality

编辑或微调是否改变了不相关行为?

陷阱:测试集过窄会漏掉远距离副作用。

系统资源 Tokens / FLOPs / Params / Memory

训练与推理的完整成本是什么?

陷阱:只报可训练参数会漏掉模块、缓存和路由。

在线真实性 Leakage Audit

后续阶段是否访问旧样本、标签、任务名或统计量?

陷阱:把离线信息泄漏包装成在线持续学习。

06 · Comparison matrix

方法对照矩阵

同一种“防遗忘”目标,可以通过保存数据、限制梯度、隔离参数、扩展容量或引入外部记忆实现;代价发生在不同位置。

方法族写入位置旧数据容量增长任务 ID优势风险
数据重放
Replay
训练数据流 需要,或生成替代样本 通常不需要 直接近似旧分布,简单且基线强 隐私、存储、采样偏差、上下文膨胀
正则化与梯度约束
Protect
原模型参数,但限制方向/幅度 EWC 不需要;GEM 需要记忆 保存重要性或梯度摘要 训练时通常需要边界 额外推理结构少,机制清晰 重要性近似粗糙,强约束损害可塑性
PEFT 与子空间隔离
Isolate
低秩或任务相关参数子空间 可做到无重放 按任务或模块增长 部分方法需要 训练经济,适合大模型 方向耗尽、路由错误、阻碍正迁移
模型扩展与路由
Expand
新增宽度、模块或专家 可选 显式增长 取决于路由器 旧主干稳定,新容量可塑 容量无界、路由成本、部署复杂
数据调度与优化动态
Schedule
全模型参数与优化器状态 通常混合少量旧数据 不需要显式任务 ID 系统改动小,计算收益可观 对数据分布、学习率和状态复用敏感
模型编辑与参数记忆
Edit
侧记忆、残差记忆或局部参数 通常不需要完整旧数据 侧记忆随编辑增长 由查询路由替代 细粒度写入,显式优化局部性 路由错判、记忆碰撞、冲突编辑
外部记忆与智能体技能
Remember
轨迹、经验、技能库、上下文 以经验记忆形式保留 上下文或技能库增长 通常没有清晰边界 更新快、可解释、易回滚 检索噪声、错误经验、未真正内化
自适应与多时间尺度学习
Adapt
上下文快权重 + 参数慢权重 + 多级记忆 由在线经验和验证反馈决定 依架构而定 面向连续流 统一短期适应和长期积累 外循环昂贵、奖励投机、错误自修改

07 · Timeline

从参数保护到自适应闭环

这条时间线关注研究问题如何变化:先解决遗忘,再追求真实时间流、局部写入、长期经验和多时间尺度学习。

2017

保护重要参数与旧任务梯度

EWC · GEM

持续学习被明确写成稳定性—可塑性优化问题:要么让重要权重变得不易更新,要么把有害梯度投影回可行空间。

2021

从任务序列走向持续预训练

Lifelong Pretraining

研究对象从小型分类器扩展到持续到来的语料,旧域困惑度、下游迁移和训练成本开始共同进入评价。

2022

用动态容量承接新分布

ELLE

函数保持式模型扩展展示了固定容量之外的路径:保留旧功能,同时为新数据增加可塑空间。

2023

LLM 持续指令微调成形

TRACE · O-LoRA · ConPET

benchmark、正交低秩子空间、静态重放与动态路由同时出现,经典 CL 方法开始在生成任务上接受检验。

2024

分类框架与真实假设被系统整理

两篇 Survey · InsCL · SAPT

研究地图覆盖 CPT、DAP、CFT;数据高效 replay、共享注意力和模块选择成为持续微调的主线。

2024

终身模型编辑成为独立路线

WISE

可靠性、泛化与局部性的“不可能三角”促使研究者显式设计主记忆、侧记忆、路由与知识分片。

2025

真实时间网页基准与短期稳定性

TiC-LM · Stability Gap

114 期网页时间流让持续预训练走向真实规模;更新初期的性能骤降证明最终分数不足以描述部署风险。

2025

稀疏写入和可扩展残差记忆

Sparse Memory FT · MEMOIR

更新开始从“微调整个模型”转向选择记忆槽和稀疏残差参数,目标是让知识写入彼此少干扰。

2025

长期智能体与技能学习进入 benchmark

LifelongAgentBench · SkillLearnBench

跨会话经验、验证反馈、技能形成和错误漂移成为研究对象;简单 ICL/replay 仍是强基线。

2025

模型开始学习如何更新自己

SEAL · Nested Learning

自编辑策略、深层优化器、连续记忆系统与自修改架构把持续学习推向多时间尺度自适应。

2026

方法假设被更严格地压力测试

CL-Bench · ASO-LoRA · SCALE

真实任务、无任务标签、软正交和扩展式路由共同追问:在长期资源约束下,哪些优势仍然成立?

2026

快慢学习与技能内化

LifeSkill · Learning, Fast and Slow

外部经验、上下文快权重和模型慢权重被放到统一框架中,强调验证、选择性内化和低漂移更新。

08 · Paper library

41 篇论文精读库

每张卡片浓缩本地精读笔记的研究问题、方法、证据、局限和下一步实验,并保留 PDF 与 Obsidian 风格精确引用笔记入口。

论文 41 / 41 · 全库命中 55 / 55 Esc 清空搜索
01

Continual Learning of Large Language Models: A Comprehensive Survey

综述 / 研究地图

一句话结论

用“纵向能力演化 × 横向时间/领域演化”统一整理 LLM 持续预训练、领域适配和持续微调,并把评价协议与数据资源纳入同一研究框架。

研究问题

LLM 上线后会同时面对知识过时、领域迁移和用户需求变化,但经典持续学习分类不足以覆盖预训练—对齐的完整生命周期。

方法机制

作者先定义 vertical/horizontal continuity,再按 CPT、DAP、CFT 三个阶段梳理 replay、正则化、参数隔离、动态架构等方法,并单列评测与数据。

证据与实验

这是一篇结构化综述,核心证据不是单一 SOTA 数字,而是跨 300 余篇工作的分类、比较表和研究空白;重点结论是可访问、贴近真实部署的 benchmark 仍然不足。

02

Continual Learning for Large Language Models: A Survey

综述 / 入门

一句话结论

从基础语言模型持续学习的场景、方法与评测出发,给出一份更紧凑的 LLM 持续学习入门地图。

研究问题

传统持续学习方法能否直接迁移到参数巨大、训练昂贵、能力维度复杂的语言模型,并没有统一答案。

方法机制

文章按场景和机制梳理数据重放、正则约束、参数高效更新、模块化/扩展式架构与知识编辑,并讨论模型、任务和指标选择。

证据与实验

价值主要来自文献综合和概念比较:不同路线在数据保留、隐私、参数增长、推理路由和训练成本之间存在系统性权衡。

03

Continual Learning of Large Language Models

教程 / 课程地图

一句话结论

EMNLP 2025 教程摘要把持续预训练、指令微调、对齐与 lifelong agents 串成一条面向部署的学习路线。

研究问题

LLM 的知识和用户偏好持续变化,但更新过程还必须同时满足计算效率、遗忘控制、伦理与安全要求。

方法机制

教程提出分层讲授框架:先讲 CPT,再讲 instruction tuning 与 alignment,最后扩展到能自反思、调用工具和自主适应的 lifelong agents。

证据与实验

该文只有两页,是教程范围声明而不是方法论文;可将其视为研究议程和课程大纲,不能把它当作实验结论来源。

04

Lifelong Learning of Large Language Model Based Agents: A Roadmap

智能体 / 路线图

一句话结论

把 lifelong LLM agent 拆成感知、记忆、行动与自我改进环路,并从组件、数据流和评测角度提出路线图。

研究问题

现有 LLM agent 多依赖静态模型和短期上下文,无法在长期交互中稳定吸收经验、形成技能并避免错误累积。

方法机制

论文从 agent 的记忆、规划、工具使用、反思和模型更新出发,区分参数内与参数外适应,并归纳环境交互中的 lifelong learning 问题。

证据与实验

作为 roadmap,证据来自跨领域系统归纳;重要观察是仅增加检索记忆并不等于学习,长期系统还需要经验选择、验证和能力内化。

05

Continual Learning in Large Language Models: Methods, Challenges, and Opportunities

综述 / 前沿更新

一句话结论

面向 2026 年文献重新归纳 LLM 持续学习方法、开放挑战和机会,强调从静态任务序列走向真实在线流。

研究问题

研究快速扩张后,方法名称相似但假设不同,尤其是旧数据访问、任务边界、模型更新权限与评价时间跨度常被混用。

方法机制

文章按数据、参数、架构、记忆与自适应机制组织工作,并集中讨论稳定—可塑性、扩展性、隐私、评价泄漏和安全。

证据与实验

主要贡献是最新文献综合;它把在线约束和长期代理纳入传统 forgetting/transfer 之外的评估视角。

06

Continual Learning and Catastrophic Forgetting

基础机制 / 综述

一句话结论

从表示漂移、梯度干扰和稳定—可塑性矛盾解释灾难性遗忘,并总结重放、正则与参数隔离三类缓解策略。

研究问题

顺序训练为何会迅速损害旧任务,以及“保留旧能力”和“吸收新知识”之间为何难以兼得。

方法机制

文章综合神经网络持续学习理论与实验,将缓解机制归为保持重要参数、重现旧分布、隔离更新空间和扩展容量。

证据与实验

综述表明遗忘不是单一指标能刻画:最终准确率、后向迁移、表示变化与短期稳定性缺口分别揭示不同失效。

07

Overcoming Catastrophic Forgetting in Neural Networks

正则化 / 基础方法

一句话结论

EWC 用 Fisher 信息估计旧任务参数的重要性,并以加权二次惩罚限制后续更新,是参数正则化路线的经典起点。

研究问题

同一组网络权重顺序学习多个任务时,新任务梯度会覆盖旧任务所需参数。

方法机制

训练完旧任务后估计对角 Fisher;新任务目标加入 λ/2·ΣF_i(θ_i−θ_i*)²,使重要权重更“僵硬”、不重要权重保持可塑。

证据与实验

论文在排列 MNIST 和 Atari 任务序列上展示了比朴素顺序训练更好的旧任务保持,说明参数重要性加权优于统一 L2 约束。

08

Gradient Episodic Memory for Continual Learning

重放 + 梯度约束 / 基础方法

一句话结论

GEM 把旧样本记忆转成梯度不增旧任务损失的约束,并通过投影求得可行更新方向。

研究问题

简单 replay 仍可能产生伤害旧任务的梯度,需要把“不得变差”直接写进优化约束。

方法机制

为每个旧任务保留 episodic memory,计算当前梯度与旧任务梯度;若违反内积约束,就解一个小型二次规划把梯度投影到可行锥。

证据与实验

在多任务顺序学习基准上,GEM兼顾最终性能、后向迁移与前向迁移,并把正迁移纳入持续学习目标。

09

Lifelong Pretraining: Continually Adapting Language Models to Emerging Corpora

持续预训练 / 奠基

一句话结论

把语言模型预训练置于持续到来的语料流中,联合研究新语料适应、旧知识保持与跨域迁移。

研究问题

每当新领域或新时间段语料到达就从头训练代价过高,直接继续预训练又会使旧域困惑度和下游能力退化。

方法机制

论文结合持续预训练目标、旧知识保持机制与跨阶段评估,比较顺序训练、数据重放和参数/表示约束。

证据与实验

实验说明持续预训练不能只看当前语料 loss:旧域保持与下游迁移会随数据顺序、混合比例和更新策略显著变化。

10

ELLE: Efficient Lifelong Pre-training for Emerging Data

动态架构 / 持续预训练

一句话结论

ELLE 通过函数保持式模型扩展与知识保持训练,让语言模型在新语料到来时增加容量而不破坏已有功能。

研究问题

固定容量模型长期吸收新分布会加剧干扰,而每阶段训练独立模型又无法共享知识。

方法机制

在阶段边界扩展网络宽度/深度,并以保持原函数输出的初始化承接旧模型,再配合预训练与知识保持目标适应新语料。

证据与实验

在连续领域语料上,扩展式模型相对直接继续训练改善旧域保持与新域适应,展示动态容量的可行性。

11

How to (Re)warm Your Model? Reusing Optimizer State for Continual Pre-Training

优化动态 / 持续预训练

一句话结论

系统研究持续预训练阶段切换时学习率再升温与优化器状态复用,说明训练动态本身就是遗忘的重要来源。

研究问题

新数据到达时应重置学习率和 Adam 状态,还是沿用旧训练状态,并无可靠经验法则。

方法机制

控制数据切换、学习率 re-warming 幅度和 optimizer state 复用,比较适应速度、稳定性与最终 loss。

证据与实验

结果表明简单地完全重置或直接沿用都可能次优;合适的再升温与状态处理能改善新分布适应且减少训练不稳定。

12

Investigating Continual Pretraining in Large Language Models

实证研究 / 持续预训练

一句话结论

通过大规模受控实验拆解持续预训练中的数据重放、学习率、语料相似性和训练预算。

研究问题

已有方法常同时改变数据与优化配置,难以判断遗忘究竟来自分布漂移还是训练配方。

方法机制

构造连续领域/时间语料,系统改变 replay 比例、数据顺序、模型与超参数,并同时测新域、旧域和通用能力。

证据与实验

论文显示少量旧数据混合通常很强,但最佳比例依赖新旧分布;持续训练的计算收益必须与从头训练和联合训练公平比较。

13

TiC-LM: A Multi-Year Benchmark for Continual Pretraining of Language Models

时间基准 / 持续预训练

一句话结论

TiC-LM 用 114 期 Common Crawl 构建网页级时间持续预训练基准,并证明元调度配合固定比例重放可显著省算力。

研究问题

旧 benchmark 太小且缺乏真实时间结构,无法回答网页知识更新与旧能力保持如何随年份演化。

方法机制

按 Common Crawl dump 建立时间流,同时在通用网页与 Wikipedia、StackExchange、代码文档等特定域做时间分层评测。

证据与实验

在通用 CC 上,自回归 meta-schedule + fixed-ratio replay 达到与从头训练相当的 held-out loss,而计算量减少约 2.6 倍;特定域对 replay 的需求不同。

14

Continual Pre-training of Language Models: How to Re-warm Your Model?

训练动态 / 稳定性

一句话结论

揭示持续预训练开始后性能先骤降再恢复的 stability gap,并用数据相关性与训练调度缩短这段危险窗口。

研究问题

只看训练结束会掩盖更新初期的临时能力崩塌,而在线部署往往无法容忍这种短期失稳。

方法机制

跟踪训练过程而非仅最终 checkpoint,分析 epoch、数据相关性和分布切换,再设计预算受限的稳定更新策略。

证据与实验

论文报告在 OpenLLaMA-3B 医疗设置中,平均分可从 36.2 提升到 40.7,同时只使用约 40% 的预算,说明稳定性和效率可联合优化。

15

Continual Learning via Sparse Memory Finetuning

稀疏参数记忆 / 持续更新

一句话结论

只更新对新知识高度激活、但在预训练数据中较少使用的记忆槽,以稀疏参数写入降低知识覆盖。

研究问题

全量微调和 LoRA 都可能让新知识更新触碰大量承载旧能力的参数。

方法机制

在 memory-layer 模型中用类似 TF-IDF 的相对激活分数选择 memory slots,只对少量目标槽执行微调。

证据与实验

在问答实验中,新知识学习相当时,论文摘要报告旧能力 F1 降幅约为:全量微调 89%、LoRA 71%、稀疏记忆微调 11%。

16

SCALE: Scalable Continual Learning via Model Expansion

模型扩展 / 路由

一句话结论

SCALE 冻结原模型并按需扩展宽度,通过 Preserve、Adapt、Route 三个环节分配新容量。

研究问题

固定参数更新会干扰旧知识,而每任务独立模块造成无界增长和任务 ID 依赖。

方法机制

主干负责 Preserve;新增宽度负责 Adapt;学习到的路由机制决定输入如何组合旧表示和新容量。

证据与实验

实验把扩展式持续学习与 replay、PEFT 和固定容量方法比较,显示可在保持旧能力的同时提高新任务可塑性。

17

TRACE: A Comprehensive Benchmark for Continual Learning in Large Language Models

持续指令微调 / 基准

一句话结论

TRACE 把持续指令微调放到多种生成与推理任务序列中,并同时测试新任务学习、旧任务保持和通用能力。

研究问题

传统分类 benchmark 不能代表 LLM 指令跟随、推理和开放式生成中的遗忘。

方法机制

构造 8 类任务的顺序学习协议,配套 LIMA replay 数据和 EWC、GEM、MbPA++、L2P、LFPT5、O-LoRA 等基线。

证据与实验

基准显示朴素顺序微调显著遗忘,经典 CL 方法在 LLM 生成任务上并不稳定;最终平均分必须和后向迁移、通用能力一起看。

18

Orthogonal Subspace Learning for Language Model Continual Learning

PEFT / 子空间隔离

一句话结论

O-LoRA 为每个任务学习低秩更新,并约束新任务子空间与历史子空间正交,以减少参数更新干扰。

研究问题

普通 LoRA 虽参数高效,但不同阶段的低秩方向仍会重叠并覆盖旧任务。

方法机制

在训练新 LoRA 时加入与既有低秩子空间的正交约束,冻结旧模块、无需重放旧数据。

证据与实验

在持续指令与分类任务上,O-LoRA 通常优于顺序 LoRA 和多种无重放基线,展示子空间隔离的有效性。

19

ConPET: Continual Parameter-Efficient Tuning for Large Language Models

PEFT + replay/路由

一句话结论

ConPET 用参数高效模块构建静态重放与动态路由两种持续学习方案,在效率和任务扩展之间取舍。

研究问题

为每个任务全量微调成本过高,而单一小模块会发生干扰;实际系统还可能无法在推理时获得任务 ID。

方法机制

Static ConPET 将 PET 与动态 replay 结合;Dynamic ConPET 保存多个 PET 模块并训练选择器按输入路由。

证据与实验

论文报告可训练参数最多减少约 3000 倍,并在较小 benchmark 上取得至少约 5 个点提升,说明路由/重放组合具有较高性价比。

20

InsCL: A Data-efficient Continual Learning Paradigm for Fine-tuning Large Language Models with Instructions

数据高效 replay / 指令微调

一句话结论

InsCL 用指令层面的表示与样本组织提高持续微调的数据效率,尽量用少量历史信息保持旧任务。

研究问题

LLM 指令任务的数据格式和语义跨度大,随机 replay 往往冗余且无法代表旧任务边界。

方法机制

利用 instruction 信息指导样本选择和持续训练,使有限缓存覆盖更有代表性的任务语义。

证据与实验

在多任务顺序指令设置中,方法相对朴素微调和常见 replay 提高最终平均表现并降低遗忘。

21

SAPT: A Shared Attention Framework for Continual Learning of Large Language Models

共享注意力 / PEFT 路由

一句话结论

SAPT 以共享注意力同时服务参数高效学习和模块选择,让任务知识共享与输入路由相互协调。

研究问题

多模块 PEFT 方法常把“学什么”和“选哪个模块”分开优化,造成选择器与任务表示错位。

方法机制

共享 attention 表示用于对齐任务学习与选择,配合小型参数模块在不同阶段保留专门能力。

证据与实验

在 T5/LLaMA2 的 770M 到 13B 尺度实验中,方法跨多个持续任务序列改善平均性能和遗忘。

22

Revisiting Catastrophic Forgetting in Large Language Model Tuning

实证诊断 / 持续微调

一句话结论

重新审视 LLM 微调中的遗忘来源,强调任务语义、训练配方和评价方式会改变“遗忘严重”的结论。

研究问题

把下游分数下降一概归因于参数知识被抹除,可能混淆提示格式、输出偏好与真实能力丢失。

方法机制

通过不同模型、任务顺序、微调设置和能力测试,对遗忘现象做受控比较与细粒度诊断。

证据与实验

实验显示遗忘具有明显异质性:不同任务/能力、模型尺度与训练阶段的变化并不同步。

23

Online Continual Learning of Large Language Models

在线学习 / PEFT 选择

一句话结论

用代表性特征分布描述每个 PEFT 模块,并按输入相似度动态选择模块,实现避免旧任务信息泄漏的在线持续学习。

研究问题

许多“在线”方法仍在后续阶段访问旧任务数据、标签或统计,形成信息泄漏与隐私风险。

方法机制

为已学习 PEFT block 保存 presentative feature distribution;新样本根据与这些分布的相似度选择/组合合适模块。

证据与实验

ICML 2025 实验表明,在不重新访问旧任务原始信息的限制下,该方法仍能保持有竞争力的持续学习表现。

24

ASO-LoRA: Adaptive Subspace Orthogonal LoRA for Continual Learning

自适应 PEFT / 子空间

一句话结论

ASO-LoRA 根据任务归因相似度自适应决定子空间分离程度,以软正交替代 O-LoRA 的一刀切约束。

研究问题

新旧任务相似时,强制完全正交会阻断正迁移;不相似时又确实需要隔离。

方法机制

用 attribution 估计任务关系,再施加随相似度变化的 soft orthogonality,并设计无需推理任务标签的选择机制。

证据与实验

ACL 2026 实验显示其在多个任务序列上优于固定正交 LoRA,尤其能更好平衡共享与隔离。

25

WISE: Rethinking the Knowledge Memory for Lifelong Model Editing of Large Language Models

终身模型编辑 / 参数记忆

一句话结论

WISE 用主记忆、侧记忆、路由器和知识分片解决终身模型编辑中可靠性、泛化与局部性的“不可能三角”。

研究问题

直接改主模型易干扰旧知识,纯检索记忆又难把编辑泛化到改写问题。

方法机制

冻结承载预训练知识的 main memory,只写 side memory;router 决定查询走哪条路径,并把连续编辑分散到不同参数子空间后再合并。

证据与实验

在问答、幻觉修正和 OOD 场景,跨 GPT、LLaMA、Mistral 骨干比较,论文报告同时改善 reliability、generalization 与 locality。

26

MEMOIR: Lifelong Model Editing with Residual Memory

终身模型编辑 / 残差记忆

一句话结论

MEMOIR 把新知识写入稀疏残差记忆,并用样本相关激活掩码检索相关编辑,减少连续编辑之间的覆盖。

研究问题

终身编辑需要扩展到成千上万次写入,同时保持改写泛化、无关输入局部性和旧编辑可靠性。

方法机制

保留基础模型核心能力,在独立 residual memory 中学习编辑;稀疏掩码把不同样本分配到不同参数子集,推理时按激活模式匹配相关记忆。

证据与实验

在 LLaMA-3 与 Mistral 的问答、幻觉修正和 OOD 测试中,论文报告可扩展到数千次顺序编辑并保持较低遗忘。

27

LifelongAgentBench: Evaluating LLM Agents as Lifelong Learners

智能体 / 终身学习基准

一句话结论

在数据库、操作系统和知识图谱环境中评估跨会话经验积累,显示“保存全部历史”并不能自然带来 lifelong agent。

研究问题

现有 agent benchmark 多按独立 episode 评分,无法观察经验是否被长期保留、迁移或错误累积。

方法机制

构造连续交互任务,让 agent 跨阶段复用经验,并比较不同记忆、replay 和自一致性策略。

证据与实验

实验发现 replay 易被无关历史和上下文长度拖累;group self-consistency 等筛选策略能更稳地提炼可复用经验。

28

Continual Learning Bench: Benchmarking Continual Learning for LLM Agents

智能体 / 真实任务基准

一句话结论

用六类真实应用任务检验 LLM agent 的持续学习,结果提醒复杂记忆系统并不一定胜过简单的 in-context baseline。

研究问题

智能体持续学习方法常在玩具环境或短序列上验证,缺乏跨真实专业领域和长期阶段的统一比较。

方法机制

覆盖软件工程、信号处理、疾病预测、数据库、策略游戏和需求预测,比较上下文、记忆与专用持续学习系统。

证据与实验

论文报告朴素 ICL 在若干设置中超过专门记忆系统,说明记忆写入/检索噪声可能抵消所谓长期学习收益。

29

SkillLearnBench: Evaluating Continual Skill Learning in Language Agents

智能体 / 技能学习基准

一句话结论

SkillLearnBench 用 20 个可验证任务、15 个子领域评估 agent 是否能从反馈中持续形成和迁移技能。

研究问题

记住事实不等于获得技能;技能学习还要经历试错、反馈、抽象、组合与跨任务迁移。

方法机制

任务配有可执行 verifier,按连续顺序考察 self-feedback、external feedback 和不同技能记忆策略。

证据与实验

没有一种方法在所有设置都获胜;自反馈可能造成策略漂移,外部可验证反馈通常更可靠。

30

LifeSkill: Lifelong Skill Learning for Language Agents

智能体 / 技能内化

一句话结论

LifeSkill 以 verifier 引导技能提炼,再把在线成功经验内化为可复用能力,连接外部记忆与参数学习。

研究问题

只存轨迹会让上下文膨胀且检索脆弱,只改模型又昂贵并可能遗忘,需要选择性内化。

方法机制

从交互和验证反馈中学习显式技能,在线选择/修订技能,并在合适时把经验 internalize 到模型或更紧凑表示。

证据与实验

论文报告在 LifelongAgentBench 上获得约 7 个绝对百分点提升,显示 verifier-guided skill learning 的收益。

31

Nested Learning: The Illusion of Deep Learning Architecture

新范式 / 多时间尺度记忆

一句话结论

Nested Learning 把架构与优化统一看成不同更新频率的嵌套优化问题,并用 continuum memory 与 Hope 探索多时间尺度学习。

研究问题

把网络结构和外部优化器割裂,会忽略模型内部各组件本可具有不同 context flow 与更新速率。

方法机制

将反向传播、注意力和优化器解释为关联记忆;按更新频率组织层级,提出 deep optimizers、continuum memory system 和自修改 Hope 架构。

证据与实验

论文在语言建模、常识、长上下文 NIAH 与知识吸收任务中比较 Hope、Titans、Samba、Transformer 等,报告更低困惑度和更强长程记忆。

32

Self-Adapting Language Models

自适应模型 / 自编辑

一句话结论

SEAL 让模型生成自己的更新数据和训练指令,并用更新后性能作为强化学习奖励,形成可学习的 self-edit 策略。

研究问题

普通模型只能在上下文内适应,参数更新又依赖外部工程师准备数据与训练配方。

方法机制

模型根据输入生成 self-edit(合成数据、重写、学习目标等),执行小规模更新,再以更新后的任务表现训练 self-edit 生成策略。

证据与实验

实验展示模型能学会产生更有效的自我更新方案,在知识吸收和少样本适应任务上超过手工或无学习的更新基线。

33

Learning, Fast and Slow: Towards LLMs That Adapt Continually

快慢学习 / 在线适应

一句话结论

将上下文中的快速权重与模型参数中的慢速权重联合优化,用两种时间尺度兼顾即时适应和长期稳定。

研究问题

纯 in-context learning 不会永久积累,纯 RL/微调更新慢且会引起较大策略漂移。

方法机制

快速通道优化 context/fast weights,慢速通道更新 model weights,并用统一目标协调短期任务收益与长期分布约束。

证据与实验

论文报告相对仅用 RL 的方案最高约 3 倍样本效率,并将 KL 漂移最多降低约 70%。

34

Knowledge Circuits in Pretrained Transformers

机制解释 / 知识电路

一句话结论

追踪新知识在 Transformer 内部形成、优化并由深层向浅层重组的电路动态,为持续学习提供机制层诊断。

研究问题

只看输出分数无法解释模型在何处写入新知识、何时开始泛化,以及为何与旧知识发生干扰。

方法机制

通过知识定位、因果干预和训练轨迹分析,观察知识电路随学习阶段和已有知识相关性如何变化。

证据与实验

论文发现知识获取依赖其与先验知识的相关性,过程呈现 formation → optimization 的阶段转变,并出现 deep-to-shallow 演化。

35

Using Fast Weights to Attend to the Recent Past

快速神经状态 / 关联记忆

一句话结论

在激活与慢权重之间加入快速衰减的关联记忆矩阵,以近期隐藏状态外积实现序列内快速绑定。

研究问题

RNN 隐藏向量容量有限,慢权重又无法在单个序列中快速变化,缺少中间时间尺度的可塑状态。

方法机制

按 A_t=λA_{t-1}+ηh_th_t^T 写入 fast-weight matrix,并通过迭代、归一化读取;展开后等价于受时间衰减约束的点积注意。

证据与实验

关联检索任务中显著优于同规模 LSTM/IRNN,并在视觉序列与 Catch 控制任务上展示收益。

36

Learning to (Learn at Test Time): RNNs with Expressive Hidden States

测试时训练 / 模型化隐藏状态

一句话结论

把序列层的隐藏状态变成一个可训练模型,在每个 token 到来时用自监督目标更新其权重。

研究问题

Attention 长上下文成本二次增长,普通 RNN/SSM 的固定向量状态又难以保留复杂历史。

方法机制

TTT-Linear/MLP 以内部模型参数作为状态,执行 W_t=W_{t-1}-η∇ℓ(W;x_t),再从更新后的模型读取输出;用 mini-batch 与 dual form 并行化。

证据与实验

125M–1.3B 实验显示 TTT 能随 8k–32k 上下文继续降低困惑度,部分线性基线在更长上下文趋于饱和。

37

Titans: Learning to Memorize at Test Time

神经长期记忆 / 测试时学习

一句话结论

用测试时可训练的神经网络充当长期记忆,以梯度惊奇度、动量和遗忘控制写入,并与局部注意力协同。

研究问题

Attention 保存历史精确但成本随长度增长,递推模型高效却被固定容量压缩限制。

方法机制

记忆网络根据 key 重构 value,用损失梯度表示 surprise,加入 momentum 与 weight decay;提出 MAC、MAG、MAL 三种与注意力组合方式。

证据与实验

语言、常识、S-NIAH、BABILong、时间序列和基因组任务中,MAC 在作者设置下表现最强,并报告百万级上下文结果。

38

MemOS: A Memory OS for AI System

记忆操作系统 / 生命周期治理

一句话结论

把参数、激活和明文三类记忆统一为可治理的一等资源,由 Memory Cube、调度器和生命周期层管理。

研究问题

LLM 记忆散落在权重、KV、向量库和日志中,缺少统一来源、权限、版本、迁移和删除协议。

方法机制

MemCube 同时携带 payload 与 provenance、owner、lifetime、priority、version 等元数据;MemScheduler/Lifecycle/Operator 执行路由、转换、冻结和回滚。

证据与实验

论文主要提供架构分类、组件设计与场景推演,没有可与算法论文同级比较的公开端到端 benchmark。

39

Language Models Need Sleep: Learning to Self-Modify and Consolidate Memories

离线巩固 / 自生成重放

一句话结论

将在线服务的清醒期与离线巩固的睡眠期分开,通过 Knowledge Seeding 和 Dreaming 把快经验迁移到慢层。

研究问题

上下文经验会消失,而对每条经验即时改慢参数成本高、风险大,缺少可验证的离线维护周期。

方法机制

Knowledge Seeding 用广义蒸馏/RL 把小而快组件知识向上迁移;Dreaming 由内部专家生成合成课程并通过 ReSTEM/RL 训练。

证据与实验

报告 class-incremental、持续翻译、BABILong 和推理任务收益,包括长达 10M 的合成长程任务与约 80% held-out 成功率。

40

Organizing Memories for Generalization in Complementary Learning Systems

互补学习系统 / 泛化驱动巩固

一句话结论

快速记忆向慢系统回放并非越多越好;进一步巩固开始拟合不可预测噪声时应停止,以保护未来泛化。

研究问题

无限 replay 可以降低训练误差,却会把具体样本噪声写入慢系统,损害未见数据表现。

方法机制

teacher–student–notebook 理论框架中,notebook 快速记样本、student 慢学规律;Go-CLS 在 generalization error 最优点附近停止巩固。

证据与实验

解析与模拟展示收益依赖信噪比和样本/维度比,尤其在插值与 double-descent 敏感区可明显优于无限巩固。

41

Meta-Learning Biologically Plausible Plasticity Rules with Random Feedback Pathways

元可塑性 / 学习更新规则

一句话结论

从局部候选项中元学习一个稀疏、全网络共享的可塑性规则,使固定随机反馈网络能在线学习。

研究问题

随机反馈对齐避免反向权重对称,却在深层和在线低数据学习中速度慢、性能弱。

方法机制

将 10 个局部候选项线性组合,外层跨 episode 优化共享系数并施加 L1;内层每次随机初始化、batch size 1 学习 250 个样本。

证据与实验

MNIST/EMNIST/Fashion-MNIST 等实验中,规则池显著改善随机反馈,最终主要保留伪梯度、误差 Hebbian 和 Oja 三类项。

没有匹配结果。试试更宽泛的术语,或重置筛选条件。

09 · Web & audio

网页、帖子与播客

博客适合建立直觉,播客适合理解研究动机;涉及方法效果时仍应回到论文和实验配置核对。

网页 / 教程

Apple:TiC-LM — Web-Scale Time-Continual Pretraining

静态网页预训练会让模型随时间过时。TiC-LM 从 114 期 Common Crawl dump 构造真实时间顺序的数据流,并把评测分成两层: 最重要的结果是:在通用 Common Crawl 上,自回归 meta-schedule 配合固定比例旧数据 replay,能达到接近从头重训的 held-out loss,而计算量约少 2.6 倍。不过 replay 并非处处同样重要;在特定领域上,最佳新旧数据比例会改变。 这篇工作把“持续学习是否有效”落回了实际训练系统:数据按时间到达、训练预算有限、旧网页数量远大…

网页 / 教程

Google Research:Introducing Nested Learning

Nested Learning 的出发点是:模型架构与优化器不是两个彼此分离的东西,它们都可理解为带有内部信息流和更新规则的优化问题。不同组件以不同频率更新,构成嵌套的学习层级。 博客给出三个关键概念: 1. Deep optimizers:把 momentum 等优化状态视为关联记忆,并重新设计其内部目标。 2. Continuum Memory System:不再只有短期上下文与长期参数两档,而是设置多种更新频率的连续记忆谱。 3. Hope:基于 Titans 的自修改循环架构,尝试形成更多层级的 in-c…

网页 / 教程

Red Hat:Sculpting Subspaces

文章用“雕刻大理石”解释 adaptive SVD:对权重矩阵做奇异值分解,将大奇异值对应方向视为承载关键知识的高秩子空间,将较小奇异值方向视为更安全的可更新容量。新任务梯度被投影到低秩、且与重要方向正交的空间。 其目标是避免三类常见代价: - replay 需要保留旧数据; - LoRA/adapter 可能限制表达能力并持续增加模块; - 模型合并需要多个模型与复杂调参。 博客报告 T5-large 上 15 任务准确率 71.3%,高于文中 O-LoRA 的 69.6%;在 TRACE/Llama-2-7B…

网页 / 教程

EMNLP 2025 Tutorial:Continual Learning of Large Language Models

教程把大模型持续学习组织为一条生命周期链: 1. Continual pre-training:持续吸收新语料和时间知识; 2. Continual instruction tuning:顺序学习任务与指令; 3. Continual alignment:用户偏好和安全约束随时间变化; 4. Lifelong LLM agents:自主反思、工具增强、跨会话适应。 它还强调算法之外的计算、数据管线、评价、伦理和可靠性问题。两页论文只是教程摘要,不包含完整方法细节,最适合作为查漏补缺的课程目录。 - 每学完一条方法…

播客

Radical Talks:Rob Toews on Overcoming AI's Catastrophic Forgetting

Rob Toews 与主持人 Molly Welch 从产业与技术视角讨论灾难性遗忘:为什么当前模型大多是静态资产,为什么持续学习可能让系统从“每次重训”转向“随交互变强”,以及这会怎样形成数据与产品护城河。 - 持续学习的商业价值不只是节省训练成本,而是缩短新信息进入产品能力的延迟; - 真正可积累的系统会改变 AI 产品的竞争结构,但错误经验也可能形成同样强的负向复利; - 产业叙事中的 “self-improving” 需要用可回滚、可审计和长期 benchmark 约束。 - 嘉宾所说的“学习”是参数更新…

播客

Eye on AI #241:Patrick Pilarski — The Alberta Plan

Alberta Plan 关注长期存在于复杂世界中的计算智能体:它通过行动影响感知输入,以奖励驱动选择,持续学习以适应变化,并用学到的世界模型进行规划。节目把这一研究观与当代一次性预训练模型对比。 官方时间轴中的持续学习重点: 它提醒我们,持续学习不应只是一串静态 NLP 数据集。更完整的问题是:agent 在连续感知—行动—奖励环路中,如何形成可预测、可控制、会迁移的长期知识。 - 语言模型预训练知识在 Alberta Plan 中扮演先验、世界模型还是工具? - 实时更新怎样避免早期错误永久塑造 agent?…

播客

Best AI Papers Explained:Continual Learning via Sparse Memory Finetuning

节目介绍 Meta 与 Berkeley 的 sparse memory finetuning:在具备 memory layer 的模型里,不更新全部参数,而是选择那些对新知识高激活、相对预训练数据较少使用的 memory slots。选择分数采用类似 TF-IDF 的思想。 官方简介强调,在问答任务上,这种稀疏写入能学习新知识,同时比 full finetuning 和 LoRA 少遗忘旧能力。 - memory slot 的定义与模型架构依赖; - TF-IDF 激活分数怎样计算、需要多少预训练参考数据; -…

10 · Open questions

值得继续追的开放问题

这些问题来自论文间假设不一致、评价盲区和新型智能体系统的实际风险,适合直接转化为研究课题。

Q1

如何建立真正公平的总预算比较?

参数量、旧数据、上下文 token、训练 FLOPs、推理延迟与存储应进入同一账本。

可做实验:固定总 token 和显存,对 replay、O-LoRA、路由模块与外部记忆做 Pareto 前沿。

Q2

模型到底忘了知识,还是忘了调用方式?

下游分数下降可能来自提示、输出偏好或路由变化,而非事实表征彻底消失。

可做实验:结合多提示、多解码、表示探针和因果电路干预,区分存储与调用失败。

Q3

短期稳定性如何成为部署约束?

更新后的临时能力坍塌在生产环境不可接受,即使最终 checkpoint 恢复。

可做实验:逐 checkpoint 监测能力与安全阈值,研究权重插值、回滚和渐进流量策略。

Q4

长期子空间和模块何时耗尽?

正交 LoRA、adapter 和模型扩展在十个任务上有效,不代表一年数据流仍能扩展。

可做实验:把任务数扩展到百级,测子空间角度、路由熵、参数增长和延迟。

Q5

什么经验值得从外部记忆内化?

全部内化会遗忘,全部外置会膨胀且检索脆弱,需要有价值和可信度门槛。

可做实验:用 verifier、复用频率和不确定性决定内化,比较快记忆、慢参数和混合方案。

Q6

错误自编辑如何被发现和撤销?

SEAL、LifeSkill 和自修改架构让错误产生参数级复利,必须有 provenance 和回滚。

可做实验:注入错误反馈与冲突知识,测检测时间、污染半径、撤销后残留和恢复成本。

Q7

知识电路能否指导低干扰写入?

机制解释只有在能改善训练决策时,才从观察工具变成持续学习方法。

可做实验:用电路重叠预测干扰,并指导稀疏槽位、层选择或子空间约束。

Q8

多时间尺度是否对应不同知识类型?

Nested Learning 和 Fast–Slow 假设不同状态应以不同频率更新,但对应关系仍缺少因果证据。

可做实验:控制事实、程序技能和偏好变化频率,观察它们在上下文、记忆、优化器和参数中的迁移。

11 · Appendix

术语与方法说明

统一术语可以避免把外部检索、参数更新、模型编辑和技能学习混称为持续学习。

持续学习
模型在数据、任务或环境顺序到达时学习新信息,同时保留和迁移已有能力。
灾难性遗忘
学习新内容后,旧任务或旧知识性能突然显著下降。
稳定性—可塑性
保护旧能力的稳定性与吸收新信息的可塑性之间的核心矛盾。
Backward Transfer
后续学习对早期任务的影响;负值通常表示遗忘。
Forward Transfer
已有知识是否帮助未来任务更快或更好地学习。
Replay
在学习新数据时重新使用旧样本、旧样本摘要或生成样本。
PEFT
只训练少量参数的参数高效微调,如 LoRA、adapter 和 prompt tuning。
任务 ID
训练或推理时显式告知当前输入属于哪个任务;它是重要但常被忽略的额外信息。
Locality
更新目标知识时,不改变无关输入行为的能力。
Information Leakage
所谓在线学习方法在后续阶段不当访问旧任务数据、标签或统计。
技能内化
将外部经验、轨迹或显式技能转化为更紧凑、可泛化的模型能力。
快权重 / 慢权重
以不同时间尺度更新的状态:前者快速适应,后者长期积累。

资料与精读方法

本手册基于项目内保存的 41 份论文 PDF、逐篇中文精读笔记与 7 份网页/播客整理。论文笔记使用 pdf-paper-reader 工作流生成,包含 PDF++ selection 坐标与必要的 rect 图像引用。综合结论把每项工作还原到数据权限、任务边界、写入位置、容量增长、训练/推理预算和评价时间尺度后再比较。

离线边界:本 HTML 不嵌入约 70 MB 的 PDF,也不加载 CDN、外部字体或脚本。只要手册仍位于项目根目录,所有 PDF、论文笔记与媒体笔记相对链接即可使用;原始来源链接在联网时打开。

项目总说明 · 论文库说明 · 媒体资料说明