没有脱离数据流假设的“最佳方法”
允许保存旧数据、允许保存统计量、知道任务边界、知道推理任务 ID,分别对应不同难度。论文排名必须先还原这些权限。
Offline research handbook · 2026
从灾难性遗忘、持续预训练与指令微调,到知识编辑、智能体经验闭环和多时间尺度自适应:一份可搜索、可追溯、可直接动手复现的离线研究地图。
Executive synthesis
它们不是对单篇论文的复述,而是把 41 篇论文与代码实现横向对齐后得到的研究判断。
允许保存旧数据、允许保存统计量、知道任务边界、知道推理任务 ID,分别对应不同难度。论文排名必须先还原这些权限。
从 TiC-LM 到持续指令微调,合理的数据混合常常比复杂机制更稳定。新方法至少应在相同 token、存储与隐私预算下超过 replay。
Stability Gap 表明模型更新初期可能暂时崩塌后恢复。只报告最后一个 checkpoint,会漏掉真实部署最危险的时间窗口。
LoRA、adapter 与任务模块降低可训练参数,却可能增加模块数量、路由错误、推理延迟和长期容量压力。
保存轨迹或检索历史可能只是在上下文里“查到”。真正的能力学习还要经过经验选择、验证、抽象、迁移与必要时的参数内化。
WISE 与 MEMOIR 不再把更新视为普通微调,而是显式设计主记忆、侧记忆、残差记忆和路由,直接优化可靠性、泛化与局部性。
LifelongAgentBench、SkillLearnBench 与 LifeSkill 关注跨会话经验、可验证反馈和技能形成;错误经验也会产生长期负向复利。
Nested Learning、SEAL 与 Fast–Slow Learning 试图统一上下文、记忆、优化器状态和模型参数,研究不同状态应以什么频率更新。
01 · Foundations
持续学习不是某一种防遗忘算法,而是一种面向时间序列的学习范式。 它研究系统在信息持续到达、环境不断变化且历史数据受限时,如何更新自身, 同时平衡新知识吸收、旧能力保留、知识迁移与更新成本。
持续学习(Continual Learning, CL)是一种序列学习范式:学习者不能假定所有 数据一次性可见,而是在数据、任务、标签空间、知识或目标随时间到达和变化时 更新自身;更新后的系统既要吸收当前信息,也要保留、迁移并在必要时修正过去能力。
M 是系统状态,D 是当前阶段数据,B 是可访问的历史缓冲或外部记忆。 核心目标不是只优化当前损失,而是在保留、迁移、资源和风险之间取得长期平衡。
训练数据、任务、领域、标签空间、知识或目标不是一次性全部可见,而是形成有顺序的数据流。顺序本身会影响学习结果。
系统在第 t 阶段获得的变化会进入后续状态,而不是只在一次推理请求中临时存在;更新对象可以是参数、适配器、记忆或它们的组合。
不能只看当前阶段学得多快,还要检查过去能力是否遗忘、能否正向迁移,以及通用能力和安全行为是否退化。
历史数据通常无法无限保存和反复训练,计算、存储、隐私、版权与更新时间均受限制;这些限制是问题定义的一部分。
静态训练假设与长期部署现实之间的五个结构性矛盾。
事实知识、用户偏好、业务规则、传感器分布与任务目标都会漂移。静态模型上线后,其训练分布与现实之间的距离只会继续扩大。
每次新增数据都从零训练,会重复支付巨额算力、时间和工程成本。持续学习试图把更新变成增量过程,并控制单位新知识的成本。
隐私、版权、合规、存储上限或数据生命周期可能阻止旧样本长期保留。模型因此必须在有限回放甚至无回放条件下维持过去能力。
个人助手、企业知识系统和专业模型需要吸收本地经验与反馈。这种适应既要足够快,又不能破坏基础模型已有的通用能力。
新数据可能带来遗忘、知识污染、偏差放大或安全回退。研究重点不只是让模型会变,而是让变化可衡量、可审计、可回滚。
研究重点逐步从单个神经网络现象,扩展到设定、指标、系统和治理。
神经网络学习新映射时会突然破坏旧映射,形成后来所谓的灾难性遗忘问题:共享参数上的新梯度会覆盖旧知识。
研究逐渐把问题表述为:系统既要保持稳定,又要对新经验保持可塑。回放、参数保护、模块化与双记忆系统等思路在这一时期奠基。
EWC 用参数重要性约束更新,GEM 用记忆样本限制梯度方向。两者分别代表正则化与经验回放路线,推动可比较实验快速增长。
Task/Domain/Class-Incremental、在线、无任务边界等设定被系统区分;平均准确率、遗忘、前向与后向迁移成为常见报告指标。
研究对象扩展到持续预训练、持续指令微调和知识更新。模型编辑、参数高效微调、检索记忆与防遗忘训练开始被放进统一更新视角比较。
前沿问题从固定任务序列转向开放数据流:系统如何在工作记忆、外部知识库、局部参数和基础参数之间选择更新位置,并持续做版本治理。
读论文时应先确认任务边界是否可见、输出空间是否变化、数据是否可回看; 同一种算法在不同设定下的难度和结论不可直接横比。
关键区别不在工具名称,而在更新是否持续保留、是否面对序列,以及是否评价旧能力。
| 相邻概念 | 更新持久化 | 显式序列 | 旧能力保持 | 与持续学习的关系 |
|---|---|---|---|---|
| 静态微调 | 是 | 通常否 | 常不评价 | 一次性适配;若反复顺序微调并评价遗忘,才进入持续学习问题。 |
| 迁移学习 | 是 | 源域 → 目标域 | 不一定 | 关注知识对新任务的帮助;持续学习还要求长期序列中的保留与迁移。 |
| 领域适应 | 可选 | 常为单次域迁移 | 通常非核心 | Domain-IL 可视为多阶段领域适应加上旧域保持约束。 |
| 在线学习 | 是 | 是 | 未必 | 二者重叠,但在线学习可只优化当前累计损失,不一定显式研究遗忘。 |
| 测试时适应 | 常为临时 | 测试流 | 较少 | 多在部署时适应当前分布;若更新长期保留并跨阶段评价,边界会重叠。 |
| RAG / 外部记忆 | 知识库可持久 | 可支持 | 参数不必改变 | 它是更新知识的机制而非完整学习范式;可成为持续学习系统的一层。 |
| 模型编辑 | 通常是 | 多为局部事实 | 以局部性衡量 | 强调精准修改;连续多次编辑、累积干扰与全局保持构成持续编辑问题。 |
| 元学习 | 学习适应规则 | 跨任务分布 | 不一定 | 可让模型更快持续适应,但本身不等同于部署期持续更新。 |
一张阶段 × 任务的完整评测矩阵,比单个最终分数更能揭示学习动态。
序列结束后,在所有已见任务或领域上的平均得分。
单独看 ACC 会掩盖模型何时遗忘、是否依赖大量回放。后续学习对过去任务的影响;负值通常表示过去能力下降。
需保留各阶段评测矩阵,不能只记录最终一次结果。过去经验是否让尚未专门训练的新任务获得更好的初始表现。
它区分了真正可迁移的表示与单纯记住旧任务。在线更新前后输出波动、恢复时间及最近窗口内的性能变化。
对连续服务很关键,最终平均分无法反映更新瞬间的风险。专业更新后,语言、推理、安全、校准等基础能力是否退化。
LLM 评测不能只覆盖当前增量数据对应的小任务。每阶段训练算力、峰值显存、回放缓存、更新时间和存储增量。
若不报告预算,方法间的稳定性与准确率往往不可公平比较。先读综述统一词汇,再用 EWC 与 GEM 理解两条经典路线,最后进入 LLM 设定。
用于建立统一定义、方法谱系、问题设定与评价语言。
连接传统持续学习与持续预训练、微调、知识更新和能力扩展。
集中解释遗忘产生机制、衡量方式与主要缓解路线。
正则化路线代表作:保护对旧任务重要的参数。
回放路线代表作:利用记忆样本约束梯度,减少旧任务损失上升。
以 LLM 为中心梳理设定、方法、评测和当前开放问题。
02 · Persistent adaptive intelligence
更广义的问题不是“每隔多久微调一次”,而是让模型在运行过程中拥有跨会话、 可寻址、可增长并直接影响计算的内部状态,同时学会决定什么值得写入、何时巩固、 如何遗忘以及怎样撤销错误更新。
本手册用它指代一个工作性上位框架:系统不再只是冻结参数 所定义的静态函数,而是一个运行在多时间尺度可塑状态之上的学习机器。 这不是一个已经统一命名的学术领域,也不替代严格的持续学习定义。
关键分类不再只是“参数是否更新”,而是系统中的哪些变量,以什么时间尺度, 依据什么信号,按照什么规则更新。
F 决定当前如何推理;U 才决定系统如何学习。ε 是预测误差,r 是结果或奖励, c 携带来源、时间、置信度与适用上下文。
越往外层,研究目标越接近长期智能系统;越需要明确证据成熟度和评测边界。
任务、类别或领域按序到达;评价遗忘、迁移、旧数据访问与资源预算。
持续预训练、指令微调、模型编辑、参数高效模块和外部记忆共同承担更新。
系统跨会话保留可塑状态,在多个时间尺度选择性学习知识、技能与学习规则。
人类式学习的关键未必是单一状态足够大,而可能是快速记录、缓慢抽象和极慢 改变学习方式的多个系统共同工作。
当前推理轨迹、注意力、临时变量和短期目标。
写入信号当前输入、上下文与中间计算。
主要失效上下文溢出、注意力稀释、会话结束即消失。
事件、对话、来源、时间、例外和结果轨迹。
写入信号新颖性、意外程度、用户纠正和行动结果。
主要失效噪声累积、错误写入、无法从案例获得泛化。
跨事件抽取的概念、关系、规律与世界模型。
写入信号重复证据、跨情境一致性和未来预测效用。
主要失效过早抽象、覆盖时间条件、知识冲突与漂移。
技能、策略、工具调用方式和可执行子程序。
写入信号成功轨迹、奖励、验证器和复用频率。
主要失效错误技能固化、模块膨胀、路由和组合失效。
学习率、保护度、写入门、路由和更新规则。
写入信号长期保持、迁移、干扰、成本和安全回归。
主要失效学会错误的学习策略、奖励投机与目标漂移。
这些工作提供了结构信号,但目前大多验证的是长序列建模、有限数据流或受控任务, 还不是跨月份、跨年份运行的完整终身学习系统。
在瞬时激活与慢速训练权重之间,引入快速变化的可塑变量。
已经证明证明快速权重可以存储近期模式,并为序列模型提供对过去的内容寻址。
尚未证明主要是短期序列记忆;未证明跨会话、开放世界的终身知识积累。
把隐藏状态变成线性模型或 MLP,并用自监督目标在测试序列上持续更新。
已经证明在 125M–1.3B 模型和长上下文语言建模中展示线性复杂度与表达性状态。
尚未证明关注单个序列内的 test-time training;跨会话保持、可信写入和长期治理仍未解决。
用预测误差或“意外程度”驱动测试时神经长期记忆写入,并与注意力组合。
已经证明在语言、常识、基因组和时间序列上展示长上下文建模能力。
尚未证明“长期”主要指序列上下文尺度;不等于跨月份运行的可靠语义记忆。
把模型描述为多个嵌套优化层,每层拥有独立信息流、记忆容量和更新频率。
已经证明提出 Continuum Memory 与自修改模块,并在语言建模、知识吸收和持续任务上给出初步结果。
尚未证明仍是新近预印本;更高阶自修改是否能在开放数据流中稳定扩展尚未验证。
将在线短期经验暂存,周期性重放、蒸馏或“做梦”,转入更稳定结构。
已经证明两条同期工作分别探索参数级知识巩固,以及从上下文到 fast weights 的离线巩固。
尚未证明实验仍在有限轨迹和受控任务上;巩固可能同时放大模型自产错误。
把参数记忆、激活记忆和文本记忆作为可追踪、迁移和治理的一等资源。
已经证明MemOS 给出统一抽象、生命周期和跨记忆类型调度的系统设计。
尚未证明操作系统式治理不自动产生语义泛化;需要与学习规则和长期实证结合。
让模型生成自己的微调数据、更新指令和优化配置,再以未来任务表现训练这种能力。
已经证明SEAL 在知识吸收和少样本泛化实验中展示自生成更新的可行性。
尚未证明仍依赖梯度微调和外部评价;自生成数据可能形成错误反馈回路。
离线用元学习获得部署期可执行的局部、稀疏或生物约束更新规则。
已经证明研究已在小规模深度网络的在线学习中发现可解释、有效的局部可塑性规则。
尚未证明距离大模型规模、多模态知识和长期安全更新仍有显著工程与理论鸿沟。
新经验先作为可追溯事件存在,只有经重复证据、结果反馈和未来效用验证, 才逐步进入语义、技能或慢参数层。
接收输入、环境结果、用户纠正和工具反馈;输入只是证据,不自动成为事实。
先记录事件、来源、时间和上下文,避免一次输入直接改变稳定世界模型。
估计可信度、新颖性和风险,并检索是否已有相容或矛盾记忆。
利用独立来源、后续结果或可信反馈决定经验应被修正、保留还是丢弃。
从多个事件中压缩可泛化规律,或从成功轨迹形成可复用程序。
在合适窗口把稳定信息迁移到参数、专家模块或更慢的神经状态。
联合检查新知识、旧能力、迁移、安全、校准与资源成本。
删除低价值状态、保留审计记录;污染或退化时恢复到已知安全快照。
选择性写入门: gt = g(novelty, prediction error, source reliability, repetition, future utility, reward, risk)
这是一把分析学习深度的尺,不是一条确定的产品或产业发展路线。
应当验证跨会话准确找回事件、来源与时间。
仍不代表只证明系统保存了档案,不代表模型已经学会。
应当验证相同输入在不同历史状态下产生合理不同的判断和策略。
仍不代表可能只是检索提示改变输出,尚未形成可迁移结构。
应当验证从多个具体事件抽象规律,并迁移到未见场景。
仍不代表需要排除训练泄漏和简单最近邻复述。
应当验证把轨迹压缩成可组合、可复用、可验证的程序或策略。
仍不代表技能库增长并不保证正确路由和跨技能组合。
应当验证根据长期结果改进写入门、学习率、课程和更新规则。
仍不代表必须在新任务分布上验证,避免只记住元训练模式。
应当验证能在来源审计、安全边界、版本和回滚机制下长期更新。
仍不代表这是系统级研究目标,不是目前模型已经普遍具备的能力。
用户材料提出了一个值得实验化的问题:下一代模型的主要 scaling 对象, 可能不只是静态参数量,还包括有效状态容量、读写带宽和更新规则质量。 目前没有被广泛验证的通用状态 scaling law。
基础表示、计算和解释可变状态的能力。
核心太弱时,再大的状态也可能无法被正确寻址和利用。可持久保存且能被可靠区分的信息、技能与程序容量。
物理容量不等于有效容量;干扰和检索错误会迅速侵蚀收益。每个学习步骤能准确读取和局部修改多少相关状态。
仓库变大但带宽不变,可能只会让可达信息比例继续下降。写入门、寻址、压缩、巩固、冲突处理与遗忘策略的质量。
Q 决定容量增长带来知识还是噪声,是最难直接量化的因素。对静态模型,错误通常止于一次输出;对持久学习系统,错误可能成为下一轮推理 和训练的输入。来源、版本、隔离、回滚与遗忘必须进入架构。
恶意输入、提示注入或伪造反馈一旦跨会话保留,会形成长期行为偏置或后门。
模型把自己的猜测重新当作训练数据,错误会在反复重放和自蒸馏中放大。
局部成功反馈可能逐步改变原始目标、拒答边界和价值约束。
参数、路由和更新规则同时变化时,污染来源难定位,撤销单次更新也未必能恢复。
保存所有事件会带来成本、延迟、隐私风险和检索质量下降。
系统可能提高近期任务得分,却破坏长期可塑性、通用能力或校准。
优先读一手论文,并始终把“长上下文效果”“受控持续任务”与“开放世界终身学习” 三种结论分开。
快速衰减的关联矩阵:序列内神经可塑状态的早期基础
把隐藏状态模型化,并在每个 token 上执行自监督测试时训练
神经长期记忆、梯度惊奇度与动量/遗忘驱动写入
按上下文流与更新频率组织嵌套优化、多时间尺度记忆和自修改模块
让模型生成自己的更新数据/指令,再以更新后能力训练编辑策略
统一表示和治理参数、激活与明文记忆的生命周期控制平面
以优化文本作为快权重、模型参数作为慢权重的协同后训练
在离线睡眠期通过 Knowledge Seeding 与 Dreaming 巩固快经验
快速情景记忆与慢速泛化系统之间的停止巩固准则
用元学习发现稀疏、共享、可解释的在线局部可塑性规则
03 · Mechanisms & scope
本章只讨论经验如何跨时间持久写入,以及系统如何在吸收新知识的同时保持旧能力。临时上下文适应、单次推理或工具调用,只有在形成可保留的记忆、技能或参数变化后,才进入持续学习研究范围。
严格判据:数据、任务或环境按时间连续到来;系统发生可跨会话保留的变化;评价同时覆盖新知识获取、旧能力保持、迁移和遗忘。仅仅“这次回答得更好”并不等于持续学习。
Learning depth
现实系统可能混合多个层级,但需要明确经验写到哪里、能保存多久、是否改变未来行为,以及更新失败时能否追溯和撤销。
Prompt、in-context examples、临时工作记忆
RAG、情景记忆、对话与轨迹库
代码技能、工具策略、LoRA、adapter
持续预训练、微调、编辑和稀疏写入
学习目标、课程、数据生成、更新规则与验证器
重要区分:外部记忆让系统“以后还能查到”,参数或技能更新更接近“以后本身就会”。前者更易审计和撤销,后者可能拥有更强泛化能力,也承担更高的遗忘与污染风险。
Update loop
可靠的持续学习不能直接把所有反馈写入系统。它需要先识别学习信号、选择写入层级、验证候选更新,并在写入后重新检查新旧能力。
持续接收按时间到来的数据、任务、反馈和知识变化。
区分真正的新知识、分布漂移、偶发噪声和重复样本。
决定保留在上下文、外部记忆、技能模块还是模型参数中。
检查来源、正确性、安全性、可复用性和潜在冲突。
通过记忆写入、模块训练、重放或受约束参数更新保存经验。
同时测量新能力和旧能力,发现遗忘或污染时撤销更新。
Primary sources
这里只保留直接讨论大模型持续学习、长期智能体学习或受控持久适应的研究。链接仅在主动点击时联网打开,手册本身不会加载外部资源。
04 · Field map
用“写到哪里”和“何时更新”理解方法,比只按论文名称分类更接近真实系统。
直接近似旧分布,简单且基线强
额外推理结构少,机制清晰
训练经济,适合大模型
旧主干稳定,新容量可塑
系统改动小,计算收益可观
细粒度写入,显式优化局部性
更新快、可解释、易回滚
统一短期适应和长期积累
Guided reading
按目标进入资料库,而不是机械地从第 1 篇读到第 41 篇。
产出:形成术语表、指标字典和方法谱系图。
产出:得到等 token、等 FLOPs、等旧数据预算的 CPT 实验方案。
产出:形成可验证、可回滚、区分快速记忆与慢速内化的 agent 方案。
05 · Evaluation
所有横向比较都应先公开任务边界、旧数据权限、总 token、额外参数、推理成本与评价时间点。
所有任务学习结束后,系统总体还能做多好?
陷阱:平均值会掩盖关键任务和短期崩塌。
学完后续任务后,早期任务相对最佳点下降多少?
陷阱:输出格式或提示敏感性可能被误判为能力丢失。
旧知识是否帮助新任务更快、更少样本地学会?
陷阱:过强保护会得到低遗忘、低学习的假稳定。
目标输入是否稳定产生新的正确答案?
陷阱:记住一个表述不代表理解同一事实。
同一知识的改写、推理和 OOD 查询能否触发更新?
陷阱:宽泛触发可能以牺牲局部性为代价。
编辑或微调是否改变了不相关行为?
陷阱:测试集过窄会漏掉远距离副作用。
训练与推理的完整成本是什么?
陷阱:只报可训练参数会漏掉模块、缓存和路由。
后续阶段是否访问旧样本、标签、任务名或统计量?
陷阱:把离线信息泄漏包装成在线持续学习。
06 · Comparison matrix
同一种“防遗忘”目标,可以通过保存数据、限制梯度、隔离参数、扩展容量或引入外部记忆实现;代价发生在不同位置。
| 方法族 | 写入位置 | 旧数据 | 容量增长 | 任务 ID | 优势 | 风险 |
|---|---|---|---|---|---|---|
| 数据重放 Replay |
训练数据流 | 需要,或生成替代样本 | 无 | 通常不需要 | 直接近似旧分布,简单且基线强 | 隐私、存储、采样偏差、上下文膨胀 |
| 正则化与梯度约束 Protect |
原模型参数,但限制方向/幅度 | EWC 不需要;GEM 需要记忆 | 保存重要性或梯度摘要 | 训练时通常需要边界 | 额外推理结构少,机制清晰 | 重要性近似粗糙,强约束损害可塑性 |
| PEFT 与子空间隔离 Isolate |
低秩或任务相关参数子空间 | 可做到无重放 | 按任务或模块增长 | 部分方法需要 | 训练经济,适合大模型 | 方向耗尽、路由错误、阻碍正迁移 |
| 模型扩展与路由 Expand |
新增宽度、模块或专家 | 可选 | 显式增长 | 取决于路由器 | 旧主干稳定,新容量可塑 | 容量无界、路由成本、部署复杂 |
| 数据调度与优化动态 Schedule |
全模型参数与优化器状态 | 通常混合少量旧数据 | 无 | 不需要显式任务 ID | 系统改动小,计算收益可观 | 对数据分布、学习率和状态复用敏感 |
| 模型编辑与参数记忆 Edit |
侧记忆、残差记忆或局部参数 | 通常不需要完整旧数据 | 侧记忆随编辑增长 | 由查询路由替代 | 细粒度写入,显式优化局部性 | 路由错判、记忆碰撞、冲突编辑 |
| 外部记忆与智能体技能 Remember |
轨迹、经验、技能库、上下文 | 以经验记忆形式保留 | 上下文或技能库增长 | 通常没有清晰边界 | 更新快、可解释、易回滚 | 检索噪声、错误经验、未真正内化 |
| 自适应与多时间尺度学习 Adapt |
上下文快权重 + 参数慢权重 + 多级记忆 | 由在线经验和验证反馈决定 | 依架构而定 | 面向连续流 | 统一短期适应和长期积累 | 外循环昂贵、奖励投机、错误自修改 |
07 · Timeline
这条时间线关注研究问题如何变化:先解决遗忘,再追求真实时间流、局部写入、长期经验和多时间尺度学习。
持续学习被明确写成稳定性—可塑性优化问题:要么让重要权重变得不易更新,要么把有害梯度投影回可行空间。
研究对象从小型分类器扩展到持续到来的语料,旧域困惑度、下游迁移和训练成本开始共同进入评价。
函数保持式模型扩展展示了固定容量之外的路径:保留旧功能,同时为新数据增加可塑空间。
benchmark、正交低秩子空间、静态重放与动态路由同时出现,经典 CL 方法开始在生成任务上接受检验。
研究地图覆盖 CPT、DAP、CFT;数据高效 replay、共享注意力和模块选择成为持续微调的主线。
可靠性、泛化与局部性的“不可能三角”促使研究者显式设计主记忆、侧记忆、路由与知识分片。
114 期网页时间流让持续预训练走向真实规模;更新初期的性能骤降证明最终分数不足以描述部署风险。
更新开始从“微调整个模型”转向选择记忆槽和稀疏残差参数,目标是让知识写入彼此少干扰。
跨会话经验、验证反馈、技能形成和错误漂移成为研究对象;简单 ICL/replay 仍是强基线。
自编辑策略、深层优化器、连续记忆系统与自修改架构把持续学习推向多时间尺度自适应。
真实任务、无任务标签、软正交和扩展式路由共同追问:在长期资源约束下,哪些优势仍然成立?
外部经验、上下文快权重和模型慢权重被放到统一框架中,强调验证、选择性内化和低漂移更新。
08 · Paper library
每张卡片浓缩本地精读笔记的研究问题、方法、证据、局限和下一步实验,并保留 PDF 与 Obsidian 风格精确引用笔记入口。
综述 / 研究地图
用“纵向能力演化 × 横向时间/领域演化”统一整理 LLM 持续预训练、领域适配和持续微调,并把评价协议与数据资源纳入同一研究框架。
LLM 上线后会同时面对知识过时、领域迁移和用户需求变化,但经典持续学习分类不足以覆盖预训练—对齐的完整生命周期。
作者先定义 vertical/horizontal continuity,再按 CPT、DAP、CFT 三个阶段梳理 replay、正则化、参数隔离、动态架构等方法,并单列评测与数据。
这是一篇结构化综述,核心证据不是单一 SOTA 数字,而是跨 300 余篇工作的分类、比较表和研究空白;重点结论是可访问、贴近真实部署的 benchmark 仍然不足。
综述 / 入门
从基础语言模型持续学习的场景、方法与评测出发,给出一份更紧凑的 LLM 持续学习入门地图。
传统持续学习方法能否直接迁移到参数巨大、训练昂贵、能力维度复杂的语言模型,并没有统一答案。
文章按场景和机制梳理数据重放、正则约束、参数高效更新、模块化/扩展式架构与知识编辑,并讨论模型、任务和指标选择。
价值主要来自文献综合和概念比较:不同路线在数据保留、隐私、参数增长、推理路由和训练成本之间存在系统性权衡。
教程 / 课程地图
EMNLP 2025 教程摘要把持续预训练、指令微调、对齐与 lifelong agents 串成一条面向部署的学习路线。
LLM 的知识和用户偏好持续变化,但更新过程还必须同时满足计算效率、遗忘控制、伦理与安全要求。
教程提出分层讲授框架:先讲 CPT,再讲 instruction tuning 与 alignment,最后扩展到能自反思、调用工具和自主适应的 lifelong agents。
该文只有两页,是教程范围声明而不是方法论文;可将其视为研究议程和课程大纲,不能把它当作实验结论来源。
智能体 / 路线图
把 lifelong LLM agent 拆成感知、记忆、行动与自我改进环路,并从组件、数据流和评测角度提出路线图。
现有 LLM agent 多依赖静态模型和短期上下文,无法在长期交互中稳定吸收经验、形成技能并避免错误累积。
论文从 agent 的记忆、规划、工具使用、反思和模型更新出发,区分参数内与参数外适应,并归纳环境交互中的 lifelong learning 问题。
作为 roadmap,证据来自跨领域系统归纳;重要观察是仅增加检索记忆并不等于学习,长期系统还需要经验选择、验证和能力内化。
综述 / 前沿更新
面向 2026 年文献重新归纳 LLM 持续学习方法、开放挑战和机会,强调从静态任务序列走向真实在线流。
研究快速扩张后,方法名称相似但假设不同,尤其是旧数据访问、任务边界、模型更新权限与评价时间跨度常被混用。
文章按数据、参数、架构、记忆与自适应机制组织工作,并集中讨论稳定—可塑性、扩展性、隐私、评价泄漏和安全。
主要贡献是最新文献综合;它把在线约束和长期代理纳入传统 forgetting/transfer 之外的评估视角。
基础机制 / 综述
从表示漂移、梯度干扰和稳定—可塑性矛盾解释灾难性遗忘,并总结重放、正则与参数隔离三类缓解策略。
顺序训练为何会迅速损害旧任务,以及“保留旧能力”和“吸收新知识”之间为何难以兼得。
文章综合神经网络持续学习理论与实验,将缓解机制归为保持重要参数、重现旧分布、隔离更新空间和扩展容量。
综述表明遗忘不是单一指标能刻画:最终准确率、后向迁移、表示变化与短期稳定性缺口分别揭示不同失效。
正则化 / 基础方法
EWC 用 Fisher 信息估计旧任务参数的重要性,并以加权二次惩罚限制后续更新,是参数正则化路线的经典起点。
同一组网络权重顺序学习多个任务时,新任务梯度会覆盖旧任务所需参数。
训练完旧任务后估计对角 Fisher;新任务目标加入 λ/2·ΣF_i(θ_i−θ_i*)²,使重要权重更“僵硬”、不重要权重保持可塑。
论文在排列 MNIST 和 Atari 任务序列上展示了比朴素顺序训练更好的旧任务保持,说明参数重要性加权优于统一 L2 约束。
重放 + 梯度约束 / 基础方法
GEM 把旧样本记忆转成梯度不增旧任务损失的约束,并通过投影求得可行更新方向。
简单 replay 仍可能产生伤害旧任务的梯度,需要把“不得变差”直接写进优化约束。
为每个旧任务保留 episodic memory,计算当前梯度与旧任务梯度;若违反内积约束,就解一个小型二次规划把梯度投影到可行锥。
在多任务顺序学习基准上,GEM兼顾最终性能、后向迁移与前向迁移,并把正迁移纳入持续学习目标。
持续预训练 / 奠基
把语言模型预训练置于持续到来的语料流中,联合研究新语料适应、旧知识保持与跨域迁移。
每当新领域或新时间段语料到达就从头训练代价过高,直接继续预训练又会使旧域困惑度和下游能力退化。
论文结合持续预训练目标、旧知识保持机制与跨阶段评估,比较顺序训练、数据重放和参数/表示约束。
实验说明持续预训练不能只看当前语料 loss:旧域保持与下游迁移会随数据顺序、混合比例和更新策略显著变化。
动态架构 / 持续预训练
ELLE 通过函数保持式模型扩展与知识保持训练,让语言模型在新语料到来时增加容量而不破坏已有功能。
固定容量模型长期吸收新分布会加剧干扰,而每阶段训练独立模型又无法共享知识。
在阶段边界扩展网络宽度/深度,并以保持原函数输出的初始化承接旧模型,再配合预训练与知识保持目标适应新语料。
在连续领域语料上,扩展式模型相对直接继续训练改善旧域保持与新域适应,展示动态容量的可行性。
优化动态 / 持续预训练
系统研究持续预训练阶段切换时学习率再升温与优化器状态复用,说明训练动态本身就是遗忘的重要来源。
新数据到达时应重置学习率和 Adam 状态,还是沿用旧训练状态,并无可靠经验法则。
控制数据切换、学习率 re-warming 幅度和 optimizer state 复用,比较适应速度、稳定性与最终 loss。
结果表明简单地完全重置或直接沿用都可能次优;合适的再升温与状态处理能改善新分布适应且减少训练不稳定。
实证研究 / 持续预训练
通过大规模受控实验拆解持续预训练中的数据重放、学习率、语料相似性和训练预算。
已有方法常同时改变数据与优化配置,难以判断遗忘究竟来自分布漂移还是训练配方。
构造连续领域/时间语料,系统改变 replay 比例、数据顺序、模型与超参数,并同时测新域、旧域和通用能力。
论文显示少量旧数据混合通常很强,但最佳比例依赖新旧分布;持续训练的计算收益必须与从头训练和联合训练公平比较。
时间基准 / 持续预训练
TiC-LM 用 114 期 Common Crawl 构建网页级时间持续预训练基准,并证明元调度配合固定比例重放可显著省算力。
旧 benchmark 太小且缺乏真实时间结构,无法回答网页知识更新与旧能力保持如何随年份演化。
按 Common Crawl dump 建立时间流,同时在通用网页与 Wikipedia、StackExchange、代码文档等特定域做时间分层评测。
在通用 CC 上,自回归 meta-schedule + fixed-ratio replay 达到与从头训练相当的 held-out loss,而计算量减少约 2.6 倍;特定域对 replay 的需求不同。
训练动态 / 稳定性
揭示持续预训练开始后性能先骤降再恢复的 stability gap,并用数据相关性与训练调度缩短这段危险窗口。
只看训练结束会掩盖更新初期的临时能力崩塌,而在线部署往往无法容忍这种短期失稳。
跟踪训练过程而非仅最终 checkpoint,分析 epoch、数据相关性和分布切换,再设计预算受限的稳定更新策略。
论文报告在 OpenLLaMA-3B 医疗设置中,平均分可从 36.2 提升到 40.7,同时只使用约 40% 的预算,说明稳定性和效率可联合优化。
稀疏参数记忆 / 持续更新
只更新对新知识高度激活、但在预训练数据中较少使用的记忆槽,以稀疏参数写入降低知识覆盖。
全量微调和 LoRA 都可能让新知识更新触碰大量承载旧能力的参数。
在 memory-layer 模型中用类似 TF-IDF 的相对激活分数选择 memory slots,只对少量目标槽执行微调。
在问答实验中,新知识学习相当时,论文摘要报告旧能力 F1 降幅约为:全量微调 89%、LoRA 71%、稀疏记忆微调 11%。
模型扩展 / 路由
SCALE 冻结原模型并按需扩展宽度,通过 Preserve、Adapt、Route 三个环节分配新容量。
固定参数更新会干扰旧知识,而每任务独立模块造成无界增长和任务 ID 依赖。
主干负责 Preserve;新增宽度负责 Adapt;学习到的路由机制决定输入如何组合旧表示和新容量。
实验把扩展式持续学习与 replay、PEFT 和固定容量方法比较,显示可在保持旧能力的同时提高新任务可塑性。
持续指令微调 / 基准
TRACE 把持续指令微调放到多种生成与推理任务序列中,并同时测试新任务学习、旧任务保持和通用能力。
传统分类 benchmark 不能代表 LLM 指令跟随、推理和开放式生成中的遗忘。
构造 8 类任务的顺序学习协议,配套 LIMA replay 数据和 EWC、GEM、MbPA++、L2P、LFPT5、O-LoRA 等基线。
基准显示朴素顺序微调显著遗忘,经典 CL 方法在 LLM 生成任务上并不稳定;最终平均分必须和后向迁移、通用能力一起看。
PEFT / 子空间隔离
O-LoRA 为每个任务学习低秩更新,并约束新任务子空间与历史子空间正交,以减少参数更新干扰。
普通 LoRA 虽参数高效,但不同阶段的低秩方向仍会重叠并覆盖旧任务。
在训练新 LoRA 时加入与既有低秩子空间的正交约束,冻结旧模块、无需重放旧数据。
在持续指令与分类任务上,O-LoRA 通常优于顺序 LoRA 和多种无重放基线,展示子空间隔离的有效性。
PEFT + replay/路由
ConPET 用参数高效模块构建静态重放与动态路由两种持续学习方案,在效率和任务扩展之间取舍。
为每个任务全量微调成本过高,而单一小模块会发生干扰;实际系统还可能无法在推理时获得任务 ID。
Static ConPET 将 PET 与动态 replay 结合;Dynamic ConPET 保存多个 PET 模块并训练选择器按输入路由。
论文报告可训练参数最多减少约 3000 倍,并在较小 benchmark 上取得至少约 5 个点提升,说明路由/重放组合具有较高性价比。
数据高效 replay / 指令微调
InsCL 用指令层面的表示与样本组织提高持续微调的数据效率,尽量用少量历史信息保持旧任务。
LLM 指令任务的数据格式和语义跨度大,随机 replay 往往冗余且无法代表旧任务边界。
利用 instruction 信息指导样本选择和持续训练,使有限缓存覆盖更有代表性的任务语义。
在多任务顺序指令设置中,方法相对朴素微调和常见 replay 提高最终平均表现并降低遗忘。
共享注意力 / PEFT 路由
SAPT 以共享注意力同时服务参数高效学习和模块选择,让任务知识共享与输入路由相互协调。
多模块 PEFT 方法常把“学什么”和“选哪个模块”分开优化,造成选择器与任务表示错位。
共享 attention 表示用于对齐任务学习与选择,配合小型参数模块在不同阶段保留专门能力。
在 T5/LLaMA2 的 770M 到 13B 尺度实验中,方法跨多个持续任务序列改善平均性能和遗忘。
实证诊断 / 持续微调
重新审视 LLM 微调中的遗忘来源,强调任务语义、训练配方和评价方式会改变“遗忘严重”的结论。
把下游分数下降一概归因于参数知识被抹除,可能混淆提示格式、输出偏好与真实能力丢失。
通过不同模型、任务顺序、微调设置和能力测试,对遗忘现象做受控比较与细粒度诊断。
实验显示遗忘具有明显异质性:不同任务/能力、模型尺度与训练阶段的变化并不同步。
在线学习 / PEFT 选择
用代表性特征分布描述每个 PEFT 模块,并按输入相似度动态选择模块,实现避免旧任务信息泄漏的在线持续学习。
许多“在线”方法仍在后续阶段访问旧任务数据、标签或统计,形成信息泄漏与隐私风险。
为已学习 PEFT block 保存 presentative feature distribution;新样本根据与这些分布的相似度选择/组合合适模块。
ICML 2025 实验表明,在不重新访问旧任务原始信息的限制下,该方法仍能保持有竞争力的持续学习表现。
自适应 PEFT / 子空间
ASO-LoRA 根据任务归因相似度自适应决定子空间分离程度,以软正交替代 O-LoRA 的一刀切约束。
新旧任务相似时,强制完全正交会阻断正迁移;不相似时又确实需要隔离。
用 attribution 估计任务关系,再施加随相似度变化的 soft orthogonality,并设计无需推理任务标签的选择机制。
ACL 2026 实验显示其在多个任务序列上优于固定正交 LoRA,尤其能更好平衡共享与隔离。
终身模型编辑 / 参数记忆
WISE 用主记忆、侧记忆、路由器和知识分片解决终身模型编辑中可靠性、泛化与局部性的“不可能三角”。
直接改主模型易干扰旧知识,纯检索记忆又难把编辑泛化到改写问题。
冻结承载预训练知识的 main memory,只写 side memory;router 决定查询走哪条路径,并把连续编辑分散到不同参数子空间后再合并。
在问答、幻觉修正和 OOD 场景,跨 GPT、LLaMA、Mistral 骨干比较,论文报告同时改善 reliability、generalization 与 locality。
终身模型编辑 / 残差记忆
MEMOIR 把新知识写入稀疏残差记忆,并用样本相关激活掩码检索相关编辑,减少连续编辑之间的覆盖。
终身编辑需要扩展到成千上万次写入,同时保持改写泛化、无关输入局部性和旧编辑可靠性。
保留基础模型核心能力,在独立 residual memory 中学习编辑;稀疏掩码把不同样本分配到不同参数子集,推理时按激活模式匹配相关记忆。
在 LLaMA-3 与 Mistral 的问答、幻觉修正和 OOD 测试中,论文报告可扩展到数千次顺序编辑并保持较低遗忘。
智能体 / 终身学习基准
在数据库、操作系统和知识图谱环境中评估跨会话经验积累,显示“保存全部历史”并不能自然带来 lifelong agent。
现有 agent benchmark 多按独立 episode 评分,无法观察经验是否被长期保留、迁移或错误累积。
构造连续交互任务,让 agent 跨阶段复用经验,并比较不同记忆、replay 和自一致性策略。
实验发现 replay 易被无关历史和上下文长度拖累;group self-consistency 等筛选策略能更稳地提炼可复用经验。
智能体 / 真实任务基准
用六类真实应用任务检验 LLM agent 的持续学习,结果提醒复杂记忆系统并不一定胜过简单的 in-context baseline。
智能体持续学习方法常在玩具环境或短序列上验证,缺乏跨真实专业领域和长期阶段的统一比较。
覆盖软件工程、信号处理、疾病预测、数据库、策略游戏和需求预测,比较上下文、记忆与专用持续学习系统。
论文报告朴素 ICL 在若干设置中超过专门记忆系统,说明记忆写入/检索噪声可能抵消所谓长期学习收益。
智能体 / 技能学习基准
SkillLearnBench 用 20 个可验证任务、15 个子领域评估 agent 是否能从反馈中持续形成和迁移技能。
记住事实不等于获得技能;技能学习还要经历试错、反馈、抽象、组合与跨任务迁移。
任务配有可执行 verifier,按连续顺序考察 self-feedback、external feedback 和不同技能记忆策略。
没有一种方法在所有设置都获胜;自反馈可能造成策略漂移,外部可验证反馈通常更可靠。
智能体 / 技能内化
LifeSkill 以 verifier 引导技能提炼,再把在线成功经验内化为可复用能力,连接外部记忆与参数学习。
只存轨迹会让上下文膨胀且检索脆弱,只改模型又昂贵并可能遗忘,需要选择性内化。
从交互和验证反馈中学习显式技能,在线选择/修订技能,并在合适时把经验 internalize 到模型或更紧凑表示。
论文报告在 LifelongAgentBench 上获得约 7 个绝对百分点提升,显示 verifier-guided skill learning 的收益。
新范式 / 多时间尺度记忆
Nested Learning 把架构与优化统一看成不同更新频率的嵌套优化问题,并用 continuum memory 与 Hope 探索多时间尺度学习。
把网络结构和外部优化器割裂,会忽略模型内部各组件本可具有不同 context flow 与更新速率。
将反向传播、注意力和优化器解释为关联记忆;按更新频率组织层级,提出 deep optimizers、continuum memory system 和自修改 Hope 架构。
论文在语言建模、常识、长上下文 NIAH 与知识吸收任务中比较 Hope、Titans、Samba、Transformer 等,报告更低困惑度和更强长程记忆。
自适应模型 / 自编辑
SEAL 让模型生成自己的更新数据和训练指令,并用更新后性能作为强化学习奖励,形成可学习的 self-edit 策略。
普通模型只能在上下文内适应,参数更新又依赖外部工程师准备数据与训练配方。
模型根据输入生成 self-edit(合成数据、重写、学习目标等),执行小规模更新,再以更新后的任务表现训练 self-edit 生成策略。
实验展示模型能学会产生更有效的自我更新方案,在知识吸收和少样本适应任务上超过手工或无学习的更新基线。
快慢学习 / 在线适应
将上下文中的快速权重与模型参数中的慢速权重联合优化,用两种时间尺度兼顾即时适应和长期稳定。
纯 in-context learning 不会永久积累,纯 RL/微调更新慢且会引起较大策略漂移。
快速通道优化 context/fast weights,慢速通道更新 model weights,并用统一目标协调短期任务收益与长期分布约束。
论文报告相对仅用 RL 的方案最高约 3 倍样本效率,并将 KL 漂移最多降低约 70%。
机制解释 / 知识电路
追踪新知识在 Transformer 内部形成、优化并由深层向浅层重组的电路动态,为持续学习提供机制层诊断。
只看输出分数无法解释模型在何处写入新知识、何时开始泛化,以及为何与旧知识发生干扰。
通过知识定位、因果干预和训练轨迹分析,观察知识电路随学习阶段和已有知识相关性如何变化。
论文发现知识获取依赖其与先验知识的相关性,过程呈现 formation → optimization 的阶段转变,并出现 deep-to-shallow 演化。
快速神经状态 / 关联记忆
在激活与慢权重之间加入快速衰减的关联记忆矩阵,以近期隐藏状态外积实现序列内快速绑定。
RNN 隐藏向量容量有限,慢权重又无法在单个序列中快速变化,缺少中间时间尺度的可塑状态。
按 A_t=λA_{t-1}+ηh_th_t^T 写入 fast-weight matrix,并通过迭代、归一化读取;展开后等价于受时间衰减约束的点积注意。
关联检索任务中显著优于同规模 LSTM/IRNN,并在视觉序列与 Catch 控制任务上展示收益。
测试时训练 / 模型化隐藏状态
把序列层的隐藏状态变成一个可训练模型,在每个 token 到来时用自监督目标更新其权重。
Attention 长上下文成本二次增长,普通 RNN/SSM 的固定向量状态又难以保留复杂历史。
TTT-Linear/MLP 以内部模型参数作为状态,执行 W_t=W_{t-1}-η∇ℓ(W;x_t),再从更新后的模型读取输出;用 mini-batch 与 dual form 并行化。
125M–1.3B 实验显示 TTT 能随 8k–32k 上下文继续降低困惑度,部分线性基线在更长上下文趋于饱和。
神经长期记忆 / 测试时学习
用测试时可训练的神经网络充当长期记忆,以梯度惊奇度、动量和遗忘控制写入,并与局部注意力协同。
Attention 保存历史精确但成本随长度增长,递推模型高效却被固定容量压缩限制。
记忆网络根据 key 重构 value,用损失梯度表示 surprise,加入 momentum 与 weight decay;提出 MAC、MAG、MAL 三种与注意力组合方式。
语言、常识、S-NIAH、BABILong、时间序列和基因组任务中,MAC 在作者设置下表现最强,并报告百万级上下文结果。
记忆操作系统 / 生命周期治理
把参数、激活和明文三类记忆统一为可治理的一等资源,由 Memory Cube、调度器和生命周期层管理。
LLM 记忆散落在权重、KV、向量库和日志中,缺少统一来源、权限、版本、迁移和删除协议。
MemCube 同时携带 payload 与 provenance、owner、lifetime、priority、version 等元数据;MemScheduler/Lifecycle/Operator 执行路由、转换、冻结和回滚。
论文主要提供架构分类、组件设计与场景推演,没有可与算法论文同级比较的公开端到端 benchmark。
离线巩固 / 自生成重放
将在线服务的清醒期与离线巩固的睡眠期分开,通过 Knowledge Seeding 和 Dreaming 把快经验迁移到慢层。
上下文经验会消失,而对每条经验即时改慢参数成本高、风险大,缺少可验证的离线维护周期。
Knowledge Seeding 用广义蒸馏/RL 把小而快组件知识向上迁移;Dreaming 由内部专家生成合成课程并通过 ReSTEM/RL 训练。
报告 class-incremental、持续翻译、BABILong 和推理任务收益,包括长达 10M 的合成长程任务与约 80% held-out 成功率。
互补学习系统 / 泛化驱动巩固
快速记忆向慢系统回放并非越多越好;进一步巩固开始拟合不可预测噪声时应停止,以保护未来泛化。
无限 replay 可以降低训练误差,却会把具体样本噪声写入慢系统,损害未见数据表现。
teacher–student–notebook 理论框架中,notebook 快速记样本、student 慢学规律;Go-CLS 在 generalization error 最优点附近停止巩固。
解析与模拟展示收益依赖信噪比和样本/维度比,尤其在插值与 double-descent 敏感区可明显优于无限巩固。
元可塑性 / 学习更新规则
从局部候选项中元学习一个稀疏、全网络共享的可塑性规则,使固定随机反馈网络能在线学习。
随机反馈对齐避免反向权重对称,却在深层和在线低数据学习中速度慢、性能弱。
将 10 个局部候选项线性组合,外层跨 episode 优化共享系数并施加 L1;内层每次随机初始化、batch size 1 学习 250 个样本。
MNIST/EMNIST/Fashion-MNIST 等实验中,规则池显著改善随机反馈,最终主要保留伪梯度、误差 Hebbian 和 Oja 三类项。
09 · Web & audio
博客适合建立直觉,播客适合理解研究动机;涉及方法效果时仍应回到论文和实验配置核对。
静态网页预训练会让模型随时间过时。TiC-LM 从 114 期 Common Crawl dump 构造真实时间顺序的数据流,并把评测分成两层: 最重要的结果是:在通用 Common Crawl 上,自回归 meta-schedule 配合固定比例旧数据 replay,能达到接近从头重训的 held-out loss,而计算量约少 2.6 倍。不过 replay 并非处处同样重要;在特定领域上,最佳新旧数据比例会改变。 这篇工作把“持续学习是否有效”落回了实际训练系统:数据按时间到达、训练预算有限、旧网页数量远大…
Nested Learning 的出发点是:模型架构与优化器不是两个彼此分离的东西,它们都可理解为带有内部信息流和更新规则的优化问题。不同组件以不同频率更新,构成嵌套的学习层级。 博客给出三个关键概念: 1. Deep optimizers:把 momentum 等优化状态视为关联记忆,并重新设计其内部目标。 2. Continuum Memory System:不再只有短期上下文与长期参数两档,而是设置多种更新频率的连续记忆谱。 3. Hope:基于 Titans 的自修改循环架构,尝试形成更多层级的 in-c…
文章用“雕刻大理石”解释 adaptive SVD:对权重矩阵做奇异值分解,将大奇异值对应方向视为承载关键知识的高秩子空间,将较小奇异值方向视为更安全的可更新容量。新任务梯度被投影到低秩、且与重要方向正交的空间。 其目标是避免三类常见代价: - replay 需要保留旧数据; - LoRA/adapter 可能限制表达能力并持续增加模块; - 模型合并需要多个模型与复杂调参。 博客报告 T5-large 上 15 任务准确率 71.3%,高于文中 O-LoRA 的 69.6%;在 TRACE/Llama-2-7B…
教程把大模型持续学习组织为一条生命周期链: 1. Continual pre-training:持续吸收新语料和时间知识; 2. Continual instruction tuning:顺序学习任务与指令; 3. Continual alignment:用户偏好和安全约束随时间变化; 4. Lifelong LLM agents:自主反思、工具增强、跨会话适应。 它还强调算法之外的计算、数据管线、评价、伦理和可靠性问题。两页论文只是教程摘要,不包含完整方法细节,最适合作为查漏补缺的课程目录。 - 每学完一条方法…
Rob Toews 与主持人 Molly Welch 从产业与技术视角讨论灾难性遗忘:为什么当前模型大多是静态资产,为什么持续学习可能让系统从“每次重训”转向“随交互变强”,以及这会怎样形成数据与产品护城河。 - 持续学习的商业价值不只是节省训练成本,而是缩短新信息进入产品能力的延迟; - 真正可积累的系统会改变 AI 产品的竞争结构,但错误经验也可能形成同样强的负向复利; - 产业叙事中的 “self-improving” 需要用可回滚、可审计和长期 benchmark 约束。 - 嘉宾所说的“学习”是参数更新…
Alberta Plan 关注长期存在于复杂世界中的计算智能体:它通过行动影响感知输入,以奖励驱动选择,持续学习以适应变化,并用学到的世界模型进行规划。节目把这一研究观与当代一次性预训练模型对比。 官方时间轴中的持续学习重点: 它提醒我们,持续学习不应只是一串静态 NLP 数据集。更完整的问题是:agent 在连续感知—行动—奖励环路中,如何形成可预测、可控制、会迁移的长期知识。 - 语言模型预训练知识在 Alberta Plan 中扮演先验、世界模型还是工具? - 实时更新怎样避免早期错误永久塑造 agent?…
节目介绍 Meta 与 Berkeley 的 sparse memory finetuning:在具备 memory layer 的模型里,不更新全部参数,而是选择那些对新知识高激活、相对预训练数据较少使用的 memory slots。选择分数采用类似 TF-IDF 的思想。 官方简介强调,在问答任务上,这种稀疏写入能学习新知识,同时比 full finetuning 和 LoRA 少遗忘旧能力。 - memory slot 的定义与模型架构依赖; - TF-IDF 激活分数怎样计算、需要多少预训练参考数据; -…
10 · Open questions
这些问题来自论文间假设不一致、评价盲区和新型智能体系统的实际风险,适合直接转化为研究课题。
参数量、旧数据、上下文 token、训练 FLOPs、推理延迟与存储应进入同一账本。
可做实验:固定总 token 和显存,对 replay、O-LoRA、路由模块与外部记忆做 Pareto 前沿。
下游分数下降可能来自提示、输出偏好或路由变化,而非事实表征彻底消失。
可做实验:结合多提示、多解码、表示探针和因果电路干预,区分存储与调用失败。
更新后的临时能力坍塌在生产环境不可接受,即使最终 checkpoint 恢复。
可做实验:逐 checkpoint 监测能力与安全阈值,研究权重插值、回滚和渐进流量策略。
正交 LoRA、adapter 和模型扩展在十个任务上有效,不代表一年数据流仍能扩展。
可做实验:把任务数扩展到百级,测子空间角度、路由熵、参数增长和延迟。
全部内化会遗忘,全部外置会膨胀且检索脆弱,需要有价值和可信度门槛。
可做实验:用 verifier、复用频率和不确定性决定内化,比较快记忆、慢参数和混合方案。
SEAL、LifeSkill 和自修改架构让错误产生参数级复利,必须有 provenance 和回滚。
可做实验:注入错误反馈与冲突知识,测检测时间、污染半径、撤销后残留和恢复成本。
机制解释只有在能改善训练决策时,才从观察工具变成持续学习方法。
可做实验:用电路重叠预测干扰,并指导稀疏槽位、层选择或子空间约束。
Nested Learning 和 Fast–Slow 假设不同状态应以不同频率更新,但对应关系仍缺少因果证据。
可做实验:控制事实、程序技能和偏好变化频率,观察它们在上下文、记忆、优化器和参数中的迁移。
11 · Appendix
统一术语可以避免把外部检索、参数更新、模型编辑和技能学习混称为持续学习。
本手册基于项目内保存的 41 份论文 PDF、逐篇中文精读笔记与 7 份网页/播客整理。论文笔记使用 pdf-paper-reader 工作流生成,包含 PDF++ selection 坐标与必要的 rect 图像引用。综合结论把每项工作还原到数据权限、任务边界、写入位置、容量增长、训练/推理预算和评价时间尺度后再比较。
离线边界:本 HTML 不嵌入约 70 MB 的 PDF,也不加载 CDN、外部字体或脚本。只要手册仍位于项目根目录,所有 PDF、论文笔记与媒体笔记相对链接即可使用;原始来源链接在联网时打开。