title: "Learning, Fast and Slow: Towards LLMs That Adapt Continually" source: "https://arxiv.org/abs/2605.12484" paper: "33-learning-fast-and-slow.pdf" publication: "2026" venue: "arXiv" status: deep-read-v2 tags: - fast-slow-learning - post-training - prompt-evolution - reinforcement-learning - deep-read-v2
Learning, Fast and Slow: Towards LLMs That Adapt Continually
[!abstract] 一句话结论 把可进化的文本提示当作快权重、模型参数当作慢权重,在后训练中交替优化,以较低参数漂移快速试探策略,再把稳定收益沉淀进模型。
TL;DR
| 维度 | 精读结论 |
|---|---|
| 发表 | 2026 · arXiv |
| 核心命题 | 把可进化的文本提示当作快权重、模型参数当作慢权重,在后训练中交替优化,以较低参数漂移快速试探策略,再把稳定收益沉淀进模型。 |
| 证据边界 | 本笔记区分机制证据、短期任务收益、长期稳定性与生产治理,不把其中一项自动外推为另一项。 |
| 阅读定位 | 新一代模型的可塑状态、记忆组织或学习规则;需要放在统一长期自适应框架中比较。 |
- 原始页面:https://arxiv.org/abs/2605.12484
- 本地原文:[[33-learning-fast-and-slow.pdf]]
- 笔记版本:
deep-read-v2,引用坐标来自本地 PDF 文本层,图示使用页内 rect。
1. 问题与背景
现有 LLM 后训练几乎把适应等同于参数更新:无论新任务、新反馈还是新领域,都交给 RL/SFT 改变同一组慢权重。问题是参数更新昂贵、样本效率低,早期探索可能破坏已有能力;而纯 prompt optimization 虽快,却受上下文长度、推理成本和表达容量限制。论文提出 fast–slow framework,试图让两种适应通道分工。
“快权重”在这里需要加引号:它不是 Fast Weights 或 TTT 那种神经状态矩阵,而是一个通过 GEPA 式反思与进化优化的文本提示种群 \(\Phi\)。慢权重才是常规模型参数 \(\theta\),通过 RL 更新。快通道以文本形式搜索策略、规则和任务表述,慢通道把更稳定的行为内化到参数。两者交替进行,期望快速适应提高慢学习的采样效率。
论文研究的问题更准确地说是 adaptive post-training,而非无限期持续学习。它关注一个训练运行中任务变化时能否减少 optimizer steps、提高最终性能、降低 KL 位移。记忆跨会话持久化、版本冲突、数据治理与多年稳定性不在主要实验范围。
2. 相关工作
该方法连接 RLHF/RLVR、prompt optimization、population-based search、元学习与双系统理论。与只优化 system prompt 的工作相比,它允许慢参数继续学习;与只做 RL 相比,提示种群承担更快、更可读的策略搜索;与蒸馏相似,快通道发现的行为最终可被慢通道吸收,但论文是交替协同而非一次性 teacher–student。
它也与 in-context learning 的“临时程序”观点相近:文本提示可看成放在上下文中的短期程序。区别在于这些提示不是当前样本临时生成后丢弃,而是在种群中跨优化步保存、选择和改写。与真正神经快权重相比,它可解释、可编辑,却每次推理都占 token,且无法直接表示高维连续状态。
与相邻概念的边界
- Long context 让当前前向过程访问更多历史,但不必改变任何持久状态。
- RAG / 外部记忆 把知识留在可检索介质,更新快、可追踪,却不自动形成内化技能。
- Test-time adaptation 在推理流中改变状态,持续时间可能只有一个序列或会话。
- Continual learning 要求在非平稳任务/数据流中获得新能力并控制旧能力退化。
- Self-improvement 还多一层目标与验证闭环:系统不仅能更新,还能判断什么更新值得提交。
本文与这些概念有交集,但其证据只能覆盖实际实验过的范围。特别要避免把“状态能跨较长 token 序列存在”写成“知识能跨模型版本稳定保存”。
3. 方法
框架可抽象为两个交替目标。固定慢参数时,优化文本种群:
快通道通过反思、变异、选择找到更高奖励提示;慢通道在这些提示塑造的行为分布上更新。论文还用相对初始策略的 KL 位移衡量参数漂移: \(\mathbb{E}_x[D_{\mathrm{KL}}(\pi_{\theta_k}\|\pi_{\theta_0})]\)。 较低 KL 只是“改得较少”的代理,不自动等价于旧能力保持。
系统维护一组候选文本策略。GEPA 根据任务反馈和失败案例产生反思,对提示进行变异与选择,快速形成针对当前任务的高收益指导;随后 RL 在这些提示条件下采样并更新参数。交替过程让 fast weights 提供局部探索方向,让 slow weights 提供更高容量、无额外上下文负担的长期内化。
这种分工的潜在优势有三点。第一,文本搜索不必每次反向传播整个模型,早期可快速试错。第二,提示明确表达策略,便于人工检查和跨任务重组。第三,慢参数看到的是被快策略筛选后的更高价值轨迹,可能提高 RL 样本效率。代价则是每个任务需要反馈函数,提示种群维护和反思会增加模型调用,推理时长提示也占据上下文。
论文的 sequential adaptation 实验让任务在单次不间断训练中切换,用来观察 RL 是否停滞、快慢协同能否重新适应。它接近持续流的雏形,但任务边界和反馈仍清楚,序列长度也很短。不能把“在三次切换中适应更快”解释为“已具备开放世界自主学习”。
关键图示
这张裁剪用于定位论文的整体机制/架构。阅读时应沿着输入、写入信号、被更新状态和输出四条线检查:若只知道“有记忆模块”而不知道其写入目标与重置边界,就无法判断它属于缓存、在线学习还是持久知识。
第二张裁剪用于定位结果或关键消融。图表分数必须与预算一起读:额外状态、额外参数、额外生成 token、离线更新次数和墙钟成本都可能是收益来源。
4. 实验与证据
在 CodeIO、数学与 HoVer 等任务上,论文报告 FST 相比 RL-only 使用约 1.4–3 倍更少 optimizer steps,通常达到更高渐近性能,并在一些设置下降低至多约 70% 的 KL 位移。塑性探针用于检查模型在训练过程中学习新映射的能力,结果支持快通道能缓解 RL 的适应停滞。
顺序实验按 HoVer→CodeIO→Physics 切换任务,每 200 步换一次。RL-only 在 CodeIO 上出现停滞,对 Physics 的适应也不完整;FST 能更快利用提示种群形成新策略。论文进一步分解 fast 与 slow 的贡献,表明二者都参与最终提升,而非纯提示就能解释全部收益。
证据仍有边界。optimizer step 少不等于总算力少,因为 GEPA 需要额外生成、评估和反思;KL 位移低不保证旧任务性能不下降;三任务短序列不足以观察种群膨胀、提示冲突和长期回归。最稳妥结论是“文本快通道能改善若干后训练任务的探索与样本效率”。
我对证据强度的判断
- 直接支持:论文实际实现的状态更新机制,在其报告任务和预算下具有可测收益。
- 部分支持:多时间尺度/自适应设计可能比单一静态状态更有效,但具体因果项仍需等预算消融。
- 尚未支持:多年开放世界运行、跨用户安全持久化、自动选择长期目标、无需外部评估的自主迭代。
判断实验是否接近持续学习,至少要同时看到学习新分布的速度和旧分布的完整轨迹。只报告最后一步平均分会隐藏“先学会、后忘掉”与任务顺序敏感性;只报告长上下文检索又会把存储/定位能力误当成参数知识与技能形成。
5. 局限与开放问题
第一,快权重是提示文本,推理时持续消耗 context 和注意力计算,不能无限扩展。第二,GEPA 依赖可用的任务奖励和失败反馈,开放世界中往往没有廉价真值。第三,慢通道仍是普通 RL 参数更新,长期遗忘没有被直接约束。第四,报告的 step efficiency 未完整等价到端到端 FLOPs、时延或美元成本。第五,提示种群可能对 benchmark 模板过拟合,迁移到措辞或分布变化后的任务需要额外验证。
反例是快慢通道形成错误共振:提示先发现一个奖励漏洞,慢参数随后把漏洞固化;表面上奖励更快上升、KL 也可能较低,但真实能力下降。因此长期系统必须让独立验证器审查快通道提议,并在慢巩固前进行反事实和旧能力测试。
尚待回答的开放问题
- 容量:数据流无限而状态有限时,淘汰规则是否可解释、可调、可恢复?
- 冲突:新事实与旧事实冲突时,是覆盖、并存版本、按上下文路由,还是拒绝更新?
- 信用:一次长期收益应归因于哪条经验、哪个记忆层或哪次参数更新?
- 治理:如何做到用户隔离、来源追踪、敏感信息删除、异常检测和事务式回滚?
- 目标稳定:模型可以改变学习状态后,谁保证其优化目标、安全边界和评估器没有共同漂移?
6. 与长期自适应智能的关系
这篇工作把长期自适应智能中的“多介质记忆”具体化:文本策略是快速、可读、可撤销的记忆;参数是慢速、高容量、推理便宜但难回滚的记忆。它给出一种巩固流程:先在可解释介质中探索,再把跨样本稳定的模式写入参数。这个思想可与外部知识库、程序技能库和 episodic memory 组合,而不必把所有经验直接 fine-tune。
它补足了 NL 的一个实践视角:时间尺度不一定都由神经矩阵承载,也可以由文本、程序和参数共同承载。但要进入长期部署,还需回答提示何时淘汰、哪些知识值得蒸馏、如何发现冲突、怎样保证慢更新不损害安全对齐。
在完整闭环中的位置
一个更完整的系统需要按顺序完成:观察经验 → 判断新颖性/可信度 → 写入快记忆 → 检索并解决冲突 → 离线巩固 → 多维验证 → 提交或回滚 → 监控长期漂移。本文主要强化其中一个或数个环节,而不是覆盖整条链。
因此,“下一代模型”不应被理解为单一更大的参数函数,而应是多个可塑介质和学习回路组成的系统:即时激活负责当前计算,快状态负责临时适应,外部记忆负责可追踪事实,慢参数负责稳定技能,元规则负责决定如何更新。持续学习是这些层之间受约束的信息流。
审稿式证据分级
阅读这类论文时,建议把证据分成四级,而不要把“模型能更新”直接等同于“模型会长期学习”:
- 机制存在:某种状态确实会被输入改变,且消融能定位到该机制。
- 短期有效:在同一上下文、单任务或少量任务切换中,新增能力优于基线。
- 长期稳定:在足够长的数据流中,新能力保持、旧能力不发生不可接受退化。
- 可治理部署:更新有来源、权限、版本、隔离、审计和回滚,能抵抗噪声与恶意输入。
本文的实验主要覆盖前两级,并在部分设置触及第三级;若没有跨会话状态、长周期回归和故障注入,就不能宣称达到第四级。这个分级用于防止把 long context、test-time state、参数编辑和持续学习混成一个概念。
统一比较坐标
| 维度 | 精读时要问的问题 |
|---|---|
| 写入介质 | token/KV、外部条目、神经状态、adapter,还是基础参数? |
| 写入信号 | 监督标签、自监督损失、惊奇度、奖励、重放,还是人工规则? |
| 保留周期 | 单步、单会话、跨会话、跨模型版本,还是永久? |
| 容量与遗忘 | 固定容量如何淘汰?容量增长是否计入比较? |
| 选择与路由 | 谁决定写什么、读什么、何时巩固?是否需要 task ID? |
| 证据公平性 | 参数量、状态字节、训练 token、生成 token、FLOPs 与墙钟是否等价? |
| 可逆性 | 能否定位一次更新、撤销单条知识、恢复旧 checkpoint? |
| 安全与隐私 | 恶意经验、跨用户污染、敏感数据删除如何处理? |
最小复现协议
建议先建立四条等预算基线:冻结模型 + 长上下文/RAG、naive sequential fine-tuning、等容量 replay、一个参数隔离/PEFT 方法。对目标方法固定总训练 token、可训练参数、推理上下文、状态字节和总 FLOPs;如果方法额外生成数据或搜索候选,也必须计入预算。
数据流至少包含:稳定新知识、随时间变更的事实、互相冲突的任务、一次性噪声、重复噪声、稀有高价值事件和对抗写入。每个阶段保存 checkpoint,画完整学习轨迹,不只报最终平均分。最低指标集包括新任务学习面积(forward transfer)、旧任务保持/BWT、通用能力、校准、安全回归、状态/参数增长、时延、吞吐、能耗与原始数据保留量。
最重要的测试是 恢复性:分布 A→B→A 后,系统能否快速回到 A;删除一条经验后,所有介质是否都不再泄露;一次错误更新能否自动检测并回滚。持续学习不是只看平均准确率,而是看一个长期运行系统是否仍可控。
部署成熟度检查
在研究原型之外,还应记录更新是否发生在共享基础模型、用户专属适配器、会话状态或外部存储中。四者的故障半径完全不同:共享参数的一次错误可能影响所有用户,会话状态的错误通常可随重置消失,外部条目则较容易审计与撤销。默认策略应当是先写可逆介质、后做慢层提交,并把每次提交视为一次需要回归测试的模型发布。若论文没有说明状态边界、重置条件和跨用户隔离,就只能评价算法可塑性,不能据此判断生产可用性。
还要区分 记忆正确、行为正确 与 目标正确:系统可能准确记住错误信息,也可能拥有正确事实却在错误目标驱动下使用它。长期评估因此不能只查事实命中率,还要审查策略遵从、因果一致性、拒答与不确定性。自适应系统的失败往往不是完全忘记,而是把局部经验错误地泛化到不该适用的上下文。
[!tip] 阅读建议 先判断论文改变了哪个状态、该状态能保留多久,再看分数。若论文只证明更长上下文上的困惑度或检索准确率,把它标为“在线/上下文适应证据”;只有跨任务、跨会话、带旧能力回归的实验,才升级为“持续学习证据”。最后单独审查治理条件,不让算法指标替代部署安全。
个人思考
我认为“快权重=文本”既是亮点也是命名风险。亮点是它把快速适应变得可审计;风险是读者可能把它与神经 fast weights 混为一谈。真正值得保留的是工程原则:先在廉价、可逆的空间搜索,证据足够后再提交到昂贵、难逆的状态。
最有价值的后续实验应固定总 token、总前向 FLOPs 与墙钟时间,把 RL-only、prompt-only、FST 和“prompt 搜索后一次蒸馏”比较;同时每轮复测所有旧任务,记录提示长度、种群规模和参数 KL。若 FST 在长任务流中仍保持更好的面积下面积(new-task learning curve 与 old-task retention curve),才能说明它不仅加速短期后训练,也改善长期适应。
可证伪预测
若本文机制真正捕捉到通用长期适应规律,那么在固定总 FLOPs、状态字节和参数量后,它仍应在长任务流上同时改善新任务学习曲线与旧任务保持曲线;收益不应只来自更长提示、更多生成样本或更大隐状态。若加入噪声、冲突、任务顺序反转和 A→B→A 恢复后优势消失,就应把结论降级为特定 benchmark 的序列建模技巧。
最终判断
这篇论文值得精读,因为它为“模型如何在运行中改变”提供了一个具体机制或系统抽象。我的判断不是简单的推荐/否定,而是:先把它放到正确时间尺度和状态介质上,再用等预算、长周期、可恢复的实验检验。只有同时通过能力、稳定性和治理三道门,它才从“可塑模型组件”成长为“长期自适应智能组件”。