title: "Nested Learning: The Illusion of Deep Learning Architecture" source: "https://abehrouz.github.io/nestedlearning/" paper: "31-nested-learning.pdf" publication: "2025" venue: "NeurIPS 2025" status: deep-read-v2 tags: - nested-learning - continual-learning - multi-timescale - hope - deep-read-v2
Nested Learning: The Illusion of Deep Learning Architecture
[!abstract] 一句话结论 把模型、优化器与训练过程统一成按不同频率更新的嵌套优化系统;真正的“深度”不只来自层数,也来自优化层级与记忆时间尺度。
TL;DR
| 维度 | 精读结论 |
|---|---|
| 发表 | 2025 · NeurIPS 2025 |
| 核心命题 | 把模型、优化器与训练过程统一成按不同频率更新的嵌套优化系统;真正的“深度”不只来自层数,也来自优化层级与记忆时间尺度。 |
| 证据边界 | 本笔记区分机制证据、短期任务收益、长期稳定性与生产治理,不把其中一项自动外推为另一项。 |
| 阅读定位 | 新一代模型的可塑状态、记忆组织或学习规则;需要放在统一长期自适应框架中比较。 |
- 原始页面:https://abehrouz.github.io/nestedlearning/
- 本地原文:[[31-nested-learning.pdf]]
- 笔记版本:
deep-read-v2,引用坐标来自本地 PDF 文本层,图示使用页内 rect。
1. 问题与背景
论文挑战了一个默认分工:架构负责表示,优化器负责学习。作者认为这条边界会遮住模型内部大量“正在学习的组件”。注意力、动量、梯度累积、外层训练乃至推理时记忆,都可以被看成把输入—目标关联写入某种记忆的优化过程;区别主要在于状态放在哪里、看到什么上下文、多久更新一次。由此,持续学习不再只是“在任务序列上继续微调”,而是要设计一组相互嵌套、频率不同的学习循环。
这个重述很重要,因为灾难性遗忘往往被归因于单一参数空间承担了互相冲突的时间尺度:刚出现的事件需要快速写入,稳定知识需要缓慢改变,技能和元规则可能需要更慢的统计。若所有信息都经过同一个步长、同一种梯度、同一套容量进入权重,就很难同时获得可塑性与稳定性。Nested Learning(NL)试图把这一矛盾提升为架构原则,而不是补丁式正则项。
但应先划清论域:NL 是一个统一语言、若干优化器构造、Continuum Memory System(CMS)以及 Hope 模型的组合。统一语言本身不是“已解决持续学习”的证据;Hope 的实验结果也不能自动证明所有嵌套层级都对应真实、可分离的记忆过程。精读时必须把概念贡献、算法贡献和实证贡献分开。
2. 相关工作
它与四条路线相交。第一是元学习与 learned optimizer:外层过程学习内层如何更新,NL 将这种内外层关系推广到模型的每个组件。第二是 fast weights、线性注意力和现代状态空间模型:这些方法都把序列历史压缩到可更新状态,只是更新规则和时间尺度不同。第三是互补学习系统与多时间尺度记忆:快速情景记忆、慢速语义记忆的直觉,在 NL 中被扩展成连续而非二元的频率谱。第四是持续学习中的 replay、正则化和参数隔离:它们仍是有用基线,但 NL 认为仅在慢权重上约束更新,没有重新设计整个学习系统。
与普通“多层网络”相比,NL 的层级是 optimization level,不等同于神经网络的层。某个组件即使在前向图上很浅,也可能由一个慢外层训练出更新规则,再在快内层写入状态。与简单的多模块路由也不同,关键不是模块数量,而是每一级的目标、上下文流和更新频率是否显式可辨。
与相邻概念的边界
- Long context 让当前前向过程访问更多历史,但不必改变任何持久状态。
- RAG / 外部记忆 把知识留在可检索介质,更新快、可追踪,却不自动形成内化技能。
- Test-time adaptation 在推理流中改变状态,持续时间可能只有一个序列或会话。
- Continual learning 要求在非平稳任务/数据流中获得新能力并控制旧能力退化。
- Self-improvement 还多一层目标与验证闭环:系统不仅能更新,还能判断什么更新值得提交。
本文与这些概念有交集,但其证据只能覆盖实际实验过的范围。特别要避免把“状态能跨较长 token 序列存在”写成“知识能跨模型版本稳定保存”。
3. 方法
设第 \(l\) 个学习层级拥有状态 \(\theta^{(l)}\)、局部目标 \(\mathcal{L}^{(l)}\)、更新算子 \(U^{(l)}\) 与频率 \(f_l\),可抽象为:
这里 \(c^{(l)}_t\) 是该层能看到的 context flow。这个抽象不是论文唯一的正式方程,却准确抓住 NL 的可检验核心:不同状态必须拥有不同更新时钟,且快层的行为可以成为慢层的训练信号。CMS 再把原本“短期/长期”二分扩为一组 \(f_1>f_2>\cdots>f_L\) 的连续谱。Deep optimizer(如 Delta Momentum、M3)则把优化器状态也解释为关联记忆并进一步嵌套。
方法论的第一步是“关联记忆视角”:一个组件通过优化目标把 key 映射到 value,因此反向传播、注意力和优化器可以在同一语言里描述。第二步是把更新频率当作新的结构轴。模型不只是有不同参数块,而是每一块以自己的节奏读取上下文、写入状态。第三步是 deep optimizer:作者从梯度下降和动量出发,引入 Delta GD、Delta Momentum 与 M3,使优化器自身具备更深的更新结构。第四步是 CMS,它用多个频率层级保存从瞬时到稳定的信息。
Hope 是这些思想的具体承载体:它把 Titans 风格的自修改长期记忆与 CMS 结合,并使用论文提出的优化结构。因而 Hope 的成功可视为“多频率状态 + 自修改更新”这一组合的证据,但不能逐项归因。要判断 NL 是否真正成立,必须看消融:固定总参数量和训练 token,逐个去掉深层优化器、减少频率层级、把异步更新改成等频更新,并观察适应速度、旧能力保持和计算成本是否同步恶化。
一个容易误读的点是“self-modifying”。这里不是模型任意重写源代码,而是某些学习规则或记忆模块在另一个优化层级的控制下改变。它仍由训练目标、可微更新和预先定义的状态空间约束。把它直接外推成开放世界自主进化,会越过论文证据。
关键图示
这张裁剪用于定位论文的整体机制/架构。阅读时应沿着输入、写入信号、被更新状态和输出四条线检查:若只知道“有记忆模块”而不知道其写入目标与重置边界,就无法判断它属于缓存、在线学习还是持久知识。
第二张裁剪用于定位结果或关键消融。图表分数必须与预算一起读:额外状态、额外参数、额外生成 token、离线更新次数和墙钟成本都可能是收益来源。
4. 实验与证据
论文覆盖语言建模、常识推理、知识吸收、few-shot、长上下文检索和持续学习。作者报告 Hope 在所选设置中相对 Transformer、Mamba、Titans 等获得更好的困惑度或长程记忆表现,并在 class-incremental 的 CLINC、Banking、DBpedia 等任务上取得较高最终准确率。附录还讨论 CMS 的额外计算开销以及 M3 相对其他优化器的速度。
证据的强项是任务跨度较宽,并且不仅测试一次性长上下文,还测试知识写入与任务序列。弱项是:多项创新被绑在同一个系统里,比较基线的优化程度、总训练预算与内存容量未必完全等价;长上下文 NIAH 也更接近检索压力测试,不等价于在开放世界中形成可迁移知识。论文自己的结论明确承认灾难性遗忘并未被“解决”:有限容量与压缩必然导致某种遗忘,真正问题是遗忘什么、以何种速率遗忘。
因而最稳健的结论不是“NL 已经解锁人类式持续学习”,而是:把更新频率与上下文流显式化,确实提供了比单一权重更新更丰富的设计空间;Hope 给出有希望的系统级结果;关于长期稳定性、因果归因和真实部署流,还需要独立复现。
我对证据强度的判断
- 直接支持:论文实际实现的状态更新机制,在其报告任务和预算下具有可测收益。
- 部分支持:多时间尺度/自适应设计可能比单一静态状态更有效,但具体因果项仍需等预算消融。
- 尚未支持:多年开放世界运行、跨用户安全持久化、自动选择长期目标、无需外部评估的自主迭代。
判断实验是否接近持续学习,至少要同时看到学习新分布的速度和旧分布的完整轨迹。只报告最后一步平均分会隐藏“先学会、后忘掉”与任务顺序敏感性;只报告长上下文检索又会把存储/定位能力误当成参数知识与技能形成。
5. 局限与开放问题
主要局限有五类。其一,理论语言很宽,几乎任何带状态的训练过程都能被重新描述为嵌套优化,解释力不自动等于预测力。其二,Hope 同时改变架构、记忆和优化器,难以确定收益来自哪一项。其三,频率层级增加调参维度,也可能带来吞吐、同步和硬件利用率问题。其四,实验流仍是人工构造的任务或 benchmark,离多年在线、分布持续漂移、目标互相冲突的部署环境很远。其五,论文并未消除容量上限;当旧数据不可访问时,压缩错误会变成不可逆遗忘。
一个关键反例是:若数据流没有可分离的时间尺度,固定频率谱可能成为错误先验;若突发但长期重要的事实被快层吸收后未能巩固,它会快速消失;若噪声恰好反复出现,慢层又可能把噪声固化。真正系统需要重要性估计、巩固触发、冲突检测和回滚,而不仅是更多更新频率。
尚待回答的开放问题
- 容量:数据流无限而状态有限时,淘汰规则是否可解释、可调、可恢复?
- 冲突:新事实与旧事实冲突时,是覆盖、并存版本、按上下文路由,还是拒绝更新?
- 信用:一次长期收益应归因于哪条经验、哪个记忆层或哪次参数更新?
- 治理:如何做到用户隔离、来源追踪、敏感信息删除、异常检测和事务式回滚?
- 目标稳定:模型可以改变学习状态后,谁保证其优化目标、安全边界和评估器没有共同漂移?
6. 与长期自适应智能的关系
对“长期自适应智能”而言,NL 的价值是给出统一坐标系:工作记忆、情景记忆、参数知识、优化器状态和元规则可以按写入速度、保留周期、容量和可逆性排序。它把持续学习从单一算法问题扩展为学习系统设计问题,也为“什么时候只写外部记忆、什么时候改快权重、什么时候巩固到慢权重”提供结构语言。
它最接近的是机制层与架构层,而不是完整自治闭环。完整闭环还要有新颖性检测、数据可信度、目标选择、离线验证、安全门控和失败回滚。NL 告诉我们可塑性可以放在哪些层级,却没有完整回答由谁决定写入、如何证明更新有益、怎样防止恶意经验污染。因此应把它视为下一代可学习系统的骨架候选,而非自主改进系统的成品。
在完整闭环中的位置
一个更完整的系统需要按顺序完成:观察经验 → 判断新颖性/可信度 → 写入快记忆 → 检索并解决冲突 → 离线巩固 → 多维验证 → 提交或回滚 → 监控长期漂移。本文主要强化其中一个或数个环节,而不是覆盖整条链。
因此,“下一代模型”不应被理解为单一更大的参数函数,而应是多个可塑介质和学习回路组成的系统:即时激活负责当前计算,快状态负责临时适应,外部记忆负责可追踪事实,慢参数负责稳定技能,元规则负责决定如何更新。持续学习是这些层之间受约束的信息流。
审稿式证据分级
阅读这类论文时,建议把证据分成四级,而不要把“模型能更新”直接等同于“模型会长期学习”:
- 机制存在:某种状态确实会被输入改变,且消融能定位到该机制。
- 短期有效:在同一上下文、单任务或少量任务切换中,新增能力优于基线。
- 长期稳定:在足够长的数据流中,新能力保持、旧能力不发生不可接受退化。
- 可治理部署:更新有来源、权限、版本、隔离、审计和回滚,能抵抗噪声与恶意输入。
本文的实验主要覆盖前两级,并在部分设置触及第三级;若没有跨会话状态、长周期回归和故障注入,就不能宣称达到第四级。这个分级用于防止把 long context、test-time state、参数编辑和持续学习混成一个概念。
统一比较坐标
| 维度 | 精读时要问的问题 |
|---|---|
| 写入介质 | token/KV、外部条目、神经状态、adapter,还是基础参数? |
| 写入信号 | 监督标签、自监督损失、惊奇度、奖励、重放,还是人工规则? |
| 保留周期 | 单步、单会话、跨会话、跨模型版本,还是永久? |
| 容量与遗忘 | 固定容量如何淘汰?容量增长是否计入比较? |
| 选择与路由 | 谁决定写什么、读什么、何时巩固?是否需要 task ID? |
| 证据公平性 | 参数量、状态字节、训练 token、生成 token、FLOPs 与墙钟是否等价? |
| 可逆性 | 能否定位一次更新、撤销单条知识、恢复旧 checkpoint? |
| 安全与隐私 | 恶意经验、跨用户污染、敏感数据删除如何处理? |
最小复现协议
建议先建立四条等预算基线:冻结模型 + 长上下文/RAG、naive sequential fine-tuning、等容量 replay、一个参数隔离/PEFT 方法。对目标方法固定总训练 token、可训练参数、推理上下文、状态字节和总 FLOPs;如果方法额外生成数据或搜索候选,也必须计入预算。
数据流至少包含:稳定新知识、随时间变更的事实、互相冲突的任务、一次性噪声、重复噪声、稀有高价值事件和对抗写入。每个阶段保存 checkpoint,画完整学习轨迹,不只报最终平均分。最低指标集包括新任务学习面积(forward transfer)、旧任务保持/BWT、通用能力、校准、安全回归、状态/参数增长、时延、吞吐、能耗与原始数据保留量。
最重要的测试是 恢复性:分布 A→B→A 后,系统能否快速回到 A;删除一条经验后,所有介质是否都不再泄露;一次错误更新能否自动检测并回滚。持续学习不是只看平均准确率,而是看一个长期运行系统是否仍可控。
部署成熟度检查
在研究原型之外,还应记录更新是否发生在共享基础模型、用户专属适配器、会话状态或外部存储中。四者的故障半径完全不同:共享参数的一次错误可能影响所有用户,会话状态的错误通常可随重置消失,外部条目则较容易审计与撤销。默认策略应当是先写可逆介质、后做慢层提交,并把每次提交视为一次需要回归测试的模型发布。若论文没有说明状态边界、重置条件和跨用户隔离,就只能评价算法可塑性,不能据此判断生产可用性。
还要区分 记忆正确、行为正确 与 目标正确:系统可能准确记住错误信息,也可能拥有正确事实却在错误目标驱动下使用它。长期评估因此不能只查事实命中率,还要审查策略遵从、因果一致性、拒答与不确定性。自适应系统的失败往往不是完全忘记,而是把局部经验错误地泛化到不该适用的上下文。
[!tip] 阅读建议 先判断论文改变了哪个状态、该状态能保留多久,再看分数。若论文只证明更长上下文上的困惑度或检索准确率,把它标为“在线/上下文适应证据”;只有跨任务、跨会话、带旧能力回归的实验,才升级为“持续学习证据”。最后单独审查治理条件,不让算法指标替代部署安全。
个人思考
我认为这篇论文最强的部分不是 Hope 的单项分数,而是把“优化器也是记忆、架构也是学习过程”变成可操作的研究纲领。它迫使研究者报告每个状态的读写权限、更新频率和容量,而不是笼统地说模型“有长期记忆”。最需要警惕的是概念包容性过强:如果任何训练都能被 NL 解释,下一步必须提出只有 NL 视角才容易导出的、可被反驳的预测。
最值得做的实验是频率错配实验:先估计环境真实变化的频谱,再故意把 CMS 的更新频率调快或调慢,观察遗忘曲线和迁移曲线是否按理论预测变化。若最优频率与数据流结构稳定对应,NL 就不仅是一种漂亮重述,而成为可指导设计的理论。
可证伪预测
若本文机制真正捕捉到通用长期适应规律,那么在固定总 FLOPs、状态字节和参数量后,它仍应在长任务流上同时改善新任务学习曲线与旧任务保持曲线;收益不应只来自更长提示、更多生成样本或更大隐状态。若加入噪声、冲突、任务顺序反转和 A→B→A 恢复后优势消失,就应把结论降级为特定 benchmark 的序列建模技巧。
最终判断
这篇论文值得精读,因为它为“模型如何在运行中改变”提供了一个具体机制或系统抽象。我的判断不是简单的推荐/否定,而是:先把它放到正确时间尺度和状态介质上,再用等预算、长周期、可恢复的实验检验。只有同时通过能力、稳定性和治理三道门,它才从“可塑模型组件”成长为“长期自适应智能组件”。