Google Research:Introducing Nested Learning
- 原文:Google Research Blog
- 论文:
../../papers/05-agents-new-paradigms/31-nested-learning.pdf - 发布:2025 年 11 月
核心内容
Nested Learning 的出发点是:模型架构与优化器不是两个彼此分离的东西,它们都可理解为带有内部信息流和更新规则的优化问题。不同组件以不同频率更新,构成嵌套的学习层级。
博客给出三个关键概念:
- Deep optimizers:把 momentum 等优化状态视为关联记忆,并重新设计其内部目标。
- Continuum Memory System:不再只有短期上下文与长期参数两档,而是设置多种更新频率的连续记忆谱。
- Hope:基于 Titans 的自修改循环架构,尝试形成更多层级的 in-context learning。
博客报告 Hope 在语言建模、常识与长上下文 needle-in-a-haystack 任务中优于若干现代循环模型和 Transformer 基线。
我的判断
这是一个值得跟踪但需要谨慎验证的宏大框架。它最有价值的部分不是“新架构赢了几个点”,而是把持续学习改写为“哪些状态以什么频率、根据什么 context flow 更新”。这为比较 optimizer state、KV/外部记忆、adapter、主模型参数提供了共同语言。
带着问题读
- 多频率更新与经典 fast weights、元学习、互补学习系统有何本质区别?
- Hope 的收益来自范式、更多状态容量,还是更多在线计算?
- 不同时间尺度是否真的存储不同类型知识,能否做因果干预?
- 自修改环路如何验证、回滚并防止错误积累?