continue_learning/papers/05-agents-new-paradigms/32-seal.md

title: "Self-Adapting Language Models" source: "https://arxiv.org/abs/2506.10943" paper: "32-seal.pdf" publication: "2025" venue: "arXiv" status: deep-read-v2 tags: - self-adaptation - self-editing - reinforcement-learning - continual-learning - deep-read-v2


Self-Adapting Language Models

[!abstract] 一句话结论 让语言模型学习如何把新信息转化为自己的训练数据与更新指令,再用更新后的能力作为奖励训练“编辑策略”。

TL;DR

维度 精读结论
发表 2025 · arXiv
核心命题 让语言模型学习如何把新信息转化为自己的训练数据与更新指令,再用更新后的能力作为奖励训练“编辑策略”。
证据边界 本笔记区分机制证据、短期任务收益、长期稳定性与生产治理,不把其中一项自动外推为另一项。
阅读定位 新一代模型的可塑状态、记忆组织或学习规则;需要放在统一长期自适应框架中比较。

1. 问题与背景

传统预训练把模型冻结在一个时间切片上。遇到新知识或新任务时,我们通常由人决定如何构造数据、选超参数并微调;模型只执行更新,不学习“如何更新自己”。SEAL(Self-Adapting LLMs)研究的不是单次 fine-tuning 配方,而是能否让模型生成 self-edit:把输入材料改写成合适的合成训练样本、训练指令或其他更新规范,使后续参数更新更有效。

这里的核心难题是信用分配。某条编辑文本本身没有天然标签,只有真正执行更新、再在下游任务上评估,才能知道它是否好。于是系统形成外循环:模型提出候选编辑,内循环应用编辑并训练,评估更新后的模型,奖励再反过来优化编辑生成策略。这比普通数据增强更进一步,因为“怎样从经验构造学习事件”本身成为被学习的策略。

论文讨论两类设置:few-shot adaptation 与 knowledge incorporation。前者要求模型从少量示例推导可泛化的训练信号;后者要求模型阅读新文章,在没有原文上下文时回答相关问题。二者都比把文本塞入当前上下文更接近持久适应,但实验仍是受控、短周期的参数编辑。

[!PDF|] 问题/定义原文锚点 1 · 32-seal.pdf, p.9

[!PDF|] 问题/定义原文锚点 2 · 32-seal.pdf, p.1

2. 相关工作

SEAL 位于元学习、合成数据、模型编辑、continual pretraining 与 agentic self-improvement 的交叉处。与 MAML 类元学习相比,它输出自然语言/数据形式的编辑,而非只学习一个易适应初始化;与 RAG 相比,它会改变参数,因此查询时不必始终携带原材料;与单事实模型编辑相比,它更关注模型自动构造更新数据;与普通合成数据相比,生成器通过“更新后的真实效果”而不是表面质量接受反馈。

它也与 ReST/EM、强化学习式搜索相似:从候选 self-edit 中筛出高奖励样本,再提高模型生成这些编辑的概率。与完全自治的自我改进不同,评估问题、奖励函数、训练代码和可更新参数范围仍由外部给定。系统学习的是受约束更新策略,不是任意选择目标。

与相邻概念的边界

本文与这些概念有交集,但其证据只能覆盖实际实验过的范围。特别要避免把“状态能跨较长 token 序列存在”写成“知识能跨模型版本稳定保存”。

3. 方法

可把 SEAL 写成双层优化。模型策略 \(\pi_\phi\) 针对经验 \(x\) 生成编辑 \(e\),内层更新得到 \(\theta'=\operatorname{Update}(\theta,e)\),外层根据 更新后性能给奖励:

\[ \max_{\phi}\; \mathbb{E}_{e\sim\pi_\phi(e\mid x)} \left[R\!\left(\operatorname{Update}(\theta,e);D_{\mathrm{eval}}\right)\right]. \]

真正昂贵之处在于 \(R\) 只有执行一次或多次训练后才能观察。论文使用强化学习/ReSTEM 式外循环,从候选编辑的下游效果中学习。这个目标也揭示安全边界:若 \(D_{\mathrm{eval}}\) 很窄,编辑策略会优化 benchmark,而不是获得普遍正确的学习能力。

在 few-shot 场景中,模型根据少数题目生成可用于微调的 self-edit,例如对解法进行重构、产生新的训练实例或给出训练规范;系统应用这些编辑后评估适应成功率。在知识吸收场景中,输入是一段文章,模型把它转换为合成问答或其他训练材料,再通过参数更新让模型在无上下文状态回答问题。外循环保留高奖励编辑并优化模型,使其逐渐学会哪些编辑更有效。

这套方法有三个层次必须分开:编辑策略 \(\pi_\phi\)、被编辑的基础参数 \(\theta\)、执行编辑的训练算子。论文主要创新在第一层。即便编辑文本看似“自我指令”,实际可塑性仍来自常规梯度更新;若训练算子、LoRA 容量或学习率改变,编辑策略可能失效。因此复现必须记录完整内层轨迹,而不能只保存最终合成文本。

方法还隐含一个数据治理问题:原始经验被模型重写后,可能丢失出处、置信度和反例。若要用于长期系统,self-edit 需要附带 provenance、时间戳、适用范围、回滚点和冲突关系。SEAL 原型证明了“学习如何生成更新数据”可行,但没有提供完备的记忆治理层。

[!PDF|] 方法原文锚点 1 · 32-seal.pdf, p.2

[!PDF|] 方法原文锚点 2 · 32-seal.pdf, p.6

关键图示

图 1:精读裁剪 · 32-seal.pdf, p.2

这张裁剪用于定位论文的整体机制/架构。阅读时应沿着输入、写入信号、被更新状态和输出四条线检查:若只知道“有记忆模块”而不知道其写入目标与重置边界,就无法判断它属于缓存、在线学习还是持久知识。

图 2:精读裁剪 · 32-seal.pdf, p.8

第二张裁剪用于定位结果或关键消融。图表分数必须与预算一起读:额外状态、额外参数、额外生成 token、离线更新次数和墙钟成本都可能是收益来源。

4. 实验与证据

few-shot 实验显示,经外循环学习的编辑策略能提高多个任务的 adaptation success rate。知识吸收实验使用 SQuAD 风格评估:在单段落设置中,基础模型约 32.7,直接使用段落约 33.5,普通合成数据约 39.7,GPT‑4.1 生成合成数据约 46.3,SEAL 报告约 47.0。这个结果支持“用真实更新效果训练编辑策略”有增益,但领先强外部合成器的幅度并不总是大。

更大 continual-pretraining 样本量下,结果不是 SEAL 全面占优:某些设置 GPT‑4.1 合成数据达到或超过 SEAL,例如文中表格在特定 n 下报告 59.4 对 58.2、49.2 对 46.4。这个细节非常重要,它把结论限制为“自适应策略具有竞争力且可由模型自身学习”,而不是“永远优于更强教师”。

连续编辑实验还显示,随着新编辑累积,较早任务的表现逐渐下降。也就是说,SEAL 改进了获得新知识的方式,却没有消除参数更新的干扰。论文价值在于暴露一个新的可优化接口——编辑生成——而非解决稳定性—可塑性困境。

[!PDF|] 实验/结果原文锚点 1 · 32-seal.pdf, p.7

[!PDF|] 实验/结果原文锚点 2 · 32-seal.pdf, p.9

我对证据强度的判断

判断实验是否接近持续学习,至少要同时看到学习新分布的速度和旧分布的完整轨迹。只报告最后一步平均分会隐藏“先学会、后忘掉”与任务顺序敏感性;只报告长上下文检索又会把存储/定位能力误当成参数知识与技能形成。

5. 局限与开放问题

首要局限是外层奖励依赖专门评估集;没有可靠自动评估,就没有可信信用信号。第二,候选编辑都要触发训练与评估,搜索成本高,且可能对固定评测过拟合。第三,连续编辑仍遗忘旧任务,缺少冲突检测、replay、参数隔离或巩固机制。第四,编辑可能把错误、偏见或提示注入固化进权重,而参数变化比外部记忆更难审计和撤销。第五,实验规模与持续时间离开放世界仍远,不能证明长期自我维护。

反例是奖励黑客:若评估问题可被编辑策略猜到,它可以生成只覆盖测试模板的样本;如果文章含互相矛盾的信息,单一正确率也无法决定应该覆盖旧知识、并存版本还是拒绝更新。生产系统必须在执行 self-edit 前后做隔离验证,并默认支持回滚。

[!PDF|] 局限/结论原文锚点 1 · 32-seal.pdf, p.8

[!PDF|] 局限/结论原文锚点 2 · 32-seal.pdf, p.9

尚待回答的开放问题

  1. 容量:数据流无限而状态有限时,淘汰规则是否可解释、可调、可恢复?
  2. 冲突:新事实与旧事实冲突时,是覆盖、并存版本、按上下文路由,还是拒绝更新?
  3. 信用:一次长期收益应归因于哪条经验、哪个记忆层或哪次参数更新?
  4. 治理:如何做到用户隔离、来源追踪、敏感信息删除、异常检测和事务式回滚?
  5. 目标稳定:模型可以改变学习状态后,谁保证其优化目标、安全边界和评估器没有共同漂移?

6. 与长期自适应智能的关系

SEAL 是长期自适应智能中“学习写入策略”的原型。它位于感知新经验之后、参数巩固之前:先把原始经验加工成高价值学习事件,再执行内层更新。与 Fast Weights/TTT 关注可更新状态不同,SEAL 更关注训练数据和训练指令如何自动产生;与 MemOS 关注治理不同,它直接优化写入后的任务收益。

若把它放进完整闭环,前面需要来源验证和新颖性检测,中间需要沙箱训练、旧能力回归测试与冲突分析,后面需要版本管理、回滚和长期监控。只有把“能编辑”与“应不应该编辑”分开,self-adaptation 才可能从 benchmark 技巧变成可靠能力。

在完整闭环中的位置

一个更完整的系统需要按顺序完成:观察经验 → 判断新颖性/可信度 → 写入快记忆 → 检索并解决冲突 → 离线巩固 → 多维验证 → 提交或回滚 → 监控长期漂移。本文主要强化其中一个或数个环节,而不是覆盖整条链。

因此,“下一代模型”不应被理解为单一更大的参数函数,而应是多个可塑介质和学习回路组成的系统:即时激活负责当前计算,快状态负责临时适应,外部记忆负责可追踪事实,慢参数负责稳定技能,元规则负责决定如何更新。持续学习是这些层之间受约束的信息流。

审稿式证据分级

阅读这类论文时,建议把证据分成四级,而不要把“模型能更新”直接等同于“模型会长期学习”:

  1. 机制存在:某种状态确实会被输入改变,且消融能定位到该机制。
  2. 短期有效:在同一上下文、单任务或少量任务切换中,新增能力优于基线。
  3. 长期稳定:在足够长的数据流中,新能力保持、旧能力不发生不可接受退化。
  4. 可治理部署:更新有来源、权限、版本、隔离、审计和回滚,能抵抗噪声与恶意输入。

本文的实验主要覆盖前两级,并在部分设置触及第三级;若没有跨会话状态、长周期回归和故障注入,就不能宣称达到第四级。这个分级用于防止把 long context、test-time state、参数编辑和持续学习混成一个概念。

统一比较坐标

维度 精读时要问的问题
写入介质 token/KV、外部条目、神经状态、adapter,还是基础参数?
写入信号 监督标签、自监督损失、惊奇度、奖励、重放,还是人工规则?
保留周期 单步、单会话、跨会话、跨模型版本,还是永久?
容量与遗忘 固定容量如何淘汰?容量增长是否计入比较?
选择与路由 谁决定写什么、读什么、何时巩固?是否需要 task ID?
证据公平性 参数量、状态字节、训练 token、生成 token、FLOPs 与墙钟是否等价?
可逆性 能否定位一次更新、撤销单条知识、恢复旧 checkpoint?
安全与隐私 恶意经验、跨用户污染、敏感数据删除如何处理?

最小复现协议

建议先建立四条等预算基线:冻结模型 + 长上下文/RAG、naive sequential fine-tuning、等容量 replay、一个参数隔离/PEFT 方法。对目标方法固定总训练 token、可训练参数、推理上下文、状态字节和总 FLOPs;如果方法额外生成数据或搜索候选,也必须计入预算。

数据流至少包含:稳定新知识、随时间变更的事实、互相冲突的任务、一次性噪声、重复噪声、稀有高价值事件和对抗写入。每个阶段保存 checkpoint,画完整学习轨迹,不只报最终平均分。最低指标集包括新任务学习面积(forward transfer)、旧任务保持/BWT、通用能力、校准、安全回归、状态/参数增长、时延、吞吐、能耗与原始数据保留量。

最重要的测试是 恢复性:分布 A→B→A 后,系统能否快速回到 A;删除一条经验后,所有介质是否都不再泄露;一次错误更新能否自动检测并回滚。持续学习不是只看平均准确率,而是看一个长期运行系统是否仍可控。

部署成熟度检查

在研究原型之外,还应记录更新是否发生在共享基础模型、用户专属适配器、会话状态或外部存储中。四者的故障半径完全不同:共享参数的一次错误可能影响所有用户,会话状态的错误通常可随重置消失,外部条目则较容易审计与撤销。默认策略应当是先写可逆介质、后做慢层提交,并把每次提交视为一次需要回归测试的模型发布。若论文没有说明状态边界、重置条件和跨用户隔离,就只能评价算法可塑性,不能据此判断生产可用性。

还要区分 记忆正确行为正确目标正确:系统可能准确记住错误信息,也可能拥有正确事实却在错误目标驱动下使用它。长期评估因此不能只查事实命中率,还要审查策略遵从、因果一致性、拒答与不确定性。自适应系统的失败往往不是完全忘记,而是把局部经验错误地泛化到不该适用的上下文。

[!tip] 阅读建议 先判断论文改变了哪个状态、该状态能保留多久,再看分数。若论文只证明更长上下文上的困惑度或检索准确率,把它标为“在线/上下文适应证据”;只有跨任务、跨会话、带旧能力回归的实验,才升级为“持续学习证据”。最后单独审查治理条件,不让算法指标替代部署安全。

个人思考

我最认同的方向是把数据工程本身变成可学习对象。人类学习也不只是改变突触,还会重述材料、出题、找反例和安排复习。SEAL 证明模型可以通过下游结果改进这种“学习前处理”。但它最危险的外推是把 self-edit 直接称为 self-improvement:目标与评估仍是外置的,而且遗忘曲线已经说明局部奖励可能牺牲历史能力。

最关键实验应是盲化、长期的编辑流:编辑策略看不到最终测试模板;每轮只接收自然材料;系统必须同时通过新知识、旧知识、通用能力、安全和校准五类门。将 SEAL 与固定合成器、强教师、随机数据增强、直接 CPT 在等训练 FLOPs 下比较,才可判断收益来自“学会编辑”还是来自额外搜索计算。

可证伪预测

若本文机制真正捕捉到通用长期适应规律,那么在固定总 FLOPs、状态字节和参数量后,它仍应在长任务流上同时改善新任务学习曲线与旧任务保持曲线;收益不应只来自更长提示、更多生成样本或更大隐状态。若加入噪声、冲突、任务顺序反转和 A→B→A 恢复后优势消失,就应把结论降级为特定 benchmark 的序列建模技巧。

最终判断

这篇论文值得精读,因为它为“模型如何在运行中改变”提供了一个具体机制或系统抽象。我的判断不是简单的推荐/否定,而是:先把它放到正确时间尺度和状态介质上,再用等预算、长周期、可恢复的实验检验。只有同时通过能力、稳定性和治理三道门,它才从“可塑模型组件”成长为“长期自适应智能组件”。