
{
  "01-comprehensive-survey": {
    "one": "用“纵向能力演化 × 横向时间/领域演化”统一整理 LLM 持续预训练、领域适配和持续微调，并把评价协议与数据资源纳入同一研究框架。",
    "problem": "LLM 上线后会同时面对知识过时、领域迁移和用户需求变化，但经典持续学习分类不足以覆盖预训练—对齐的完整生命周期。",
    "method": "作者先定义 vertical/horizontal continuity，再按 CPT、DAP、CFT 三个阶段梳理 replay、正则化、参数隔离、动态架构等方法，并单列评测与数据。",
    "evidence": "这是一篇结构化综述，核心证据不是单一 SOTA 数字，而是跨 300 余篇工作的分类、比较表和研究空白；重点结论是可访问、贴近真实部署的 benchmark 仍然不足。",
    "limits": "分类框架擅长建立地图，但难以比较不同论文中不一致的数据顺序、模型规模、旧知识测试集和算力预算；读表时不能把横向名次当作严格公平实验。",
    "research": "适合作为本项目的总索引；后续可沿“预训练流、指令流、编辑流、智能体经验流”分别建立统一 budget 与 forgetting/transfer 指标。",
    "route": "综述 / 研究地图"
  },
  "02-llm-continual-learning-survey": {
    "one": "从基础语言模型持续学习的场景、方法与评测出发，给出一份更紧凑的 LLM 持续学习入门地图。",
    "problem": "传统持续学习方法能否直接迁移到参数巨大、训练昂贵、能力维度复杂的语言模型，并没有统一答案。",
    "method": "文章按场景和机制梳理数据重放、正则约束、参数高效更新、模块化/扩展式架构与知识编辑，并讨论模型、任务和指标选择。",
    "evidence": "价值主要来自文献综合和概念比较：不同路线在数据保留、隐私、参数增长、推理路由和训练成本之间存在系统性权衡。",
    "limits": "篇幅较短，且发表时间较早，未覆盖 2025—2026 年兴起的智能体技能学习、自编辑和多时间尺度记忆。",
    "research": "先用它建立术语，再用综合综述和 2025/2026 benchmark 校正；阅读时重点记录每种方法需要的任务 ID、旧数据与额外参数。",
    "route": "综述 / 入门"
  },
  "03-emnlp-2025-tutorial": {
    "one": "EMNLP 2025 教程摘要把持续预训练、指令微调、对齐与 lifelong agents 串成一条面向部署的学习路线。",
    "problem": "LLM 的知识和用户偏好持续变化，但更新过程还必须同时满足计算效率、遗忘控制、伦理与安全要求。",
    "method": "教程提出分层讲授框架：先讲 CPT，再讲 instruction tuning 与 alignment，最后扩展到能自反思、调用工具和自主适应的 lifelong agents。",
    "evidence": "该文只有两页，是教程范围声明而不是方法论文；可将其视为研究议程和课程大纲，不能把它当作实验结论来源。",
    "limits": "没有算法细节、消融实验或可复现配置；真正深入需回到教程引用的综述和实证论文。",
    "research": "可据此设计阅读顺序：基础遗忘机制 → 持续预训练 → 持续指令/对齐 → 智能体记忆与技能。",
    "route": "教程 / 课程地图"
  },
  "04-lifelong-learning-llm-agents-roadmap": {
    "one": "把 lifelong LLM agent 拆成感知、记忆、行动与自我改进环路，并从组件、数据流和评测角度提出路线图。",
    "problem": "现有 LLM agent 多依赖静态模型和短期上下文，无法在长期交互中稳定吸收经验、形成技能并避免错误累积。",
    "method": "论文从 agent 的记忆、规划、工具使用、反思和模型更新出发，区分参数内与参数外适应，并归纳环境交互中的 lifelong learning 问题。",
    "evidence": "作为 roadmap，证据来自跨领域系统归纳；重要观察是仅增加检索记忆并不等于学习，长期系统还需要经验选择、验证和能力内化。",
    "limits": "很多组件仍是概念性组合，缺少统一环境、长时间跨度和真实成本下的对照；安全与错误自增强也尚未被充分量化。",
    "research": "与 LifelongAgentBench、SkillLearnBench、LifeSkill 一起读，建立“存什么—何时取—如何验证—何时内化”的实验矩阵。",
    "route": "智能体 / 路线图"
  },
  "05-continual-learning-llms-methods-challenges": {
    "one": "面向 2026 年文献重新归纳 LLM 持续学习方法、开放挑战和机会，强调从静态任务序列走向真实在线流。",
    "problem": "研究快速扩张后，方法名称相似但假设不同，尤其是旧数据访问、任务边界、模型更新权限与评价时间跨度常被混用。",
    "method": "文章按数据、参数、架构、记忆与自适应机制组织工作，并集中讨论稳定—可塑性、扩展性、隐私、评价泄漏和安全。",
    "evidence": "主要贡献是最新文献综合；它把在线约束和长期代理纳入传统 forgetting/transfer 之外的评估视角。",
    "limits": "预印本时效性强但分类尚未经过长期社区检验，且新论文的结果往往缺少独立复现。",
    "research": "用它补齐 2025—2026 新路线，同时坚持把每项结果还原到数据流假设和资源预算后再比较。",
    "route": "综述 / 前沿更新"
  },
  "06-catastrophic-forgetting-review": {
    "one": "从表示漂移、梯度干扰和稳定—可塑性矛盾解释灾难性遗忘，并总结重放、正则与参数隔离三类缓解策略。",
    "problem": "顺序训练为何会迅速损害旧任务，以及“保留旧能力”和“吸收新知识”之间为何难以兼得。",
    "method": "文章综合神经网络持续学习理论与实验，将缓解机制归为保持重要参数、重现旧分布、隔离更新空间和扩展容量。",
    "evidence": "综述表明遗忘不是单一指标能刻画：最终准确率、后向迁移、表示变化与短期稳定性缺口分别揭示不同失效。",
    "limits": "大量证据来自小模型与分类任务，迁移到生成式 LLM 时还要考虑开放式评价、上下文学习和对齐能力。",
    "research": "读后应建立指标字典：ACC、BWT、FWT、forgetting、general ability 与 locality，避免只报告最终平均分。",
    "route": "基础机制 / 综述"
  },
  "07-ewc": {
    "one": "EWC 用 Fisher 信息估计旧任务参数的重要性，并以加权二次惩罚限制后续更新，是参数正则化路线的经典起点。",
    "problem": "同一组网络权重顺序学习多个任务时，新任务梯度会覆盖旧任务所需参数。",
    "method": "训练完旧任务后估计对角 Fisher；新任务目标加入 λ/2·ΣF_i(θ_i−θ_i*)²，使重要权重更“僵硬”、不重要权重保持可塑。",
    "evidence": "论文在排列 MNIST 和 Atari 任务序列上展示了比朴素顺序训练更好的旧任务保持，说明参数重要性加权优于统一 L2 约束。",
    "limits": "对角 Fisher 是粗近似；每个任务要保存参数锚点/重要性，任务数增加后成本累积，且相互冲突的知识仍难兼容。",
    "research": "在 LLM 上可把 EWC 作为低成本基线，但需和 LoRA/子空间约束比较，并测试 Fisher 估计对层、数据量和任务顺序的敏感性。",
    "route": "正则化 / 基础方法"
  },
  "08-gem": {
    "one": "GEM 把旧样本记忆转成梯度不增旧任务损失的约束，并通过投影求得可行更新方向。",
    "problem": "简单 replay 仍可能产生伤害旧任务的梯度，需要把“不得变差”直接写进优化约束。",
    "method": "为每个旧任务保留 episodic memory，计算当前梯度与旧任务梯度；若违反内积约束，就解一个小型二次规划把梯度投影到可行锥。",
    "evidence": "在多任务顺序学习基准上，GEM兼顾最终性能、后向迁移与前向迁移，并把正迁移纳入持续学习目标。",
    "limits": "需要存旧数据、任务边界和多次梯度计算；大模型上每步投影与显存开销高，生成任务的损失约束也未必对应能力保持。",
    "research": "把 GEM 视为“显式约束 replay”基线；LLM 实验可研究梯度草图、低秩约束和隐私友好的代表样本。",
    "route": "重放 + 梯度约束 / 基础方法"
  },
  "09-lifelong-pretraining": {
    "one": "把语言模型预训练置于持续到来的语料流中，联合研究新语料适应、旧知识保持与跨域迁移。",
    "problem": "每当新领域或新时间段语料到达就从头训练代价过高，直接继续预训练又会使旧域困惑度和下游能力退化。",
    "method": "论文结合持续预训练目标、旧知识保持机制与跨阶段评估，比较顺序训练、数据重放和参数/表示约束。",
    "evidence": "实验说明持续预训练不能只看当前语料 loss：旧域保持与下游迁移会随数据顺序、混合比例和更新策略显著变化。",
    "limits": "早期实验模型与数据规模低于当代 LLM；网页时间流、去重污染和 optimizer state 等系统因素未被完全覆盖。",
    "research": "与 TiC-LM 和 re-warming 工作对照，分离数据混合、学习率/优化器状态和模型结构三类因素。",
    "route": "持续预训练 / 奠基"
  },
  "10-elle": {
    "one": "ELLE 通过函数保持式模型扩展与知识保持训练，让语言模型在新语料到来时增加容量而不破坏已有功能。",
    "problem": "固定容量模型长期吸收新分布会加剧干扰，而每阶段训练独立模型又无法共享知识。",
    "method": "在阶段边界扩展网络宽度/深度，并以保持原函数输出的初始化承接旧模型，再配合预训练与知识保持目标适应新语料。",
    "evidence": "在连续领域语料上，扩展式模型相对直接继续训练改善旧域保持与新域适应，展示动态容量的可行性。",
    "limits": "模型参数随阶段增长，部署和推理成本不再固定；扩展时机、规模与数据边界需要人为设定。",
    "research": "与 SCALE 对照：关注何处扩展、如何路由、是否冻结主干，以及长期任务流中容量是否最终耗尽。",
    "route": "动态架构 / 持续预训练"
  },
  "11-rewarm-your-model": {
    "one": "系统研究持续预训练阶段切换时学习率再升温与优化器状态复用，说明训练动态本身就是遗忘的重要来源。",
    "problem": "新数据到达时应重置学习率和 Adam 状态，还是沿用旧训练状态，并无可靠经验法则。",
    "method": "控制数据切换、学习率 re-warming 幅度和 optimizer state 复用，比较适应速度、稳定性与最终 loss。",
    "evidence": "结果表明简单地完全重置或直接沿用都可能次优；合适的再升温与状态处理能改善新分布适应且减少训练不稳定。",
    "limits": "结论依赖数据分布变化幅度、训练阶段长度和模型尺度，无法直接变成一个普适超参数。",
    "research": "任何 CPT 方法对比都应固定/报告 optimizer state 与 LR schedule，否则算法收益可能被训练配方混淆。",
    "route": "优化动态 / 持续预训练"
  },
  "12-investigating-continual-pretraining": {
    "one": "通过大规模受控实验拆解持续预训练中的数据重放、学习率、语料相似性和训练预算。",
    "problem": "已有方法常同时改变数据与优化配置，难以判断遗忘究竟来自分布漂移还是训练配方。",
    "method": "构造连续领域/时间语料，系统改变 replay 比例、数据顺序、模型与超参数，并同时测新域、旧域和通用能力。",
    "evidence": "论文显示少量旧数据混合通常很强，但最佳比例依赖新旧分布；持续训练的计算收益必须与从头训练和联合训练公平比较。",
    "limits": "受控实验仍难覆盖真实网页流中的质量漂移、重复数据与概念突变；最终结论不应外推到所有模型族。",
    "research": "把该文当作实验设计模板，优先复现数据/算力等预算基线，再评价更复杂的正则或架构方法。",
    "route": "实证研究 / 持续预训练"
  },
  "13-tic-lm": {
    "one": "TiC-LM 用 114 期 Common Crawl 构建网页级时间持续预训练基准，并证明元调度配合固定比例重放可显著省算力。",
    "problem": "旧 benchmark 太小且缺乏真实时间结构，无法回答网页知识更新与旧能力保持如何随年份演化。",
    "method": "按 Common Crawl dump 建立时间流，同时在通用网页与 Wikipedia、StackExchange、代码文档等特定域做时间分层评测。",
    "evidence": "在通用 CC 上，自回归 meta-schedule + fixed-ratio replay 达到与从头训练相当的 held-out loss，而计算量减少约 2.6 倍；特定域对 replay 的需求不同。",
    "limits": "网页 loss 不等同于事实更新或下游能力；Common Crawl 的噪声、去重和许可问题也会影响解释。",
    "research": "优先复现实验调度与 replay 曲线，再增加事实时效性、污染和能耗指标。",
    "route": "时间基准 / 持续预训练"
  },
  "14-stability-gap": {
    "one": "揭示持续预训练开始后性能先骤降再恢复的 stability gap，并用数据相关性与训练调度缩短这段危险窗口。",
    "problem": "只看训练结束会掩盖更新初期的临时能力崩塌，而在线部署往往无法容忍这种短期失稳。",
    "method": "跟踪训练过程而非仅最终 checkpoint，分析 epoch、数据相关性和分布切换，再设计预算受限的稳定更新策略。",
    "evidence": "论文报告在 OpenLLaMA-3B 医疗设置中，平均分可从 36.2 提升到 40.7，同时只使用约 40% 的预算，说明稳定性和效率可联合优化。",
    "limits": "稳定性缺口对模型、任务和评测采样频率敏感；平均分可能掩盖个别关键能力的短暂坍塌。",
    "research": "部署实验应画完整更新轨迹并设安全阈值；可结合权重插值、学习率控制和小规模 replay。",
    "route": "训练动态 / 稳定性"
  },
  "15-sparse-memory-finetuning": {
    "one": "只更新对新知识高度激活、但在预训练数据中较少使用的记忆槽，以稀疏参数写入降低知识覆盖。",
    "problem": "全量微调和 LoRA 都可能让新知识更新触碰大量承载旧能力的参数。",
    "method": "在 memory-layer 模型中用类似 TF-IDF 的相对激活分数选择 memory slots，只对少量目标槽执行微调。",
    "evidence": "在问答实验中，新知识学习相当时，论文摘要报告旧能力 F1 降幅约为：全量微调 89%、LoRA 71%、稀疏记忆微调 11%。",
    "limits": "依赖具备显式 memory layer 的架构；激活稀疏并不自动保证语义隔离，槽位容量与长期饱和仍待验证。",
    "research": "重点复核 TF-IDF 选槽稳定性、长期任务数扩展和不同问题改写下的知识泛化。",
    "route": "稀疏参数记忆 / 持续更新"
  },
  "16-scale": {
    "one": "SCALE 冻结原模型并按需扩展宽度，通过 Preserve、Adapt、Route 三个环节分配新容量。",
    "problem": "固定参数更新会干扰旧知识，而每任务独立模块造成无界增长和任务 ID 依赖。",
    "method": "主干负责 Preserve；新增宽度负责 Adapt；学习到的路由机制决定输入如何组合旧表示和新容量。",
    "evidence": "实验把扩展式持续学习与 replay、PEFT 和固定容量方法比较，显示可在保持旧能力的同时提高新任务可塑性。",
    "limits": "容量仍随任务流增长；路由错误和扩展策略会成为新的失效点，推理吞吐也需单独评估。",
    "research": "与 ELLE、专家混合和 adapter routing 比较时，统一报告每阶段新增参数、路由开销和任务 ID 假设。",
    "route": "模型扩展 / 路由"
  },
  "17-trace": {
    "one": "TRACE 把持续指令微调放到多种生成与推理任务序列中，并同时测试新任务学习、旧任务保持和通用能力。",
    "problem": "传统分类 benchmark 不能代表 LLM 指令跟随、推理和开放式生成中的遗忘。",
    "method": "构造 8 类任务的顺序学习协议，配套 LIMA replay 数据和 EWC、GEM、MbPA++、L2P、LFPT5、O-LoRA 等基线。",
    "evidence": "基准显示朴素顺序微调显著遗忘，经典 CL 方法在 LLM 生成任务上并不稳定；最终平均分必须和后向迁移、通用能力一起看。",
    "limits": "任务顺序和自动评价器会影响排名；训练/测试模板差异可能把提示敏感性误判为知识遗忘。",
    "research": "仓库已下载；先复现统一数据顺序和评测，再加入在线无任务边界及安全能力监控。",
    "route": "持续指令微调 / 基准"
  },
  "18-o-lora": {
    "one": "O-LoRA 为每个任务学习低秩更新，并约束新任务子空间与历史子空间正交，以减少参数更新干扰。",
    "problem": "普通 LoRA 虽参数高效，但不同阶段的低秩方向仍会重叠并覆盖旧任务。",
    "method": "在训练新 LoRA 时加入与既有低秩子空间的正交约束，冻结旧模块、无需重放旧数据。",
    "evidence": "在持续指令与分类任务上，O-LoRA 通常优于顺序 LoRA 和多种无重放基线，展示子空间隔离的有效性。",
    "limits": "严格正交会随任务数增加耗尽可用方向，也默认任务边界清楚；相似任务本可共享的正迁移可能被抑制。",
    "research": "重点看 rank、正交强度、任务顺序和长序列容量；ASO-LoRA 正是对“所有任务一律正交”的修正。",
    "route": "PEFT / 子空间隔离"
  },
  "19-conpet": {
    "one": "ConPET 用参数高效模块构建静态重放与动态路由两种持续学习方案，在效率和任务扩展之间取舍。",
    "problem": "为每个任务全量微调成本过高，而单一小模块会发生干扰；实际系统还可能无法在推理时获得任务 ID。",
    "method": "Static ConPET 将 PET 与动态 replay 结合；Dynamic ConPET 保存多个 PET 模块并训练选择器按输入路由。",
    "evidence": "论文报告可训练参数最多减少约 3000 倍，并在较小 benchmark 上取得至少约 5 个点提升，说明路由/重放组合具有较高性价比。",
    "limits": "Static 依赖旧数据，Dynamic 的模块数与路由复杂度随任务增长；选择器错误会直接造成能力错配。",
    "research": "分析仓库中的 selector、buffer 更新和模块增长；把参数量、存储量与推理延迟统一计入总成本。",
    "route": "PEFT + replay/路由"
  },
  "20-inscl": {
    "one": "InsCL 用指令层面的表示与样本组织提高持续微调的数据效率，尽量用少量历史信息保持旧任务。",
    "problem": "LLM 指令任务的数据格式和语义跨度大，随机 replay 往往冗余且无法代表旧任务边界。",
    "method": "利用 instruction 信息指导样本选择和持续训练，使有限缓存覆盖更有代表性的任务语义。",
    "evidence": "在多任务顺序指令设置中，方法相对朴素微调和常见 replay 提高最终平均表现并降低遗忘。",
    "limits": "收益依赖指令文本能否准确代表任务；开放式、隐式或高度相似的任务边界可能破坏选择质量。",
    "research": "复现时记录缓存预算、采样器和模板；补充语义相近任务、指令改写与无任务 ID 的鲁棒性测试。",
    "route": "数据高效 replay / 指令微调"
  },
  "21-sapt": {
    "one": "SAPT 以共享注意力同时服务参数高效学习和模块选择，让任务知识共享与输入路由相互协调。",
    "problem": "多模块 PEFT 方法常把“学什么”和“选哪个模块”分开优化，造成选择器与任务表示错位。",
    "method": "共享 attention 表示用于对齐任务学习与选择，配合小型参数模块在不同阶段保留专门能力。",
    "evidence": "在 T5/LLaMA2 的 770M 到 13B 尺度实验中，方法跨多个持续任务序列改善平均性能和遗忘。",
    "limits": "模块与路由仍会随任务增长；共享注意力若被新任务主导，也可能成为新的干扰通道。",
    "research": "关注规模效应、路由置信度和共享表示漂移；与 Dynamic ConPET 及专家混合做同预算比较。",
    "route": "共享注意力 / PEFT 路由"
  },
  "22-revisiting-catastrophic-forgetting": {
    "one": "重新审视 LLM 微调中的遗忘来源，强调任务语义、训练配方和评价方式会改变“遗忘严重”的结论。",
    "problem": "把下游分数下降一概归因于参数知识被抹除，可能混淆提示格式、输出偏好与真实能力丢失。",
    "method": "通过不同模型、任务顺序、微调设置和能力测试，对遗忘现象做受控比较与细粒度诊断。",
    "evidence": "实验显示遗忘具有明显异质性：不同任务/能力、模型尺度与训练阶段的变化并不同步。",
    "limits": "诊断仍依赖有限 benchmark；开放式生成的潜在能力很难由单一提示和自动指标充分测出。",
    "research": "在每个持续学习实验中加入多提示、多解码与表示探针，区分能力丢失、调用失败和行为对齐变化。",
    "route": "实证诊断 / 持续微调"
  },
  "23-online-cl-llms": {
    "one": "用代表性特征分布描述每个 PEFT 模块，并按输入相似度动态选择模块，实现避免旧任务信息泄漏的在线持续学习。",
    "problem": "许多“在线”方法仍在后续阶段访问旧任务数据、标签或统计，形成信息泄漏与隐私风险。",
    "method": "为已学习 PEFT block 保存 presentative feature distribution；新样本根据与这些分布的相似度选择/组合合适模块。",
    "evidence": "ICML 2025 实验表明，在不重新访问旧任务原始信息的限制下，该方法仍能保持有竞争力的持续学习表现。",
    "limits": "分布摘要本身也可能泄露信息；当表征随模型更新漂移时，早期统计会失准，模块数量仍可能增长。",
    "research": "把 privacy accounting、分布漂移和任务无边界流作为复现重点，而不只复跑最终准确率。",
    "route": "在线学习 / PEFT 选择"
  },
  "24-aso-lora": {
    "one": "ASO-LoRA 根据任务归因相似度自适应决定子空间分离程度，以软正交替代 O-LoRA 的一刀切约束。",
    "problem": "新旧任务相似时，强制完全正交会阻断正迁移；不相似时又确实需要隔离。",
    "method": "用 attribution 估计任务关系，再施加随相似度变化的 soft orthogonality，并设计无需推理任务标签的选择机制。",
    "evidence": "ACL 2026 实验显示其在多个任务序列上优于固定正交 LoRA，尤其能更好平衡共享与隔离。",
    "limits": "归因估计质量决定约束强度，计算成本和稳定性需要关注；相似度不等于梯度兼容性。",
    "research": "直接对照 O-LoRA，画任务相似度—子空间角度—BWT/FWT 三者关系，并测试错误归因的敏感性。",
    "route": "自适应 PEFT / 子空间"
  },
  "25-wise": {
    "one": "WISE 用主记忆、侧记忆、路由器和知识分片解决终身模型编辑中可靠性、泛化与局部性的“不可能三角”。",
    "problem": "直接改主模型易干扰旧知识，纯检索记忆又难把编辑泛化到改写问题。",
    "method": "冻结承载预训练知识的 main memory，只写 side memory；router 决定查询走哪条路径，并把连续编辑分散到不同参数子空间后再合并。",
    "evidence": "在问答、幻觉修正和 OOD 场景，跨 GPT、LLaMA、Mistral 骨干比较，论文报告同时改善 reliability、generalization 与 locality。",
    "limits": "路由错判会让正确编辑不可达或污染无关查询；长期分片、合并和侧记忆容量仍可能形成新冲突。",
    "research": "利用 EasyEdit 仓库检查 edit batch、router 阈值与 merge 规则；必须报告编辑长度扩展曲线而非只测短序列。",
    "route": "终身模型编辑 / 参数记忆"
  },
  "26-memoir": {
    "one": "MEMOIR 把新知识写入稀疏残差记忆，并用样本相关激活掩码检索相关编辑，减少连续编辑之间的覆盖。",
    "problem": "终身编辑需要扩展到成千上万次写入，同时保持改写泛化、无关输入局部性和旧编辑可靠性。",
    "method": "保留基础模型核心能力，在独立 residual memory 中学习编辑；稀疏掩码把不同样本分配到不同参数子集，推理时按激活模式匹配相关记忆。",
    "evidence": "在 LLaMA-3 与 Mistral 的问答、幻觉修正和 OOD 测试中，论文报告可扩展到数千次顺序编辑并保持较低遗忘。",
    "limits": "稀疏哈希可能碰撞，记忆容量和检索阈值会影响长期行为；基础模型真正更新与外接记忆之间的界线仍需审视。",
    "research": "与 WISE 对照 side memory 的路由粒度、参数增长、编辑吞吐和错误恢复；测试冲突编辑与撤销编辑。",
    "route": "终身模型编辑 / 残差记忆"
  },
  "27-lifelong-agent-bench": {
    "one": "在数据库、操作系统和知识图谱环境中评估跨会话经验积累，显示“保存全部历史”并不能自然带来 lifelong agent。",
    "problem": "现有 agent benchmark 多按独立 episode 评分，无法观察经验是否被长期保留、迁移或错误累积。",
    "method": "构造连续交互任务，让 agent 跨阶段复用经验，并比较不同记忆、replay 和自一致性策略。",
    "evidence": "实验发现 replay 易被无关历史和上下文长度拖累；group self-consistency 等筛选策略能更稳地提炼可复用经验。",
    "limits": "三个工具环境仍是受控代理任务；外部 API 变化、多人协作和真实长期安全风险尚未覆盖。",
    "research": "把记忆质量分成写入、压缩、检索、验证四步评估，并记录 token/延迟成本与负迁移。",
    "route": "智能体 / 终身学习基准"
  },
  "28-cl-bench": {
    "one": "用六类真实应用任务检验 LLM agent 的持续学习，结果提醒复杂记忆系统并不一定胜过简单的 in-context baseline。",
    "problem": "智能体持续学习方法常在玩具环境或短序列上验证，缺乏跨真实专业领域和长期阶段的统一比较。",
    "method": "覆盖软件工程、信号处理、疾病预测、数据库、策略游戏和需求预测，比较上下文、记忆与专用持续学习系统。",
    "evidence": "论文报告朴素 ICL 在若干设置中超过专门记忆系统，说明记忆写入/检索噪声可能抵消所谓长期学习收益。",
    "limits": "2026 预印本结果仍需独立复现；领域任务的 verifier、工具稳定性和上下文预算会显著影响排名。",
    "research": "将其作为“简单 baseline 优先”的提醒：任何新记忆方法都必须超过等 token 的检索/上下文基线。",
    "route": "智能体 / 真实任务基准"
  },
  "29-skilllearnbench": {
    "one": "SkillLearnBench 用 20 个可验证任务、15 个子领域评估 agent 是否能从反馈中持续形成和迁移技能。",
    "problem": "记住事实不等于获得技能；技能学习还要经历试错、反馈、抽象、组合与跨任务迁移。",
    "method": "任务配有可执行 verifier，按连续顺序考察 self-feedback、external feedback 和不同技能记忆策略。",
    "evidence": "没有一种方法在所有设置都获胜；自反馈可能造成策略漂移，外部可验证反馈通常更可靠。",
    "limits": "可验证任务偏向能自动判分的技能；开放式社交、科学发现和长期协作难以由同类 verifier 覆盖。",
    "research": "仓库已下载；优先分析任务生成、验证器和 contamination，随后研究技能表示是否可组合、可撤销。",
    "route": "智能体 / 技能学习基准"
  },
  "30-lifeskill": {
    "one": "LifeSkill 以 verifier 引导技能提炼，再把在线成功经验内化为可复用能力，连接外部记忆与参数学习。",
    "problem": "只存轨迹会让上下文膨胀且检索脆弱，只改模型又昂贵并可能遗忘，需要选择性内化。",
    "method": "从交互和验证反馈中学习显式技能，在线选择/修订技能，并在合适时把经验 internalize 到模型或更紧凑表示。",
    "evidence": "论文报告在 LifelongAgentBench 上获得约 7 个绝对百分点提升，显示 verifier-guided skill learning 的收益。",
    "limits": "高度依赖 verifier 的覆盖和正确性；错误技能若被内化会比普通记忆污染更难清除。",
    "research": "重点测试错误反馈、分布外任务、技能冲突与回滚；同时区分即时上下文收益和真正跨会话学习。",
    "route": "智能体 / 技能内化"
  },
  "31-nested-learning": {
    "one": "Nested Learning 把架构与优化统一看成不同更新频率的嵌套优化问题，并用 continuum memory 与 Hope 探索多时间尺度学习。",
    "problem": "把网络结构和外部优化器割裂，会忽略模型内部各组件本可具有不同 context flow 与更新速率。",
    "method": "将反向传播、注意力和优化器解释为关联记忆；按更新频率组织层级，提出 deep optimizers、continuum memory system 和自修改 Hope 架构。",
    "evidence": "论文在语言建模、常识、长上下文 NIAH 与知识吸收任务中比较 Hope、Titans、Samba、Transformer 等，报告更低困惑度和更强长程记忆。",
    "limits": "这是宏大新范式与 proof-of-concept 的组合；“避免遗忘”的机制解释和规模化训练成本仍需大量独立验证。",
    "research": "先复现最小 deep optimizer/CMS 消融，再验证不同更新频率是否真对应可分离的记忆时间尺度。",
    "route": "新范式 / 多时间尺度记忆"
  },
  "32-seal": {
    "one": "SEAL 让模型生成自己的更新数据和训练指令，并用更新后性能作为强化学习奖励，形成可学习的 self-edit 策略。",
    "problem": "普通模型只能在上下文内适应，参数更新又依赖外部工程师准备数据与训练配方。",
    "method": "模型根据输入生成 self-edit（合成数据、重写、学习目标等），执行小规模更新，再以更新后的任务表现训练 self-edit 生成策略。",
    "evidence": "实验展示模型能学会产生更有效的自我更新方案，在知识吸收和少样本适应任务上超过手工或无学习的更新基线。",
    "limits": "外循环计算昂贵，奖励易被投机；错误自编辑、数据污染和能力退化需要沙箱、验证与回滚。",
    "research": "把 SEAL 与 LifeSkill 对照：一个学习参数自编辑策略，一个强调 verifier 驱动技能；可研究二者的安全组合。",
    "route": "自适应模型 / 自编辑"
  },
  "33-learning-fast-and-slow": {
    "one": "将上下文中的快速权重与模型参数中的慢速权重联合优化，用两种时间尺度兼顾即时适应和长期稳定。",
    "problem": "纯 in-context learning 不会永久积累，纯 RL/微调更新慢且会引起较大策略漂移。",
    "method": "快速通道优化 context/fast weights，慢速通道更新 model weights，并用统一目标协调短期任务收益与长期分布约束。",
    "evidence": "论文报告相对仅用 RL 的方案最高约 3 倍样本效率，并将 KL 漂移最多降低约 70%。",
    "limits": "双层优化增加实现和调参复杂度；KL 较小不必然表示知识保留，长期任务冲突仍需专门测量。",
    "research": "复现实验时分离 fast-only、slow-only 与联合方案，并检查收益是否来自更多在线计算或隐式数据重用。",
    "route": "快慢学习 / 在线适应"
  },
  "34-knowledge-circuits": {
    "one": "追踪新知识在 Transformer 内部形成、优化并由深层向浅层重组的电路动态，为持续学习提供机制层诊断。",
    "problem": "只看输出分数无法解释模型在何处写入新知识、何时开始泛化，以及为何与旧知识发生干扰。",
    "method": "通过知识定位、因果干预和训练轨迹分析，观察知识电路随学习阶段和已有知识相关性如何变化。",
    "evidence": "论文发现知识获取依赖其与先验知识的相关性，过程呈现 formation → optimization 的阶段转变，并出现 deep-to-shallow 演化。",
    "limits": "电路定义和定位工具存在方法依赖；机制观察多为相关/局部因果证据，未必能直接转化为高效训练算法。",
    "research": "把电路指标加入 CPT/编辑实验，检验稀疏更新或子空间方法是否真的减少旧知识电路干扰。",
    "route": "机制解释 / 知识电路"
  },
  "35-fast-weights": {
    "one": "在激活与慢权重之间加入快速衰减的关联记忆矩阵，以近期隐藏状态外积实现序列内快速绑定。",
    "problem": "RNN 隐藏向量容量有限，慢权重又无法在单个序列中快速变化，缺少中间时间尺度的可塑状态。",
    "method": "按 A_t=λA_{t-1}+ηh_th_t^T 写入 fast-weight matrix，并通过迭代、归一化读取；展开后等价于受时间衰减约束的点积注意。",
    "evidence": "关联检索任务中显著优于同规模 LSTM/IRNN，并在视觉序列与 Catch 控制任务上展示收益。",
    "limits": "固定外积和指数衰减无法按价值选择记忆，O(H²) 状态昂贵，且实验只覆盖序列内短期记忆。",
    "research": "在等状态字节与 FLOPs 下对比线性注意力、TTT 与外部记忆，并增加冲突、噪声和 A→B→A 恢复测试。",
    "route": "快速神经状态 / 关联记忆"
  },
  "36-ttt-layers": {
    "one": "把序列层的隐藏状态变成一个可训练模型，在每个 token 到来时用自监督目标更新其权重。",
    "problem": "Attention 长上下文成本二次增长，普通 RNN/SSM 的固定向量状态又难以保留复杂历史。",
    "method": "TTT-Linear/MLP 以内部模型参数作为状态，执行 W_t=W_{t-1}-η∇ℓ(W;x_t)，再从更新后的模型读取输出；用 mini-batch 与 dual form 并行化。",
    "evidence": "125M–1.3B 实验显示 TTT 能随 8k–32k 上下文继续降低困惑度，部分线性基线在更长上下文趋于饱和。",
    "limits": "固定状态仍是有损压缩，辅助目标可能错位，测试时梯度更新增加串行、I/O 与状态污染风险。",
    "research": "除 perplexity 外测真实吞吐、HBM 流量、状态恢复和对抗污染；严格区分会话级适应与跨会话持续学习。",
    "route": "测试时训练 / 模型化隐藏状态"
  },
  "37-titans": {
    "one": "用测试时可训练的神经网络充当长期记忆，以梯度惊奇度、动量和遗忘控制写入，并与局部注意力协同。",
    "problem": "Attention 保存历史精确但成本随长度增长，递推模型高效却被固定容量压缩限制。",
    "method": "记忆网络根据 key 重构 value，用损失梯度表示 surprise，加入 momentum 与 weight decay；提出 MAC、MAG、MAL 三种与注意力组合方式。",
    "evidence": "语言、常识、S-NIAH、BABILong、时间序列和基因组任务中，MAC 在作者设置下表现最强，并报告百万级上下文结果。",
    "limits": "惊奇不等于价值，分布式神经记忆难精确删除和追踪来源，超长检索 benchmark 不能证明跨会话知识稳定。",
    "research": "做跨用户持久状态红队与等字节 KV/RAG/TTT 对照，测隐私删除、恶意新奇输入、版本冲突和回滚。",
    "route": "神经长期记忆 / 测试时学习"
  },
  "38-memos": {
    "one": "把参数、激活和明文三类记忆统一为可治理的一等资源，由 Memory Cube、调度器和生命周期层管理。",
    "problem": "LLM 记忆散落在权重、KV、向量库和日志中，缺少统一来源、权限、版本、迁移和删除协议。",
    "method": "MemCube 同时携带 payload 与 provenance、owner、lifetime、priority、version 等元数据；MemScheduler/Lifecycle/Operator 执行路由、转换、冻结和回滚。",
    "evidence": "论文主要提供架构分类、组件设计与场景推演，没有可与算法论文同级比较的公开端到端 benchmark。",
    "limits": "参数记忆难细粒度可逆，activation 难跨模型迁移；统一控制面可能成为单点故障，未来记忆市场仍偏愿景。",
    "research": "用外部条目、会话状态和 LoRA 做最小原型，对错误写入、用户删除、模型升级与跨租户访问做故障注入。",
    "route": "记忆操作系统 / 生命周期治理"
  },
  "39-language-models-need-sleep": {
    "one": "将在线服务的清醒期与离线巩固的睡眠期分开，通过 Knowledge Seeding 和 Dreaming 把快经验迁移到慢层。",
    "problem": "上下文经验会消失，而对每条经验即时改慢参数成本高、风险大，缺少可验证的离线维护周期。",
    "method": "Knowledge Seeding 用广义蒸馏/RL 把小而快组件知识向上迁移；Dreaming 由内部专家生成合成课程并通过 ReSTEM/RL 训练。",
    "evidence": "报告 class-incremental、持续翻译、BABILong 和推理任务收益，包括长达 10M 的合成长程任务与约 80% held-out 成功率。",
    "limits": "额外 sleep compute、参数激活和自生成数据都可能解释收益；同源生成—评价会放大幻觉、偏见和恶意注入。",
    "research": "运行数百 wake/sleep 周期，混入漂移、冲突和攻击；用独立验证器审计每次提交并记录回滚与总算力。",
    "route": "离线巩固 / 自生成重放"
  },
  "40-complementary-learning-systems": {
    "one": "快速记忆向慢系统回放并非越多越好；进一步巩固开始拟合不可预测噪声时应停止，以保护未来泛化。",
    "problem": "无限 replay 可以降低训练误差，却会把具体样本噪声写入慢系统，损害未见数据表现。",
    "method": "teacher–student–notebook 理论框架中，notebook 快速记样本、student 慢学规律；Go-CLS 在 generalization error 最优点附近停止巩固。",
    "evidence": "解析与模拟展示收益依赖信噪比和样本/维度比，尤其在插值与 double-descent 敏感区可明显优于无限巩固。",
    "limits": "teacher 和网络高度简化，真实系统无法直接看到未来泛化误差，具体生物停止机制也未确定。",
    "research": "在 LLM 中构造可控 signal/noise 与概念漂移流，比较无限 replay、固定预算、验证早停和价值加权早停。",
    "route": "互补学习系统 / 泛化驱动巩固"
  },
  "41-meta-learned-plasticity": {
    "one": "从局部候选项中元学习一个稀疏、全网络共享的可塑性规则，使固定随机反馈网络能在线学习。",
    "problem": "随机反馈对齐避免反向权重对称，却在深层和在线低数据学习中速度慢、性能弱。",
    "method": "将 10 个局部候选项线性组合，外层跨 episode 优化共享系数并施加 L1；内层每次随机初始化、batch size 1 学习 250 个样本。",
    "evidence": "MNIST/EMNIST/Fashion-MNIST 等实验中，规则池显著改善随机反馈，最终主要保留伪梯度、误差 Hebbian 和 Oja 三类项。",
    "limits": "外层仍用反向传播，候选基底由人定义，证据来自浅层小数据分类，尚未验证 Transformer 与长期非平稳流。",
    "research": "先在小型 adapter/recurrent memory 上迁移，并测试跨任务、跨架构稳定、数值发散和对抗输入。",
    "route": "元可塑性 / 学习更新规则"
  }
}
