Best AI Papers Explained:Continual Learning via Sparse Memory Finetuning
- 播放:Apple Podcasts
- 日期:2025-10-26
- 时长:14 分钟
- 论文:
../../papers/02-continual-pretraining/15-sparse-memory-finetuning.pdf
节目简介
节目介绍 Meta 与 Berkeley 的 sparse memory finetuning:在具备 memory layer 的模型里,不更新全部参数,而是选择那些对新知识高激活、相对预训练数据较少使用的 memory slots。选择分数采用类似 TF-IDF 的思想。
官方简介强调,在问答任务上,这种稀疏写入能学习新知识,同时比 full finetuning 和 LoRA 少遗忘旧能力。
听后应回论文核对
- memory slot 的定义与模型架构依赖;
- TF-IDF 激活分数怎样计算、需要多少预训练参考数据;
- 论文中“遗忘减少”的 F1 口径和测试集;
- 长期写入后槽位是否碰撞、饱和或失去稀疏性。
这集适合先听概念,再转到本地论文精读笔记核对数字和实验假设。