Apple:TiC-LM — Web-Scale Time-Continual Pretraining
- 原文:Apple Machine Learning Research
- 论文:
../../papers/02-continual-pretraining/13-tic-lm.pdf - 代码:
../../github-repos/ml-tic-lm/ - 发布:2025 年 6 月;ACL 2025 oral
核心内容
静态网页预训练会让模型随时间过时。TiC-LM 从 114 期 Common Crawl dump 构造真实时间顺序的数据流,并把评测分成两层:
- 通用网页分布:检验总体语言建模和旧知识保持;
- 特定领域:Wikipedia、StackExchange 与代码文档,用来观察新知识适应。
最重要的结果是:在通用 Common Crawl 上,自回归 meta-schedule 配合固定比例旧数据 replay,能达到接近从头重训的 held-out loss,而计算量约少 2.6 倍。不过 replay 并非处处同样重要;在特定领域上,最佳新旧数据比例会改变。
为什么值得细读
这篇工作把“持续学习是否有效”落回了实际训练系统:数据按时间到达、训练预算有限、旧网页数量远大于新数据。它也是校验各种新方法的好基线——如果复杂方法无法超过合理的数据混合和调度,就很难证明机制本身有价值。
带着问题读
- 语言模型 loss 的保持,是否等于事实时效性与下游能力保持?
- 114 期数据如何去重、过滤和避免评测污染?
- 固定 replay 比例能否由分布漂移或梯度冲突动态决定?
- 2.6× 的口径是 token、FLOPs、wall-clock 还是完整工程成本?