Eye on AI #241:Patrick Pilarski — The Alberta Plan
- 节目页:Eye on AI / Libsyn
- Apple Podcasts:播放入口
- 日期:2025-03-07
- 相关论文:The Alberta Plan for AI Research
节目主线
Alberta Plan 关注长期存在于复杂世界中的计算智能体:它通过行动影响感知输入,以奖励驱动选择,持续学习以适应变化,并用学到的世界模型进行规划。节目把这一研究观与当代一次性预训练模型对比。
官方时间轴中的持续学习重点:
- 05:49:Alberta Plan 的核心原则;
- 07:46:经验驱动学习;
- 18:26:持续学习与避免灾难性遗忘;
- 27:56:预测模型与类人学习;
- 40:16:持续学习的未来;
- 44:33:义肢中的人机共同适应。
为什么和 LLM 研究相关
它提醒我们,持续学习不应只是一串静态 NLP 数据集。更完整的问题是:agent 在连续感知—行动—奖励环路中,如何形成可预测、可控制、会迁移的长期知识。
收听问题
- 语言模型预训练知识在 Alberta Plan 中扮演先验、世界模型还是工具?
- 实时更新怎样避免早期错误永久塑造 agent?
- reward、prediction error 与人类反馈如何在长时间尺度上组合?