paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Learning to Reason for Long-Form Story Generation" authors: Alexander Gurung, Mirella Lapata year: 2025 source: COLM 2025; arXiv:2503.22828v2 pdf: 39_learning_to_reason_ncp.pdf
Learning to Reason:用真实下一章的似然提升训练故事规划
一句话总结:论文提出 Next-Chapter Prediction(NCP)和 VR-CLI 奖励,让规划模型生成的详细计划若能降低真实下一章在冻结生成器下的 perplexity 就获奖,再以 GRPO 学习;7B 模型的人评明显改善,但数据只有 30 本受版权保护的新书、评审一致性偏低,3B 收益很弱,奖励也天然偏向复现原作而非开放式创作。
TL;DR
- 【论文报告】NCP 输入全书高层 sketch、此前故事摘要、三名主角 character sheets 和下一章短 synopsis,输出详细章节计划,再由冻结生成器写下一章。
- 【论文报告】VR-CLI 不需要人工偏好标签:比较有/无该计划时冻结生成器对真实下一章的 per-token perplexity,按改善幅度给 0/0.5/0.9/1 奖励。
- 【论文报告】Qwen2.5-7B 的 RL-Trained 相对 Base,Overall Bradley–Terry 偏好概率为 76.5%;相对未训练 reasoning 为 64.7%,相对 SFT 为 90.0%。
- 【阅读者推断】这是“可验证代理奖励”的聪明实例,但可验证的是对既有章节的重构能力,不是原创性、作者意图或完整小说质量。
数据与任务
【论文报告】作者购买并收集 30 本 2024 年及以后出版的书,以减轻模型记忆泄漏;每本约 67k–214k tokens,均值 139k。按书和作者切为 22/4/4 本训练、验证、测试,经章节位置与 200–5,000 词长度过滤,得到 1,004/162/181 个数据点(§4)。
【论文报告】章节摘要来自 SuperSummary;Llama 3.3 70B 进一步生成全书 sketch、此前故事摘要和三位主角的 character sheets。下一章 synopsis 平均为真实下一章 token 数的 7.4%。
【阅读者推断】按书切分避免同一本书章节泄漏,但高层 sketch 是由全书所有章节摘要生成,包含未来情节;因此任务更像“已知全局故事路线时细化下一章”,不是在线作者从未知未来做开放规划。
VR-CLI 奖励
【论文报告】给定故事信息 x、真实下一章 y 和规划 a,改进量为:
正值表示计划让冻结生成器更容易生成真实章节。NCP 实验使用阈值奖励:I<0.05 得 0;0.05–1 得 0.5;1–2 得 0.9;I≥2 得 1(式 4、7)。
【论文报告】policy 与 generator 使用 Qwen2.5 3B/7B-Instruct-1M;generator 冻结,policy 用 GRPO 更新。初始 7B reasoning 的平均 improvement 为 −0.06%,说明未训练推理并不会自然提供有效计划。
Story Information x
→ policy 采样多条 reasoning + 详细计划 a
→ 冻结 generator 计算真实下一章 y 的 PPL 改善
→ 组内归一化奖励 + KL 约束训练 policy
→ 测试时只保留 policy 计划 → generator 生成新章节
对照与人评
【论文报告】四种设置为 Base(无计划)、Base-Reasoning(未训练计划)、SFT(直接微调章节生成器)和 RL-Trained(VR-CLI + GRPO 训练计划器)。测试集每本随机取 5 个章节位置。
【论文报告】Prolific 评审的第一语言为英语、职业属于 creative writing;评价 plot、character、creativity、development、language 和 overall。每个 variant comparison 只有 20 个数据点且正式阶段每点 1 个判断;初始一致性校准另用 20 对、每对 3 人。
| 7B 比较(A-B) | Plot | Creativity | Language | Overall |
|---|---|---|---|---|
| RL-Trained – Base | 52.9 | 81.2 | 80.0 | 76.5 |
| RL-Trained – Base-Reasoning | 62.5 | 70.6 | 58.8 | 64.7 |
| RL-Trained – SFT | 89.5 | 84.2 | 88.9 | 90.0 |
【论文报告】表中是 Bradley–Terry 偏好概率,不是包含 tie 的原始胜率;附录中 RL–Base 的原始 Overall 胜率为 65%。SFT 出现重复/模式崩溃,作者用规则截断后仍表现最差。
证据边界与零结果
- 【论文报告】perplexity improvement 与人类总体判断的 Spearman 相关为 ρ=.33,p=.01,N=60:方向一致但只属中等相关。
- 【论文报告】一致性校准的 Fleiss’ kappa 为 .060–.218;language 最低 .060,overall .210,说明维度判断噪声不小。
- 【论文报告】3B 的 RL-Trained 相对 Base Overall 偏好概率仅 52.9%;creativity 和 language 还偏向 Base-Reasoning。收益不能简单外推到更小模型。
- 【论文报告】分体裁样本每格最低只有 5 个;“科幻提升最大”是探索性异质性结果,而非稳健体裁定律。
- 【论文报告】作者购买的书、派生数据和模型因版权不能公开,只承诺发布代码。
局限与适用边界
【阅读者推断】奖励偏好能预测原作的计划,可能鼓励保守复现和 synopsis 拷贝。表 10 确实显示训练后 reasoning 与 story information 的 Rouge-L overlap 较高,但论文没有直接测量情节新颖性相对奖励的变化。
【阅读者推断】奖励训练时必须看到真实下一章并计算 token likelihood,部署时却没有真实续写;它是离线学习信号,不是生成时可直接使用的质量验证器。
【阅读者推断】只有 30 本书与 1,004 个训练章节,SFT 的崩溃更可能说明小数据直接微调失败,不足以证明 RL 一般性优于大规模 SFT。
阅读者判断
VR-CLI 提供了比 LLM-as-a-judge 更可复算的训练信号,最适合学习“如何把给定全局路线细化成可生成的章节计划”。它不应被描述成免标注的通用创意奖励:人类书籍与摘要本身就是昂贵监督,且目标偏向复现。可将其作为规划预训练,再用独立的原创性与长程一致性评价做二阶段校准。
关键原文定位
- NCP 定义与 Story Information:§3–4,表 1,PDF pp.4–5。
- 数据规模与切分:§4.2,PDF p.5;Appendix A,PDF pp.19–22。
- VR-CLI 公式与假设:§5–6,式 4–7,PDF pp.5–7。
- 模型与人评协议:§7,PDF pp.7–8。
- 主结果与零结果:§8,表 2–4,PDF pp.9–10。
- 版权与发布限制:Ethics Statement,PDF pp.10–11。
- 人评成本、一致性与相关:Appendix C–D,表 12,PDF pp.24–26。