AI_writing/pdfs/39_learning_to_reason_ncp_精读.md

paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Learning to Reason for Long-Form Story Generation" authors: Alexander Gurung, Mirella Lapata year: 2025 source: COLM 2025; arXiv:2503.22828v2 pdf: 39_learning_to_reason_ncp.pdf

Learning to Reason:用真实下一章的似然提升训练故事规划

一句话总结:论文提出 Next-Chapter Prediction(NCP)和 VR-CLI 奖励,让规划模型生成的详细计划若能降低真实下一章在冻结生成器下的 perplexity 就获奖,再以 GRPO 学习;7B 模型的人评明显改善,但数据只有 30 本受版权保护的新书、评审一致性偏低,3B 收益很弱,奖励也天然偏向复现原作而非开放式创作。

TL;DR

数据与任务

【论文报告】作者购买并收集 30 本 2024 年及以后出版的书,以减轻模型记忆泄漏;每本约 67k–214k tokens,均值 139k。按书和作者切为 22/4/4 本训练、验证、测试,经章节位置与 200–5,000 词长度过滤,得到 1,004/162/181 个数据点(§4)。

【论文报告】章节摘要来自 SuperSummary;Llama 3.3 70B 进一步生成全书 sketch、此前故事摘要和三位主角的 character sheets。下一章 synopsis 平均为真实下一章 token 数的 7.4%。

【阅读者推断】按书切分避免同一本书章节泄漏,但高层 sketch 是由全书所有章节摘要生成,包含未来情节;因此任务更像“已知全局故事路线时细化下一章”,不是在线作者从未知未来做开放规划。

VR-CLI 奖励

【论文报告】给定故事信息 x、真实下一章 y 和规划 a,改进量为:

\[ I(x,y,a)=\left(1-\frac{PPL(y\mid x,a)}{PPL(y\mid x)}\right)\times100 \]

正值表示计划让冻结生成器更容易生成真实章节。NCP 实验使用阈值奖励:I<0.05 得 0;0.05–1 得 0.5;1–2 得 0.9;I≥2 得 1(式 4、7)。

【论文报告】policy 与 generator 使用 Qwen2.5 3B/7B-Instruct-1M;generator 冻结,policy 用 GRPO 更新。初始 7B reasoning 的平均 improvement 为 −0.06%,说明未训练推理并不会自然提供有效计划。

Story Information x
→ policy 采样多条 reasoning + 详细计划 a
→ 冻结 generator 计算真实下一章 y 的 PPL 改善
→ 组内归一化奖励 + KL 约束训练 policy
→ 测试时只保留 policy 计划 → generator 生成新章节

对照与人评

【论文报告】四种设置为 Base(无计划)、Base-Reasoning(未训练计划)、SFT(直接微调章节生成器)和 RL-Trained(VR-CLI + GRPO 训练计划器)。测试集每本随机取 5 个章节位置。

【论文报告】Prolific 评审的第一语言为英语、职业属于 creative writing;评价 plot、character、creativity、development、language 和 overall。每个 variant comparison 只有 20 个数据点且正式阶段每点 1 个判断;初始一致性校准另用 20 对、每对 3 人。

7B 比较(A-B) Plot Creativity Language Overall
RL-Trained – Base 52.9 81.2 80.0 76.5
RL-Trained – Base-Reasoning 62.5 70.6 58.8 64.7
RL-Trained – SFT 89.5 84.2 88.9 90.0

【论文报告】表中是 Bradley–Terry 偏好概率,不是包含 tie 的原始胜率;附录中 RL–Base 的原始 Overall 胜率为 65%。SFT 出现重复/模式崩溃,作者用规则截断后仍表现最差。

证据边界与零结果

局限与适用边界

【阅读者推断】奖励偏好能预测原作的计划,可能鼓励保守复现和 synopsis 拷贝。表 10 确实显示训练后 reasoning 与 story information 的 Rouge-L overlap 较高,但论文没有直接测量情节新颖性相对奖励的变化。

【阅读者推断】奖励训练时必须看到真实下一章并计算 token likelihood,部署时却没有真实续写;它是离线学习信号,不是生成时可直接使用的质量验证器。

【阅读者推断】只有 30 本书与 1,004 个训练章节,SFT 的崩溃更可能说明小数据直接微调失败,不足以证明 RL 一般性优于大规模 SFT。

阅读者判断

VR-CLI 提供了比 LLM-as-a-judge 更可复算的训练信号,最适合学习“如何把给定全局路线细化成可生成的章节计划”。它不应被描述成免标注的通用创意奖励:人类书籍与摘要本身就是昂贵监督,且目标偏向复现。可将其作为规划预训练,再用独立的原创性与长程一致性评价做二阶段校准。

关键原文定位