paper_type: 方法与系统, Benchmark 与数据集, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Towards Human-Level Book-Writing Capability" authors: Jan Zierstek, Matteo Batelic, Maya Medjad, Tim Schönenberger year: 2026 source: arXiv:2605.17064v2 pdf: 05_book_writing_capability.pdf tags: [论文精读, 长篇生成, 创意写作, Planning Scaffold, LongPage, PageStorm, 规则化评测] related: [[03_dome]], [[09_longwriter]], [[17_spoiler_alert]], [[19_storyalign]], [[21_narrative_flattening]]
PageStorm:把公版书反演成规划轨迹,再训练 14B 模型逐层写回正文
一句话答案:论文从约 6,000 本 Gutenberg 公版书反演出“用户提示—多层规划脚手架—原书正文”轨迹,用 Ministral 3 14B Base 做长上下文 SFT;模型在 360 个提示的七项首章叙事诊断上全部超过 GPT‑5.5,并在与 GPT‑5.5、Claude Opus 4.8 的主比较中赢得 4/7 项,但这些是 Gemma 4 抽取后由规则计算的首章通过率,不等于人类确认的整本书文学质量,且模型在后续规划遵从和完整长书生成上仍明显失稳。
核心问题:创意写作不等于助手任务
问题入口。作者认为通用助手后训练鼓励诚实、直接回答和消除歧义,而小说需要虚构、隐瞒、道德暧昧、不可靠叙述和延迟揭示。由此产生的核心假设不是“base 模型天然会写小说”,而是:以人类小说正文为最终监督目标、显式监督从提示到长书的规划过程,可能比在 instruct 模型上继续提示更贴近文学文本分布。(作者主张,Abstract、§1、§3.1)
这项工作要回答两个不同问题:能否从成书恢复可学习的规划轨迹,以及模型学到这条轨迹后是否真的改善新题材的叙事行为? 前者由 LongPage 数据管线和训练系统回答,后者由首章诊断、脚手架遵从与解释性分析回答。
先给结论
- 数据与训练。LongPage 含约 6,000 本 Gutenberg 公版书;管线从场景、章节到全书逐级压缩,再生成多样化合成提示。训练时方向反转,Ministral 3 14B Base 从提示生成 scaffold,最后预测原始人类正文。(论文报告,§2–§3)
- 首章结果。模型在七项规则诊断上均高于 GPT‑5.5;与 GPT‑5.5、Claude Opus 4.8 两个主基线相比有 4/7 项最高。若把附录中的 DeepSeek V4 Pro、GLM‑5.1、Kimi K2.6 也计入,则实际只有 blocked goal、unresolved mystery、locally motivated exposition 三项最高。(论文报告,§4.2,图 4、表 2;阅读者分析)
- 最显著差异。“Mystery remains unresolved”通过率为 32.3%,GPT‑5.5 为 7.2%,Claude Opus 4.8 为 6.4%;但 32.3% 仍意味着约三分之二样本没有通过该规则。(论文报告,§4.2、Appendix B,表 2;阅读者分析)
- 主要失败。原创新作从 prompt 到 preview 的遵从为 93.7%,preview 到 book plan 降至 54.2%,book plan 到首章正文仅 39.2%;fanfiction 对应为 86.0%、28.1%、31.1%。完整长生成还会进入不可恢复的重复循环。(论文报告,§4.3、Conclusion and Limitations,表 1)
LongPage 如何把“书”改造成训练样本
语料来源。第一阶段取 Gutenberg 下载量最高的 300 本书,用 Qwen3-32B 推理模型完成全流程标注;第二阶段再加入 5,700 本,并用第一阶段数据蒸馏出的 Qwen3-14B 工具模型处理高频的场景级、章节级步骤,高层摘要与元数据仍由 Qwen3-32B 生成。(论文报告,§2.1–§2.2)
层级压缩。场景层记录局部事件、人物焦点、叙述视角和叙事功能;章节层连接场景并保留信息分布与节奏;全书层再压缩为全局结构。中间摘要采用多条短 bullet,典型长度 10–20 词、上限 45 词,目标是保留可组合事实而非写出漂亮摘要。(论文报告,§2.3、图 1)
提示生成。Structured Guide Sampling 先采样提示长度、措辞、结构、细节度和表面噪声,再让模型依据全书表示合成请求;目标分布约为 30% 短提示、60% 中等提示、10% 长结构化提示。这样可以减少合成提示都长得一样,但不能保证它等同真实用户分布。(论文报告,§2.3.4;阅读者分析)
数据规模。按 Llama 3 tokenizer,6,000 条完整轨迹共 649.1M tokens;平均每条 106,940 tokens,中位数 88,983。全语料中正文占 60.43%,planning scaffold 占 39.35%,合成 prompt 仅占 0.23%,说明训练的大量容量用于学习中间结构。(论文报告,§2.3.5、图 2)
模型怎样学习并执行这条轨迹
基座选择。作者从 Ministral 3 14B Base 移除视觉编码器,只训练语言模型。论文把 base 选择解释为减少助手式诚实、解释和直接解决问题的先验;不过 SFT 后模型仍在指令模板下取得约 50% GSM8K 准确率,作者据此怀疑 base checkpoint 仍含指令式数据。这是作者的机制解释,不是与同架构 instruct 起点的受控对比。(论文报告,§3.1;阅读者分析)
训练表示。每个样本是一条序列:用户提示、全书规划、尽早生成的第一章规划与正文、之后重复的章节规划—场景拆分—章节正文。Early First Chapter 让系统在昂贵的后续生成前先检查第一章,差样本可以早停;它是一项运行时质控设计,不是论文中被单独消融验证的质量机制。(论文报告,§3.2、图 3;阅读者分析)
训练系统。模型以标准自回归交叉熵做 SFT,只 mask 初始 prompt,后续 scaffold 与正文 token 都计算损失;最大训练长度 262,144 tokens。训练使用 JAX、TPU v6e-256、Ring Attention、Muon,FP32 主参数与优化器状态配合 bfloat16 训练副本,并提出随学习率退火的随机 downcast。(论文报告,§3.3–§3.5)
推理约束。推理时沿用同一序列模板,并用 regex-guided constrained decoding 固定组件顺序、header 和边界;约束只管输出结构,不直接限制正文语义或风格。(论文报告,§3.6)
实验方法:测的是首章叙事规则,不是整本审美
提示集。评测包含 360 个单轮长书请求,分为 36 个 family、每类 10 个;其中 240 个是原创小说,120 个是 fanfiction。提示由 Gemma 3 27B 辅助起草后人工审校,长度 32–238 词,中位数 74、均值 93。(论文报告,§4.1、Appendix A)
七项诊断。作者从叙事理论操作化 setup becomes a live problem、same goal stays active、blocked goal triggers response、mystery remains unresolved、initial situation is clear、viewpoint control holds、exposition is motivated by local need。Gemma 4 31B 从 First Chapter Text 中抽取目标、阻碍、未决问题、视角和说明性信息等结构化证据,再由确定性规则输出二元 pass/fail;除特殊窗口外,抽取通常限于前 12 段。(论文报告,§4.2、Appendix C)
测量边界。这种“LLM 只抽证据、规则负责判分”的方式比直接让 LLM 给审美分更可审计,但抽取错误仍会传入最终分数,规则也由作者选择。论文没有报告人工读者对七项标签的验证、一致性或与总体文学偏好的相关性,因此应称为“叙事诊断通过率”,不能直接改写成“人类级写作质量”。(阅读者分析)
七项结果应该按两个比较口径读取
主图口径。相对 GPT‑5.5,模型七项全部更高;相对 GPT‑5.5 和 Claude Opus 4.8 两个主基线,模型在 setup、blocked goal、unresolved mystery、locally motivated exposition 四项最高,Claude 在持续目标、初始清晰度和视角控制三项更高。这支持专用模型在部分“延迟解决与局部推动”规则上更强。(论文报告,§4.2,图 4)
完整表口径。加入 DeepSeek V4 Pro、GLM‑5.1、Kimi K2.6 后,模型各项为 34.4%、31.4%、74.0%、32.3%、80.3%、88.5%、15.8%;它只在 blocked goal、unresolved mystery 和 exposition 三项全表最高。旧笔记把“4/7 最高”写成对所有模型成立,忽略了主图与附录的基线范围差异。(论文报告,Appendix B,表 2;阅读者分析)
绝对水平。最强项 viewpoint 为 88.5%,但 explanation 的 locally motivated exposition 只有 15.8%,unresolved mystery 也只有 32.3%。大幅相对提升与较低绝对通过率同时存在,不能只引用“超过前沿模型”。(论文报告,Appendix B,表 2;阅读者分析)
从规划到正文的信息仍在持续丢失
阶段遵从。原创新作的 prompt→preview、preview→plan、plan→首章分别为 93.7%、54.2%、39.2%;fanfiction 为 86.0%、28.1%、31.1%。作者把 fanfiction 的更大下降归因于对具体角色、关系与 canon 知识的要求,但这只是与分布偏移一致的解释,没有与检索增强等替代方案比较。(论文报告,§4.3,表 1;阅读者分析)
跨章遵从。章节计划到正文的平均遵从从第 1 章 73.1% 降到第 2 章 65.4%,之后总体下行,最后一个被评章节为 50.8%,中间范围 37.2%–65.5%。这些是 1–7 rubric 线性归一化后的百分比,不是精确事实覆盖率。(论文报告,§4.4、图 5)
完整生成限制。虽然训练上下文达到 256k tokens,作者报告足够长的生成最终会进入不可恢复的重复循环,无法稳定在完整训练长度上写完书。论文因此证明的是首章与有限章节上的部分能力,而不是稳定的“prompt-to-complete-book”产品能力。(论文报告,Conclusion and Limitations;阅读者分析)
解释性证据能说明什么
注意力分析。128 个生成样本的组件级注意力显示,章节正文在局部上下文之外仍会回看 book plan、chapter plan 和人物字段,作者据此认为 scaffold 不是一次性草稿。(论文报告,§5.1、图 6)
SAE 分析。稀疏自编码器找到与叙事概念和故事机制相对应的候选特征,并用局部干预观察 next-token 对比变化。这为“模型内部存在可解释的写作操作”提供补充线索,但 SAE 特征命名和局部因果效应不能证明全书层级的规划正确。(论文报告,§5.2–§5.4;阅读者分析)
哪些结论仍没有被隔离
起点混杂。没有同样数据、训练预算和架构下的 instruct checkpoint 对照,因此“助手对齐压制虚构”的论证主要来自动机、行为观察和跨模型结果,不能与 scaffold 数据、base 预训练差异分开。(阅读者分析)
数据与评价循环。数据 scaffold 由 Qwen 系列模型生成,提示来自结构化合成;评价又依赖 Gemma 4 的结构抽取和作者制定的规则。最终正文目标虽是人类原书,训练中间表示和评估信号仍包含模型与设计者偏好,且没有人工读者实验校准。(论文报告,§2、§4.2;阅读者分析)
语料与版权范围。训练目标来自英语公版书,现代原创提示的迁移结果主要落在首章,fanfiction 更弱;论文没有验证中文、当代网络文学、职业作者协作或长期编辑收益。(论文报告,§2.1、§4.3、Conclusion and Limitations;阅读者分析)
原文定位(附录)
- 研究动机、核心主张与资源链接:Abstract、§1,PDF pp.1–2。
- LongPage 语料、标注与层级管线:§2.1–§2.3,图 1–2,PDF pp.3–10。
- 基座选择、序列格式和训练系统:§3,图 3,PDF pp.10–14。
- 360 个提示与七项首章诊断:§4.1–§4.2,图 4,PDF pp.14–18。
- 阶段遵从、跨章退化:§4.3–§4.4,表 1、图 5,PDF pp.18–19。
- 注意力与 SAE 分析:§5,PDF pp.20–27、p.71。
- 完整生成限制:Conclusion and Limitations,PDF pp.27–28。
- 提示集组成与全模型结果:Appendix A–B,PDF pp.33–37。
- 七项诊断的抽取与确定性规则:Appendix C,PDF pp.37–70。
读完后的判断
这篇论文最扎实的贡献是把“人类正文作为最终目标”和“显式规划作为中间监督”结合成可发布的数据与训练配方,并把创意写作评估拆成可审计的局部规则。证据足以支持 PageStorm 在这些首章诊断上显著区别于所选通用模型,也显示规划信息确实被模型读取;它不足以支持“14B 已达到人类整本写作水平”或“base 起点就是收益原因”。
对当前项目最值得复用的是三点:从成稿反演多尺度计划、在第一章设置早期质量闸门、让结构抽取与规则判定分工。落地时应增加真实读者盲评、同架构 base/instruct 对照、跨章事实与约束保持率、完整成书成功率以及计算成本。这样才能把“首章局部规则更好”推进到“长篇阅读体验更好”。