Towards Human-Level Book-Writing Capability
- arXiv: 2605.17064(2026-05)
- 作者: Jan Zierstek, Matteo Batelic, Maya Medjad, Tim Schönenberger(Pageshift Entertainment)
- 类型: 训练框架 / 数据构造(书籍级创意写作)
- 一句话: 把 SFT 重新定义为"prompt→整本书"的生成任务,用公版小说反演出多分辨率规划脚手架来训练,使专用创意写作模型在写作质量上超过 GPT-5.5 与 Claude Opus 4.8。
1. 要解决的问题
通用助手型 LLM 的散文偏"assistant 腔",写不出书籍尺度、有文学性的长篇。核心症结是训练数据:模型没见过"从一句 prompt 扩展成整本书"的监督样本。
2. 方法 / 核心思路
核心 trick:多分辨率规划脚手架(Planning Scaffold)+ 层级反演
- 数据来源:公有领域(public-domain)小说整本。
- 自顶向下摘要:对每本书做逐级细化的摘要——从高层 premise → 章节级结构 → 场景级结构,形成一个多分辨率的规划层级。
- 训练时反演(invert):把这个层级倒过来用,让模型学会:
prompt → 逐步细化的计划(premise→章节→场景)→ 最终还原出原书正文。 - 训练目标因此从"写助手式回答"转向"写人类文学文本"。
直觉:DOME 是推理时动态展开大纲(见 [[03_dome]]),本文是把"大纲→正文"这条链路烘进训练数据里,让模型内化整本书的展开能力。
3. 数据与实验
- 数据:公版小说整本,派生出 premise/章节/场景多层摘要作为训练输入。
- 评测:写作质量评估,对比 GPT-5.5、Claude Opus 4.8 等前沿模型。
4. 主要结果
- 专用创意写作模型在写作质量评估上超过 GPT-5.5 和 Claude Opus 4.8。
- 生成风格明显从"助手式散文"偏移到"人类文学写作"。
- (具体分数/评测协议需查原文 PDF 补齐。)
5. 局限
- 依赖公版小说 → 语料偏经典/古早英文文学,风格分布可能偏老派。
- "质量超过前沿模型"依赖其评测协议,需看是否有评审偏置。
- 版权/风格模仿的边界问题(虽用公版规避)。
6. 对做产品 / 工程的启发
- 数据构造 > 花哨架构:想让模型写长篇,最有效的是喂"prompt→计划→整本书"的反演数据,而非只堆 pipeline。
- 多分辨率摘要(premise→章→场景)是可复用的数据合成配方,中文网文语料也能照做。
- 小而专的写作模型可在特定维度打赢通用大模型 —— 对做垂类写作产品是利好。
关联
- 训练侧"内化大纲展开"与 [[03_dome]] 推理侧动态大纲互补。
- 与 [[09_longwriter]] 同属"用数据合成解锁长输出"思路(LongWriter 侧重长度,本文侧重文学质量)。
- 与 [[08_polaris]] 一样瞄准"让(相对小的)专用模型逼近/超过前沿模型"。