paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Ex3: Automatic Novel Writing by Extracting, Excelsior and Expanding" authors: Lei Huang, Jiaming Guo, Guanhua He, Xishan Zhang, Rui Zhang, Shaohui Peng, Shaoli Liu, Tianshi Chen year: 2024 source: ACL 2024; arXiv:2408.08506 pdf: 06_ex3.pdf
Ex3:从真实小说反推层级结构,再训练模型扩写
一句话总结:Ex3 从约 800 部中文网文中递归抽取“段落—章节—全书”层级结构,把结构到正文的展开过程制成指令数据微调 Baichuan2-13B,再以深度优先树扩展和实体数据库生成约 4k/10k 字小说;它相对旧基线的人评优势明显,但跨语言翻译比较、极低标注一致性和未评测的真正长篇限制了结论强度。
TL;DR
- 【论文报告】Extract 用相邻段落语义相似度分组,并递归摘要得到多层大纲;Excelsior 把真实小说的层级映射制成五类指令数据;Expand 以深度优先顺序展开树节点并更新实体状态。
- 【论文报告】训练语料来自约 800 部中文网文;Baichuan2-13B-Chat 微调 2 epochs,loss 约降至 1.0 时停止。
- 【论文报告】在 20 个未进入训练集的 premise 上生成约 4k 和 10k 中文字规模作品;相对 Rolling-GPT、DOC、Re3、RecurrentGPT,多数成对人评指标偏向 Ex3。
- 【阅读者推断】论文支持“真实文本反演结构 + 结构化 SFT”优于只做 prompt,但不足以证明任意长度、跨语言或接近人类小说。
研究问题与设计假设
【作者主张】传统 plan-then-write 主要依赖通用 LLM 临场规划,既缺小说领域语言能力,也缺从真实长篇学习到的结构模式。Ex3 的假设是:摘要比扩写容易,因此可让同一类模型先从小说中反向抽取结构,再学习从结构还原正文。
【阅读者推断】这不是严格的“自我改进”:知识仍来自外部小说语料,摘要和实体更新也会引入模型偏差。更准确的描述是弱监督结构反演与 supervised fine-tuning。
方法链路
原始中文小说
→ 相邻段落 CoSENT 相似度分组
→ 组摘要 → 章节摘要 → 递归上卷为多层大纲
→ 结构 + 实体历史 + 原文组成指令样本
→ 微调 Baichuan2-13B-Chat
→ 深度优先展开:全书大纲 → 章节 → 段落 → 正文
→ 每轮抽取并更新实体数据库
Extract:结构与实体反演
【论文报告】段落使用预训练 CoSENT embedding 和 cosine similarity;在长度窗口内选择最低相似度处切分。Baichuan2 的 2,048 token 窗口下,实验把中文文本组控制在约 400–1,800 字(§3.1)。
【论文报告】章节内先对段落组摘要,再合并为章节摘要;全书层面继续按相似度分组和摘要,直到按长度终止条件收敛为最高层概述。实体数据库保存人物、地点、组织等当前重要信息,但会主动丢弃部分旧信息。
Excelsior:结构到正文的训练数据
【论文报告】五类提示覆盖层级展开、开篇/中段/结尾章节以及开篇/中段/结尾段落;输入组合当前大纲、此前情节、相关实体历史与 POV,输出下一层大纲或正文(图 6)。
Expand:深度优先树扩展
【论文报告】用户指定体裁与层级深度;完成当前 outline 子树后才扩展下一个同级节点。细化段落时先召回相关实体,生成正文后再更新数据库。叶节点按顺序拼接成完整作品(§3.3,图 7)。
【阅读者推断】深度决定长度只是间接控制;没有每层分支数、单节点长度和终止质量约束时,“任意长度”更像架构可延展性,不是质量可保持性。
实验协议与核心证据
【论文报告】20 个 premise 来自真实小说、长度 60–120 词,覆盖科幻、奇幻、悬疑和爱情;其中 10 个用于约 4k 字、10 个用于约 10k 字比较。每对作品由 3 人评审,共招募 20 名中文母语研究生,指标为 relevant、coherent、event、diction、transition、interesting、human-like。
【论文报告】约 10k 字实验中,Ex3 相对 DOC 的 coherent 支持率为 50.00%(DOC 15.63%),相对 Re3 为 51.61%(Re3 25.81%),相对 Rolling-GPT 为 75.86%(13.79%);表内允许“两者都好/都不好”,不同成对比较的百分比不能横向相减。
【论文报告】NO-TRAIN 消融中 Ex3 在七项指标均更高;NO-ENTITY 下 Ex3 在 coherence、transition、human-like 更高,但 diction 与 interesting 没有优势。中间步骤人评认为 77.5% 的分组合理、摘要 conciseness 92.5%、completeness 80.0%;多层摘要排序 Kendall tau 仅 0.1777。
【论文报告】与人类原作比较时,人类在 coherent 为 96.67%、transition 为 96.67%、human-like 为 90.00%,Ex3 分别为 36.67%、16.67%、56.67%,差距依然明显(附录表 5)。
局限与有效性威胁
- 【论文报告】作者未能全面评价更长小说;主要训练和生成是中文,其他语言未验证;初始大纲缺少审计和修订机制。
- 【论文报告】DOC、Re3、Rolling-GPT 先以英文生成再由 DeepL 翻译为中文,Ex3 直接中文生成;翻译会改变 diction、transition 与风格,比较并非同语言生成条件。
- 【论文报告】Fleiss’ kappa 大多接近 0 或为负,部分低至约 −0.44;作者明确称总体一致性较差。
- 【阅读者推断】要求在 5–10 分钟内读完 4k/10k 字作品可能促使快速浏览,难以可靠判断长程一致性。
- 【阅读者推断】网文来源、授权、去重与训练污染审计报告不足;“审计过的人类小说数据”不能替代清晰的数据治理说明。
阅读者判断
Ex3 的长期价值在数据配方:从优质长文反推不同分辨率的结构,再让模型学习逐层展开。其人评结果适合视为早期可行性证据,不应转述为“质量超过成熟长篇系统”或“可写任意长度小说”。复现时应改用同语言同底座基线、专业编辑盲评、足够阅读时间和更可靠的实体状态模型。
关键原文定位
- 三阶段总览:§3,图 1,PDF pp.2–3。
- 分组、递归摘要、实体数据库:§3.1,图 2–5,PDF pp.3–5。
- 指令数据与训练:§3.2,图 6,PDF pp.5–6。
- 深度优先扩展:§3.3,图 7,PDF pp.6–7。
- 主实验与消融:§4–5,表 1–3,PDF pp.6–9。
- 局限:Limitations,PDF p.10。
- 数据、基线翻译、人评一致性:Appendix D–G,PDF pp.18–21。