AI_writing/pdfs/06_ex3_精读.md

paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Ex3: Automatic Novel Writing by Extracting, Excelsior and Expanding" authors: Lei Huang, Jiaming Guo, Guanhua He, Xishan Zhang, Rui Zhang, Shaohui Peng, Shaoli Liu, Tianshi Chen year: 2024 source: ACL 2024; arXiv:2408.08506 pdf: 06_ex3.pdf

Ex3:从真实小说反推层级结构,再训练模型扩写

一句话总结:Ex3 从约 800 部中文网文中递归抽取“段落—章节—全书”层级结构,把结构到正文的展开过程制成指令数据微调 Baichuan2-13B,再以深度优先树扩展和实体数据库生成约 4k/10k 字小说;它相对旧基线的人评优势明显,但跨语言翻译比较、极低标注一致性和未评测的真正长篇限制了结论强度。

TL;DR

研究问题与设计假设

【作者主张】传统 plan-then-write 主要依赖通用 LLM 临场规划,既缺小说领域语言能力,也缺从真实长篇学习到的结构模式。Ex3 的假设是:摘要比扩写容易,因此可让同一类模型先从小说中反向抽取结构,再学习从结构还原正文。

【阅读者推断】这不是严格的“自我改进”:知识仍来自外部小说语料,摘要和实体更新也会引入模型偏差。更准确的描述是弱监督结构反演与 supervised fine-tuning。

方法链路

原始中文小说
→ 相邻段落 CoSENT 相似度分组
→ 组摘要 → 章节摘要 → 递归上卷为多层大纲
→ 结构 + 实体历史 + 原文组成指令样本
→ 微调 Baichuan2-13B-Chat
→ 深度优先展开:全书大纲 → 章节 → 段落 → 正文
→ 每轮抽取并更新实体数据库

Extract:结构与实体反演

【论文报告】段落使用预训练 CoSENT embedding 和 cosine similarity;在长度窗口内选择最低相似度处切分。Baichuan2 的 2,048 token 窗口下,实验把中文文本组控制在约 400–1,800 字(§3.1)。

【论文报告】章节内先对段落组摘要,再合并为章节摘要;全书层面继续按相似度分组和摘要,直到按长度终止条件收敛为最高层概述。实体数据库保存人物、地点、组织等当前重要信息,但会主动丢弃部分旧信息。

Excelsior:结构到正文的训练数据

【论文报告】五类提示覆盖层级展开、开篇/中段/结尾章节以及开篇/中段/结尾段落;输入组合当前大纲、此前情节、相关实体历史与 POV,输出下一层大纲或正文(图 6)。

Expand:深度优先树扩展

【论文报告】用户指定体裁与层级深度;完成当前 outline 子树后才扩展下一个同级节点。细化段落时先召回相关实体,生成正文后再更新数据库。叶节点按顺序拼接成完整作品(§3.3,图 7)。

【阅读者推断】深度决定长度只是间接控制;没有每层分支数、单节点长度和终止质量约束时,“任意长度”更像架构可延展性,不是质量可保持性。

实验协议与核心证据

【论文报告】20 个 premise 来自真实小说、长度 60–120 词,覆盖科幻、奇幻、悬疑和爱情;其中 10 个用于约 4k 字、10 个用于约 10k 字比较。每对作品由 3 人评审,共招募 20 名中文母语研究生,指标为 relevant、coherent、event、diction、transition、interesting、human-like。

【论文报告】约 10k 字实验中,Ex3 相对 DOC 的 coherent 支持率为 50.00%(DOC 15.63%),相对 Re3 为 51.61%(Re3 25.81%),相对 Rolling-GPT 为 75.86%(13.79%);表内允许“两者都好/都不好”,不同成对比较的百分比不能横向相减。

【论文报告】NO-TRAIN 消融中 Ex3 在七项指标均更高;NO-ENTITY 下 Ex3 在 coherence、transition、human-like 更高,但 diction 与 interesting 没有优势。中间步骤人评认为 77.5% 的分组合理、摘要 conciseness 92.5%、completeness 80.0%;多层摘要排序 Kendall tau 仅 0.1777。

【论文报告】与人类原作比较时,人类在 coherent 为 96.67%、transition 为 96.67%、human-like 为 90.00%,Ex3 分别为 36.67%、16.67%、56.67%,差距依然明显(附录表 5)。

局限与有效性威胁

阅读者判断

Ex3 的长期价值在数据配方:从优质长文反推不同分辨率的结构,再让模型学习逐层展开。其人评结果适合视为早期可行性证据,不应转述为“质量超过成熟长篇系统”或“可写任意长度小说”。复现时应改用同语言同底座基线、专业编辑盲评、足够阅读时间和更可靠的实体状态模型。

关键原文定位