AI_writing/pdfs/03_dome_精读.md

paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 深度复现 title: "Generating Long-form Story Using Dynamic Hierarchical Outlining with Memory-Enhancement" authors: Qianyue Wang, Jinwu Hu, Zhengping Li, Yufeng Wang, Daiyuan Li, Yu Hu, Mingkui Tan year: 2025 source: arXiv:2412.13575v1; NAACL 2025 pdf: 03_dome.pdf tags: [论文精读, 长篇生成, 动态分层大纲, 时序知识图谱, 记忆增强, 故事一致性] related: [[01_lost_in_stories]], [[09_longwriter]], [[10_storywriter]], [[38_re3]]

DOME:边写边展开大纲,并用时序知识图谱压缩历史

一句话答案:DOME 先固定五阶段故事骨架、到达某阶段时才展开三级细纲,再把已写内容抽成时序知识图谱供后续检索;它在 20 个 DOC premise 上把 Qwen1.5-72B 的平均长度从 496 词扩到 7,114 词,并取得更低的自动冲突率和更好的人评排序,但消融不等预算、冲突指标与系统共享同一套图谱表示,因而不能把全部收益严格归因于动态大纲或图谱记忆。

真正的问题是规划刚性与生成不确定性冲突

问题入口。固定的详细大纲能提供全局结构,却无法吸收正文生成时出现的新人物、事件和因果;完全逐步生成又容易失去全局方向。论文要解决的不是单纯“上下文不够长”,而是如何同时保留宏观故事弧和局部适应性,并避免早期事实在长生成中被遗忘。(作者主张,§1、图 1)

核心问题可以写成:哪些信息必须预先固定,哪些信息应随正文展开,以及历史应以什么形式回流到下一步规划? DOME 的答案是把全局阶段、局部细纲和已发生事实分成三种状态,各自在不同时间尺度更新。

先给结论

信息流:规划、记忆与评价怎样接续

粗纲状态。系统依据 Campbell 的五阶段结构先生成 rough outline,使开端、发展、高潮和收束在写作前已有全局位置。这个层级保持稳定,承担“故事最终要去哪里”的约束。(论文报告,§3.1、图 2)

细纲状态。写到某个粗阶段时,DHO 才结合该阶段、此前正文和相关历史,逐次生成 3 个 detailed outlines,再按细纲写正文。下一阶段的细节没有过早冻结,因此正文中新出现的信息可以影响后续规划。(论文报告,§3.1、算法 1)

记忆状态。MEM 从正文抽取 <subject, action, object, chapter index> 四元组形成 temporal knowledge graph。检索先用实体向量召回候选,论文实现采用 bge-large-en-v1.5、余弦阈值 0.75,再由 LLM 过滤语义相关事实;返回的精简历史同时服务于细纲扩展和正文生成。(论文报告,§3.2、图 3)

评价状态。TCA 将图谱四元组按相关实体组织,并让 LLM 判断时间顺序中的事实冲突。若检测到的冲突数为 \(m\)、候选四元组组数为 \(N\),论文定义 \(CR=m/N\times100\%\)。这一指标适合自动比较,但它测的是“图谱抽取后可见的显式冲突”,不是完整的叙事连贯性。(论文报告,§4、图 4;阅读者分析)

实验方法:比较什么、由谁判断

任务与基线。作者从 DOC 使用的资源中选择 20 个 premise,比较直接调用 Llama3-70B、直接调用 Qwen1.5-72B-chat、Re3、DOC 与 DOME;DOME 主实验使用 Qwen1.5-72B-chat,温度 0.5、单次最大输出 1,000 tokens,在 2 张 A800 上运行。(论文报告,§5.1)

自动指标。长度衡量系统能否持续生成;Ent-2 衡量二元词组多样性;CR 由 TCA 衡量显式事实冲突。三者分别覆盖规模、词汇多样性和一种结构化一致性,但没有直接测情节质量、人物弧或读者沉浸。(论文报告,§4、§5.1;阅读者分析)

人工协议。3 名受过良好教育的研究生在不知道系统身份的情况下,对每个 premise 下的 5 个输出进行排序,维度为 plot completeness、plot coherence、relevance、interestingness 和 expression coherence,共 20 组。论文没有报告评审一致性、置信区间或显著性检验,因此名次差异只能视为小规模偏好证据。(论文报告,§5.1、Appendix A.4;阅读者分析)

主结果支持了什么

长度与自动指标。DOME 的 7,113.75 词远长于 DOC 的 3,904.90 和 Re3 的 3,802.15;CR 为 0.56,低于 DOC 的 1.21 和 Re3 的 0.77;Ent-2 为 12.29,高于两者的 11.55、11.56。与直接 Qwen 的 495.70 词、CR 0.66、Ent-2 9.06 相比,最确定的收益是系统显著延长了生成并提高词汇多样性。(论文报告,§5.2,表 1)

人工排序。DOME 在五维平均名次上都排第一,其中 plot completeness 为 1.15,下一名 DOC 为 2.58;expression coherence 为 1.16,下一名 DOC 为 2.56。该结果与自动指标方向一致,但评审只有 3 人,而且更长文本可能让完整性与有趣程度的印象同时上升,不能据此推出职业写作质量。(论文报告,§5.2,表 1;阅读者分析)

消融怎样读才不夸大因果

移除 MEM。w/o MEM 平均 6,511.10 词,CR 从完整系统的 0.56 升至 4.52,Ent-2 从 12.29 降至 10.00;论文据此计算 MEM 将冲突减少 87.61%。不过该版本因计算限制只运行 2 轮 chat,且缺少等 token 的滑窗或摘要记忆替代,所以数值同时混入“记忆形式”和“可用计算/历史量”的差异。(论文报告,§5.3,表 2、脚注;阅读者分析)

移除 DHO。w/o DHO 只生成 1,471.90 词,CR 0.65、Ent-2 11.50;人评五维名次也普遍更差。长度坍缩说明 DHO 对持续展开很重要,但也使质量比较与文本长度混杂:实验没有提供同长度的静态大纲或滚动大纲对照。(论文报告,§5.3,表 2;阅读者分析)

跨骨干结果。作者还在 Yi1.5-34B、Llama3-70B 和 Qwen1.5-72B 上比较直接生成与 DOME,三个骨干均出现 Ent-2 上升、CR 下降;正文强调 Llama 的 CR 降幅超过 18%,Yi 的 Ent-2 增幅超过 29%。这说明方向不只出现在一个骨干上,但没有给出等成本设置或重复运行的不确定性。(论文报告,§5.4,图 5;阅读者分析)

复现时真正需要记录的工程条件

调用与资源。表 3 对知识图谱构建报告约 791 个节点、258 个关系、405 个四元组和 16 次 API 调用;局限部分进一步说明完成约 7,000 词故事总计接近 200 次 API 调用、约需 4 小时。16 次不是整套 DOME 的总成本,复现预算应以后一个口径为准。(论文报告,§5.5,表 3、Limitations)

最小复现链。实现至少需要:五阶段粗纲模板;每阶段 3 个细纲的按需展开;四元组抽取和带时间索引的图存储;实体向量召回与 LLM 过滤;当前细纲、检索历史到正文的提示接口;独立记录长度、Ent-2、冲突判断和调用成本。若要验证机制,还应加入同长度静态大纲、滑窗摘要记忆和等调用预算三类基线。(阅读者分析)

局限与适用边界

风险点。论文没有提供自动质量指标,只有 20 个 premise;图谱抽取错误会同时影响记忆和 CR;自定义提示和大量模型调用使结果对闭源/特定骨干敏感。作者也承认大量调用让付费闭源模型的规模化使用不现实。(论文报告,Limitations;阅读者分析)

原文定位(附录)

读完后的判断

DOME 的设计逻辑是完整的:稳定粗纲保全局、延迟展开细纲保适应性、图谱记忆保历史可检索。主结果和消融都支持这套组合能在小规模 premise 集上生成更长、显式冲突更少且更受评审偏好的故事;其中“持续写长”的证据最强,“提高整体文学质量”的证据较弱。

对当前项目最值得迁移的不是“多调用本身”,而是三种状态的分离与可审计接口。若落地,应把总调用、延迟、长度和错误率一起纳入评价,并用等预算摘要记忆、同长度静态大纲和独立事实检查器重新做消融。这样才能判断收益来自动态规划、结构化记忆,还是更大的推理预算。