AI_writing/pdfs/38_re3_精读.md

paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: Re3: Generating Longer Stories With Recursive Reprompting and Revision authors: Kevin Yang, Yuandong Tian, Nanyun Peng, Dan Klein year: 2022 source: EMNLP 2022; arXiv:2210.06774v3 pdf: 38_re3.pdf

Re3:长篇“计划—起草—重写—编辑”的祖型

一句话总结:Re3 用结构计划、动态重组的上下文、连贯/相关 reranker 和角色属性编辑器,让 GPT-3 生成 2,000–2,500 词故事;人评显著改善总体情节连贯与 premise relevance,但 Edit 模块未改善主指标、标注一致性很低,说明架构思想比绝对效果更持久。

TL;DR

信息流

premise → Plan:setting + characters + 三点 outline
→ Draft:相关角色 + 旧大纲 + 近期摘要 + 当前大纲 + 最后原文
→ Rewrite:多候选按 coherence + relevance + 规则重排
→ Edit:抽取角色属性 → 检测新旧冲突 → 局部改写

【论文报告】Plan 与 Draft 主要用 GPT3/GPT3-Instruct;Rewrite 的 coherence/relevance reranker 基于 WritingPrompts 训练的 Longformer;Edit 用开放属性字典、entailment 模型与 GPT3 Edit API(§3)。

【论文报告】单篇平均调用 davinci 12 次、text-davinci-002 70.2 次、Edit API 7 次、text-curie-001 362.6 次,总成本数美元(附录 D,表 12)。

模块细节

【论文报告】Draft 采用 coarse-to-fine context:早期章节只保留 outline,较近段落用模型摘要,紧邻段落原文保留;Flair 发现新实体,DPR 只取与近期段落相关的角色描述(§3.2)。

【论文报告】Rewrite 从候选中筛除重复、第一人称等问题,再用两个判别器分别判断与前文连贯、与当前 outline point 相关(§3.3)。

【论文报告】Edit 不比较全部句对,而维护每个角色的 attribute-value dictionary;只在同 key 新旧 value 矛盾时触发局部编辑,以追求高 precision(§3.4)。

【阅读者推断】这三层分别对应上下文预算、搜索和状态约束;它们应独立评测,不能因最终系统获胜就假定每层都有效。

实验协议与核心证据

【论文报告】100 个 premise 由 GPT3-Instruct 高温生成;正式故事约 3,000 tokens/2,000–2,500 词,固定三段 outline、每段四个 256-token continuation。基线 Rolling 使用同一 GPT3 滚动窗口,Rolling-FT 用 WritingPrompts 微调生成器(§4)。

【论文报告】Mechanical Turk 对故事做 interesting、coherent、relevant、humanlike 和五类问题标注;显著性用 paired t-test。Re3 相对 Rolling 的 coherent +14.3 个百分点、relevant +20.0;interesting 与 humanlike 未显著(表 1)。

【论文报告】Fleiss’ kappa 多在 −.05 到 .20,作者承认标注者只是快速 skim 长故事、主观指标噪声很高(附录 I,表 16–17)。

【阅读者推断】低一致性削弱单项百分点的稳定性;结果支持总体方向,但不足以精确排序小差异。

消融、失败与边界

对当前项目的迁移

【阅读者推断】采用 Re3 的 context pyramid,但把自由文本角色字典升级为带时间与来源的多值状态;Rewrite 同时优化结构相关性和多样性;Edit 只在可定位证据冲突时执行,并保留修改前后 provenance。

阅读者判断

Re3 是工程必读的祖型论文。其最稳健贡献不是“生成了小说”,而是证明长文可被拆成计划、上下文重组、候选选择与局部修复四类问题;Edit 的负结果同样重要。

关键原文定位