paper_type: 方法与系统, Benchmark 与数据集, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Agents' Room: Narrative Generation through Multi-step Collaboration" authors: Fantine Huot, Reinald Kim Amplayo, Jennimaria Palomaki, Alice Shoshana Jakobovits, Elizabeth Clark, Mirella Lapata year: 2025 source: ICLR 2025 pdf: 14_agents_room.pdf tags: [论文精读, 多智能体, 长篇生成, 叙事规划, TellMeAStory, 故事评估] related: [[10_storywriter]], [[15_storyline_trees]], [[19_storyalign]], [[23_story_eval_survey]]
Agents' Room:多智能体写作的收益,主要来自把正文分段写出来
一句话答案:Agents' Room 把长篇写作拆成规划 agent、分段写作 agent、共享 scratchpad 和固定 orchestrator,在同一 Gemini 1.5 Flash 骨干下优于端到端基线;但实验同时表明,只有规划而没有专门分段写作并不占优,因此论文真正支持的是“专职分段生成 + 共享状态”,而不是“agent 越多越好”。
为什么一条长提示词难以承担整篇故事
问题入口。长篇虚构同时要求情节、人物、设定、语言和叙事节奏协同工作。端到端模型既要规划又要一次写完,很容易缩短输出,或在局部流畅与全局结构之间顾此失彼。论文由此提出核心问题:能否像 writers' room 一样,把写作拆给不同专职成员,并通过共享记忆把它们重新组织成一篇故事?(作者主张,§1–3)
论文的回答分三步推进:先给出通用多 agent 协作形式,再把它实例化为四个规划 agent 和五个写作 agent,最后用新建的 TellMeAStory 数据集、人类成对比较和 LLM 评委检验这种分工究竟改善了什么。
先给结论
- 系统设计。四个规划 agent 分别处理 conflict、character、setting 和 plot;五个写作 agent 按 exposition、rising action、climax、falling action、resolution 分段生成,所有产出写入带 agent 标签的共享 scratchpad,固定 orchestrator 依序调度。(论文报告,§3–4.1,算法 1)
- 数据与训练。TellMeAStory 含 123/52/55 个训练、验证和测试样本,平均 prompt 为 113 tokens、故事为 1,498 tokens;28 名写作者通过持续 3–4 周的 workshop 完成写作、同伴反馈和负责人复核。规划与分段标签由 Gemini Ultra 从成文反向生成,再用于 LoRA 微调专职 agent。(论文报告,§4.2–4.3,表 1)
- 核心结果。专家评委更偏好带写作 agent 的 Agents' Room,而人类故事仍在所有维度领先机器;系统生成约 3,000 词,是端到端基线约 1,100–1,200 词的两倍以上,但重复度也明显更高。(论文报告,§7,表 2,图 3)
- 证据边界。实验没有把“多 agent”与“多次调用、分段生成、更长 token 预算”完全分开,规划-only 变体表现较弱,所以不能把结果解释成对多智能体架构的一般性证明。(阅读者分析)
从通用协作框架到故事写作实例
协作模型。在通用形式中,每个 agent 都是文本到文本的专职映射,可以是微调模型、带特定提示的零样本模型、确定性函数,甚至未来的人类参与者。scratchpad 从原始任务开始,在每次调用后追加 agent 标签和输出;orchestrator 根据当前 scratchpad 决定下一个 agent,并在写作 agent 产出时把文本追加到最终结果。(论文报告,§3,算法 1)
故事实例。论文没有学习调度策略,而是采用叙事理论给出的固定顺序:CONFLICT → CHARACTER → SETTING → PLOT,随后是 Freytag 式五段写作。规划 agent 只写 scratchpad,写作 agent 同时写 scratchpad 和最终文本。这个设计把“准备什么”和“真正写哪一段”分开,也让每个生成调用只面对一个较窄的目标。(论文报告,§4.1)
机制解释。固定顺序和共享文本状态是清楚、可复现的工程选择,但它们没有自动产生协调智能:agent 之间不辩论、不回退,也不动态增删角色。系统更接近模块化流水线,而不是自治成员组成的编剧室。(阅读者分析)
TellMeAStory 怎样支撑训练与评价
数据构建。28 名写作者自行创作详细 prompt 和初稿,经过同伴反馈、修改以及 workshop lead 的再次反馈与批准;workshop 平均持续 3–4 周,每名写作者通常每周不超过 2–3 个样本。最终数据规模小,但 prompt 比常用开放故事数据更详细,目标故事也更长,题材以科幻和奇幻为主,同时包含恐怖、戏剧、喜剧、冒险和民间故事。(论文报告,§4.3,表 1)
合成监督。由于人工故事不含 conflict、setting 或 climax 等中间标签,作者用 Gemini Ultra 对成文做 distilled backtranslation:恢复规划组件并切分故事阶段。Gemini 1.5 Flash 作为所有基线和 agent 的骨干;微调采用 LoRA rank 4、学习率 1e-6、250 steps、batch size 16,并按验证损失选 checkpoint。(论文报告,§4.2、§5)
数据边界。TellMeAStory 的写作和复核流程比抓取式语料更扎实,却只有 123 个训练样本;agent 监督又来自另一个 LLM 对金标故事的反推,因此“专职微调有效”同时依赖人工成文质量和教师模型能否正确恢复隐含结构。(阅读者分析)
实验真正比较了什么
比较条件。基线包括端到端零样本与微调、在同一次调用中先规划或反思再写、自动分解,以及先生成计划再二阶段成文。Agents' Room 则比较 planning-only、writing-only 和 plan+write 三种结构,并分别采用全零样本或全微调 agent。所有系统共用 Gemini 1.5 Flash,减少了骨干模型差异。(论文报告,§5)
人类评价。具有写作经历或相关学位的评委对两个匿名故事做成对比较,维度为 plot、creativity、development、language use 和 overall;呈现顺序随机,并用 Latin square 避免同一参与者重复评价同一个 prompt。研究共得到 9,900 个成对评分,Fleiss' κ 为 0.46(p<.01,N=150,k=3),再用 Bradley–Terry 模型汇总系统强度。(论文报告,§6.1)
自动评价。论文同时报告长度、句法表面特征、词汇独特性、篇内/篇间 trigram 重复、prompt 重叠、ROUGE-L 和 BERTScore,并让 Gemini 1.5 Pro 按与人评相同的四个质量维度做成对判断。(论文报告,§6.2)
结果支持“分段写作”,但没有支持所有规划分解
长度结果。端到端系统平均约 1,126–1,207 词,人类故事平均 1,439 词;带写作 agent 的变体达到 3,006–3,278 词。更长并非无代价:这些系统的 unique-word ratio 更低,篇内和篇间 trigram 重复更高。(论文报告,§7,表 2)
偏好结果。人评在各维度都把人类故事排在机器故事之前,差距在 language use 上较小;评委偏爱更长故事的比例约为 0.51,不能用简单长度偏好解释人类优势。机器系统内部,带 writing agent 的 AR_FT write 和 AR_FT plan+write 最好,微调 agent 总体优于零样本 agent;planning-only 变体因为单一 finalizer 未能有效利用计划,表现不佳。(论文报告,§7,图 3)
评委一致性。LLM 排名与人评在系统层面的 Spearman ρ=0.62、样本层面 ρ=0.41(均 p<.01);development 和 creativity 的系统层相关分别为 0.83 和 0.85。交换故事呈现顺序后,LLM 有 90.2% 的比较保持同一偏好。(论文报告,§7)
这些证据最稳妥地说明:把最终文本拆给多个写作 agent,确实能突破一次生成的长度分布,并在本任务上获得更好偏好;它们没有证明 planning agent 本身带来增益,也没有隔离调用次数、总推理预算和分段提示的贡献。(阅读者分析)
证据边界与可迁移部分
内部效度。最缺的比较是“同样调用次数、同样总 token 预算、同样五段生成,但不使用多 agent 抽象”的控制条件。没有这个对照,系统收益可能来自分段生成和额外计算,而不一定来自 agent 身份或 scratchpad 通信。(阅读者分析)
外部效度。测试集只有 55 个 prompt,题材分布偏科幻和奇幻,主实验依赖单一 Gemini 骨干与专家偏好;论文没有进行真实作者参与的长期共创研究。生成更长但更重复,也说明“长度遵从”不能直接等同于“长篇质量”。(论文报告,§4.3、§5–7;阅读者分析)
可迁移设计。对当前项目最值得保留的不是九个固定角色,而是三条约束:规划状态与正文分离;每段生成前可读取带来源标签的共享状态;评估时同时报告长度、重复和人类偏好,防止系统用冗长换取表面完成度。(阅读者分析)
原文定位(附录)
- 通用 agent、scratchpad 与 orchestrator:§3,PDF pp.3–5。
- 九个故事写作 agent 与固定调度:§4.1,PDF p.5。
- 合成监督和 TellMeAStory:§4.2–4.3,表 1,PDF pp.5–7。
- 基线、骨干与微调设置:§5,PDF p.7。
- 人评和自动评价协议:§6,PDF p.8。
- 长度、重复、偏好和 LLM 评委结果:§7,表 2、图 3,PDF pp.9–10。
- 小模型补充结果与参与者反馈:附录 F,表 3–4,PDF pp.33–34。
读完后的判断
Agents' Room 回答了开头的问题,但答案比论文标题更窄:把复杂长篇任务拆开是有效的,最可靠的增益来自专门的分段写作和共享上下文,而不是“多 agent”本身。人评、长度统计和规划-only 负结果共同支持这一判断,因此对这条局部结论可以持中高信心。
读完后应把它视为多智能体故事生成的清晰基线,而不是最佳架构。后续系统若声称超过它,需要同时控制骨干、调用数、总 token 和段落数量,并报告重复、计划利用率和跨段一致性。只有在这些控制下,动态调度、角色专业化或更复杂通信才算真正新增的机制。