AI_writing/papers/14_agents_room.md

Agents' Room: Narrative Generation through Multi-step Collaboration


1. 要解决的问题

写好长篇小说是多面工程(情节、人物、语言…),但 LLM 目前重度依赖复杂 prompt,且单次生成难以维持长文的连贯、语气、事实一致,也难写出独特声音;同时缺长文写作数据集与标准化评测。作者主张把长文写作看成多智能体协作问题(而非在单 agent 内做分解),借专门化 + 协作把复杂写作拆成可处理的子任务。目标故事长度 1,000–2,000 tokens

2. 方法 / 核心思路

框架(Algorithm 1)由 orchestrator + scratchpad + 两类 agent 构成:

2.1 两类 agent(灵感来自叙事理论 Freytag 金字塔)

2.2 Orchestrator(编排器)

中心化、确定性调度,按固定顺序先调 4 个规划 agent(CONFLICT→CHARACTER→SETTING→PLOT)再调 5 个写作 agent。形式上是马尔可夫过程(下一步只依赖当前 scratchpad),也可换成学习式;本文因叙事理论先验强而用确定性版本。

2.3 Scratchpad(共享草稿板 / 记忆)

初始化为写作 prompt,每个 agent 输出(带唯一标签 l_t)追加进去传给下一个 agent;写作 agent 的输出还会拼进最终稿 y。标签让各 agent 能引用/解析特定片段、避免重复。agent 定义很泛(可以是 zero-shot prompt、微调 LLM、确定性函数,甚至人类),天然支持 human-in-the-loop。

2.4 变体与训练

3. 数据与实验

4. 主要结果(带数值 vs baseline)

长度与文风(Table 2):含写作 agent 的变体故事显著更长(约翻倍)——AR_ZS write 约 3,278 词、AR plan+write 约 3,034 词,而 E2E 仅约 1,207 词、人写 1,439 词。Agents' Room 与 prompt 的 trigram 重叠最低(最少照抄、接近人类水平)。

偏好排名(Figure 3,人评 + LLM 评委): - 人写故事总体最优(各维度都有差距,但语言维度差距最小——提示 LLM 已可当写作助手)。 - Agents' Room(带写作 agent 的变体)在所有维度都优于基线系统,其中 AR_FT write 与 AR_FT plan+write 最好;微调 agent 优于 zero-shot(证明反向翻译造合成数据有效)。仅有规划的 plan 变体较弱(单个 [FINALIZER] 太简单,用不好规划内容)。 - LLM 评委胜率(Table 3,AR_ZS plan+write vs 基线,overall/plot/creativ/develop/language):vs E2E_ZS+plan 74.55 / 63.64 / 75.47 / 75.93 / 81.13;vs E2E_ZS+decompose 高达 89.09 / 80.00 / 87.04 / 90.91 / 90.91;vs 2STAGE decompose 66.67。换小模型 Gemma2-9B-it 时(Table 4)AR vs E2E_ZS 仍 80.00 / 67.27 / 84.62 / 83.33 / 77.78。 - LLM 评委与人评一致:系统级 Spearman ρ=0.62、条目级 ρ=0.41;发展维 ρ=0.83、创意维 ρ=0.85;LLM 换序复评 90.2% 保持同一偏好。 - 偏好非因更长:人评"更长者被选"的比例仅约 0.51。

5. 局限

  1. 数据集极小(123/52/55),不足以从零训练,只能靠合成数据 + LoRA。
  2. orchestrator 是确定性、固定叙事结构(仅 Freytag 五段式),未探索更丰富结构或学习式编排(作者列为 future work,需先有好的评测/奖励模型)。
  3. 仍显著逊于人类作者(各维度有差距);参与者反馈指出模型有"套路化词汇、整段重复、突兀语气切换、七年级写作水平"等问题。
  4. 实验主要用 Gemini 1.5 Flash(受长上下文+写作质量要求所限),未大规模跨模型验证。

6. 对做产品 / 工程的启发

关联