AI_writing/papers/02_from_personas_to_plot_magnet.md

From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives


1. 要解决的问题

LLM 在多角色长篇里普遍出现角色不一致情节断裂。本文主张:让每个角色作为独立 agent 依据人设自主"行动",再由叙述者组织成连贯散文,从而在长跨度下保持角色与情节一致。

2. 提出的系统

Magnet(生成系统,5 个核心组件)

  1. Character Agents(角色智能体,DPO 微调的 Gemma-4-31B-it) - 依据角色人设 + 故事目标 + 世界状态产生"行动"。 - 人设包含:关系、性格、目标、描述、能力等属性。

  2. Critic Module(评审模块,Gemini 2.5 Flash) - 评估候选行动的相关性、具体性、一致性、合理性。 - 过滤掉不合理/重复的行动,再交给叙述者;也负责生成世界状态更新。

  3. Narrator(叙述者,Claude Opus 4.7) - 从通过评审的行动里选取合适的,转写成连贯的散文段落

  4. Goal Sequencing(目标编排,Claude Opus 4.7) - 先生成高层故事目标并迭代更新。 - 每 15 步替换未完成目标以防卡死;每 40 步引入新冲突以保持多样性;生成目标切换间的过渡段。

  5. Shared World State(共享世界状态,图结构) - 有向图:根世界节点 + 角色节点 + 状态变量;展平成字典供 agent 读取。 - 只应用"叙述者选中的行动"带来的更新(覆盖式冲突解决),以此维持一致性。

Atlas(图结构幻觉检测流水线,三遍扫描)

3. 实验设置

4. 评估指标

  1. 编辑式评估(GPT-5.4 mini):故事级(逻辑一致、主题连贯、角色弧完成)、章节级(目标-冲突-结局推进、开合钩子、章节必要性)、句子级(节奏、清晰度、句法多样性)——用"标注数量"衡量,越低越好
  2. 成对 rubric 打分(GPT-5.4 mini):故事/章节/句子三层,满分 100,越高越好
  3. Atlas 幻觉检测:对人工验证的 ground truth 计算 P/R/F1(LLM 编辑判断与人工对齐率 90%)。

5. 主要结果

100 页设定(长度越长优势越明显): - 编辑标注数:Magnet 24 vs 单模型 37 vs IBSEN 30(分别降低 41% / 34%)。 - 幻觉数:Magnet 6 vs 单模型 12 vs IBSEN 11(降低 50% / 45%)。 - rubric(故事级):Magnet 89 vs 单模型 75 vs IBSEN 24。

20 页设定: Magnet 比单模型少 9 个标注、比 IBSEN 少 30 个;rubric 各层均领先。

Atlas 检测器: 聚合 F1 = 0.853(vs LLM-as-Judge 基线 0.805),Precision 0.914 / Recall 0.800。

消融(20 页): 各组件都有贡献;移除 Critic 模块导致标注数上升最多;世界状态、目标切换、DPO 训练均被证明有效。

6. 结论

长篇叙事可以从显式世界状态追踪 + 目标驱动的多智能体生成中"涌现"出来;优势主要体现在高层叙事组织长程连贯上,且随长度增加而放大。

7. 对做产品 / 工程的启发

关联