From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives
- arXiv: 2607.00918(2026-07,本月最新)
- 作者: Aayush Aluru, Chloe Ho, Muhammad Hammouri, Kerry Luo, Myra Malik, Ryan Lagasse, Arjun Bahuguna, Vasu Sharma(Pocket FM 及合作高校)
- 类型: 多智能体生成方法 + 幻觉检测
- 一句话: 以"角色人设"为第一性驱动,用多智能体 + 显式共享世界状态生成长篇;配套一个图结构的幻觉检测流水线。能扩展到"100 页"级别。
1. 要解决的问题
LLM 在多角色长篇里普遍出现角色不一致和情节断裂。本文主张:让每个角色作为独立 agent 依据人设自主"行动",再由叙述者组织成连贯散文,从而在长跨度下保持角色与情节一致。
2. 提出的系统
Magnet(生成系统,5 个核心组件)
-
Character Agents(角色智能体,DPO 微调的 Gemma-4-31B-it) - 依据角色人设 + 故事目标 + 世界状态产生"行动"。 - 人设包含:关系、性格、目标、描述、能力等属性。
-
Critic Module(评审模块,Gemini 2.5 Flash) - 评估候选行动的相关性、具体性、一致性、合理性。 - 过滤掉不合理/重复的行动,再交给叙述者;也负责生成世界状态更新。
-
Narrator(叙述者,Claude Opus 4.7) - 从通过评审的行动里选取合适的,转写成连贯的散文段落。
-
Goal Sequencing(目标编排,Claude Opus 4.7) - 先生成高层故事目标并迭代更新。 - 每 15 步替换未完成目标以防卡死;每 40 步引入新冲突以保持多样性;生成目标切换间的过渡段。
-
Shared World State(共享世界状态,图结构) - 有向图:根世界节点 + 角色节点 + 状态变量;展平成字典供 agent 读取。 - 只应用"叙述者选中的行动"带来的更新(覆盖式冲突解决),以此维持一致性。
Atlas(图结构幻觉检测流水线,三遍扫描)
- 把场景拆成事件单元(描述 + 文本证据)。
- 用固定 schema 抽取实体与关系,比较当前场景与历史场景的世界状态,找出"先立后驳"的矛盾。
- Schema:7 类节点(Character / Event / Location / TimePoint / Object / Vehicle / Concept)+ 5 组边(事件角色、社交、事件间、时空、物体相关)。
3. 实验设置
- 长度:2 页、20 页、100 页三档(100 页因算力只跑 1 篇)。
- DPO 训练数据:1,012 训练 + 53 评估偏好样本。
- Baseline:
- 单模型直接提示(Claude Opus 4.7,无 agent / 世界状态 / 目标编排)。
- IBSEN(导演—演员式多智能体剧本框架)。
4. 评估指标
- 编辑式评估(GPT-5.4 mini):故事级(逻辑一致、主题连贯、角色弧完成)、章节级(目标-冲突-结局推进、开合钩子、章节必要性)、句子级(节奏、清晰度、句法多样性)——用"标注数量"衡量,越低越好。
- 成对 rubric 打分(GPT-5.4 mini):故事/章节/句子三层,满分 100,越高越好。
- Atlas 幻觉检测:对人工验证的 ground truth 计算 P/R/F1(LLM 编辑判断与人工对齐率 90%)。
5. 主要结果
100 页设定(长度越长优势越明显): - 编辑标注数:Magnet 24 vs 单模型 37 vs IBSEN 30(分别降低 41% / 34%)。 - 幻觉数:Magnet 6 vs 单模型 12 vs IBSEN 11(降低 50% / 45%)。 - rubric(故事级):Magnet 89 vs 单模型 75 vs IBSEN 24。
20 页设定: Magnet 比单模型少 9 个标注、比 IBSEN 少 30 个;rubric 各层均领先。
Atlas 检测器: 聚合 F1 = 0.853(vs LLM-as-Judge 基线 0.805),Precision 0.914 / Recall 0.800。
消融(20 页): 各组件都有贡献;移除 Critic 模块导致标注数上升最多;世界状态、目标切换、DPO 训练均被证明有效。
6. 结论
长篇叙事可以从显式世界状态追踪 + 目标驱动的多智能体生成中"涌现"出来;优势主要体现在高层叙事组织和长程连贯上,且随长度增加而放大。
7. 对做产品 / 工程的启发
- "角色即 agent + 共享世界状态图" 是当前长篇一致性的强范式,比单模型硬写更稳。
- 只让被采纳的行动更新世界状态,是一个简单但关键的一致性设计。
- 生成与检测配套(Magnet + Atlas):边写边查的思路值得工程化。
- 混用多家模型分工(Gemma 角色、Gemini 评审、Claude 叙述/编排)体现了"按能力选模型"的实用主义。
关联
- Atlas 与 [[01_lost_in_stories]] 的一致性检测目标一致(前后世界状态比对)。
- 世界状态图 + 冲突解决呼应 [[03_dome]] 的时序知识图谱记忆。
- 多智能体思路同 StoryWriter / StoryBox 一脉。