MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration
- arXiv/venue: 2602.03028(2026-02;HTML: arxiv.org/html/2602.03028v1)
- 作者: Wenzhang Sun, Zhenyu Wang, Zhangchi Hu, Chunfeng Wang, Hao Li, Wei Chen(理想汽车 Li Auto / 中国科学技术大学 USTC)
- 类型: 多模态(音-视)长篇叙事生成的多智能体框架,核心是 plan-execute-verify-revise 闭环约束执行
- 一句话: 把"长篇音视频故事生成"formalize 成闭环约束执行问题——多 agent 迭代 规划-执行-校验-修订,把叙事意图翻译成对身份/空间/时序的可执行控制,并用多模态反馈在生成中纠偏,解决序列变长后的语义漂移与身份不一致。
注:本篇为多模态视觉叙事(短提示 → 多镜头音视频),与本批其余四篇的"纯文本长故事"不同;收录在此作为"闭环认知编排"多智能体范式的代表。
1. 要解决的问题
从一句短提示生成长篇音视频故事时,存在意图-执行鸿沟(intent-execution gap):高层叙事意图要在几十个镜头级多模态生成中保持一致(角色身份、空间构图、时序连续)。现有前馈式方法随序列变长出现语义漂移与身份不一致。
2. 方法 / 核心思路
把讲故事重构成闭环约束执行:一个统管全模态的控制器维护共享记忆 ℋ,跑 plan → execute → verify → revise 迭代环。叙事意图不再用自然语言 prompt,而是编码成结构化、带类型的可执行控制(身份锚、布局、路由决策、时序边界);反馈也是带类型的违规信号(身份不符 / 布局违规 / 时序泄漏)。分三阶段,每阶段配一个 Critic 做校验-修订:
2.1 Pre-Production(身份锚定)
- Screenwriter Agent:把用户提示扩成结构化剧本(𝒰→𝒮)。
- Planner:把剧本分解成原子镜头规格。
- VTS(Vocal Trait Synthesis):从语义描述(年龄/性别/音色/韵律)生成零样本声学锚,生成前冻结。
- Visual Casting:从外观约束建持久视觉身份态 z_vis。
- Critic Ψ_pre:校验指令对齐与跨角色一致性,违规则定向重生。
2.2 Production(空间构图)
- Router:动态选渲染路径(直接文生视频 vs 布局引导合成)。
- LayoutGen:生成粗粒度边界框(角色位置/尺度),几何护栏强制最小空间范围、消解重叠。
- Asset Generator:在冻结身份锚条件下产出视觉/音频资产。
- Critic Ψ_prod:检测实体在场违规、视觉一致性问题(光照、构图伪影),局部修订。
2.3 Post-Production(时序合成)
- Action Planner:定相机运动、演员运动、时长约束。
- VideoGen:基于前一镜头帧尾生成,
v_i = VideoGen(s_i | Tail(v_{i-1}), z_vis)。 - Critic Ψ_post:校验时序连续与边界合规,违规则截断/重生。
3. 数据与实验
- MUSEBench:无参考的开放式评测协议,30 条精选提示,5 类题材(惊悚/日常/年代/科幻/奇幻),复杂度从单角色到多 agent 交互;由人评验证(140 样本上与人评的 Pearson 相关:剧本 r=0.64、视觉 r=0.74、音频 r=0.49)。
- 指标:剧本(NSR 叙事语义相关、SER 语义错误率、CES 因果事件分);视觉一致性(CIDS 身份分、CSD 风格距离、CP 复制粘贴比);视觉-剧本对齐(Atmosphere、Synergy、Grounding);音频(年龄/情绪/韵律/清晰度一致性)。
- 模型/设施:推理 Gemini 2.5 Pro(规划 temp 0.7 / 批判 0.2);视觉 Flux.2-Dev(guidance 3.5, 28 步)+ Wan 2.2-I2V-A14B;音频 VTS 基于 Qwen3-Instruct、20,000 小时标注音频训练;硬件 H200;每段最多 5 次迭代。
- 基线:Vlogger、AnimDirector、MMStoryAgent、V-GOT、MovieAgent。
4. 主要结果(带数值 vs baseline)
ViStoryBench(身份/风格一致性,Table 3):MUSE 在跨模态身份指标最强——CSD-Cross 0.412(vs AnimDirector 0.288 / MMStoryAgent 0.238 / MovieAgent 0.299)、CIDS-Cross 0.453(vs 0.401 / 0.388 / 0.400);CP(越低越好)0.192,优于多数基线(复制粘贴伪影更少)。
MUSEBench(整体,Table 2):视觉 CIDS-C 0.714 / CIDS-S 0.712;剧本 NSR 3.70(vs AnimDirector 3.53 / MMStoryAgent 2.89 / MovieAgent 3.50)、SER 3.67(vs 1.73 / 1.59 / 2.53);视觉-剧本 Grounding 0.857(vs MMStoryAgent 0.428)、Synergy 2.82。
消融(Table 4):Basemodel → +Planning → +Feedback → Full,CIDS-C 0.609→0.697→0.671→0.714,CP 0.227→…→0.158——Planning 提身份一致性、Feedback 精修风格一致性,二者叠加最优。
VTS 音频(Table 6):VTS 在叙事关键维度(年龄 3.97 / 情绪 2.23 / 韵律 2.44)超过 CosyVoice2、F5-TTS。
5. 局限
- 复杂/遮挡场景身份难保:拥挤或遮挡、频繁视角变化下角色身份易失稳。
- 半身素材缺口:布局引导需全身角色表示,ViStoryBench 多为半身图,导致相机动态变化下身份偏差明显。
- 多角色协同难:多角色场景中,既保留各自身份又生成自然运动仍是难题。
- 表现力语音控制不足:目前只能锚定粗粒度声学特征,情感/表现力细控仍欠缺。
- 音频评估主观:音频自动指标与人评仅中等相关(r=0.49)。
6. 对做产品 / 工程的启发
- 把"叙事意图"编成带类型的可执行控制(身份锚/布局/时序边界),而非自然语言 prompt:这是对抗长序列语义漂移的关键,反馈也做成带类型的违规信号,便于定位与定向修订。
- plan-execute-verify-revise + 每阶段一个 Critic 是可复用的闭环范式:前期锚身份、中期控空间、后期保时序,各配专职校验器,避免"一路直出、错到底"。
- 冻结身份锚(视觉 z_vis + 声学 VTS 锚)在生成前定死,是跨镜头/跨时间保持一致性的实用工程手法。
- 几何护栏(最小空间范围、重叠消解) 把"角色别叠一起"这类硬约束下沉到布局层,比纯生成更可靠。
- 限定迭代预算(每段≤5 次) 是闭环纠偏落地时控制成本/延迟的必要设计。
- 对文本长篇产品的迁移价值:即便不做视频,"结构化约束 + 分阶段 Critic 校验 + 冻结锚点"的思路同样适用于长文一致性(人名/设定/时间线)维护。
关联
- 闭环"规划-执行-校验-修订"与 [[12_cogwriter]] 的规划+监控复审、[[10_storywriter]] 的 EventValidator/ReIO 改写同属"生成中纠偏"家族,只是本篇扩到多模态。
- 多 agent 分工/编排思路承接 [[14_agents_room]](planning vs writing agent + orchestrator)。
- "身份/一致性"目标与 [[01_lost_in_stories]] 的角色一致性、[[02_from_personas_to_plot_magnet]] 的角色锚定跨模态呼应。
- 与 [[11_storybox]] 恰成对比:StoryBox 自底向上"放任涌现",MUSE 自顶向下"强约束闭环",是多智能体叙事的两极。