AI_writing/papers/13_muse.md

MUSE: A Multi-agent Framework for Unconstrained Story Envisioning via Closed-Loop Cognitive Orchestration

注:本篇为多模态视觉叙事(短提示 → 多镜头音视频),与本批其余四篇的"纯文本长故事"不同;收录在此作为"闭环认知编排"多智能体范式的代表。


1. 要解决的问题

从一句短提示生成长篇音视频故事时,存在意图-执行鸿沟(intent-execution gap):高层叙事意图要在几十个镜头级多模态生成中保持一致(角色身份、空间构图、时序连续)。现有前馈式方法随序列变长出现语义漂移与身份不一致

2. 方法 / 核心思路

把讲故事重构成闭环约束执行:一个统管全模态的控制器维护共享记忆 ℋ,跑 plan → execute → verify → revise 迭代环。叙事意图不再用自然语言 prompt,而是编码成结构化、带类型的可执行控制(身份锚、布局、路由决策、时序边界);反馈也是带类型的违规信号(身份不符 / 布局违规 / 时序泄漏)。分三阶段,每阶段配一个 Critic 做校验-修订:

2.1 Pre-Production(身份锚定)

2.2 Production(空间构图)

2.3 Post-Production(时序合成)

3. 数据与实验

4. 主要结果(带数值 vs baseline)

ViStoryBench(身份/风格一致性,Table 3):MUSE 在跨模态身份指标最强——CSD-Cross 0.412(vs AnimDirector 0.288 / MMStoryAgent 0.238 / MovieAgent 0.299)、CIDS-Cross 0.453(vs 0.401 / 0.388 / 0.400);CP(越低越好)0.192,优于多数基线(复制粘贴伪影更少)。

MUSEBench(整体,Table 2):视觉 CIDS-C 0.714 / CIDS-S 0.712;剧本 NSR 3.70(vs AnimDirector 3.53 / MMStoryAgent 2.89 / MovieAgent 3.50)、SER 3.67(vs 1.73 / 1.59 / 2.53);视觉-剧本 Grounding 0.857(vs MMStoryAgent 0.428)、Synergy 2.82

消融(Table 4):Basemodel → +Planning → +Feedback → Full,CIDS-C 0.609→0.697→0.671→0.714,CP 0.227→…→0.158——Planning 提身份一致性、Feedback 精修风格一致性,二者叠加最优。

VTS 音频(Table 6):VTS 在叙事关键维度(年龄 3.97 / 情绪 2.23 / 韵律 2.44)超过 CosyVoice2、F5-TTS。

5. 局限

  1. 复杂/遮挡场景身份难保:拥挤或遮挡、频繁视角变化下角色身份易失稳。
  2. 半身素材缺口:布局引导需全身角色表示,ViStoryBench 多为半身图,导致相机动态变化下身份偏差明显。
  3. 多角色协同难:多角色场景中,既保留各自身份又生成自然运动仍是难题。
  4. 表现力语音控制不足:目前只能锚定粗粒度声学特征,情感/表现力细控仍欠缺。
  5. 音频评估主观:音频自动指标与人评仅中等相关(r=0.49)。

6. 对做产品 / 工程的启发

关联