AI_writing/papers/11_storybox.md

StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language Models


1. 要解决的问题

主流长篇生成是自顶向下(先定大纲/结构再填充),结构僵硬,导致角色发展和情节推进不自然、"被安排感"强、可预测。作者提出混合自底向上(hybrid bottom-up):先让事件从多 agent 交互中自然涌现,再自顶向下组织成叙事,兼顾自发性与连贯性,目标是稳定生成超 1 万词且保持连贯一致的故事。

2. 方法 / 核心思路

分两大阶段:沙盒模拟(产生涌现事件)故事生成(把事件写成小说)

2.1 沙盒模拟(自底向上)

2.2 故事生成(自顶向下组织)

  1. 事件摘要:事件按时间排序,用动态窗口机制分块,每窗内摘要抽象浓缩。
  2. 故事信息生成:先定故事类型(冒险/悬疑/爱情…),随每个事件摘要迭代精修标题,产出背景、主题、各章标题、每章冲突、情节点。
  3. Storyteller Agent(故事讲述者):带信息检索模块,把事件转成 embedding 做稠密向量检索;逐章迭代生成(每章多次迭代)→ 摘要该章 → 喂给下一章(后续章生成都带前面章的摘要),保证跨章连贯。

3. 数据与实验

4. 主要结果(带数值 vs baseline)

故事长度:StoryBox 平均约 12,000 词;其他长篇方法约 10,000 词;未适配的原生模型仅约 1,000 词。

质量(Figure 4,自动评估):StoryBox 在 Plot、Character Development、Language Use、Conflict Quality 均领先,Overall "强而均衡";在沙盒专属的 Character Behavior Consistency 上略胜 IBSEN(说明模拟确实带来更自洽的角色行为)。创意维度各法接近,DeepSeek-V3 明显偏弱。

人评(78 人):StoryBox 在所有维度均分最高,趋势与自动评估基本一致;差异点是人评对 IBSEN 的偏好强于对 GPT-4o / DeepSeek-V3。

模拟时长研究(Figure 5,测 1/3/7/14/30 天):Plot、Creativity、Language Use 变化极小;Character Development、Conflict Quality 随模拟变长而提升;Overall 从 1 天到 7 天显著提升、7 天后收益递减;token 用量随时长每档约翻倍 → 推荐 7 天模拟为性价比平衡点。

消融(Figure 6):去掉对象描述 → 伤 Language Use;去掉异常行为 → 降幅最大(尤其 Creativity / Character Development / Conflict Quality);去掉动态上下文窗口 → 降 Plot。

5. 局限

  1. 串行模拟慢:角色逐个行动,整体过程慢;因行为相互依赖,并行化易造成不一致,难做。
  2. 评估困难:故事质量评估仍是难题,人评昂贵耗时,需要更准确、可扩展的自动指标。 3.(隐含)多天模拟 + 逐章多次迭代 + 向量检索,token 成本高(每档翻倍)。

6. 对做产品 / 工程的启发

关联