StoryBox: Collaborative Multi-Agent Simulation for Hybrid Bottom-Up Long-Form Story Generation Using Large Language Models
- arXiv/venue: 2510.11618(2025-10;已被 AAAI-40 收录,Proc. AAAI 40(36): 30359-30367;项目页 storyboxproject.github.io)
- 作者: Zehao Chen, Rong Pan, Haoran Li(Chen, Z., Pan, R., & Li, H., 2026)
- 类型: "自底向上 + 自顶向下"混合的多智能体沙盒模拟长篇生成(generative-agents 路线,源自 Park 的 Generative Agents)
- 一句话: 让角色 agent 在动态沙盒里自由行动、"涌现"出事件,再由 Storyteller agent 把这些涌现事件组织成故事,从而生成平均约 1.2 万词、角色行为更自洽的长篇。
1. 要解决的问题
主流长篇生成是自顶向下(先定大纲/结构再填充),结构僵硬,导致角色发展和情节推进不自然、"被安排感"强、可预测。作者提出混合自底向上(hybrid bottom-up):先让事件从多 agent 交互中自然涌现,再自顶向下组织成叙事,兼顾自发性与连贯性,目标是稳定生成超 1 万词且保持连贯一致的故事。
2. 方法 / 核心思路
分两大阶段:沙盒模拟(产生涌现事件) → 故事生成(把事件写成小说)。
2.1 沙盒模拟(自底向上)
- 角色 agent(Persona):属性含 Name / Age / Innate traits / Learned skills / Currently(状态) / Lifestyle;每天动态重生成 Daily Plan(按小时排程)。
- Abnormal Behavior + Abnormal Factor(超参):一个"异常行为"属性,用超参控制注入不可预测性——消融显示这是创意/角色发展/冲突质量的最大贡献项。
- 行为类型:move(移动)/ chat(对话)/ none(休息)。
- 环境建模:不用网格,用树状五层结构 World → Region → Zone → Area → Object(对象带描述),实现近乎无限、无坐标约束的环境。
- 事件记录:每个沙盒事件含 ID、起止时间、参与者、地点、简述、以及 detail 属性(环境、时段、涉事角色状态、动作、情绪、可能动机)。
- 模拟逐角色串行推进(每次一个角色行动)。
2.2 故事生成(自顶向下组织)
- 事件摘要:事件按时间排序,用动态窗口机制分块,每窗内摘要抽象浓缩。
- 故事信息生成:先定故事类型(冒险/悬疑/爱情…),随每个事件摘要迭代精修标题,产出背景、主题、各章标题、每章冲突、情节点。
- Storyteller Agent(故事讲述者):带信息检索模块,把事件转成 embedding 做稠密向量检索;逐章迭代生成(每章多次迭代)→ 摘要该章 → 喂给下一章(后续章生成都带前面章的摘要),保证跨章连贯。
3. 数据与实验
- 数据:20 个无参考答案的故事设定(Premise / Setting / Characters),比 DOC 数据集题材更广(含科幻),如时间冻结、反乌托邦艺术审查、北极外星发现、诅咒宅邸、地下迷宫、黑色侦探、时间旅者、读心侦探、深空外星、绑架惊悚、次元之门、丛林考古、梦境窃取、企业劫案等。
- 模型:embedding 模型做事件向量;生成与评估用 GPT-4o / GPT-4o-mini。
- 基线:复现 Re3、DOC-V2、IBSEN,外加 vanilla GPT-4o、DeepSeek-V3。
- 评估:
- 人评(78 名参与者,文学/CS/其他背景,Latin Square 分配,成对比较)6 维:情节 Plot、创意 Creativity、角色发展 Character Development、语言 Language Use、冲突质量 Conflict Quality、总体 Overall。
- 自动评估(LLM):同 6 维 + Character Behavior Consistency(角色行为一致性,0–10,衡量角色行为是否符合预设 persona,这是沙盒方法专属指标) + 平均字数。
4. 主要结果(带数值 vs baseline)
故事长度:StoryBox 平均约 12,000 词;其他长篇方法约 10,000 词;未适配的原生模型仅约 1,000 词。
质量(Figure 4,自动评估):StoryBox 在 Plot、Character Development、Language Use、Conflict Quality 均领先,Overall "强而均衡";在沙盒专属的 Character Behavior Consistency 上略胜 IBSEN(说明模拟确实带来更自洽的角色行为)。创意维度各法接近,DeepSeek-V3 明显偏弱。
人评(78 人):StoryBox 在所有维度均分最高,趋势与自动评估基本一致;差异点是人评对 IBSEN 的偏好强于对 GPT-4o / DeepSeek-V3。
模拟时长研究(Figure 5,测 1/3/7/14/30 天):Plot、Creativity、Language Use 变化极小;Character Development、Conflict Quality 随模拟变长而提升;Overall 从 1 天到 7 天显著提升、7 天后收益递减;token 用量随时长每档约翻倍 → 推荐 7 天模拟为性价比平衡点。
消融(Figure 6):去掉对象描述 → 伤 Language Use;去掉异常行为 → 降幅最大(尤其 Creativity / Character Development / Conflict Quality);去掉动态上下文窗口 → 降 Plot。
5. 局限
- 串行模拟慢:角色逐个行动,整体过程慢;因行为相互依赖,并行化易造成不一致,难做。
- 评估困难:故事质量评估仍是难题,人评昂贵耗时,需要更准确、可扩展的自动指标。 3.(隐含)多天模拟 + 逐章多次迭代 + 向量检索,token 成本高(每档翻倍)。
6. 对做产品 / 工程的启发
- "沙盒涌现事件 → 再组织成叙事" 是与大纲派完全不同的第三条路:适合做"世界模拟型"产品(互动小说、游戏 NPC 生活流、角色扮演),能自然长出有生活质感、行为自洽的角色。
- 树状五层环境(World→…→Object) 比网格更适合 LLM,语言可寻址、可无限扩展,是构建 agent 世界的实用数据结构。
- "异常因子"注入不可预测性 是提升创意/冲突的低成本旋钮——纯按 persona 行动会太平淡,可控随机性反而更好看。
- 模拟时长是可调的质量/成本旋钮:7 天是甜点,超过收益递减但成本翻倍,产品化要按预算设档。
- Character Behavior Consistency(0–10) 提供了一个"角色是否 OOC"的可自动化评测维度,可接入 CI。
- 局限提醒:串行是硬瓶颈,若要产品化需想清楚如何在保持一致性的前提下做并行/增量模拟。
关联
- 与 [[10_storywriter]]、[[03_dome]] 形成鲜明对照:后两者是自顶向下"事件图/分层大纲"派,本篇是自底向上"沙盒模拟"派;本篇明确把 [[14_agents_room]](1–2k 词)、IBSEN(剧本)当作"更短/更僵硬"的对比对象。
- 角色状态/世界建模与 [[02_from_personas_to_plot_magnet]] 的角色-世界状态图、[[01_lost_in_stories]] 的一致性追踪同源。
- 角色行为一致性(Character Behavior Consistency)与 [[01_lost_in_stories]] 关注的角色崩坏/一致性问题直接呼应。
- 同批次可与 [[12_cogwriter]](认知写作/并行生成)、[[13_muse]](闭环编排的多模态叙事)比较不同"多智能体协作"范式。