AI_writing/papers/00_survey_llm_story_generation.md

大语言模型故事生成:方法、评价与开放问题

覆盖范围:本文综合梳理本库 00–46 共 47 篇论文精读,时间跨度从 Re3(2022)到 2026 年的新近工作。它不是对某一篇综述的摘要,而是一份以问题为中心的研究地图。不同论文的数据、模型、长度和评价设置并不完全可比,文中的跨论文判断均以“共同趋势”而非统一排行榜来理解。

摘要

大语言模型已经能够生成语法流畅、局部连贯、长度可观的故事,但“会继续写”不等于“会讲故事”。综合现有研究,主要瓶颈已从局部语言质量转向五类全局能力:长程事实与时间一致性、因果和伏笔管理、叙事张力与信息释放、人物及风格差异、在多重约束下产生非平庸选择。长度扩展只是必要条件;模型可以写得更长,却仍在中段遗忘事实、提前化解冲突,或把不同题材压成相似的语言与人物弧。

方法演进也呈现出清晰方向:从一次性提示生成,发展为分层大纲、事件图和知识图谱,再到多智能体分工、搜索与局部修订,最后进入专用数据、奖励模型和可验证训练阶段。贯穿这些路线的共同变化,是把隐含在上下文中的叙事状态转化为可检查的中间表示,并把“生成—评价—修订”做成闭环。

与此同时,评价已成为与生成同等重要的研究问题。词重叠指标无法测量开放式叙事,通用 LLM 评委又容易偏爱流畅、长度和表面风格。专用奖励模型、结构化检查器、叙事学指标、信息论方法和可执行环境分别补足了不同维度,但没有任何单一分数能够可靠代表整体故事质量。更可行的方向是:硬约束用结构化检查,软质量用专用判别与人类校准,创造力同时测发散、收敛和受约束的意外,交互系统还要评价过程而非只看最终文本。


1. 研究版图:两个系统形态,四个相互耦合的问题

生成侧综述提出了一个有用的入口:按“谁是主导作者”区分两类系统。

这个分类回答“人和模型如何分工”,但不足以解释系统内部如何工作。综合 47 篇论文,还需要同时观察四个彼此反馈的板块:

板块 核心问题 典型研究
生成与规划 如何把主题扩展成具有层级、因果和节奏的长篇? DOMEStoryWriterBiT-MCTS
状态与质量控制 如何记住事实、关系、承诺,并在错误扩散前修正? Lost in StoriesMagnetCFPG
评价与学习信号 如何测量故事质量,并把评价转化为训练或搜索信号? Story Evaluation SurveyStoryAlignEvolvR
人机协作与真实使用 作者和读者实际需要什么,系统过程是否可控、可靠? FabulaGraphStoryAI Fiction in the Wild

四个板块不是独立模块。规划决定评价器需要检查什么;评价器决定搜索和训练优化什么;真实使用又决定“质量”究竟是文学创新、类型满足、个性化体验,还是稳定完成用户意图。


2. 共同瓶颈:流畅文本为何仍不是好故事

2.1 长度、上下文与一致性是三个不同问题

LongWriter证明,模型的有效输出长度与监督微调阶段见过的最长样本高度相关;通过长样本合成和训练,小模型可以显著突破常见的约 2,000 词上限。HelloBench也从通用长文评测侧确认,多数模型难以稳定写过 4,000 词,能写长的模型还会重复或降质。

但长度能力不自动带来叙事一致性。Lost in Stories在 8k–10k 词任务上发现,事实、人物、世界规则和时间线错误具有稳定分布,常聚集在叙事中段;其跨系统结果还显示,一些擅长长输出或具备规划模块的方法仍会产生大量细粒度矛盾。反过来,TLDM表明,把整本小说塞进长上下文也不等于真正理解:被测模型在 64k token 后都难以稳定整合情节、故事世界和叙事时间。

综合来看,长篇系统至少要分别解决三件事:生成足够长、维护可更新的叙事状态、在超长文本上可靠地检索和验证。 Storyline Trees用场景级故事线树改善长篇理解,Chain-of-Agents用分段 worker 与 manager 绕开单模型长上下文瓶颈,说明“结构化预处理或分段协作”通常比硬读整本更可靠。

2.2 局部连贯会掩盖全局叙事缺陷

现有模型最容易取得的进步是语句顺畅和段落连贯,最难的是控制信息何时出现、事件为何发生、人物如何变化。Spoiler Alert用 100-Endings 测量结局不可预测性,发现专业短篇的后段张力显著高于 LLM 故事,而常见 rubric 却可能把后者评得更高。Codified Foreshadowing and Payoff进一步表明,模型能埋下线索,却常在触发条件出现后忽略或错误兑现叙事承诺。

类似的“表面正常、深层退化”还出现在:

这些结果共同表明,流畅性更适合作为最低质量门槛,而不是主要优化目标。

2.3 创造力不是“多写几个不同答案”

Automated Creativity Evaluation把创造力拆成发散与收敛:前者是探索范围,后者是能否形成适合任务的解;两者经验相关性很弱。Assessing Creativity从测量有效性提出更严格的要求:创造力指标必须解释通用能力无法解释的增量,否则它只是在间接测量模型规模或语言能力。

Progressive Conditional Surprise测量一组输出是否真正覆盖不同模式,并用 coherence 项防止把噪声误当多样性;Calibrated Surprise则提出更整体的理论:高质量选择既要在无条件视角下罕见,又要在全部作品约束下高度合适。两者分别强调“跨输出的模式多样性”和“单个作品中受约束的意外”,不能互相替代。

因此,创造力评价至少需要区分:

  1. 是否探索了不同可能性;
  2. 是否满足题目、体裁、人物和因果约束;
  3. 是否避免模板化但仍保持可理解;
  4. 是否在关键宏观选择上产生有意义的意外。

3. 方法演进:从一次生成到可验证的闭环

3.1 奠基范式:计划—起草—重排—编辑

Re3在 2022 年已经给出此后长篇生成的基本模板:先构造设定、人物和大纲,再分段起草,用候选重排保证切题,最后编辑事实一致性。后续方法并没有抛弃这条链路,而是在强化每个环节:

3.2 分层规划:把“写长”变成多尺度决策

DOME用粗粒度五段骨架保证完整性,再随生成动态展开细纲;StoryWriter把大纲建成事件图,并在保留因果关系的前提下做非线性重排;Book Writing CapabilityEx3都从人类作品反演多层结构,再把“结构到正文”的能力训练进模型。CogWriter则把规划、监控、复审做成免训练的推理时脚手架。

这些工作支持“分层规划有效”,但它不是无条件正确:

3.3 显式状态:从文本记忆到图和账本

纯文本摘要会丢失事实之间的关系。多篇论文因此选择把叙事状态显式化:

显式状态的收益是可检索、可更新、可校验;代价是表示能力有限和维护成本上升。SVO 或三元组适合事件和硬事实,却难以完整表达心理暧昧、隐喻或不可靠叙述。更合理的方向不是让图替代散文,而是让图负责需要确定性追踪的部分。

3.4 多智能体:分工、涌现与协调成本

Agents' Room以“编剧室”方式分开规划、写作和编排,是多智能体故事生成的早期基线。StoryBox走向另一端:让角色在环境中自主行动,先涌现事件,再由 Storyteller 编织成故事;其异常因子主动打破日常,以增加冲突和意外。Magnet则把角色提议、批评、行动选择和叙述串成受世界状态约束的闭环。

多智能体的价值不是 agent 数量本身,而是三种可分离机制:

  1. 角色化分工:不同模块承担规划、批评、叙述或编辑;
  2. 候选竞争:多个行动或方案由评价器选择;
  3. 环境交互:角色行为改变共享状态,从而产生非预设事件。

其局限也很一致:串行模拟昂贵,并行化会引入依赖冲突,文本通信可能逐轮失真。多智能体只有在职责、共享状态和停止条件清楚时,才比单模型反复提示更有意义。

3.5 搜索与定点修订:主动探索情节空间

BiT-MCTS先生成冲突和高潮,再以高潮为根双向搜索开端与结局,把大纲规划显式变成搜索问题。Suspenseful Iterative Planning不断削减主角摆脱坏结局的可行路径,以制造悬念,但同时暴露出“悬念增强、自然度下降”的目标冲突。ASP Story用高层符号约束枚举多种可行结构;One Sentence, One Drama则把开场钩子、冲突升级和结尾悬念交给不同评审,定点重写相关片段并保留未采用的候选。

这几条路线分别代表三种反同质化机制:

它们都比一次采样更能探索情节空间,但最终质量取决于搜索奖励、模拟规则或符号规范是否真正代表好叙事。

3.6 数据和奖励:把能力训练进模型

推理时脚手架可以补能力,却会增加延迟和成本。另一条路线是把结构、长度或偏好直接训练进权重:

这些方法把系统瓶颈进一步推向奖励设计:模型会学习评价器能看见的东西,也会忽略评价器看不见的东西。 如果奖励偏爱规范、长度或表面风格,训练可能提高分数却加剧叙事扁平化。


4. 五层生成系统:不同方法如何组合

把论文按端到端链路重排,可以得到一个比“单智能体/多智能体”更细的五层框架。

层次 主要职责 可用方法 典型风险
1. 表示与规划 把主题转成事件、场景、节拍和因果结构 分层大纲、事件图、Story Prototype、ASP 模板僵化、结构过度先验
2. 状态与一致性 跟踪事实、人物、关系、时间和叙事承诺 世界状态图、KG 记忆、伏笔账本、场景树 表示遗漏隐含意义、维护开销
3. 探索与修订 产生候选,选择或局部修复 MCTS、辩论、critic、rerank、定点重写 成本高,评价器偏差被放大
4. 文体与人物呈现 控制声音、人物类型、情感和叙事复杂度 风格定义、非线性编排、人物维度、反扁平指标 模仿代替原创,内容被风格遮蔽
5. 人机交互 保留作者控制、支持构思与迭代 可编辑图、Gardener/Architect、轨迹式交互 自动重写夺走控制权,单一工作流不适配所有作者

这个框架提示,很多“新系统”其实是在不同层选择部件。一个写得长但缺状态层的模型仍会遗忘;一个有精细状态却没有探索层的系统可能稳定但平庸;一个评价和搜索很强但交互层不可控的系统,也未必适合人类创作。

GraphStory提供了重要的连接方式:同一张事件图既是作者的认知外化,也是模型的结构化上下文。Fabula的专家研究则提醒,结构化界面并非越强越好;当系统修改一处就重写整体,作者会失去局部控制。好的中间表示不仅要机器可读,还要人可见、可编辑、可追溯。


5. 评价体系:从一个总分走向多种测量装置

5.1 为什么传统指标和通用评委都不够

Story Evaluation Survey系统梳理了故事评价从 BLEU/ROUGE、嵌入与概率指标到 LLM-based 评价的演进。HelloBench进一步显示,词重叠指标在开放式长文上几乎不能代表人类判断。原因并不复杂:故事没有唯一参考答案,表面不同可能同样优秀,表面相似也可能在因果、人物或张力上完全失败。

LLM 评委改善了语义理解和解释能力,但仍有明显边界:

因此,LLM 评委适合做开放式语义判断和动态标准生成,却不应独自承担所有深层叙事判断。

5.2 六类评价方法及其边界

方法 擅长 主要局限 代表工作
动态 rubric + LLM 评委 通用质量、指令适配、解释 风格/长度偏差,深层维度分辨率有限 WritingBenchPOLARIS
专用奖励模型 人类偏好、人物、创意、训练奖励 数据构造偏差、跨域泛化 StoryAlignEvolvR
结构化检查器 事实、时间、世界状态、硬约束 容易误判有意的伏笔或暧昧 Lost in StoriesMagnet/Atlas
叙事学专用指标 张力、伏笔、人物、叙事功能 每个指标覆盖面窄,需理论和标注 Spoiler AlertCASPER
信息论指标 多样性、模式坍缩、受约束意外 依赖代理模型,操作化仍在早期 Calibrated SurpriseDecan
可执行/轨迹式评测 多轮记忆、鲁棒性、个性化、交互体验 成本高,环境设计影响结果 NARRA-GymFabula

Skeleton Coherence提供了一条有用的负面证据:句子骨架不如整句建模连贯。这提醒评价设计不能为了结构化而过早丢弃整体语义。另一方面,MUSE在多模态叙事中采用“意图—可执行约束—验证—修订”的闭环,说明结构化检查与整体生成可以分工,而不必互相取代。

5.3 推荐的组合评价框架

综合现有证据,一个稳健的评价系统更像“仪表盘”,而非单一总分:

  1. 硬约束层:事实、时间、人物状态、伏笔账本和格式要求;
  2. 叙事结构层:因果、节奏、张力、信息释放和结构多样性;
  3. 人物与文体层:人物类型分布、声音一致性、风格适配与跨作品差异;
  4. 创造力层:发散范围、收敛质量、校准意外和模式坍缩;
  5. 人类与使用层:真实偏好、作者控制感、读者目标、最坏情况和多轮鲁棒性。

专用维度分数可以用于诊断或训练,但不应未经验证地加权成一个“文学质量真值”。Assessing Creativity提出的增量效度原则尤其重要:新指标必须证明自己测到了通用语言能力之外的东西。


6. 跨论文综合判断

判断一:规划通常改善一致性,但规划本身不是文学性

证据Re3DOMEStoryWriter都显示,显式计划、结构化事件和历史压缩能够改善长篇完整性与切题性。

边界StoryBox指出自顶向下结构容易可预测;Fabula中的专业作者也批评通用结构和自动重写会带来僵硬、俗套与控制权下降。

综合结论:规划应负责维护必须稳定的宏观承诺,同时为角色行动、局部语言和情节转折保留开放空间。计划越细,不一定越好。

判断二:多智能体的收益来自机制,不来自角色数量

证据Agents' RoomMagnetOne Sentence, One Drama分别验证了专职分工、候选批评和定点修订的价值。

边界StoryBox显示串行角色模拟成本高且难并行;文本式 agent 通信还可能传播错误。

综合结论:应先定义共享状态、决策权和失败处理,再决定是否需要多个 agent。没有状态边界的“多人讨论”很容易只是昂贵的重复提示。

判断三:长度是独立能力,但不是质量代理

证据LongWriterCogWriter分别从训练数据与推理脚手架显著提升长输出。

边界Lost in Stories显示长篇仍会出现系统性矛盾;AI Fiction in the Wild还揭示真实使用中的模型回复长度与传统长篇之间存在数量级差距。

综合结论:长度遵从、一致性、结构完整和文学吸引力应分开报告。任何只因“更长”而提高的总分都需要警惕。

判断四:通用评委擅长规范质量,却容易漏掉深层叙事

证据WritingBench证明动态标准能提高通用写作评价的人类一致性;POLARIS证明这类奖励足以改善生成。

反证与限制StoryAlign显示专用模型在故事偏好上超过通用前沿评委;Spoiler AlertNarrative FlatteningStyle over Story分别暴露了张力缺失、后训练压平和风格偏好。

综合结论:通用评委适合作为基础质量分支,深层叙事需要专用指标、结构检查和人类锚点。评价器在环越深,越要审计其隐藏偏好。

判断五:发散、收敛与作品质量必须分开测

证据Automated Creativity Evaluation发现发散与收敛弱相关;Progressive Conditional Surprise测的是一组回答的模式覆盖;Calibrated Surprise讨论的是单个作品在约束下是否产生罕见而合适的选择。

边界:高熵可能只是噪声,高任务完成度也可能只是保守和平均化;Assessing Creativity还表明,没有一种测试能覆盖所有创造构念。

综合结论:创造力不是单轴能力。生成系统可以在保持收敛质量的同时扩大探索,也可以在多样候选中继续优化单个作品的受约束意外。

判断六:不存在脱离读者和场景的唯一“好故事”

证据AI Fiction in the Wild显示,真实用户大量请求类型化、重复、即时和高度小众的虚构内容;在某些类型里,可预测性可能正是需求的一部分。NARRA-Gym也表明,流畅叙事仍可能在鲁棒性、个性化或体验上失败。

边界:真实日志受重度用户和样本来源影响,不能直接代表全部读者;用户即时偏好也不等于长期艺术价值。

综合结论:评价必须先声明目标:是文学创新、类型满足、作者辅助、互动体验,还是稳定生成。不同目标可以共享基础质量门槛,却不应共享未经校准的最终排序。


7. 开放问题与研究议程

  1. 综合基准:需要跨语言、体裁、长度和系统形态的基准,同时测长度、硬一致性、结构、人物、张力、创造力与人类体验。
  2. 长篇闭环验证:整本输入单个评委不可靠。应研究场景切分、层级状态、分段 agent 和全局汇总如何共同给出可追溯判断。
  3. 一致性与非平庸性的联合优化:当前方法常在“稳定但模板化”和“意外但失控”之间摆动,需要联合评价硬约束与校准意外。
  4. 人物和关系的长期演化:现有人物研究多为短篇静态分类,尚缺跨章关系变化、隐性动机和不可靠叙述的可靠测量。
  5. 评价器有效性与抗操纵:专用评估器不仅要和人类相关,还要证明增量效度、跨域稳定性、最坏情况表现和对奖励投机的抵抗力。
  6. 真实读者与作者研究:日志分析、参与式设计和长期使用研究应与离线文本评分结合,区分作者控制感、读者满足和作品质量。
  7. 人机共创的可编辑中间表示:事件图、世界状态和场景树不应只在后端存在,还应研究如何让作者理解、修改并追踪其影响。
  8. 多模态与推理时约束MUSEOne Sentence, One Drama显示,文字侧的状态、验证和定点修订原则可迁移到音视频;反过来,多模态的空间与身份检查也能丰富叙事约束。
  9. 成本与延迟:多智能体、MCTS、逐句张力测量和在线评委都很昂贵。未来比较应同时报告质量、调用次数、延迟、失败率和修订粒度。

8. 47 篇论文地图

# 论文/笔记 主要角色
00 A Survey on LLMs for Story Generation 生成侧分类学与领域入口
01 Lost in Stories 长篇一致性基准与错误定位
02 From Personas to Plot: Magnet 世界状态图、critic 闭环与 Atlas 检测
03 DOME 动态分层大纲与时序 KG 记忆
04 Codified Foreshadowing and Payoff 伏笔—触发—兑现的符号化控制
05 Book Writing Capability 规划脚手架反演与长篇专用训练
06 Ex3 从真实小说抽取结构并树状扩写
07 STORYTELLER SVO 情节节点与动态实体图
08 POLARIS LLM 评委奖励、HRI 与低算力 GRPO
09 LongWriter 长样本合成、长度能力与长文基准
10 StoryWriter 事件图、非线性编排与历史压缩
11 StoryBox 角色沙盒、涌现事件与异常因子
12 CogWriter 规划—监控—复审的免训练脚手架
13 MUSE 多模态叙事的验证—修订闭环
14 Agents' Room 编剧室式多智能体基线
15 Storyline Trees 场景级层次表示与长篇检索
16 Skeleton Coherence 连贯建模粒度的负面结果
17 Spoiler Alert 100-Endings 张力指标
18 Suspenseful Iterative Planning 通过削减脱困路径生成悬念
19 StoryAlign 故事偏好基准与专用奖励模型
20 WritingBench 面向任务的动态评价标准
21 Narrative Flattening 后训练导致的主题、情感与风格收窄
22 HelloBench 通用长文生成与分层评价
23 Story Evaluation Survey 故事评价维度与指标分类学
24 BiT-MCTS 高潮优先的双向情节搜索
25 Chinese Literature Homogeneity 中文叙事功能与结构同质化
26 CAT-LLM 可解释的中文长文风格控制
27 Calibrated Surprise 受约束意外的质量理论
28 Automated Creativity Evaluation 发散/收敛创造力的分离测量
29 Progressive Conditional Surprise Decan 多样性与模式坍缩指标
30 Assessing Creativity 创造力测试的增量效度
31 NARRA-Gym 动态、多轮、轨迹式叙事评测
32 TTCW Literary Review 文学评审数据与判别器训练
33 Fabula 写作工具、auto-rater 与专家参与设计
34 GraphStory 图式构思、分支探索与作者控制
35 One Sentence, One Drama 短剧节奏、多评审与定点重写
36 AI Fiction in the Wild 真实用户请求与需求分布
37 CASPER Character Variety 人物呈现的八维叙事学测量
38 Re3 计划—起草—重排—编辑的奠基范式
39 Learning to Reason with NCP 下一章预测的可验证奖励
40 KG Literary Theory 长短期记忆与显式冲突注入
41 CreAgentive 逻辑/文体解耦与超长多体裁生成
42 Chain-of-Agents 分段 worker 与长上下文汇总
43 TLDM 整本小说理解的长上下文压力测试
44 EvolvR 自演化成对推理评价与奖励闭环
45 Style over Story LLM 重风格、轻内容的偏好诊断
46 ASP Story 抽象符号约束与情节多样性

9. 建议阅读路径

路线 A:理解长篇生成系统

Re3Agents' RoomDOME / StoryWriterMagnetBiT-MCTSBook Writing Capability

路线 B:理解长篇一致性与上下文边界

LongWriterLost in StoriesCFPGStoryline TreesTLDM / Chain-of-Agents

路线 C:建立故事评价体系

Story Evaluation SurveyHelloBench / WritingBenchStoryAlignSpoiler AlertNarrative FlatteningNARRA-Gym

路线 D:理解创造力、同质化与文学性

Calibrated SurpriseAutomated Creativity EvaluationProgressive Conditional SurpriseAssessing CreativityChinese Literature Homogeneity / CASPERFabula


结语

这组研究最一致的结论不是“某个模型已经会写小说”,而是:故事生成正在从纯文本采样问题,转化为一个表示、规划、状态、搜索、评价和人机交互共同构成的系统问题。更强的基座可以改善局部表达和通用推理,却不会自动解决长度、一致性、张力、人物多样性或评价偏差。

下一阶段的关键也不只是生成更多文本,而是让系统知道哪些承诺必须守住、哪些选择应当开放、何时需要制造意外、如何发现自己失败,以及怎样把修改权留给人。只有当这些能力被分别测量、联合校准并放回真实创作场景,长篇故事生成才可能从“可读的连续文本”走向“可控、可诊断、具有叙事意图的作品”。