Research atlas · 2022—2026

大语言模型
故事生成

方法、评价与开放问题。把 47 篇论文从“模型清单”重组为一张可导航的研究地图:问题在哪里、方法如何演进、证据支持什么,又在哪些边界上失效。

核心转向从续写到可验证的叙事系统
47篇论文
05系统层次
06综合判断
生成规划状态搜索评价交互

Chronology

论文时间轴

按首次公开时间排列;星级表示其对理解本领域的重要性。

01

Research landscape

两个系统形态,四个耦合问题

独立生成与作者辅助回答了“谁主导创作”,但要解释系统怎样工作,还必须同时观察规划、状态、评价与真实使用。

Independent generation

模型主导

人提供题目、提示或约束,模型承担主要创作。

Author assistance

作者主导

模型协助构思、组织、检索、诊断或局部改写。

01

生成与规划

如何把主题扩展成具有层级、因果和节奏的长篇?

DOME · StoryWriter · BiT-MCTS
02

状态与质量控制

如何记住事实、关系与承诺,并在错误扩散前修正?

Lost in Stories · Magnet · CFPG
03

评价与学习信号

如何测量故事质量,并把评价转化为搜索或训练信号?

StoryAlign · WritingBench · EvolvR
04

人机协作与真实使用

作者和读者真正需要什么,系统过程是否可控、可靠?

Fabula · GraphStory · AI Fiction in the Wild

规划决定评价器检查什么;评价器决定搜索与训练优化什么;真实使用又决定“质量”究竟指文学创新、类型满足、个性化体验,还是稳定完成意图。

02

Shared bottlenecks

流畅文本为何仍不是好故事

研究的主要瓶颈已经从局部语言质量,转向长程状态、因果承诺、叙事张力、人物差异与非平庸选择。

长度 ≠ 记忆

能写得更长,不代表能守住更早的事实

长输出、长上下文与长程一致性是三种不同能力。8k–10k 词的故事仍会在中段集中出现事实、人物和时间线矛盾。

流畅 ≠ 叙事

局部连贯会掩盖全局张力和人物退化

句段顺滑只是最低门槛。信息何时释放、冲突为何升级、人物怎样改变,才决定文本是否成为一个完整故事。

多样 ≠ 创造

多个不同答案,可能只是多个噪声变体

创造力至少包含探索范围、任务收敛、模式坍缩与受约束的意外;任何单一总分都会混淆这些目标。

会继续写,不等于会讲故事。— 47 篇研究共同指向的能力断层

Reader takeaways

如果只记住六件事

这些结论不是对单篇论文的复述,而是 47 篇研究共同呈现的能力边界。

流畅只是起点,不是好故事

大模型已经很会写正确、顺滑的句子,但故事还需要跨章节的因果、人物变化、节奏和承诺兑现。局部读起来不错,整体仍可能松散或矛盾。

这意味着

判断故事能力不能只看文笔和开头几段,还要看模型能否长期维护人物、事实和叙事目标。

写得更长与记得更牢是两种能力

更大的上下文窗口、更长的训练样本和更高的输出上限可以让模型继续写,却不会自动阻止事实遗忘、时间冲突和人物设定漂移。

这意味着

长度、一致性、结构完整和阅读吸引力必须分开衡量,不能把“字数更多”直接当作“故事更好”。

规划能守住承诺,也可能让故事套路化

大纲、事件图和分层计划能减少跑题与前后矛盾,但规划过细会压缩人物行动和情节转折的开放空间,使故事变得可预测。

这意味着

好的规划应固定必须稳定的宏观承诺,把局部表达、人物选择和意外转折留给生成过程。

多智能体的价值来自机制,而不是人数

给多个模型角色起不同名字并不会自动提高质量。真正有用的是明确分工、共享状态、候选比较、批评修订和失败处理。

这意味着

评价多智能体系统时,应先问它增加了什么可验证机制,而不是参与讨论的角色有多少。

创造力是约束下的合理意外,不是随机

答案更分散、词汇更稀有或情节更奇怪,不一定更有创造力。好的意外既不平庸,也要符合人物、世界和主题约束。

这意味着

发散范围、收敛能力和单篇作品质量需要分别测量,再观察模型能否产生罕见但合适的选择。

评价标准会反过来塑造模型

模型会学习奖励器和评委能够看见的东西。如果评价偏爱长度、规范和表面风格,系统可能得到更高分,却牺牲张力、人物差异和长期艺术价值。

这意味着

不存在脱离读者、体裁和使用场景的唯一“好故事”总分;更可靠的评价应组合硬约束、专用指标和人类判断。

继续查看证据与边界 →
03

Method evolution

从一次生成,到可验证的闭环

贯穿各条技术路线的共同变化,是把隐含在上下文中的叙事状态转成可检查的中间表示,并让生成、评价、修订形成闭环。

01
奠基

计划 → 起草 → 重排 → 编辑

Re3 把长篇生成拆成可诊断流水线,确立此后多数系统的基本骨架。

Re3 · 2022
02
多尺度

静态大纲走向动态分层规划

事件图、场景树和树状扩写把“写长”变成跨粒度决策,而非简单续写。

DOME · StoryWriter · Ex3
03
可追踪

把叙事状态移出隐式上下文

知识图、世界状态和伏笔账本,让事实、关系和承诺可以被更新与校验。

Magnet · CFPG · STORYTELLER
04
分工

多智能体引入角色、竞争与环境

收益并不来自 agent 数量,而来自职责边界、共享状态和候选选择机制。

Agents’ Room · StoryBox
05
探索

搜索情节空间,定点修订失败片段

MCTS、符号枚举和多评审将生成改写成“提出—检验—局部修复”的闭环。

BiT-MCTS · ASP Story
06
内化

把长度、偏好与验证信号训练进模型

专用数据、奖励模型与可验证任务降低脚手架成本,但也让评价偏差进入权重。

LongWriter · StoryAlign · EvolvR
04

System architecture

五层生成系统

这些论文不是互斥方案,而是可以组合的系统层。每一层既提供能力,也引入新的失败方式。

01

表示与规划

把主题转成事件、场景、节拍与因果结构

方法

分层大纲 · 事件图 · Story Prototype · ASP

风险

模板僵化,结构先验压缩意外空间

02

状态与一致性

跟踪事实、人物、关系、时间与叙事承诺

方法

世界状态图 · KG 记忆 · 伏笔账本 · 场景树

风险

隐含意义难以结构化,维护成本持续上升

03

探索与修订

产生候选、比较路径,并在局部定点修复

方法

MCTS · debate · critic · rerank · 定点重写

风险

成本高,评价器偏差会被搜索放大

04

文体与人物呈现

控制声音、人物类型、情感与叙事复杂度

方法

风格定义 · 非线性编排 · 人物维度 · 反扁平指标

风险

模仿替代原创,表面风格遮蔽内容贫乏

05

人机交互

保留作者控制,支持构思、诊断与迭代

方法

可编辑图 · Gardener/Architect · 轨迹式交互

风险

自动重写夺走控制权,单一路径不适配所有作者

推荐架构:规划层提出承诺,状态层维护承诺,探索层生成候选,评价层定位失败,人机交互层决定哪些修改真正发生。

05

Evaluation

从一个总分,走向多种测量装置

词重叠指标无法测量开放式叙事,通用 LLM 评委又偏爱流畅、长度和表面风格。更稳健的方案是一组相互校验的仪表,而非“文学质量真值”。

方法擅长主要局限代表工作
动态 rubric + LLM 评委通用质量、指令适配、解释风格与长度偏差;深层维度分辨率有限WritingBench · POLARIS
专用奖励模型人类偏好、人物、创意与训练奖励数据构造偏差;跨域泛化仍待验证StoryAlign · EvolvR
结构化检查器事实、时间、世界状态与硬约束可能误判有意伏笔、暧昧与不可靠叙述Lost in Stories · Magnet/Atlas
叙事学专用指标张力、伏笔、人物与叙事功能覆盖面窄;依赖理论操作化与标注Spoiler Alert · CASPER
信息论指标多样性、模式坍缩与受约束意外依赖代理模型;操作化仍处于早期Calibrated Surprise · Decan
可执行 / 轨迹式评测多轮记忆、鲁棒性、个性化与交互体验成本高;环境设计显著影响结论NARRA-Gym · Fabula
06

Synthesis

六条跨论文综合判断

每条判断都区分证据、适用边界和结论,避免把局部实验结果升级成普遍规律。

判断 01

规划通常改善一致性,但规划本身不是文学性

证据

Re3、DOME 与 StoryWriter 显示,显式计划和事件结构能改善完整性与切题性。

边界

StoryBox 与 Fabula 提醒:过细计划会带来可预测、僵硬与作者控制权下降。

综合结论

让规划维护必须稳定的宏观承诺,同时把人物行动、局部语言与转折留在开放空间。

判断 02

多智能体的收益来自机制,不来自角色数量

证据

Agents’ Room、Magnet 与 One Sentence, One Drama 分别验证了分工、候选批评和定点修订。

边界

串行角色模拟昂贵,文本式 agent 通信还可能逐轮传播错误。

综合结论

先定义共享状态、决策权与失败处理,再决定是否真的需要多个 agent。

判断 03

长度是独立能力,但不是质量代理

证据

LongWriter 与 CogWriter 从训练数据和推理脚手架两端显著提升了长输出。

边界

Lost in Stories 仍观察到系统性矛盾;真实使用中的长度与传统长篇还有数量级差距。

综合结论

长度遵从、一致性、结构完整和文学吸引力必须分开报告。

判断 04

通用评委擅长规范质量,却容易漏掉深层叙事

证据

WritingBench 与 POLARIS 证明动态标准和评委奖励能改善通用写作质量。

边界

张力缺失、后训练压平和“重风格轻内容”常不会反映在通用总分中。

综合结论

把通用评委放在基础质量分支,深层叙事交给专用指标、结构检查和人类锚点。

判断 05

发散、收敛与作品质量必须分开测

证据

三类研究分别测量探索范围、模式覆盖,以及单篇作品中受约束的意外。

边界

高熵可能只是噪声,高任务完成度也可能只是保守与平均化。

综合结论

创造力是多轴能力:扩大探索,同时守住收敛质量,再优化有意义的意外。

判断 06

不存在脱离读者和场景的唯一“好故事”

证据

真实日志与动态评测表明,类型满足、个性化、鲁棒性和文学创新并不是同一个目标。

边界

即时偏好不等于长期艺术价值,重度用户样本也不能代表全部读者。

综合结论

评价必须先声明目标;可共享基础质量门槛,但不应共享未经校准的最终排序。

07

Open questions

下一阶段的研究议程

更强的基座不会自动解决叙事问题。下一步需要把质量拆开测量,把中间表示交还作者,并把成本纳入比较。

  1. 01

    构建跨语言、体裁、长度和系统形态的综合基准

  2. 02

    研究整本输入下的分段验证与可追溯全局汇总

  3. 03

    联合优化一致性与非平庸性,摆脱“稳定但模板化”

  4. 04

    测量人物关系的跨章演化、隐性动机与不可靠叙述

  5. 05

    验证评价器的增量效度、跨域稳定与抗投机能力

  6. 06

    把真实读者、作者研究与离线文本评分结合

  7. 07

    让事件图、世界状态和场景树成为作者可编辑对象

  8. 08

    把文字侧验证原则迁移到多模态与空间约束

  9. 09

    同时报告质量、调用次数、延迟、失败率与修订粒度

08

Paper map

47 篇论文地图

按标题、角色、标签、年份或发表载体搜索;点击论文卡片可打开本地精读笔记。引用数据:Semantic Scholar · 快照于 2026-08-02;引用次数不等同于论文质量。

2022

奠基范式

1 篇论文

2024

规划、长文与评价

10 篇论文

2025

系统化与训练

12 篇论文
12

CogWriter

2025-02ACL 2025 Findings
关键工作
引用 19 次

规划—监控—复审的免训练脚手架

生成与规划状态与一致性
20

WritingBench

2025-03NeurIPS 2025
领域锚点
引用 74 次

面向任务的动态评价标准

评价
39

Learning to Reason with NCP

2025-03COLM 2025
关键工作
引用 39 次

下一章预测的可验证奖励

生成与规划评价
43

TLDM

2025-05arXiv preprint
关键工作
引用 8 次

整本小说理解的长上下文压力测试

长上下文评价
07

STORYTELLER

2025-06ACL 2025 Findings
关键工作
引用 12 次

SVO 情节节点与动态实体图

生成与规划状态与一致性
10

StoryWriter

2025-06CIKM 2025
关键工作
引用 20 次

事件图、非线性编排与历史压缩

生成与规划长上下文
40

KG Literary Theory

2025-08arXiv preprint
重要补充
引用 0 次

长短期记忆与显式冲突注入

状态与一致性创造力
44

EvolvR

2025-08arXiv preprint
关键工作
引用 1 次

自演化成对推理评价与奖励闭环

评价生成与规划
41

CreAgentive

2025-09arXiv preprint
关键工作
引用 0 次

逻辑 / 文体解耦与超长多体裁生成

生成与规划长上下文创造力
45

Style over Story

2025-10arXiv preprint
关键工作
引用 1 次

LLM 重风格、轻内容的偏好诊断

评价创造力
11

StoryBox

2025-10AAAI 2026
关键工作
引用 1 次

角色沙盒、涌现事件与异常因子

生成与规划创造力
00

A Survey on LLMs for Story Generation

2025-11EMNLP 2025 Findings
领域锚点
引用 23 次

生成侧分类学与领域入口

生成与规划评价

2026

评价闭环与真实使用

24 篇论文
04

Codified Foreshadowing and Payoff

2026-01arXiv preprint
关键工作
引用 0 次

伏笔—触发—兑现的符号化控制

状态与一致性生成与规划
13

MUSE

2026-02arXiv preprint
补充证据
引用 5 次

多模态叙事的验证—修订闭环

生成与规划评价
01

Lost in Stories

2026-03arXiv preprint
领域锚点
引用 3 次

长篇一致性基准与错误定位

状态与一致性长上下文评价
24

BiT-MCTS

2026-03arXiv preprint
关键工作
引用 0 次

高潮优先的双向情节搜索

生成与规划创造力
25

Chinese Literature Homogeneity

2026-03arXiv preprint
重要补充
引用 0 次

中文叙事功能与结构同质化

创造力评价
16

Skeleton Coherence

2026-04arXiv preprint
补充证据
引用 0 次

连贯建模粒度的负面结果

评价状态与一致性
17

Spoiler Alert

2026-04arXiv preprint
关键工作
引用 1 次

100-Endings 张力指标

评价创造力
27

Calibrated Surprise

2026-04arXiv preprint
关键工作
引用 1 次

受约束意外的质量理论

创造力评价
19

StoryAlign

2026-05ICLR 2026
领域锚点
引用 2 次

故事偏好基准与专用奖励模型

评价
31

NARRA-Gym

2026-05Technical report
关键工作
引用 0 次

动态、多轮、轨迹式叙事评测

评价人机协作
30

Assessing Creativity

2026-05arXiv preprint
重要补充
引用 0 次

创造力测试的增量效度

创造力评价
05

Book Writing Capability

2026-05arXiv preprint
关键工作
引用 0 次

规划脚手架反演与长篇专用训练

生成与规划长上下文
32

TTCW Literary Review

2026-05arXiv preprint
重要补充
引用 0 次

文学评审数据与判别器训练

评价
35

One Sentence, One Drama

2026-05arXiv preprint
补充证据
引用 2 次

短剧节奏、多评审与定点重写

生成与规划评价
21

Narrative Flattening

2026-05arXiv preprint
领域锚点
引用 0 次

后训练导致的主题、情感与风格收窄

创造力评价
29

Progressive Conditional Surprise

2026-06ICML 2026 Workshop (non-archival)
重要补充
引用 0 次

Decan 多样性与模式坍缩指标

创造力评价
08

POLARIS

2026-06arXiv preprint
重要补充
引用 0 次

LLM 评委奖励、HRI 与低算力 GRPO

评价
28

Automated Creativity Evaluation

2026-06arXiv preprint
关键工作
引用 0 次

发散 / 收敛创造力的分离测量

创造力评价
33

Fabula

2026-06arXiv preprint
关键工作
引用 1 次

写作工具、auto-rater 与专家参与设计

人机协作评价
34

GraphStory

2026-06arXiv preprint (ACM format)
关键工作
引用 0 次

图式构思、分支探索与作者控制

人机协作生成与规划
15

Storyline Trees

2026-06arXiv preprint
重要补充
引用 0 次

场景级层次表示与长篇检索

长上下文状态与一致性
37

CASPER Character Variety

2026-06arXiv preprint
关键工作
引用 0 次

人物呈现的八维叙事学测量

评价创造力
36

AI Fiction in the Wild

2026-06MFS Cultural AI / Modern Fiction Studies
关键工作
引用 1 次

真实用户请求与需求分布

人机协作评价
02

From Personas to Plot: Magnet

2026-07arXiv preprint
关键工作
引用 0 次

世界状态图、critic 闭环与 Atlas 检测

状态与一致性生成与规划
09

Reading routes

四条建议阅读路径

不必从 00 读到 46。按照问题进入,才能看见方法之间的继承、冲突与边界。

A

理解长篇生成系统

从奠基流水线走向状态闭环与主动搜索。

  1. 1Re3
  2. 2Agents’ Room
  3. 3DOME / StoryWriter
  4. 4Magnet
  5. 5BiT-MCTS
  6. 6Book Writing Capability
B

理解一致性与上下文边界

区分“写得长”“记得住”和“能验证”。

  1. 1LongWriter
  2. 2Lost in Stories
  3. 3CFPG
  4. 4Storyline Trees
  5. 5TLDM / Chain-of-Agents
C

建立故事评价体系

从分类学、通用评委走向专用指标与轨迹评测。

  1. 1Story Evaluation Survey
  2. 2HelloBench / WritingBench
  3. 3StoryAlign
  4. 4Spoiler Alert
  5. 5Narrative Flattening
  6. 6NARRA-Gym
D

理解创造力与文学性

拆开发散、收敛、意外、同质化与人物多样性。

  1. 1Calibrated Surprise
  2. 2Automated Creativity Evaluation
  3. 3Decan
  4. 4Assessing Creativity
  5. 5Chinese Literature Homogeneity / CASPER
  6. 6Fabula