Research atlas

大模型故事生成研究图谱

从时间线、核心洞见、方法演进、评价体系到 47 篇论文精读笔记

47论文总数
2022–2026首次公开跨度
6主题标签
2026-08-02Semantic Scholar 快照
47 篇论文2022–2026更新于 2026-08-03

综合梳理大模型故事生成中的长文本规划、一致性、创造力、评价与人机协作研究。

  • · 聚焦故事与小说生成,不把一般代码、数学或工具调用能力作为主体。
  • · 引用次数采用固定快照,仅表示外部传播度,不代表论文质量。

Chronology

论文时间轴

按首次公开时间排列;星级表示编辑阅读价值,引用数表示外部传播度。

Reader takeaways

如果只记住六件事

这些内容是跨论文综合结论,不是对单篇论文摘要的重复。

I01

好故事不是流畅文本,而是跨层叙事能力

新版证据反复显示,句子顺滑、局部切题与整篇故事成立并不是同一件事。模型还要维持跨章事实、人物变化、节奏、张力和早先承诺的兑现。

这意味着

评价时应把语言质量、结构完整、状态一致和读者体验分开,避免用开头几段或一个总分代替整本判断。

I04

多智能体外化的是流程,不是集体智慧

较可信的收益来自分段写作、共享状态、候选比较和定点修订,而不是给同一模型增加角色名称。现有证据又常把 agent 数量与更多 token、调用和专用提示混在一起。

这意味着

引入 agent 前先定义状态、决策权和失败处理,并用单模型多轮等预算基线检验多角色是否真的必要。

I05

创造力指标测到的多是代理,不是作品本身

熵、语义差异、不可预测性和结构选择能诊断发散、张力或模式坍缩,却都可能把噪声、措辞偏好或评分器特性误当成创造力。

这意味着

先说明指标测的是探索、收敛还是受约束意外,再用独立人评和下游作品验证增量效度。

I06

评价器既是尺子,也是偏差放大器

动态 rubric、专用奖励和轨迹评测提供了有用代理,但不少主榜存在 judge—benchmark 闭环、弱人类相关或同源训练;结构化选择偏好也不能直接外推到真实生成与评分。

这意味着

把自动评价当作可审计的代理:报告效度边界、隔离训练与测试,并用结构检查、专用指标和人类锚点交叉验证。

Shared bottlenecks

共同瓶颈

多篇研究反复暴露的问题,往往比单项指标提升更能说明领域边界。

Method evolution

方法演进

每条路线都解决旧问题,同时引入新的成本、偏差或控制难题。

Stage 01

显式计划与符号骨架

先规划、再起草、重排和编辑,建立长篇故事生成的基本流水线。

新增代价:更可控,但静态骨架容易僵化。

Stage 02

层次大纲与事件图

把情节拆成多尺度大纲、事件节点和动态实体关系。

新增代价:结构更清晰,但维护复杂度增加。

System map

系统分类

把不同论文放入同一条研究或系统链路,观察模块之间的职责与风险。

Layer 05

人机交互

职责:保留作者控制,支持构思、诊断与迭代

方法:可编辑图 · Gardener/Architect · 轨迹式交互

风险:自动重写夺走控制权,单一路径不适配所有作者

Evaluation

评价方法及边界

评价装置看到什么,研究系统就会优先优化什么。

方法优势边界代表工作
动态 rubric + LLM 评委按任务拆解要求,适合解释和成对比较绝对分效度弱;可能形成 judge—benchmark 闭环WritingBench · POLARIS
专用奖励模型比通用评委更聚焦故事偏好和专用维度混合金标、同源评测与 reward hacking 风险StoryAlign · EvolvR
结构化检查器可定位事实、时间、世界状态与硬约束错误常在合成错误上验证,也可能与生成器共享表示偏差Lost in Stories · Magnet/Atlas
叙事学专用指标能观察通用总分遗漏的张力、人物与叙事功能代理通常只覆盖窄构念,不能直接等同文学质量Spoiler Alert · CASPER
信息论指标诊断探索范围、模式坍缩与受约束意外依赖 scorer 和样本协议,高熵也可能只是噪声Calibrated Surprise · Decan
可执行 / 轨迹式评测能暴露多轮记忆、用户抵触和交互过程中的失败共享脚手架、环境设计和小样本限制模型归因NARRA-Gym · Fabula

Synthesis

跨论文综合判断

每项判断同时呈现支持证据、适用边界和综合结论。

证据

Re3、DOME、StoryWriter 与 CFPG 在各自协议中改善了完整性、长度、自动一致性或承诺兑现。

边界

这些系统通常同时增加调用、上下文、检索和修订;多项消融不等预算,检查器还可能复用系统表示。

结论

用规划维护宏观承诺,但应以等预算对照和独立评价区分结构表示与更多计算的收益。

证据

Agents’ Room、Magnet、CogWriter 与短剧流水线显示,分段生成、共享状态、候选比较和定点修订能改善特定任务。

边界

现有实验常把角色数量、调用次数、token 预算和专用提示一起改变,样本量与人工评价也偏小。

结论

先定义状态、决策权和失败处理,并用单模型多轮等预算基线验证多个 agent 是否必要。

证据

LongWriter 解锁长度遵从,Chain-of-Agents 和 Storyline Trees改善长输入处理,状态图方法减少部分冲突。

边界

HelloBench 的自动质量相关有限,TLDM 没有人类真值,Lost in Stories 的检查器主要在注入错误上验证。

结论

分别报告输出长度、长上下文理解、跨章状态、结构完整和文学吸引力。

证据

WritingBench 的动态 criterion 在受限成对实验中更贴近人工偏好;专用评委和轨迹评测也能暴露通用总分遗漏的问题。

边界

WritingBench 主榜存在 judge—benchmark 闭环,POLARIS 依赖 LLM judge;Style over Story 的结构化选择不能外推到真实生成或评分。

结论

自动评委用于基础诊断与筛选,最终结论需要隔离数据、独立人评和多种互补测量。

证据

多项研究分别测量语义分叉、模式覆盖、不可预测性、叙事功能与受约束意外,并揭示后训练后的分布收窄。

边界

高熵可能是噪声,不可预测不等于张力,结构差异不等于质量;多数代理缺少独立专家和跨任务验证。

结论

明确指标测的是探索、收敛还是作品质量,再报告它对独立人评与下游创作的增量效度。

证据

综述、NARRA-Gym、Fabula 与 GraphStory 表明,独立生成、作者辅助和互动叙事需要不同成功标准。

边界

AI Fiction in the Wild 只观察请求行为,不能推出阅读体验或用户心理;学生与重度用户样本也不能代表全部作者和读者。

结论

共享基础质量门槛,但按作者控制、互动目标和目标读者分别定义最终评价。

Open questions

开放问题

现有证据尚未解决、值得继续验证的研究问题。

  1. 用等 token、等调用和等模型基线拆开规划、多代理与更多计算的贡献
  2. 建立带人类真值的整本状态、一致性、张力和人物演化基准
  3. 验证自动评委对独立人评、跨体裁和真实创作结果的增量效度
  4. 隔离 judge 训练数据、benchmark query 与被评模型,审计评价闭环污染
  5. 联合测量长度遵从、长上下文理解、跨章状态和整本作品质量
  6. 区分发散、收敛、不可预测性与文学质量,验证创造力代理的构念效度
  7. 把作者控制、用户抵触和长期创作收益纳入轨迹式评测
  8. 让事件图、世界状态和场景树成为可编辑、可追溯而非隐藏的系统对象
  9. 同时报告质量、调用次数、token、延迟、失败率和人工修订成本

Paper map

论文地图

按标题、角色、标签、年份或发表载体搜索;点击卡片打开本地精读笔记。

引用数据:Semantic Scholar · 快照于 2026-08-02;引用次数不等同于论文质量,星级为本综述的编辑判断。

2022

1 篇论文

2024

10 篇论文
26

CAT-LLM

2024-01 · ACM journal version (2025)
★★★☆☆重要补充引用 12 次

可解释的中文长文风格控制

重要性理由:提供可解释的中文长文风格定义和迁移方法。

生成与规划创造力
18

Suspenseful Iterative Planning

2024-02 · EACL 2024
★★★★☆关键工作引用 27 次

通过削减脱困路径生成悬念

重要性理由:把经典悬念理论转化为可执行的迭代规划算法。

生成与规划创造力
46

ASP Story

2024-06 · ACL 2024 Workshop
★★★★☆关键工作引用 12 次

符号约束带来的结构差异而非质量保证

重要性理由:把符号结构与语言模型结合并提高结构多样性;尚无质量、连贯性和人工验证。

生成与规划创造力
42

Chain-of-Agents

2024-06 · NeurIPS 2024
★★★☆☆重要补充引用 263 次

长输入读取与汇总的顺序通信参照

重要性理由:通用长上下文分段框架可供整本阅读参照,但并非故事生成证据。

长上下文生成与规划
09

LongWriter

2024-08 · arXiv preprint
★★★★★领域锚点引用 153 次

长样本合成、长度能力与长文基准

重要性理由:证明长输出受训练数据长度制约,并给出可复用的长文数据工程方案。

长上下文生成与规划
06

Ex3

2024-08 · ACL 2024
★★★★☆关键工作引用 12 次

从真实小说抽取结构并树状扩写

重要性理由:把小说结构抽取、领域微调与树状扩写串成完整训练管线。

生成与规划
23

Story Evaluation Survey

2024-08 · ACM Computing Surveys
★★★★★领域锚点引用 22 次

故事评价维度与指标分类学

重要性理由:系统整理故事评价维度、数据集和指标,是评价侧的总览地图。

评价
22

HelloBench

2024-09 · arXiv preprint
★★★★☆关键工作引用 44 次

通用长文生成与分层评价

重要性理由:较早系统揭示长度遵循失败;自动质量评估与人类结果的相关证据仍偏弱。

长上下文评价
14

Agents’ Room

2024-10 · ICLR 2025
★★★★★领域锚点引用 71 次

分段写作、共享 scratchpad 的多智能体基线

重要性理由:奠定编剧室式基线;证据更支持分段写作与共享状态,而非智能体数量本身。

生成与规划人机协作
03

DOME

2024-12 · NAACL 2025
★★★★☆关键工作引用 38 次

动态分层大纲与时序 KG 记忆

重要性理由:动态大纲与时序知识图谱是重要系统路线,但部分增益混有预算不等的因素。

生成与规划状态与一致性

2025

12 篇论文
12

CogWriter

2025-02 · ACL 2025 Findings
★★★★☆关键工作引用 19 次

规划—监控—复审的免训练脚手架

重要性理由:将规划、监控和复审认知过程落地为免训练长文脚手架。

生成与规划状态与一致性
20

WritingBench

2025-03 · NeurIPS 2025
★★★★★领域锚点引用 74 次

动态 criterion 与 judge 闭环的效度案例

重要性理由:验证随任务标准下的成对评价;评委复用提示与标准形成闭环,绝对分数有明显效度边界。

评价
39

Learning to Reason with NCP

2025-03 · COLM 2025
★★★★☆关键工作引用 39 次

下一章预测的可验证奖励

重要性理由:用下一章预测构造可验证奖励,代表从无标注书籍学习规划的新路线。

生成与规划评价
43

TLDM

2025-05 · arXiv preprint
★★★★☆关键工作引用 8 次

整本小说理解的长上下文压力测试

重要性理由:用整本小说揭示长短上下文表现断层;无人工真值,不能等同于总体叙事不理解。

长上下文评价
07

STORYTELLER

2025-06 · ACL 2025 Findings
★★★★☆关键工作引用 12 次

SVO 情节节点与动态实体图

重要性理由:以 SVO 节点和动态实体图管理叙事状态;主要证据来自 200 个提示与 GPT-4o 评审。

生成与规划状态与一致性
10

StoryWriter

2025-06 · CIKM 2025
★★★★☆关键工作引用 20 次

事件图、非线性编排与历史压缩

重要性理由:事件图、非线性编排和历史压缩组成成熟的长篇多智能体流水线。

生成与规划长上下文
40

KG Literary Theory

2025-08 · arXiv preprint
★★★☆☆重要补充引用 0 次

长短期记忆与显式冲突注入

重要性理由:结合记忆、知识图谱和叙事障碍理论改善主题漂移与情节平淡。

状态与一致性创造力
44

EvolvR

2025-08 · arXiv preprint
★★★★☆关键工作引用 1 次

成对推理评价器与部分成立的奖励闭环

重要性理由:将成对推理评估器接入部分奖励闭环,同时暴露开放域退化与奖励投机。

评价生成与规划
41

CreAgentive

2025-09 · arXiv preprint
★★★★☆关键工作引用 0 次

逻辑 / 文体解耦与超长多体裁生成

重要性理由:展示超长连续生成的工程规模;文学质量证据弱于系统与流程主张。

生成与规划长上下文创造力
45

Style over Story

2025-10 · arXiv preprint
★★★★☆关键工作引用 1 次

结构化选择中的风格偏好代理

重要性理由:揭示结构化选择任务中的风格偏好;不能外推为真实生成或自由评审偏好。

评价创造力
11

StoryBox

2025-10 · AAAI 2026
★★★★☆关键工作引用 1 次

角色沙盒、涌现事件与异常因子

重要性理由:以角色沙盒和异常因子展示自底向上、涌现式故事生成。

生成与规划创造力
00

A Survey on LLMs for Story Generation

2025-11 · EMNLP 2025 Findings
★★★★★领域锚点引用 23 次

按主作者权划分生成与共创路线的领域入口

重要性理由:给出双范式分类学和领域地图;结论边界受纳入范围与非系统综述方法约束。

生成与规划评价

2026

24 篇论文
04

Codified Foreshadowing and Payoff

2026-01 · arXiv preprint
★★★★☆关键工作引用 0 次

伏笔—触发—兑现的符号化控制

重要性理由:首次把伏笔、触发与回收编码成可维护的叙事承诺。

状态与一致性生成与规划
13

MUSE

2026-02 · arXiv preprint
★★☆☆☆补充证据引用 5 次

多模态叙事的验证—修订闭环

重要性理由:以多模态叙事验证闭环提供跨媒介参照,但与纯文本主题距离较远。

生成与规划评价
01

Lost in Stories

2026-03 · arXiv preprint
★★★★★领域锚点引用 3 次

长篇一致性基准与错误定位

重要性理由:把长篇一致性转成可检查基准;检查器效度主要由注入错误验证。

状态与一致性长上下文评价
24

BiT-MCTS

2026-03 · arXiv preprint
★★★★☆关键工作引用 0 次

高潮优先的双向情节搜索

重要性理由:以高潮为根节点进行双向搜索,为开放主题规划引入显式探索。

生成与规划创造力
25

Chinese Literature Homogeneity

2026-03 · arXiv preprint
★★★☆☆重要补充引用 0 次

中文叙事功能与结构同质化

重要性理由:从叙事功能而非词汇表面定位中文网文的结构同质化。

创造力评价
16

Skeleton Coherence

2026-04 · arXiv preprint
★★☆☆☆补充证据引用 0 次

连贯建模粒度的负面结果

重要性理由:负面结果澄清句子骨架并非更好的连贯判别粒度。

评价状态与一致性
17

Spoiler Alert

2026-04 · arXiv preprint
★★★★☆关键工作引用 1 次

100-Endings 张力指标

重要性理由:用结局可预测性直接操作化叙事张力,补足通用评委的盲区。

评价创造力
27

Calibrated Surprise

2026-04 · arXiv preprint
★★★★☆关键工作引用 1 次

受约束意外的质量理论

重要性理由:提出约束满足与意外性的可计算假设;小规模退化对照尚不能充当通用文学质量函数。

创造力评价
19

StoryAlign

2026-05 · ICLR 2026
★★★★★领域锚点引用 2 次

混合金标的故事偏好基准与专用奖励模型

重要性理由:建立故事偏好基准并暴露通用评委偏差;金标混合构造限制独立人类偏好解释。

评价
31

NARRA-Gym

2026-05 · Technical report
★★★★☆关键工作引用 0 次

动态、多轮、轨迹式叙事评测

重要性理由:把评测扩展为多轮全轨迹环境;分数反映共享脚手架中的系统表现,而非裸模型能力。

评价人机协作
30

Assessing Creativity

2026-05 · arXiv preprint
★★★☆☆重要补充引用 0 次

创造力测试的增量效度

重要性理由:检验经典创造力测验的预测效度,说明单一指标无法覆盖全部构念。

创造力评价
05

Book Writing Capability

2026-05 · arXiv preprint
★★★★☆关键工作引用 0 次

从公版书反演规划轨迹的长篇专用训练

重要性理由:从真实书籍反演多尺度脚手架;首章规则诊断和规划遵循下降限定其外推范围。

生成与规划长上下文
32

TTCW Literary Review

2026-05 · arXiv preprint
★★★☆☆重要补充引用 0 次

固定格式文学评论中的推理监督负面结果

重要性理由:提供大规模文学评审训练经验,并以负面结果警示推理监督和数据一致性问题。

评价
35

One Sentence, One Drama

2026-05 · arXiv preprint
★★☆☆☆补充证据引用 2 次

多模态短剧流水线、多评审与局部 patch

重要性理由:提供多模态短剧的评审重写系统参考;缺少评审一致性和显著性证据。

生成与规划评价
21

Narrative Flattening

2026-05 · arXiv preprint
★★★★★领域锚点引用 0 次

后训练导致的主题、情感与风格收窄

重要性理由:用同基座检查点证明后训练会系统压平主题、情感和文体差异。

创造力评价
29

Progressive Conditional Surprise

2026-06 · ICML 2026 Workshop (non-archival)
★★★☆☆重要补充引用 0 次

按 byte 归一的条件惊奇与多样性代理

重要性理由:提出无需参考答案的多样性指标,但证据仍限于早期工作坊规模。

创造力评价
08

POLARIS

2026-06 · arXiv preprint
★★★☆☆重要补充引用 0 次

人类参考注入与 16 维 LLM 奖励的长篇 RL

重要性理由:提供低算力写作强化学习配方;长度遵循有限且质量依赖 LLM 评审。

评价
28

Automated Creativity Evaluation

2026-06 · arXiv preprint
★★★★☆关键工作引用 0 次

发散 / 收敛创造力的分离测量

重要性理由:把创造力拆为发散与收敛两轴;自动指标仍是对文学创造力的代理测量。

创造力评价
33

Fabula

2026-06 · arXiv preprint
★★★★☆关键工作引用 1 次

职业写作者参与设计与工具角色重定位

重要性理由:通过职业写作者参与设计,重新界定 AI 在创作工具中的合适角色。

人机协作评价
34

GraphStory

2026-06 · arXiv preprint (ACM format)
★★★★☆关键工作引用 0 次

图式构思、分支探索与作者控制

重要性理由:以可编辑事件图同时服务作者构思和模型上下文,代表共创界面方向。

人机协作生成与规划
15

Storyline Trees

2026-06 · arXiv preprint
★★★☆☆重要补充引用 0 次

场景级层次表示与长篇检索

重要性理由:提供场景到主题的层次表示,为整本叙事检索与验证补上基础设施。

长上下文状态与一致性
37

CASPER Character Variety

2026-06 · arXiv preprint
★★★★☆关键工作引用 0 次

人物呈现八维分类器及其混杂诊断

重要性理由:把人物呈现操作化为八维诊断框架;中等一致性与来源、长度混杂需保留。

评价创造力
36

AI Fiction in the Wild

2026-06 · MFS Cultural AI / Modern Fiction Studies
★★★★☆关键工作引用 1 次

小说请求的高度集中、重复与行为边界

重要性理由:真实日志揭示虚构请求的集中与重复;不能外推到读者体验、享受或心理效应。

人机协作评价
02

From Personas to Plot: Magnet

2026-07 · arXiv preprint
★★★★☆关键工作引用 0 次

角色提案—叙述者提交的状态闭环与 Atlas 检测

重要性理由:闭合角色行动、世界状态与一致性检测;长篇优势仍来自少量样本和模型评审。

状态与一致性生成与规划

Reading paths

建议阅读路径

从不同问题意识出发,以最短路径进入论文库。