模型主导
人提供题目、提示或约束,模型承担主要创作。
Research atlas · 2022—2026
方法、评价与开放问题。把 47 篇论文从“模型清单”重组为一张可导航的研究地图:问题在哪里、方法如何演进、证据支持什么,又在哪些边界上失效。
Chronology
按首次公开时间排列;星级表示其对理解本领域的重要性。
Research landscape
独立生成与作者辅助回答了“谁主导创作”,但要解释系统怎样工作,还必须同时观察规划、状态、评价与真实使用。
人提供题目、提示或约束,模型承担主要创作。
模型协助构思、组织、检索、诊断或局部改写。
如何把主题扩展成具有层级、因果和节奏的长篇?
DOME · StoryWriter · BiT-MCTS如何记住事实、关系与承诺,并在错误扩散前修正?
Lost in Stories · Magnet · CFPG如何测量故事质量,并把评价转化为搜索或训练信号?
StoryAlign · WritingBench · EvolvR作者和读者真正需要什么,系统过程是否可控、可靠?
Fabula · GraphStory · AI Fiction in the Wild规划决定评价器检查什么;评价器决定搜索与训练优化什么;真实使用又决定“质量”究竟指文学创新、类型满足、个性化体验,还是稳定完成意图。
Shared bottlenecks
研究的主要瓶颈已经从局部语言质量,转向长程状态、因果承诺、叙事张力、人物差异与非平庸选择。
长输出、长上下文与长程一致性是三种不同能力。8k–10k 词的故事仍会在中段集中出现事实、人物和时间线矛盾。
句段顺滑只是最低门槛。信息何时释放、冲突为何升级、人物怎样改变,才决定文本是否成为一个完整故事。
创造力至少包含探索范围、任务收敛、模式坍缩与受约束的意外;任何单一总分都会混淆这些目标。
“会继续写,不等于会讲故事。— 47 篇研究共同指向的能力断层
Reader takeaways
这些结论不是对单篇论文的复述,而是 47 篇研究共同呈现的能力边界。
大模型已经很会写正确、顺滑的句子,但故事还需要跨章节的因果、人物变化、节奏和承诺兑现。局部读起来不错,整体仍可能松散或矛盾。
判断故事能力不能只看文笔和开头几段,还要看模型能否长期维护人物、事实和叙事目标。
更大的上下文窗口、更长的训练样本和更高的输出上限可以让模型继续写,却不会自动阻止事实遗忘、时间冲突和人物设定漂移。
长度、一致性、结构完整和阅读吸引力必须分开衡量,不能把“字数更多”直接当作“故事更好”。
大纲、事件图和分层计划能减少跑题与前后矛盾,但规划过细会压缩人物行动和情节转折的开放空间,使故事变得可预测。
好的规划应固定必须稳定的宏观承诺,把局部表达、人物选择和意外转折留给生成过程。
给多个模型角色起不同名字并不会自动提高质量。真正有用的是明确分工、共享状态、候选比较、批评修订和失败处理。
评价多智能体系统时,应先问它增加了什么可验证机制,而不是参与讨论的角色有多少。
答案更分散、词汇更稀有或情节更奇怪,不一定更有创造力。好的意外既不平庸,也要符合人物、世界和主题约束。
发散范围、收敛能力和单篇作品质量需要分别测量,再观察模型能否产生罕见但合适的选择。
模型会学习奖励器和评委能够看见的东西。如果评价偏爱长度、规范和表面风格,系统可能得到更高分,却牺牲张力、人物差异和长期艺术价值。
不存在脱离读者、体裁和使用场景的唯一“好故事”总分;更可靠的评价应组合硬约束、专用指标和人类判断。
Method evolution
贯穿各条技术路线的共同变化,是把隐含在上下文中的叙事状态转成可检查的中间表示,并让生成、评价、修订形成闭环。
Re3 把长篇生成拆成可诊断流水线,确立此后多数系统的基本骨架。
Re3 · 2022事件图、场景树和树状扩写把“写长”变成跨粒度决策,而非简单续写。
DOME · StoryWriter · Ex3知识图、世界状态和伏笔账本,让事实、关系和承诺可以被更新与校验。
Magnet · CFPG · STORYTELLER收益并不来自 agent 数量,而来自职责边界、共享状态和候选选择机制。
Agents’ Room · StoryBoxMCTS、符号枚举和多评审将生成改写成“提出—检验—局部修复”的闭环。
BiT-MCTS · ASP Story专用数据、奖励模型与可验证任务降低脚手架成本,但也让评价偏差进入权重。
LongWriter · StoryAlign · EvolvRSystem architecture
这些论文不是互斥方案,而是可以组合的系统层。每一层既提供能力,也引入新的失败方式。
把主题转成事件、场景、节拍与因果结构
分层大纲 · 事件图 · Story Prototype · ASP
模板僵化,结构先验压缩意外空间
跟踪事实、人物、关系、时间与叙事承诺
世界状态图 · KG 记忆 · 伏笔账本 · 场景树
隐含意义难以结构化,维护成本持续上升
产生候选、比较路径,并在局部定点修复
MCTS · debate · critic · rerank · 定点重写
成本高,评价器偏差会被搜索放大
控制声音、人物类型、情感与叙事复杂度
风格定义 · 非线性编排 · 人物维度 · 反扁平指标
模仿替代原创,表面风格遮蔽内容贫乏
保留作者控制,支持构思、诊断与迭代
可编辑图 · Gardener/Architect · 轨迹式交互
自动重写夺走控制权,单一路径不适配所有作者
推荐架构:规划层提出承诺,状态层维护承诺,探索层生成候选,评价层定位失败,人机交互层决定哪些修改真正发生。
Evaluation
词重叠指标无法测量开放式叙事,通用 LLM 评委又偏爱流畅、长度和表面风格。更稳健的方案是一组相互校验的仪表,而非“文学质量真值”。
| 方法 | 擅长 | 主要局限 | 代表工作 |
|---|---|---|---|
| 动态 rubric + LLM 评委 | 通用质量、指令适配、解释 | 风格与长度偏差;深层维度分辨率有限 | WritingBench · POLARIS |
| 专用奖励模型 | 人类偏好、人物、创意与训练奖励 | 数据构造偏差;跨域泛化仍待验证 | StoryAlign · EvolvR |
| 结构化检查器 | 事实、时间、世界状态与硬约束 | 可能误判有意伏笔、暧昧与不可靠叙述 | Lost in Stories · Magnet/Atlas |
| 叙事学专用指标 | 张力、伏笔、人物与叙事功能 | 覆盖面窄;依赖理论操作化与标注 | Spoiler Alert · CASPER |
| 信息论指标 | 多样性、模式坍缩与受约束意外 | 依赖代理模型;操作化仍处于早期 | Calibrated Surprise · Decan |
| 可执行 / 轨迹式评测 | 多轮记忆、鲁棒性、个性化与交互体验 | 成本高;环境设计显著影响结论 | NARRA-Gym · Fabula |
Synthesis
每条判断都区分证据、适用边界和结论,避免把局部实验结果升级成普遍规律。
Re3、DOME 与 StoryWriter 显示,显式计划和事件结构能改善完整性与切题性。
StoryBox 与 Fabula 提醒:过细计划会带来可预测、僵硬与作者控制权下降。
让规划维护必须稳定的宏观承诺,同时把人物行动、局部语言与转折留在开放空间。
Agents’ Room、Magnet 与 One Sentence, One Drama 分别验证了分工、候选批评和定点修订。
串行角色模拟昂贵,文本式 agent 通信还可能逐轮传播错误。
先定义共享状态、决策权与失败处理,再决定是否真的需要多个 agent。
LongWriter 与 CogWriter 从训练数据和推理脚手架两端显著提升了长输出。
Lost in Stories 仍观察到系统性矛盾;真实使用中的长度与传统长篇还有数量级差距。
长度遵从、一致性、结构完整和文学吸引力必须分开报告。
WritingBench 与 POLARIS 证明动态标准和评委奖励能改善通用写作质量。
张力缺失、后训练压平和“重风格轻内容”常不会反映在通用总分中。
把通用评委放在基础质量分支,深层叙事交给专用指标、结构检查和人类锚点。
三类研究分别测量探索范围、模式覆盖,以及单篇作品中受约束的意外。
高熵可能只是噪声,高任务完成度也可能只是保守与平均化。
创造力是多轴能力:扩大探索,同时守住收敛质量,再优化有意义的意外。
真实日志与动态评测表明,类型满足、个性化、鲁棒性和文学创新并不是同一个目标。
即时偏好不等于长期艺术价值,重度用户样本也不能代表全部读者。
评价必须先声明目标;可共享基础质量门槛,但不应共享未经校准的最终排序。
Open questions
更强的基座不会自动解决叙事问题。下一步需要把质量拆开测量,把中间表示交还作者,并把成本纳入比较。
构建跨语言、体裁、长度和系统形态的综合基准
研究整本输入下的分段验证与可追溯全局汇总
联合优化一致性与非平庸性,摆脱“稳定但模板化”
测量人物关系的跨章演化、隐性动机与不可靠叙述
验证评价器的增量效度、跨域稳定与抗投机能力
把真实读者、作者研究与离线文本评分结合
让事件图、世界状态和场景树成为作者可编辑对象
把文字侧验证原则迁移到多模态与空间约束
同时报告质量、调用次数、延迟、失败率与修订粒度
Paper map
按标题、角色、标签、年份或发表载体搜索;点击论文卡片可打开本地精读笔记。引用数据:Semantic Scholar · 快照于 2026-08-02;引用次数不等同于论文质量。
奠基范式
1 篇论文规划、长文与评价
10 篇论文可解释的中文长文风格控制
通过削减脱困路径生成悬念
抽象符号约束与情节多样性
分段 worker 与长上下文汇总
长样本合成、长度能力与长文基准
从真实小说抽取结构并树状扩写
故事评价维度与指标分类学
通用长文生成与分层评价
编剧室式多智能体基线
动态分层大纲与时序 KG 记忆
系统化与训练
12 篇论文规划—监控—复审的免训练脚手架
面向任务的动态评价标准
下一章预测的可验证奖励
整本小说理解的长上下文压力测试
SVO 情节节点与动态实体图
事件图、非线性编排与历史压缩
长短期记忆与显式冲突注入
自演化成对推理评价与奖励闭环
逻辑 / 文体解耦与超长多体裁生成
LLM 重风格、轻内容的偏好诊断
角色沙盒、涌现事件与异常因子
生成侧分类学与领域入口
评价闭环与真实使用
24 篇论文伏笔—触发—兑现的符号化控制
多模态叙事的验证—修订闭环
长篇一致性基准与错误定位
高潮优先的双向情节搜索
中文叙事功能与结构同质化
连贯建模粒度的负面结果
100-Endings 张力指标
受约束意外的质量理论
故事偏好基准与专用奖励模型
动态、多轮、轨迹式叙事评测
创造力测试的增量效度
规划脚手架反演与长篇专用训练
文学评审数据与判别器训练
短剧节奏、多评审与定点重写
后训练导致的主题、情感与风格收窄
Decan 多样性与模式坍缩指标
LLM 评委奖励、HRI 与低算力 GRPO
发散 / 收敛创造力的分离测量
写作工具、auto-rater 与专家参与设计
图式构思、分支探索与作者控制
场景级层次表示与长篇检索
人物呈现的八维叙事学测量
真实用户请求与需求分布
世界状态图、critic 闭环与 Atlas 检测
Reading routes
不必从 00 读到 46。按照问题进入,才能看见方法之间的继承、冲突与边界。
从奠基流水线走向状态闭环与主动搜索。
区分“写得长”“记得住”和“能验证”。
从分类学、通用评委走向专用指标与轨迹评测。
拆开发散、收敛、意外、同质化与人物多样性。