好故事不是流畅文本,而是跨层叙事能力
新版证据反复显示,句子顺滑、局部切题与整篇故事成立并不是同一件事。模型还要维持跨章事实、人物变化、节奏、张力和早先承诺的兑现。
评价时应把语言质量、结构完整、状态一致和读者体验分开,避免用开头几段或一个总分代替整本判断。
Chronology
按首次公开时间排列;星级表示编辑阅读价值,引用数表示外部传播度。
Reader takeaways
这些内容是跨论文综合结论,不是对单篇论文摘要的重复。
新版证据反复显示,句子顺滑、局部切题与整篇故事成立并不是同一件事。模型还要维持跨章事实、人物变化、节奏、张力和早先承诺的兑现。
评价时应把语言质量、结构完整、状态一致和读者体验分开,避免用开头几段或一个总分代替整本判断。
长样本训练能解锁输出长度,分段代理能处理更长输入,外部状态能减少遗忘;三者都不会自动带来小说级连贯或文学质量。
系统报告至少要拆开长度遵从、长上下文理解、状态一致性和作品质量,不能把标称窗口或字数当成综合能力。
大纲、事件图和符号承诺在多项实验中改善了长度、完整性或自动一致性;但多数系统同时增加调用、上下文、检索与修订预算,消融也常不等成本。
应让规划维护宏观承诺,同时用等预算对照区分结构表示、更多计算和评委偏好各自贡献。
较可信的收益来自分段写作、共享状态、候选比较和定点修订,而不是给同一模型增加角色名称。现有证据又常把 agent 数量与更多 token、调用和专用提示混在一起。
引入 agent 前先定义状态、决策权和失败处理,并用单模型多轮等预算基线检验多角色是否真的必要。
熵、语义差异、不可预测性和结构选择能诊断发散、张力或模式坍缩,却都可能把噪声、措辞偏好或评分器特性误当成创造力。
先说明指标测的是探索、收敛还是受约束意外,再用独立人评和下游作品验证增量效度。
动态 rubric、专用奖励和轨迹评测提供了有用代理,但不少主榜存在 judge—benchmark 闭环、弱人类相关或同源训练;结构化选择偏好也不能直接外推到真实生成与评分。
把自动评价当作可审计的代理:报告效度边界、隔离训练与测试,并用结构检查、专用指标和人类锚点交叉验证。
Research landscape
从问题而非论文清单出发,理解不同研究板块如何相互连接。
如何把主题扩展为跨章节可控、可验证又不僵化的故事?
如何区分写得长、读得长、记得住和真正理解整本叙事?
自动分数测到了什么,能否外推到真实作品、读者和训练闭环?
如何保留合理意外、人物差异与作者控制,又不把请求日志或代理指标误当体验?
Shared bottlenecks
多篇研究反复暴露的问题,往往比单项指标提升更能说明领域边界。
输出长度、长上下文读取、跨章状态和整本理解是不同能力;扩大样本、窗口或调用链不会自动消除漂移。
规划、状态图和多代理系统常同时增加 token、调用、检索与修订;不等预算消融使组件因果贡献难以分配。
自动评委常依赖同源训练、弱人类相关或自构 gold;精确小数不代表真实作品质量、读者体验或跨域稳定。
不可预测、语义差异、结构化选择和请求重复都提供线索,却不能单独证明张力、创造力、真实生成偏好或用户体验。
Method evolution
每条路线都解决旧问题,同时引入新的成本、偏差或控制难题。
Stage 01
先规划、再起草、重排和编辑,建立长篇故事生成的基本流水线。
新增代价:更可控,但静态骨架容易僵化。
Stage 02
把情节拆成多尺度大纲、事件节点和动态实体关系。
新增代价:结构更清晰,但维护复杂度增加。
Stage 03
显式记录人物、世界状态、伏笔和场景层次,并为冲突返回证据。
新增代价:检查器常与系统共享表示或在合成错误上验证,真实召回仍受限。
Stage 04
规划、分段生成、评审与修订被拆成可观察步骤,并通过共享状态接续。
新增代价:多代理收益常与更多调用和专用提示混杂,成本与失败传播上升。
Stage 05
用迭代规划、树搜索和可验证奖励探索非平庸但合约束的路径。
新增代价:探索能力增强,同时放大评价器偏差。
Stage 06
长篇数据、奖励模型、轨迹基准和可编辑界面开始共同塑造创作系统。
新增代价:更贴近工作流,但闭环评价、数据来源和跨域外推成为主要风险。
System map
把不同论文放入同一条研究或系统链路,观察模块之间的职责与风险。
Layer 01
职责:把主题转成事件、场景、节拍与因果结构
方法:分层大纲 · 事件图 · Story Prototype · ASP
风险:模板僵化,结构先验压缩意外空间
Layer 02
职责:跟踪事实、人物、关系、时间与叙事承诺
方法:世界状态图 · KG 记忆 · 伏笔账本 · 场景树
风险:隐含意义难以结构化,维护成本持续上升
Layer 03
职责:产生候选、比较路径,并在局部定点修复
方法:MCTS · debate · critic · rerank · 定点重写
风险:成本高,评价器偏差与更多计算预算会被搜索放大
Layer 04
职责:控制声音、人物类型、情感与叙事复杂度
方法:风格定义 · 非线性编排 · 人物维度 · 反扁平指标
风险:模仿替代原创,表面风格遮蔽内容贫乏
Layer 05
职责:保留作者控制,支持构思、诊断与迭代
方法:可编辑图 · Gardener/Architect · 轨迹式交互
风险:自动重写夺走控制权,单一路径不适配所有作者
Evaluation
评价装置看到什么,研究系统就会优先优化什么。
| 方法 | 优势 | 边界 | 代表工作 |
|---|---|---|---|
| 动态 rubric + LLM 评委 | 按任务拆解要求,适合解释和成对比较 | 绝对分效度弱;可能形成 judge—benchmark 闭环 | WritingBench · POLARIS |
| 专用奖励模型 | 比通用评委更聚焦故事偏好和专用维度 | 混合金标、同源评测与 reward hacking 风险 | StoryAlign · EvolvR |
| 结构化检查器 | 可定位事实、时间、世界状态与硬约束错误 | 常在合成错误上验证,也可能与生成器共享表示偏差 | Lost in Stories · Magnet/Atlas |
| 叙事学专用指标 | 能观察通用总分遗漏的张力、人物与叙事功能 | 代理通常只覆盖窄构念,不能直接等同文学质量 | Spoiler Alert · CASPER |
| 信息论指标 | 诊断探索范围、模式坍缩与受约束意外 | 依赖 scorer 和样本协议,高熵也可能只是噪声 | Calibrated Surprise · Decan |
| 可执行 / 轨迹式评测 | 能暴露多轮记忆、用户抵触和交互过程中的失败 | 共享脚手架、环境设计和小样本限制模型归因 | NARRA-Gym · Fabula |
Synthesis
每项判断同时呈现支持证据、适用边界和综合结论。
J01
Re3、DOME、StoryWriter 与 CFPG 在各自协议中改善了完整性、长度、自动一致性或承诺兑现。
这些系统通常同时增加调用、上下文、检索和修订;多项消融不等预算,检查器还可能复用系统表示。
用规划维护宏观承诺,但应以等预算对照和独立评价区分结构表示与更多计算的收益。
J02
Agents’ Room、Magnet、CogWriter 与短剧流水线显示,分段生成、共享状态、候选比较和定点修订能改善特定任务。
现有实验常把角色数量、调用次数、token 预算和专用提示一起改变,样本量与人工评价也偏小。
先定义状态、决策权和失败处理,并用单模型多轮等预算基线验证多个 agent 是否必要。
J03
LongWriter 解锁长度遵从,Chain-of-Agents 和 Storyline Trees改善长输入处理,状态图方法减少部分冲突。
HelloBench 的自动质量相关有限,TLDM 没有人类真值,Lost in Stories 的检查器主要在注入错误上验证。
分别报告输出长度、长上下文理解、跨章状态、结构完整和文学吸引力。
J04
WritingBench 的动态 criterion 在受限成对实验中更贴近人工偏好;专用评委和轨迹评测也能暴露通用总分遗漏的问题。
WritingBench 主榜存在 judge—benchmark 闭环,POLARIS 依赖 LLM judge;Style over Story 的结构化选择不能外推到真实生成或评分。
自动评委用于基础诊断与筛选,最终结论需要隔离数据、独立人评和多种互补测量。
J05
多项研究分别测量语义分叉、模式覆盖、不可预测性、叙事功能与受约束意外,并揭示后训练后的分布收窄。
高熵可能是噪声,不可预测不等于张力,结构差异不等于质量;多数代理缺少独立专家和跨任务验证。
明确指标测的是探索、收敛还是作品质量,再报告它对独立人评与下游创作的增量效度。
J06
综述、NARRA-Gym、Fabula 与 GraphStory 表明,独立生成、作者辅助和互动叙事需要不同成功标准。
AI Fiction in the Wild 只观察请求行为,不能推出阅读体验或用户心理;学生与重度用户样本也不能代表全部作者和读者。
共享基础质量门槛,但按作者控制、互动目标和目标读者分别定义最终评价。
Open questions
现有证据尚未解决、值得继续验证的研究问题。
Paper map
按标题、角色、标签、年份或发表载体搜索;点击卡片打开本地精读笔记。
引用数据:Semantic Scholar · 快照于 2026-08-02;引用次数不等同于论文质量,星级为本综述的编辑判断。
可解释的中文长文风格控制
重要性理由:提供可解释的中文长文风格定义和迁移方法。
18通过削减脱困路径生成悬念
重要性理由:把经典悬念理论转化为可执行的迭代规划算法。
46符号约束带来的结构差异而非质量保证
重要性理由:把符号结构与语言模型结合并提高结构多样性;尚无质量、连贯性和人工验证。
42长输入读取与汇总的顺序通信参照
重要性理由:通用长上下文分段框架可供整本阅读参照,但并非故事生成证据。
09长样本合成、长度能力与长文基准
重要性理由:证明长输出受训练数据长度制约,并给出可复用的长文数据工程方案。
06从真实小说抽取结构并树状扩写
重要性理由:把小说结构抽取、领域微调与树状扩写串成完整训练管线。
23故事评价维度与指标分类学
重要性理由:系统整理故事评价维度、数据集和指标,是评价侧的总览地图。
22通用长文生成与分层评价
重要性理由:较早系统揭示长度遵循失败;自动质量评估与人类结果的相关证据仍偏弱。
14分段写作、共享 scratchpad 的多智能体基线
重要性理由:奠定编剧室式基线;证据更支持分段写作与共享状态,而非智能体数量本身。
03动态分层大纲与时序 KG 记忆
重要性理由:动态大纲与时序知识图谱是重要系统路线,但部分增益混有预算不等的因素。
规划—监控—复审的免训练脚手架
重要性理由:将规划、监控和复审认知过程落地为免训练长文脚手架。
20动态 criterion 与 judge 闭环的效度案例
重要性理由:验证随任务标准下的成对评价;评委复用提示与标准形成闭环,绝对分数有明显效度边界。
39下一章预测的可验证奖励
重要性理由:用下一章预测构造可验证奖励,代表从无标注书籍学习规划的新路线。
43整本小说理解的长上下文压力测试
重要性理由:用整本小说揭示长短上下文表现断层;无人工真值,不能等同于总体叙事不理解。
07SVO 情节节点与动态实体图
重要性理由:以 SVO 节点和动态实体图管理叙事状态;主要证据来自 200 个提示与 GPT-4o 评审。
10事件图、非线性编排与历史压缩
重要性理由:事件图、非线性编排和历史压缩组成成熟的长篇多智能体流水线。
40长短期记忆与显式冲突注入
重要性理由:结合记忆、知识图谱和叙事障碍理论改善主题漂移与情节平淡。
44成对推理评价器与部分成立的奖励闭环
重要性理由:将成对推理评估器接入部分奖励闭环,同时暴露开放域退化与奖励投机。
41逻辑 / 文体解耦与超长多体裁生成
重要性理由:展示超长连续生成的工程规模;文学质量证据弱于系统与流程主张。
45结构化选择中的风格偏好代理
重要性理由:揭示结构化选择任务中的风格偏好;不能外推为真实生成或自由评审偏好。
11角色沙盒、涌现事件与异常因子
重要性理由:以角色沙盒和异常因子展示自底向上、涌现式故事生成。
00按主作者权划分生成与共创路线的领域入口
重要性理由:给出双范式分类学和领域地图;结论边界受纳入范围与非系统综述方法约束。
伏笔—触发—兑现的符号化控制
重要性理由:首次把伏笔、触发与回收编码成可维护的叙事承诺。
13多模态叙事的验证—修订闭环
重要性理由:以多模态叙事验证闭环提供跨媒介参照,但与纯文本主题距离较远。
01长篇一致性基准与错误定位
重要性理由:把长篇一致性转成可检查基准;检查器效度主要由注入错误验证。
24高潮优先的双向情节搜索
重要性理由:以高潮为根节点进行双向搜索,为开放主题规划引入显式探索。
25中文叙事功能与结构同质化
重要性理由:从叙事功能而非词汇表面定位中文网文的结构同质化。
16连贯建模粒度的负面结果
重要性理由:负面结果澄清句子骨架并非更好的连贯判别粒度。
17100-Endings 张力指标
重要性理由:用结局可预测性直接操作化叙事张力,补足通用评委的盲区。
27受约束意外的质量理论
重要性理由:提出约束满足与意外性的可计算假设;小规模退化对照尚不能充当通用文学质量函数。
19混合金标的故事偏好基准与专用奖励模型
重要性理由:建立故事偏好基准并暴露通用评委偏差;金标混合构造限制独立人类偏好解释。
31动态、多轮、轨迹式叙事评测
重要性理由:把评测扩展为多轮全轨迹环境;分数反映共享脚手架中的系统表现,而非裸模型能力。
30创造力测试的增量效度
重要性理由:检验经典创造力测验的预测效度,说明单一指标无法覆盖全部构念。
05从公版书反演规划轨迹的长篇专用训练
重要性理由:从真实书籍反演多尺度脚手架;首章规则诊断和规划遵循下降限定其外推范围。
32固定格式文学评论中的推理监督负面结果
重要性理由:提供大规模文学评审训练经验,并以负面结果警示推理监督和数据一致性问题。
35多模态短剧流水线、多评审与局部 patch
重要性理由:提供多模态短剧的评审重写系统参考;缺少评审一致性和显著性证据。
21后训练导致的主题、情感与风格收窄
重要性理由:用同基座检查点证明后训练会系统压平主题、情感和文体差异。
29按 byte 归一的条件惊奇与多样性代理
重要性理由:提出无需参考答案的多样性指标,但证据仍限于早期工作坊规模。
08人类参考注入与 16 维 LLM 奖励的长篇 RL
重要性理由:提供低算力写作强化学习配方;长度遵循有限且质量依赖 LLM 评审。
28发散 / 收敛创造力的分离测量
重要性理由:把创造力拆为发散与收敛两轴;自动指标仍是对文学创造力的代理测量。
33职业写作者参与设计与工具角色重定位
重要性理由:通过职业写作者参与设计,重新界定 AI 在创作工具中的合适角色。
34图式构思、分支探索与作者控制
重要性理由:以可编辑事件图同时服务作者构思和模型上下文,代表共创界面方向。
15场景级层次表示与长篇检索
重要性理由:提供场景到主题的层次表示,为整本叙事检索与验证补上基础设施。
37人物呈现八维分类器及其混杂诊断
重要性理由:把人物呈现操作化为八维诊断框架;中等一致性与来源、长度混杂需保留。
36小说请求的高度集中、重复与行为边界
重要性理由:真实日志揭示虚构请求的集中与重复;不能外推到读者体验、享受或心理效应。
02角色提案—叙述者提交的状态闭环与 Atlas 检测
重要性理由:闭合角色行动、世界状态与一致性检测;长篇优势仍来自少量样本和模型评审。
请缩短关键词或切换到“全部”。
Reading paths
从不同问题意识出发,以最短路径进入论文库。
从奠基流水线走向状态闭环与主动搜索。
区分“写得长”“记得住”和“能验证”。
从分类学、通用评委走向专用指标与轨迹评测。
拆开发散、收敛、意外、同质化与人物多样性。