大语言模型故事生成:方法、评价与开放问题
覆盖范围:本文综合梳理本库 00–46 共 47 篇论文精读,时间跨度从 Re3(2022)到 2026 年的新近工作。它不是对某一篇综述的摘要,而是一份以问题为中心的研究地图。不同论文的数据、模型、长度和评价设置并不完全可比,文中的跨论文判断均以“共同趋势”而非统一排行榜来理解。
摘要
大语言模型已经能够生成语法流畅、局部连贯、长度可观的故事,但“会继续写”不等于“会讲故事”。综合现有研究,主要瓶颈已从局部语言质量转向五类全局能力:长程事实与时间一致性、因果和伏笔管理、叙事张力与信息释放、人物及风格差异、在多重约束下产生非平庸选择。长度扩展只是必要条件;模型可以写得更长,却仍在中段遗忘事实、提前化解冲突,或把不同题材压成相似的语言与人物弧。
方法演进也呈现出清晰方向:从一次性提示生成,发展为分层大纲、事件图和知识图谱,再到多智能体分工、搜索与局部修订,最后进入专用数据、奖励模型和可验证训练阶段。贯穿这些路线的共同变化,是把隐含在上下文中的叙事状态转化为可检查的中间表示,并把“生成—评价—修订”做成闭环。
与此同时,评价已成为与生成同等重要的研究问题。词重叠指标无法测量开放式叙事,通用 LLM 评委又容易偏爱流畅、长度和表面风格。专用奖励模型、结构化检查器、叙事学指标、信息论方法和可执行环境分别补足了不同维度,但没有任何单一分数能够可靠代表整体故事质量。更可行的方向是:硬约束用结构化检查,软质量用专用判别与人类校准,创造力同时测发散、收敛和受约束的意外,交互系统还要评价过程而非只看最终文本。
1. 研究版图:两个系统形态,四个相互耦合的问题
生成侧综述提出了一个有用的入口:按“谁是主导作者”区分两类系统。
- Independent generation:模型承担主要创作,人提供题目、提示或约束。
- Author-assistance:人保留创作主导权,模型协助构思、组织、检索、诊断或局部改写。
这个分类回答“人和模型如何分工”,但不足以解释系统内部如何工作。综合 47 篇论文,还需要同时观察四个彼此反馈的板块:
| 板块 | 核心问题 | 典型研究 |
|---|---|---|
| 生成与规划 | 如何把主题扩展成具有层级、因果和节奏的长篇? | DOME、StoryWriter、BiT-MCTS |
| 状态与质量控制 | 如何记住事实、关系、承诺,并在错误扩散前修正? | Lost in Stories、Magnet、CFPG |
| 评价与学习信号 | 如何测量故事质量,并把评价转化为训练或搜索信号? | Story Evaluation Survey、StoryAlign、EvolvR |
| 人机协作与真实使用 | 作者和读者实际需要什么,系统过程是否可控、可靠? | Fabula、GraphStory、AI Fiction in the Wild |
四个板块不是独立模块。规划决定评价器需要检查什么;评价器决定搜索和训练优化什么;真实使用又决定“质量”究竟是文学创新、类型满足、个性化体验,还是稳定完成用户意图。
2. 共同瓶颈:流畅文本为何仍不是好故事
2.1 长度、上下文与一致性是三个不同问题
LongWriter证明,模型的有效输出长度与监督微调阶段见过的最长样本高度相关;通过长样本合成和训练,小模型可以显著突破常见的约 2,000 词上限。HelloBench也从通用长文评测侧确认,多数模型难以稳定写过 4,000 词,能写长的模型还会重复或降质。
但长度能力不自动带来叙事一致性。Lost in Stories在 8k–10k 词任务上发现,事实、人物、世界规则和时间线错误具有稳定分布,常聚集在叙事中段;其跨系统结果还显示,一些擅长长输出或具备规划模块的方法仍会产生大量细粒度矛盾。反过来,TLDM表明,把整本小说塞进长上下文也不等于真正理解:被测模型在 64k token 后都难以稳定整合情节、故事世界和叙事时间。
综合来看,长篇系统至少要分别解决三件事:生成足够长、维护可更新的叙事状态、在超长文本上可靠地检索和验证。 Storyline Trees用场景级故事线树改善长篇理解,Chain-of-Agents用分段 worker 与 manager 绕开单模型长上下文瓶颈,说明“结构化预处理或分段协作”通常比硬读整本更可靠。
2.2 局部连贯会掩盖全局叙事缺陷
现有模型最容易取得的进步是语句顺畅和段落连贯,最难的是控制信息何时出现、事件为何发生、人物如何变化。Spoiler Alert用 100-Endings 测量结局不可预测性,发现专业短篇的后段张力显著高于 LLM 故事,而常见 rubric 却可能把后者评得更高。Codified Foreshadowing and Payoff进一步表明,模型能埋下线索,却常在触发条件出现后忽略或错误兑现叙事承诺。
类似的“表面正常、深层退化”还出现在:
- 结构:Chinese Literature Homogeneity把中文故事的套路化定位为叙事功能层面的结构坍缩,而非简单的词汇重复。
- 人物:CASPER发现 LLM 人物更容易被写成符号化且必然成长的角色,扩大模型规模也没有自动带来人物类型多样性。
- 训练后变化:Narrative Flattening在同一模型族的 Base、SFT、DPO 和 RLVR 检查点间隔离出后训练效应:主题运动、情感强度和语言多样性逐阶段收窄。
- 模型偏好:Style over Story发现多个模型稳定地把风格约束置于事件、人物和设定之上,提示生成器和评委都可能“重表面、轻内容”。
这些结果共同表明,流畅性更适合作为最低质量门槛,而不是主要优化目标。
2.3 创造力不是“多写几个不同答案”
Automated Creativity Evaluation把创造力拆成发散与收敛:前者是探索范围,后者是能否形成适合任务的解;两者经验相关性很弱。Assessing Creativity从测量有效性提出更严格的要求:创造力指标必须解释通用能力无法解释的增量,否则它只是在间接测量模型规模或语言能力。
Progressive Conditional Surprise测量一组输出是否真正覆盖不同模式,并用 coherence 项防止把噪声误当多样性;Calibrated Surprise则提出更整体的理论:高质量选择既要在无条件视角下罕见,又要在全部作品约束下高度合适。两者分别强调“跨输出的模式多样性”和“单个作品中受约束的意外”,不能互相替代。
因此,创造力评价至少需要区分:
- 是否探索了不同可能性;
- 是否满足题目、体裁、人物和因果约束;
- 是否避免模板化但仍保持可理解;
- 是否在关键宏观选择上产生有意义的意外。
3. 方法演进:从一次生成到可验证的闭环
3.1 奠基范式:计划—起草—重排—编辑
Re3在 2022 年已经给出此后长篇生成的基本模板:先构造设定、人物和大纲,再分段起草,用候选重排保证切题,最后编辑事实一致性。后续方法并没有抛弃这条链路,而是在强化每个环节:
- Plan 变成动态大纲、事件图、场景树或符号结构;
- Draft 引入相关记忆、世界状态和角色代理;
- Rerank 变成专用评委、搜索或多智能体辩论;
- Edit 从整体重写转向定位错误后的局部修订。
3.2 分层规划:把“写长”变成多尺度决策
DOME用粗粒度五段骨架保证完整性,再随生成动态展开细纲;StoryWriter把大纲建成事件图,并在保留因果关系的前提下做非线性重排;Book Writing Capability和 Ex3都从人类作品反演多层结构,再把“结构到正文”的能力训练进模型。CogWriter则把规划、监控、复审做成免训练的推理时脚手架。
这些工作支持“分层规划有效”,但它不是无条件正确:
- 静态计划容易僵化,动态计划又会增加调用和状态管理成本;
- 过强的结构模板可能提高完整性,却降低意外性;
- 并行分段有利于长度和指令遵从,但可能削弱跨段情感与伏笔;
- 从经典或公版作品反演的结构,未必直接迁移到现代题材。
3.3 显式状态:从文本记忆到图和账本
纯文本摘要会丢失事实之间的关系。多篇论文因此选择把叙事状态显式化:
- STORYTELLER:SVO 情节节点 + 动态故事线 + 叙事实体图;
- DOME:带章节时间的知识图谱记忆;
- Magnet:角色、变量和关系构成的世界状态图,只有被选中的行动才能更新状态;
- KG Literary Theory:长短期记忆与主动加入冲突节点;
- CreAgentive:用体裁无关的 Story Prototype 解耦故事逻辑与文体呈现;
- CFPG:用“伏笔—触发—兑现”三元组维护尚未履行的叙事承诺。
显式状态的收益是可检索、可更新、可校验;代价是表示能力有限和维护成本上升。SVO 或三元组适合事件和硬事实,却难以完整表达心理暧昧、隐喻或不可靠叙述。更合理的方向不是让图替代散文,而是让图负责需要确定性追踪的部分。
3.4 多智能体:分工、涌现与协调成本
Agents' Room以“编剧室”方式分开规划、写作和编排,是多智能体故事生成的早期基线。StoryBox走向另一端:让角色在环境中自主行动,先涌现事件,再由 Storyteller 编织成故事;其异常因子主动打破日常,以增加冲突和意外。Magnet则把角色提议、批评、行动选择和叙述串成受世界状态约束的闭环。
多智能体的价值不是 agent 数量本身,而是三种可分离机制:
- 角色化分工:不同模块承担规划、批评、叙述或编辑;
- 候选竞争:多个行动或方案由评价器选择;
- 环境交互:角色行为改变共享状态,从而产生非预设事件。
其局限也很一致:串行模拟昂贵,并行化会引入依赖冲突,文本通信可能逐轮失真。多智能体只有在职责、共享状态和停止条件清楚时,才比单模型反复提示更有意义。
3.5 搜索与定点修订:主动探索情节空间
BiT-MCTS先生成冲突和高潮,再以高潮为根双向搜索开端与结局,把大纲规划显式变成搜索问题。Suspenseful Iterative Planning不断削减主角摆脱坏结局的可行路径,以制造悬念,但同时暴露出“悬念增强、自然度下降”的目标冲突。ASP Story用高层符号约束枚举多种可行结构;One Sentence, One Drama则把开场钩子、冲突升级和结尾悬念交给不同评审,定点重写相关片段并保留未采用的候选。
这几条路线分别代表三种反同质化机制:
- 搜索:在评价函数引导下扩大候选空间;
- 涌现:让角色和环境交互产生计划外事件;
- 符号枚举:在硬约束下生成多个合法结构。
它们都比一次采样更能探索情节空间,但最终质量取决于搜索奖励、模拟规则或符号规范是否真正代表好叙事。
3.6 数据和奖励:把能力训练进模型
推理时脚手架可以补能力,却会增加延迟和成本。另一条路线是把结构、长度或偏好直接训练进权重:
- LongWriter:合成长样本,解除输出长度的训练数据上限;
- Book Writing Capability与 Ex3:从真实作品反演结构—正文训练对;
- POLARIS:用 16 维 LLM 评委奖励和人类范文锚点做低算力 GRPO;
- StoryAlign:用文学平台信号和构造偏好对训练专用故事奖励模型;
- Learning to Reason with NCP:用“计划能否帮助预测真实下一章”构造免标注可验证奖励;
- EvolvR:自合成、自筛选成对推理数据,再把评估器作为生成奖励;
- TTCW Literary Review:构造多维文学评审数据,并指出固定格式评分不一定受益于推理监督。
这些方法把系统瓶颈进一步推向奖励设计:模型会学习评价器能看见的东西,也会忽略评价器看不见的东西。 如果奖励偏爱规范、长度或表面风格,训练可能提高分数却加剧叙事扁平化。
4. 五层生成系统:不同方法如何组合
把论文按端到端链路重排,可以得到一个比“单智能体/多智能体”更细的五层框架。
| 层次 | 主要职责 | 可用方法 | 典型风险 |
|---|---|---|---|
| 1. 表示与规划 | 把主题转成事件、场景、节拍和因果结构 | 分层大纲、事件图、Story Prototype、ASP | 模板僵化、结构过度先验 |
| 2. 状态与一致性 | 跟踪事实、人物、关系、时间和叙事承诺 | 世界状态图、KG 记忆、伏笔账本、场景树 | 表示遗漏隐含意义、维护开销 |
| 3. 探索与修订 | 产生候选,选择或局部修复 | MCTS、辩论、critic、rerank、定点重写 | 成本高,评价器偏差被放大 |
| 4. 文体与人物呈现 | 控制声音、人物类型、情感和叙事复杂度 | 风格定义、非线性编排、人物维度、反扁平指标 | 模仿代替原创,内容被风格遮蔽 |
| 5. 人机交互 | 保留作者控制、支持构思与迭代 | 可编辑图、Gardener/Architect、轨迹式交互 | 自动重写夺走控制权,单一工作流不适配所有作者 |
这个框架提示,很多“新系统”其实是在不同层选择部件。一个写得长但缺状态层的模型仍会遗忘;一个有精细状态却没有探索层的系统可能稳定但平庸;一个评价和搜索很强但交互层不可控的系统,也未必适合人类创作。
GraphStory提供了重要的连接方式:同一张事件图既是作者的认知外化,也是模型的结构化上下文。Fabula的专家研究则提醒,结构化界面并非越强越好;当系统修改一处就重写整体,作者会失去局部控制。好的中间表示不仅要机器可读,还要人可见、可编辑、可追溯。
5. 评价体系:从一个总分走向多种测量装置
5.1 为什么传统指标和通用评委都不够
Story Evaluation Survey系统梳理了故事评价从 BLEU/ROUGE、嵌入与概率指标到 LLM-based 评价的演进。HelloBench进一步显示,词重叠指标在开放式长文上几乎不能代表人类判断。原因并不复杂:故事没有唯一参考答案,表面不同可能同样优秀,表面相似也可能在因果、人物或张力上完全失败。
LLM 评委改善了语义理解和解释能力,但仍有明显边界:
- WritingBench表明,针对每个任务动态生成评价标准,比固定 rubric 更贴近人类;
- POLARIS说明结构化多维评委可以直接成为有效训练奖励;
- 但 StoryAlign中,专用 8B StoryReward 在故事偏好判断上达到 75.0%,高于 GPT-4o 的 66.3%,优势尤其集中在创意与人物;
- Spoiler Alert发现通用 rubric 会把缺乏后段张力的模型故事评在专业短篇之上;
- Style over Story说明模型评委可能继承“风格优先”的隐藏偏好。
因此,LLM 评委适合做开放式语义判断和动态标准生成,却不应独自承担所有深层叙事判断。
5.2 六类评价方法及其边界
| 方法 | 擅长 | 主要局限 | 代表工作 |
|---|---|---|---|
| 动态 rubric + LLM 评委 | 通用质量、指令适配、解释 | 风格/长度偏差,深层维度分辨率有限 | WritingBench、POLARIS |
| 专用奖励模型 | 人类偏好、人物、创意、训练奖励 | 数据构造偏差、跨域泛化 | StoryAlign、EvolvR |
| 结构化检查器 | 事实、时间、世界状态、硬约束 | 容易误判有意的伏笔或暧昧 | Lost in Stories、Magnet/Atlas |
| 叙事学专用指标 | 张力、伏笔、人物、叙事功能 | 每个指标覆盖面窄,需理论和标注 | Spoiler Alert、CASPER |
| 信息论指标 | 多样性、模式坍缩、受约束意外 | 依赖代理模型,操作化仍在早期 | Calibrated Surprise、Decan |
| 可执行/轨迹式评测 | 多轮记忆、鲁棒性、个性化、交互体验 | 成本高,环境设计影响结果 | NARRA-Gym、Fabula |
Skeleton Coherence提供了一条有用的负面证据:句子骨架不如整句建模连贯。这提醒评价设计不能为了结构化而过早丢弃整体语义。另一方面,MUSE在多模态叙事中采用“意图—可执行约束—验证—修订”的闭环,说明结构化检查与整体生成可以分工,而不必互相取代。
5.3 推荐的组合评价框架
综合现有证据,一个稳健的评价系统更像“仪表盘”,而非单一总分:
- 硬约束层:事实、时间、人物状态、伏笔账本和格式要求;
- 叙事结构层:因果、节奏、张力、信息释放和结构多样性;
- 人物与文体层:人物类型分布、声音一致性、风格适配与跨作品差异;
- 创造力层:发散范围、收敛质量、校准意外和模式坍缩;
- 人类与使用层:真实偏好、作者控制感、读者目标、最坏情况和多轮鲁棒性。
专用维度分数可以用于诊断或训练,但不应未经验证地加权成一个“文学质量真值”。Assessing Creativity提出的增量效度原则尤其重要:新指标必须证明自己测到了通用语言能力之外的东西。
6. 跨论文综合判断
判断一:规划通常改善一致性,但规划本身不是文学性
证据:Re3、DOME和 StoryWriter都显示,显式计划、结构化事件和历史压缩能够改善长篇完整性与切题性。
边界:StoryBox指出自顶向下结构容易可预测;Fabula中的专业作者也批评通用结构和自动重写会带来僵硬、俗套与控制权下降。
综合结论:规划应负责维护必须稳定的宏观承诺,同时为角色行动、局部语言和情节转折保留开放空间。计划越细,不一定越好。
判断二:多智能体的收益来自机制,不来自角色数量
证据:Agents' Room、Magnet和 One Sentence, One Drama分别验证了专职分工、候选批评和定点修订的价值。
边界:StoryBox显示串行角色模拟成本高且难并行;文本式 agent 通信还可能传播错误。
综合结论:应先定义共享状态、决策权和失败处理,再决定是否需要多个 agent。没有状态边界的“多人讨论”很容易只是昂贵的重复提示。
判断三:长度是独立能力,但不是质量代理
证据:LongWriter和 CogWriter分别从训练数据与推理脚手架显著提升长输出。
边界:Lost in Stories显示长篇仍会出现系统性矛盾;AI Fiction in the Wild还揭示真实使用中的模型回复长度与传统长篇之间存在数量级差距。
综合结论:长度遵从、一致性、结构完整和文学吸引力应分开报告。任何只因“更长”而提高的总分都需要警惕。
判断四:通用评委擅长规范质量,却容易漏掉深层叙事
证据:WritingBench证明动态标准能提高通用写作评价的人类一致性;POLARIS证明这类奖励足以改善生成。
反证与限制:StoryAlign显示专用模型在故事偏好上超过通用前沿评委;Spoiler Alert、Narrative Flattening和 Style over Story分别暴露了张力缺失、后训练压平和风格偏好。
综合结论:通用评委适合作为基础质量分支,深层叙事需要专用指标、结构检查和人类锚点。评价器在环越深,越要审计其隐藏偏好。
判断五:发散、收敛与作品质量必须分开测
证据:Automated Creativity Evaluation发现发散与收敛弱相关;Progressive Conditional Surprise测的是一组回答的模式覆盖;Calibrated Surprise讨论的是单个作品在约束下是否产生罕见而合适的选择。
边界:高熵可能只是噪声,高任务完成度也可能只是保守和平均化;Assessing Creativity还表明,没有一种测试能覆盖所有创造构念。
综合结论:创造力不是单轴能力。生成系统可以在保持收敛质量的同时扩大探索,也可以在多样候选中继续优化单个作品的受约束意外。
判断六:不存在脱离读者和场景的唯一“好故事”
证据:AI Fiction in the Wild显示,真实用户大量请求类型化、重复、即时和高度小众的虚构内容;在某些类型里,可预测性可能正是需求的一部分。NARRA-Gym也表明,流畅叙事仍可能在鲁棒性、个性化或体验上失败。
边界:真实日志受重度用户和样本来源影响,不能直接代表全部读者;用户即时偏好也不等于长期艺术价值。
综合结论:评价必须先声明目标:是文学创新、类型满足、作者辅助、互动体验,还是稳定生成。不同目标可以共享基础质量门槛,却不应共享未经校准的最终排序。
7. 开放问题与研究议程
- 综合基准:需要跨语言、体裁、长度和系统形态的基准,同时测长度、硬一致性、结构、人物、张力、创造力与人类体验。
- 长篇闭环验证:整本输入单个评委不可靠。应研究场景切分、层级状态、分段 agent 和全局汇总如何共同给出可追溯判断。
- 一致性与非平庸性的联合优化:当前方法常在“稳定但模板化”和“意外但失控”之间摆动,需要联合评价硬约束与校准意外。
- 人物和关系的长期演化:现有人物研究多为短篇静态分类,尚缺跨章关系变化、隐性动机和不可靠叙述的可靠测量。
- 评价器有效性与抗操纵:专用评估器不仅要和人类相关,还要证明增量效度、跨域稳定性、最坏情况表现和对奖励投机的抵抗力。
- 真实读者与作者研究:日志分析、参与式设计和长期使用研究应与离线文本评分结合,区分作者控制感、读者满足和作品质量。
- 人机共创的可编辑中间表示:事件图、世界状态和场景树不应只在后端存在,还应研究如何让作者理解、修改并追踪其影响。
- 多模态与推理时约束:MUSE和 One Sentence, One Drama显示,文字侧的状态、验证和定点修订原则可迁移到音视频;反过来,多模态的空间与身份检查也能丰富叙事约束。
- 成本与延迟:多智能体、MCTS、逐句张力测量和在线评委都很昂贵。未来比较应同时报告质量、调用次数、延迟、失败率和修订粒度。
8. 47 篇论文地图
| # | 论文/笔记 | 主要角色 |
|---|---|---|
| 00 | A Survey on LLMs for Story Generation | 生成侧分类学与领域入口 |
| 01 | Lost in Stories | 长篇一致性基准与错误定位 |
| 02 | From Personas to Plot: Magnet | 世界状态图、critic 闭环与 Atlas 检测 |
| 03 | DOME | 动态分层大纲与时序 KG 记忆 |
| 04 | Codified Foreshadowing and Payoff | 伏笔—触发—兑现的符号化控制 |
| 05 | Book Writing Capability | 规划脚手架反演与长篇专用训练 |
| 06 | Ex3 | 从真实小说抽取结构并树状扩写 |
| 07 | STORYTELLER | SVO 情节节点与动态实体图 |
| 08 | POLARIS | LLM 评委奖励、HRI 与低算力 GRPO |
| 09 | LongWriter | 长样本合成、长度能力与长文基准 |
| 10 | StoryWriter | 事件图、非线性编排与历史压缩 |
| 11 | StoryBox | 角色沙盒、涌现事件与异常因子 |
| 12 | CogWriter | 规划—监控—复审的免训练脚手架 |
| 13 | MUSE | 多模态叙事的验证—修订闭环 |
| 14 | Agents' Room | 编剧室式多智能体基线 |
| 15 | Storyline Trees | 场景级层次表示与长篇检索 |
| 16 | Skeleton Coherence | 连贯建模粒度的负面结果 |
| 17 | Spoiler Alert | 100-Endings 张力指标 |
| 18 | Suspenseful Iterative Planning | 通过削减脱困路径生成悬念 |
| 19 | StoryAlign | 故事偏好基准与专用奖励模型 |
| 20 | WritingBench | 面向任务的动态评价标准 |
| 21 | Narrative Flattening | 后训练导致的主题、情感与风格收窄 |
| 22 | HelloBench | 通用长文生成与分层评价 |
| 23 | Story Evaluation Survey | 故事评价维度与指标分类学 |
| 24 | BiT-MCTS | 高潮优先的双向情节搜索 |
| 25 | Chinese Literature Homogeneity | 中文叙事功能与结构同质化 |
| 26 | CAT-LLM | 可解释的中文长文风格控制 |
| 27 | Calibrated Surprise | 受约束意外的质量理论 |
| 28 | Automated Creativity Evaluation | 发散/收敛创造力的分离测量 |
| 29 | Progressive Conditional Surprise | Decan 多样性与模式坍缩指标 |
| 30 | Assessing Creativity | 创造力测试的增量效度 |
| 31 | NARRA-Gym | 动态、多轮、轨迹式叙事评测 |
| 32 | TTCW Literary Review | 文学评审数据与判别器训练 |
| 33 | Fabula | 写作工具、auto-rater 与专家参与设计 |
| 34 | GraphStory | 图式构思、分支探索与作者控制 |
| 35 | One Sentence, One Drama | 短剧节奏、多评审与定点重写 |
| 36 | AI Fiction in the Wild | 真实用户请求与需求分布 |
| 37 | CASPER Character Variety | 人物呈现的八维叙事学测量 |
| 38 | Re3 | 计划—起草—重排—编辑的奠基范式 |
| 39 | Learning to Reason with NCP | 下一章预测的可验证奖励 |
| 40 | KG Literary Theory | 长短期记忆与显式冲突注入 |
| 41 | CreAgentive | 逻辑/文体解耦与超长多体裁生成 |
| 42 | Chain-of-Agents | 分段 worker 与长上下文汇总 |
| 43 | TLDM | 整本小说理解的长上下文压力测试 |
| 44 | EvolvR | 自演化成对推理评价与奖励闭环 |
| 45 | Style over Story | LLM 重风格、轻内容的偏好诊断 |
| 46 | ASP Story | 抽象符号约束与情节多样性 |
9. 建议阅读路径
路线 A:理解长篇生成系统
Re3 → Agents' Room → DOME / StoryWriter → Magnet → BiT-MCTS → Book Writing Capability
路线 B:理解长篇一致性与上下文边界
LongWriter → Lost in Stories → CFPG → Storyline Trees → TLDM / Chain-of-Agents
路线 C:建立故事评价体系
Story Evaluation Survey → HelloBench / WritingBench → StoryAlign → Spoiler Alert → Narrative Flattening → NARRA-Gym
路线 D:理解创造力、同质化与文学性
Calibrated Surprise → Automated Creativity Evaluation → Progressive Conditional Surprise → Assessing Creativity → Chinese Literature Homogeneity / CASPER → Fabula
结语
这组研究最一致的结论不是“某个模型已经会写小说”,而是:故事生成正在从纯文本采样问题,转化为一个表示、规划、状态、搜索、评价和人机交互共同构成的系统问题。更强的基座可以改善局部表达和通用推理,却不会自动解决长度、一致性、张力、人物多样性或评价偏差。
下一阶段的关键也不只是生成更多文本,而是让系统知道哪些承诺必须守住、哪些选择应当开放、何时需要制造意外、如何发现自己失败,以及怎样把修改权留给人。只有当这些能力被分别测量、联合校准并放回真实创作场景,长篇故事生成才可能从“可读的连续文本”走向“可控、可诊断、具有叙事意图的作品”。