AI 小说 / 长文写作论文整理
主题:LLM 驱动的长篇故事生成、长文写作、创意写作及其评估 整理时间:2026-07(最新一次更新:全部 47 篇 #00–46 深度精读完成 + 主索引按主题重构) 领域两大核心难题:长程连贯性(long-form coherence) 与 可控性(controllability)
本目录汇总该方向论文,并对 47 篇代表性论文(#00–46)做了深度精读(见 pdfs/ 的 *_精读.md)。选题主要来自 awesome-llm-story-generation(288 篇合集,其完整索引见 awesome-repo-index.md)。
📚 两层笔记: -
pdfs/*_精读.md= 深度精读(Obsidian PDF++ 风格,带可点击的原文引用坐标 + 图表截取 + 公式讲解),全部 47 篇均已完成;下方各表链接均指向精读笔记。 -papers/01..26_*.md= 早期的轻量摘要(每篇一页,问题/方法/结果/启发),仅覆盖 #01–26。 - PDF 原文与 arXiv ID 映射见 pdfs/MANIFEST.md。
📌 详细解读:全部 47 篇(#00–46)按主题分组
A. 综述与总纲(2)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 00 | A Survey on LLMs for Story Generation | 2025 | 生成侧总纲:按"主导作者"分 Independent(LLM 独立)vs Author-Assistance(人机协作);点名领域缺综合基准与故事专用指标。建议阅读起点 |
| 23 | Story Evaluation Survey | 2024-08 | 评估侧地图册:任务 / 13 个人评维度 / 指标分类学 / 9 个基准 |
B. 长篇生成方法:规划 · 大纲 · 记忆 · 奖励训练(10)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 38 | Re3 | 2022-10 | 奠基:计划-起草-重排-编辑四段递归;后续 DOME/StoryWriter 等多为其变体 |
| 06 | Ex3 | 2024-08 | 从真实小说抽结构 → 构训练集 → 树状扩展,写任意长度小说 |
| 09 | LongWriter | 2024-08 | 写不长的根因是 SFT 无长样本;AgentWrite 合成数据解锁万字,工程基石 |
| 03 | DOME | 2024-12 | 动态分层大纲 + 时序知识图谱记忆,冲突率降 ~87%,主流方法代表作 |
| 07 | STORYTELLER | 2025-06 | SVO 情节节点 + 叙事实体图动态交互,人评胜率 84.33% |
| 39 | NCP / Learning to Reason | 2025-03 | RLVR:VR-CLI 用"计划能否提升真实下一章的似然"当免标注可验证奖励 |
| 40 | KG + Literary Theory | 2025-08 | 知识图谱记忆防漂移 + 叙事学 obstacle 框架主动制造转折 |
| 41 | CreAgentive | 2025-09 | 逻辑/文体解耦的 genre-agnostic Story Prototype,<$1/百章超长连载 |
| 05 | Book-Writing Capability | 2026-05 | 公版书反演多分辨率规划脚手架训练,14B 质量超 GPT-5.5 / Opus 4.8 |
| 08 | POLARIS | 2026-06 | 评委 rubric 当在线奖励 + 人类范文锚点,9B 追平 27B,外推 3× 长度 |
C. 多智能体 · 世界模拟 · 协作框架(6)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 42 | Chain of Agents | 2024-06 | 通用长上下文分段协作(worker + manager),NeurIPS 2024(非故事专用) |
| 14 | Agents' Room | 2024-10 | 4 规划 agent + 5 写作 agent(Freytag 五段),本领域奠基基线 |
| 12 | CogWriter | 2025-02 | 免训练,认知写作四过程 → Planning + 并行 Generation,14B 超 GPT-4o ~22% |
| 10 | StoryWriter | 2025-06 | 事件图大纲 → 非线性编排 → ReIO 压缩改写;蒸馏小模型超 GPT-4o |
| 11 | StoryBox | 2025-10 | 自底向上沙盒模拟,角色自由行动"涌现"事件,再组织成 ~1.2 万词 |
| 02 | Magnet / From Personas to Plot | 2026-07 | 角色即 agent + 共享世界状态图,扩展到 100 页;配 Atlas 幻觉检测 F1 0.853 |
D. 叙事技巧与结构:伏笔 · 张力 · 悬念 · 骨架(5)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 18 | Suspenseful Iterative Planning | 2024-02 | 首个 LLM 悬念生成:迭代"给主角行动 + 对抗性让其失败",胜率 84.9%(自然度降 25%) |
| 04 | Codified Foreshadowing-Payoff | 2026-01 | 把"伏笔—回收"编码成可执行约束,显式"先埋后收" |
| 17 | Spoiler Alert | 2026-04 | 100-Endings 张力指标:LLM EQ 分最高却张力最低,后段仅《纽约客》1/3 |
| 16 | Skeleton Coherence | 2026-04 | 句子骨架建连贯,但实证整句仍胜骨架 ~8–9pp(反证主流方向对) |
| 15 | Storyline Trees | 2026-06 | 长篇自动构造成 4 层"故事线树"做自适应检索,叙事 QA 全面领先 |
E. 评估 · 诊断 · 基准 · 奖励模型(7)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 22 | HelloBench | 2024-09 | 主流模型几乎写不出 >4000 词长文;BLEU/ROUGE 与人评近乎零相关 |
| 44 | EvolvR | 2025-08 | 自进化成对推理评估器 → 当奖励模型提升生成,StoryER/HANNA/OpenMEVA SOTA |
| 20 | WritingBench | 2025-03 | 每条 query 现场生成 5 条专属评分标准,人一致性 67%→84% |
| 01 | Lost in Stories | 2026-03 | 一致性 bug 的 5 大类/19 子类分类 + 自动检测器;错误集中在叙事中段、高熵段落 |
| 31 | NARRA-Gym | 2026-05 | 多轮交互叙事的可执行评测环境(仿 Gym + 轨迹日志 + 11 维);流畅 ≠ 鲁棒/个性化 |
| 32 | TTCW Literary Review | 2026-05 | 263K 故事 × 14 维自训评审模型;固定格式评分下推理监督反而有害,评分封顶 ~0.68 |
| 19 | StoryAlign | 2026-05 | 现有裁判几乎选不对人类偏好(GPT-4o 仅 66.3%),专用奖励模型达 75.0% |
F. 创造力 · 多样性 · 创意度量(8)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 46 | ASP Story | 2024-06 | 用答案集编程(ASP)写高层符号约束,引导并多样化 LLM 生成(神经符号) |
| 30 | DRAT / Assessing Creativity | 2026-05 | 系统检验创造力测试的预测有效性;发散思维随模型迭代下降 −0.47 z/年 |
| 21 | Narrative Flattening | 2026-05 | 受控实验证"叙事扁平化"主要发生在后训练阶段,专业文学被压最狠 |
| 45 | Style over Story | 2025-10 | 约束选择实验证 LLM 潜在偏好"风格 > 内容(事件/人物/设定)" |
| 27 | Calibrated Surprise | 2026-04 | 创意质量 = 校准的意外(互信息 I(X;Y));批评 rubric 与 RLHF 拉向人群均值 |
| 29 | Progressive Conditional Surprise | 2026-06 | Decan 多样性指标(base 模型 in-context surprise,无 embedding/参考/标注);对齐单调降多样性 |
| 28 | Automated Creativity Eval | 2026-06 | 创造力拆发散(语义熵,免参考)× 收敛(检索式多 agent 判官,省 63% token) |
| 37 | CASPER | 2026-06 | Forster 扁平/圆形 → 8 组可测人物刻画范畴;LLM 人物过度象征化 + 千篇一律成长弧 |
G. 人机共创 · 写作工具 · 用户研究(3)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 33 | Fabula | 2026-06 | DeepMind(Dramatron 团队)写作 sidekick 田野研究;rubric auto-rater 相关性 0.72→0.83 |
| 34 | GraphStory | 2026-06 | 事件图作为"用户交互 ↔ LLM 输入"中间层的共创界面;HCI 用户研究(cs.HC) |
| 36 | AI Fiction in the Wild | 2026-06 | WildChat 50 万对话实证:1/3 是虚构、fanfiction 49%;类型契约内的可预测性非负面 |
H. 中文小说 / 中文写作场景(3)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 26 | CAT-LLM | 2024-01 | 词级 + 句级量化文体成 prompt,《围城》风格迁移 F1 79.36%;GPT-4 反不如 3.5 |
| 24 | BiT-MCTS | 2026-03 | 高潮优先 + 双向 MCTS 生成中文长篇,多样性胜率 77–92%,长达 5.8 万 token |
| 25 | Chinese Literature Homogeneity | 2026-03 | 用 34 个 Propp 功能解剖,证 LLM 中文网文同质化根因是"读不懂功能" |
I. 多模态与长上下文 · 能力边界(可迁移点)(3)
| # | 论文 | 年份 | 一句话 |
|---|---|---|---|
| 43 | TLDM | 2025-05 | 用小说测长上下文理解:LLM 在 64k+ token 上难以真正读懂长篇(生成前须结构化预处理) |
| 13 | MUSE | 2026-02 | 多模态音视频叙事的 plan-execute-verify-revise 闭环(注:多模态,非纯文本) |
| 35 | One Sentence, One Drama | 2026-05 | 一句话 → 整部短剧(视频);多 agent 辩论压节奏 + 分区重写 + Idea Bank |
说明:分组按论文主要贡献归类,少数论文横跨多类(如 10 StoryWriter 兼具事件图规划与多智能体、35 One Sentence 兼具多模态与叙事节奏),此处取其一。年份用 arXiv 首次提交月份。
🧭 阅读建议路线
- 建立全局观:23(评估综述)+ 00(生成综述)→ 01(问题诊断)→ 03 / 10(两种主流方法)。
- 做长篇生成方法:09 LongWriter(先写得够长)→ 03 DOME / 10 StoryWriter(大纲+记忆 / 事件图)→ 02 Magnet(世界状态+多智能体)→ 05 Book-Writing(写得像文学)→ 38 Re3(理解四段递归的祖型)。
- 做评估 / 质量闸门:01 Lost in Stories → 19 StoryAlign / 44 EvolvR(奖励模型)→ 20 WritingBench / 22 HelloBench(基准)→ 31 NARRA-Gym(动态评测)→ 32 TTCW(自训评审的坑)。
- 研究创造力 / 多样性:21 Narrative Flattening(问题)→ 27 校准意外 / 28 发散收敛 / 29 Decan 多样性(度量)→ 30 DRAT(预测有效性)→ 37 CASPER(人物)→ 45 Style over Story(偏见)。
- 玩叙事技巧:04 伏笔编码 ↔ 17 张力度量("生成 ↔ 度量"配对)→ 18 悬念规划 → 15 故事线树。
- 做中文小说:24 BiT-MCTS(高潮优先范式)↔ 25 同质化诊断(问题)→ 26 CAT-LLM(风格量化注入)。
- 做人机共创产品:00(Author-Assistance 象限)→ 33 Fabula / 34 GraphStory(工具形态)→ 36 AI Fiction(需求侧实证)。
📈 领域趋势小结(2022 → 2026)
- 从"单模型长输出"走向"多智能体 + 显式状态":Re3/LongWriter/DOME → StoryWriter/StoryBox/Magnet;出现"自顶向下大纲派 vs 自底向上模拟派 vs 闭环约束派"三条路线。
- 评估越来越细、越来越"打脸":从整体打分转向可定位的一致性 bug(01)、张力/悬念(17)、多样性/同质化(25);并发现 BLEU/ROUGE 基本失效(22)、后训练会"压扁"文风(21)。
- 叙事学知识被显式编码:Campbell 五段(03)、Freytag 金字塔(14/24)、伏笔—回收(04)、Propp 功能(25)、Genette 叙事顺序(10)、Forster 扁平/圆形(37)纷纷进入生成/约束/评测。
- 小模型 + 好配方可打平大模型:POLARIS(08)9B 追平 27B、Book-Writing(05)14B 超前沿、StoryWriter/CogWriter 蒸馏或免训练超 GPT-4o —— 对成本敏感的写作产品是利好。
- 长度持续突破但连贯是瓶颈:从 ~7k 词(DOME)到 1.2 万词(StoryBox/CogWriter)乃至 5.8 万 token(BiT-MCTS)与"100 页"(Magnet);而 TLDM(43)指出 LLM 对 64k+ 长篇的理解仍未跟上。
- 创意度量与多样性独立成线:从整体质量分裂出"发散/收敛"(28)、"校准的意外/互信息"(27)、多样性(29)、人物刻画(37)等专门度量;多篇独立发现"规模与后训练不提升、甚至压低创意/多样性"(21/28/30/37)。
- 奖励模型 / 评估模型路线兴起:StoryAlign(19)、EvolvR(44)、TTCW 自训评审(32)显示"专用评估/奖励模型 > 通用 LLM 评委";NCP 的 VR-CLI(39)提供一种免标注可验证奖励。
- 从"一键生成"转向"人机共创":写作 sidekick / 图结构共创界面(33/34)+ 真实用户需求实证(36),呼应综述(00)里的 Author-Assistance 象限。
🗂️ 全量论文清单(awesome-llm-story-generation 精编)
来源:Picrew/awesome-llm-story-generation(288 篇 / 10 大类,2026-06-29 更新;维护者即 Lost in Stories 团队)。 完整 288 篇逐条索引见 → awesome-repo-index.md。下面按 10 大类各挑代表作 + 最新工作,⭐ 为本目录已精读并附笔记(本目录已精读的 47 篇按主题分组见上方《详细解读》,与此处仓库的 10 类划分不同)。
| 分类 | 数量 | 与文字写作相关度 |
|---|---|---|
| A. Planning / Decomposition 规划分解 | 21 | ★★★ |
| B. Agent Collaboration 多智能体协作 | 6 | ★★★ |
| C. Sandbox / World Simulation 世界模拟 | 17 | ★★(偏互动剧/游戏) |
| D. Multimodal 图像/视频/漫画/音频 | 64 | ★(偏视觉) |
| E. Memory & Long-Context 记忆/长上下文 | 20 | ★★★ |
| F. Consistency / Controllability 一致性/可控 | 27 | ★★★ |
| G. Refinement / Self-Critique 精修/自评 | 16 | ★★★ |
| H. Evaluation / Benchmarks 评估/基准 | 75 | ★★★ |
| I. Datasets / Surveys 数据/综述 | 32 | ★★ |
| J. Open-source Projects 开源项目 | 10 | ★★ |
A. 规划 / 分解(21) — 长篇写作的主线:先规划骨架,再展开 - ⭐ DOME(NAACL 2024)、⭐ Ex3(ACL 2024)、⭐ STORYTELLER(ACL 2025)、⭐ Book-Writing Capability(2026-05)、⭐ Codified Foreshadowing(2026-01)、⭐ BiT-MCTS(2026-03,中文)、⭐ GraphStory(2026-06,事件图共创) - 未读留意:DOC(2022,详细大纲控制,奠基)、Navigating the Path of Writing(NAACL 2024)、DPWriter(2026-01,多样规划分支 RL)、Improving Pacing in Long-Form Story Planning(EMNLP 2023)
B. 多智能体协作(6) - ⭐ CogWriter(2025-02)、⭐ Agents' Room(ICLR 2024,奠基基线)、⭐ Chain of Agents(NeurIPS 2024,长上下文协作) - 未读留意:HoLLMwood(EMNLP 2024,角色扮演编剧)、AutoAgents(IJCAI 2023)
C. 世界模拟 / 互动叙事(17) — 偏"角色自由行动涌现剧情" - ⭐ StoryBox(2025-10,自底向上沙盒)、⭐ NARRA-Gym(2026-05,多轮交互评测环境) - 未读留意:Generative Agents(2023,斯坦福"小镇",奠基)、BookWorld(2025-04,小说→智能体社会)、IBSEN(ACL 2024,导演-演员剧本)
D. 多模态(64) — 主要是视频/图像/漫画,文字写作弱相关 - ⭐ MUSE(2026-02,音视频叙事闭环)、⭐ One Sentence, One Drama(2026-05,短剧多 agent) - 文字相关少数:R²(ICLR 2025,小说→剧本,因果情节图)、SEED-Story、LongWriter-V
E. 记忆 & 长上下文(20) — 让长文"记得住、写得长" - ⭐ LongWriter(2024-08,工程基石)、⭐ Storyline Trees(2026-06)、⭐ POLARIS(2026-06)、⭐ KG + Literary Theory(2025-08)、⭐ TLDM(2025-05,长上下文理解基准) - 未读留意:RecurrentGPT(2023-05)、CHIRON(2024,长篇人物表示)、LongAlign(2024)、Self-Lengthen(2024)
F. 一致性 / 可控性(27) — 守住人设、世界规则、约束 - ⭐ ASP Story(ACL 2024 Workshop,符号约束多样化) - 未读留意:FACTTRACK(NAACL 2024,时间感知世界状态跟踪)、Suri(2024,多约束长文)、MoPS(ACL 2024,模块化 premise)、CS4(2024,用约束数量量化创造力)、Pastiche Novel(2025,模仿作者文风)
G. 精修 / 自我批评(16) — 写完再改,迭代提质 - ⭐ Suspenseful Iterative Planning(EACL 2024)、⭐ Re3(2022,递归重提示,奠基)、⭐ Fabula(2026-06,写作 sidekick 田野) - 未读留意:SuperWriter(2025-06,反思驱动)、R2-Write(2026-04,反思+修订)、Collective Critics(EMNLP 2024,多评委)、Finding Flawed Fictions(2025,情节漏洞检测)
H. 评估 / 基准(75,全库最大类) - ⭐ Lost in Stories、⭐ StoryAlign、⭐ WritingBench、⭐ HelloBench、⭐ Narrative Flattening、⭐ Spoiler Alert、⭐ 中文同质化 — 以及创意/多样性一批:⭐ Calibrated Surprise、⭐ Automated Creativity Eval、⭐ Conditional Surprise、⭐ DRAT、⭐ TTCW、⭐ CASPER、⭐ EvolvR、⭐ Style over Story、⭐ AI Fiction in the Wild - 未读留意:LitBench(2025-07)、LongEval(2025-02)、Are LLMs Capable of Human-Level Narratives?(EMNLP 2024)、Art or Artifice?(CHI 2023,奠基)
I. 数据 / 综述(32) - ⭐ Story Evaluation Survey(2024-08)、⭐ #00 生成综述(EMNLP 2025)、⭐ CAT-LLM(2024-01,中文风格迁移)、⭐ NCP(2025-03,RLVR 奖励)、⭐ CreAgentive(2025-09,超长连载引擎) - 未读留意:Narrative Theory-Driven LLM Methods: A Survey(2026-02)、What Makes a Good Story(2024-08)、Weaver(2024)、STORM(2024)、WritingPrompts(ACL 2020)
J. 开源项目(10) — 无论文的实用项目,详见仓库对应章节。