AI_writing/README.md

AI 小说 / 长文写作论文整理

主题:LLM 驱动的长篇故事生成、长文写作、创意写作及其评估 整理时间:2026-07(最新一次更新:全部 47 篇 #00–46 深度精读完成 + 主索引按主题重构) 领域两大核心难题:长程连贯性(long-form coherence)可控性(controllability)

本目录汇总该方向论文,并对 47 篇代表性论文(#00–46)做了深度精读(见 pdfs/*_精读.md)。选题主要来自 awesome-llm-story-generation(288 篇合集,其完整索引见 awesome-repo-index.md)。

📚 两层笔记: - pdfs/*_精读.md = 深度精读(Obsidian PDF++ 风格,带可点击的原文引用坐标 + 图表截取 + 公式讲解),全部 47 篇均已完成;下方各表链接均指向精读笔记。 - papers/01..26_*.md = 早期的轻量摘要(每篇一页,问题/方法/结果/启发),仅覆盖 #01–26。 - PDF 原文与 arXiv ID 映射见 pdfs/MANIFEST.md

🧭 推荐起点:先读 #00 生成综述 + #23 评估综述 两棵分类树建立全局观,再钻具体方向。


📌 详细解读:全部 47 篇(#00–46)按主题分组

A. 综述与总纲(2)

# 论文 年份 一句话
00 A Survey on LLMs for Story Generation 2025 生成侧总纲:按"主导作者"分 Independent(LLM 独立)vs Author-Assistance(人机协作);点名领域缺综合基准与故事专用指标。建议阅读起点
23 Story Evaluation Survey 2024-08 评估侧地图册:任务 / 13 个人评维度 / 指标分类学 / 9 个基准

B. 长篇生成方法:规划 · 大纲 · 记忆 · 奖励训练(10)

# 论文 年份 一句话
38 Re3 2022-10 奠基:计划-起草-重排-编辑四段递归;后续 DOME/StoryWriter 等多为其变体
06 Ex3 2024-08 从真实小说抽结构 → 构训练集 → 树状扩展,写任意长度小说
09 LongWriter 2024-08 写不长的根因是 SFT 无长样本;AgentWrite 合成数据解锁万字,工程基石
03 DOME 2024-12 动态分层大纲 + 时序知识图谱记忆,冲突率降 ~87%,主流方法代表作
07 STORYTELLER 2025-06 SVO 情节节点 + 叙事实体图动态交互,人评胜率 84.33%
39 NCP / Learning to Reason 2025-03 RLVR:VR-CLI 用"计划能否提升真实下一章的似然"当免标注可验证奖励
40 KG + Literary Theory 2025-08 知识图谱记忆防漂移 + 叙事学 obstacle 框架主动制造转折
41 CreAgentive 2025-09 逻辑/文体解耦的 genre-agnostic Story Prototype,<$1/百章超长连载
05 Book-Writing Capability 2026-05 公版书反演多分辨率规划脚手架训练,14B 质量超 GPT-5.5 / Opus 4.8
08 POLARIS 2026-06 评委 rubric 当在线奖励 + 人类范文锚点,9B 追平 27B,外推 3× 长度

C. 多智能体 · 世界模拟 · 协作框架(6)

# 论文 年份 一句话
42 Chain of Agents 2024-06 通用长上下文分段协作(worker + manager),NeurIPS 2024(非故事专用)
14 Agents' Room 2024-10 4 规划 agent + 5 写作 agent(Freytag 五段),本领域奠基基线
12 CogWriter 2025-02 免训练,认知写作四过程 → Planning + 并行 Generation,14B 超 GPT-4o ~22%
10 StoryWriter 2025-06 事件图大纲 → 非线性编排 → ReIO 压缩改写;蒸馏小模型超 GPT-4o
11 StoryBox 2025-10 自底向上沙盒模拟,角色自由行动"涌现"事件,再组织成 ~1.2 万词
02 Magnet / From Personas to Plot 2026-07 角色即 agent + 共享世界状态图,扩展到 100 页;配 Atlas 幻觉检测 F1 0.853

D. 叙事技巧与结构:伏笔 · 张力 · 悬念 · 骨架(5)

# 论文 年份 一句话
18 Suspenseful Iterative Planning 2024-02 首个 LLM 悬念生成:迭代"给主角行动 + 对抗性让其失败",胜率 84.9%(自然度降 25%)
04 Codified Foreshadowing-Payoff 2026-01 把"伏笔—回收"编码成可执行约束,显式"先埋后收"
17 Spoiler Alert 2026-04 100-Endings 张力指标:LLM EQ 分最高却张力最低,后段仅《纽约客》1/3
16 Skeleton Coherence 2026-04 句子骨架建连贯,但实证整句仍胜骨架 ~8–9pp(反证主流方向对)
15 Storyline Trees 2026-06 长篇自动构造成 4 层"故事线树"做自适应检索,叙事 QA 全面领先

E. 评估 · 诊断 · 基准 · 奖励模型(7)

# 论文 年份 一句话
22 HelloBench 2024-09 主流模型几乎写不出 >4000 词长文;BLEU/ROUGE 与人评近乎零相关
44 EvolvR 2025-08 自进化成对推理评估器 → 当奖励模型提升生成,StoryER/HANNA/OpenMEVA SOTA
20 WritingBench 2025-03 每条 query 现场生成 5 条专属评分标准,人一致性 67%→84%
01 Lost in Stories 2026-03 一致性 bug 的 5 大类/19 子类分类 + 自动检测器;错误集中在叙事中段、高熵段落
31 NARRA-Gym 2026-05 多轮交互叙事的可执行评测环境(仿 Gym + 轨迹日志 + 11 维);流畅 ≠ 鲁棒/个性化
32 TTCW Literary Review 2026-05 263K 故事 × 14 维自训评审模型;固定格式评分下推理监督反而有害,评分封顶 ~0.68
19 StoryAlign 2026-05 现有裁判几乎选不对人类偏好(GPT-4o 仅 66.3%),专用奖励模型达 75.0%

F. 创造力 · 多样性 · 创意度量(8)

# 论文 年份 一句话
46 ASP Story 2024-06 用答案集编程(ASP)写高层符号约束,引导并多样化 LLM 生成(神经符号)
30 DRAT / Assessing Creativity 2026-05 系统检验创造力测试的预测有效性;发散思维随模型迭代下降 −0.47 z/年
21 Narrative Flattening 2026-05 受控实验证"叙事扁平化"主要发生在后训练阶段,专业文学被压最狠
45 Style over Story 2025-10 约束选择实验证 LLM 潜在偏好"风格 > 内容(事件/人物/设定)"
27 Calibrated Surprise 2026-04 创意质量 = 校准的意外(互信息 I(X;Y));批评 rubric 与 RLHF 拉向人群均值
29 Progressive Conditional Surprise 2026-06 Decan 多样性指标(base 模型 in-context surprise,无 embedding/参考/标注);对齐单调降多样性
28 Automated Creativity Eval 2026-06 创造力拆发散(语义熵,免参考)× 收敛(检索式多 agent 判官,省 63% token)
37 CASPER 2026-06 Forster 扁平/圆形 → 8 组可测人物刻画范畴;LLM 人物过度象征化 + 千篇一律成长弧

G. 人机共创 · 写作工具 · 用户研究(3)

# 论文 年份 一句话
33 Fabula 2026-06 DeepMind(Dramatron 团队)写作 sidekick 田野研究;rubric auto-rater 相关性 0.72→0.83
34 GraphStory 2026-06 事件图作为"用户交互 ↔ LLM 输入"中间层的共创界面;HCI 用户研究(cs.HC)
36 AI Fiction in the Wild 2026-06 WildChat 50 万对话实证:1/3 是虚构、fanfiction 49%;类型契约内的可预测性非负面

H. 中文小说 / 中文写作场景(3)

# 论文 年份 一句话
26 CAT-LLM 2024-01 词级 + 句级量化文体成 prompt,《围城》风格迁移 F1 79.36%;GPT-4 反不如 3.5
24 BiT-MCTS 2026-03 高潮优先 + 双向 MCTS 生成中文长篇,多样性胜率 77–92%,长达 5.8 万 token
25 Chinese Literature Homogeneity 2026-03 用 34 个 Propp 功能解剖,证 LLM 中文网文同质化根因是"读不懂功能"

I. 多模态与长上下文 · 能力边界(可迁移点)(3)

# 论文 年份 一句话
43 TLDM 2025-05 用小说测长上下文理解:LLM 在 64k+ token 上难以真正读懂长篇(生成前须结构化预处理)
13 MUSE 2026-02 多模态音视频叙事的 plan-execute-verify-revise 闭环(注:多模态,非纯文本)
35 One Sentence, One Drama 2026-05 一句话 → 整部短剧(视频);多 agent 辩论压节奏 + 分区重写 + Idea Bank

说明:分组按论文主要贡献归类,少数论文横跨多类(如 10 StoryWriter 兼具事件图规划与多智能体、35 One Sentence 兼具多模态与叙事节奏),此处取其一。年份用 arXiv 首次提交月份。


🧭 阅读建议路线


📈 领域趋势小结(2022 → 2026)

  1. 从"单模型长输出"走向"多智能体 + 显式状态":Re3/LongWriter/DOME → StoryWriter/StoryBox/Magnet;出现"自顶向下大纲派 vs 自底向上模拟派 vs 闭环约束派"三条路线。
  2. 评估越来越细、越来越"打脸":从整体打分转向可定位的一致性 bug(01)、张力/悬念(17)、多样性/同质化(25);并发现 BLEU/ROUGE 基本失效(22)、后训练会"压扁"文风(21)。
  3. 叙事学知识被显式编码:Campbell 五段(03)、Freytag 金字塔(14/24)、伏笔—回收(04)、Propp 功能(25)、Genette 叙事顺序(10)、Forster 扁平/圆形(37)纷纷进入生成/约束/评测。
  4. 小模型 + 好配方可打平大模型:POLARIS(08)9B 追平 27B、Book-Writing(05)14B 超前沿、StoryWriter/CogWriter 蒸馏或免训练超 GPT-4o —— 对成本敏感的写作产品是利好。
  5. 长度持续突破但连贯是瓶颈:从 ~7k 词(DOME)到 1.2 万词(StoryBox/CogWriter)乃至 5.8 万 token(BiT-MCTS)与"100 页"(Magnet);而 TLDM(43)指出 LLM 对 64k+ 长篇的理解仍未跟上。
  6. 创意度量与多样性独立成线:从整体质量分裂出"发散/收敛"(28)、"校准的意外/互信息"(27)、多样性(29)、人物刻画(37)等专门度量;多篇独立发现"规模与后训练不提升、甚至压低创意/多样性"(21/28/30/37)。
  7. 奖励模型 / 评估模型路线兴起:StoryAlign(19)、EvolvR(44)、TTCW 自训评审(32)显示"专用评估/奖励模型 > 通用 LLM 评委";NCP 的 VR-CLI(39)提供一种免标注可验证奖励。
  8. 从"一键生成"转向"人机共创":写作 sidekick / 图结构共创界面(33/34)+ 真实用户需求实证(36),呼应综述(00)里的 Author-Assistance 象限。

🗂️ 全量论文清单(awesome-llm-story-generation 精编)

来源:Picrew/awesome-llm-story-generation(288 篇 / 10 大类,2026-06-29 更新;维护者即 Lost in Stories 团队)。 完整 288 篇逐条索引见 → awesome-repo-index.md。下面按 10 大类各挑代表作 + 最新工作,⭐ 为本目录已精读并附笔记(本目录已精读的 47 篇按主题分组见上方《详细解读》,与此处仓库的 10 类划分不同)。

分类 数量 与文字写作相关度
A. Planning / Decomposition 规划分解 21 ★★★
B. Agent Collaboration 多智能体协作 6 ★★★
C. Sandbox / World Simulation 世界模拟 17 ★★(偏互动剧/游戏)
D. Multimodal 图像/视频/漫画/音频 64 ★(偏视觉)
E. Memory & Long-Context 记忆/长上下文 20 ★★★
F. Consistency / Controllability 一致性/可控 27 ★★★
G. Refinement / Self-Critique 精修/自评 16 ★★★
H. Evaluation / Benchmarks 评估/基准 75 ★★★
I. Datasets / Surveys 数据/综述 32 ★★
J. Open-source Projects 开源项目 10 ★★

A. 规划 / 分解(21) — 长篇写作的主线:先规划骨架,再展开 - ⭐ DOME(NAACL 2024)、⭐ Ex3(ACL 2024)、⭐ STORYTELLER(ACL 2025)、⭐ Book-Writing Capability(2026-05)、⭐ Codified Foreshadowing(2026-01)、⭐ BiT-MCTS(2026-03,中文)、⭐ GraphStory(2026-06,事件图共创) - 未读留意:DOC(2022,详细大纲控制,奠基)、Navigating the Path of Writing(NAACL 2024)、DPWriter(2026-01,多样规划分支 RL)、Improving Pacing in Long-Form Story Planning(EMNLP 2023)

B. 多智能体协作(6) - ⭐ CogWriter(2025-02)、⭐ Agents' Room(ICLR 2024,奠基基线)、⭐ Chain of Agents(NeurIPS 2024,长上下文协作) - 未读留意:HoLLMwood(EMNLP 2024,角色扮演编剧)、AutoAgents(IJCAI 2023)

C. 世界模拟 / 互动叙事(17) — 偏"角色自由行动涌现剧情" - ⭐ StoryBox(2025-10,自底向上沙盒)、⭐ NARRA-Gym(2026-05,多轮交互评测环境) - 未读留意:Generative Agents(2023,斯坦福"小镇",奠基)、BookWorld(2025-04,小说→智能体社会)、IBSEN(ACL 2024,导演-演员剧本)

D. 多模态(64) — 主要是视频/图像/漫画,文字写作弱相关 - ⭐ MUSE(2026-02,音视频叙事闭环)、⭐ One Sentence, One Drama(2026-05,短剧多 agent) - 文字相关少数:R²(ICLR 2025,小说→剧本,因果情节图)、SEED-Story、LongWriter-V

E. 记忆 & 长上下文(20) — 让长文"记得住、写得长" - ⭐ LongWriter(2024-08,工程基石)、⭐ Storyline Trees(2026-06)、⭐ POLARIS(2026-06)、⭐ KG + Literary Theory(2025-08)、⭐ TLDM(2025-05,长上下文理解基准) - 未读留意:RecurrentGPT(2023-05)、CHIRON(2024,长篇人物表示)、LongAlign(2024)、Self-Lengthen(2024)

F. 一致性 / 可控性(27) — 守住人设、世界规则、约束 - ⭐ ASP Story(ACL 2024 Workshop,符号约束多样化) - 未读留意:FACTTRACK(NAACL 2024,时间感知世界状态跟踪)、Suri(2024,多约束长文)、MoPS(ACL 2024,模块化 premise)、CS4(2024,用约束数量量化创造力)、Pastiche Novel(2025,模仿作者文风)

G. 精修 / 自我批评(16) — 写完再改,迭代提质 - ⭐ Suspenseful Iterative Planning(EACL 2024)、⭐ Re3(2022,递归重提示,奠基)、⭐ Fabula(2026-06,写作 sidekick 田野) - 未读留意:SuperWriter(2025-06,反思驱动)、R2-Write(2026-04,反思+修订)、Collective Critics(EMNLP 2024,多评委)、Finding Flawed Fictions(2025,情节漏洞检测)

H. 评估 / 基准(75,全库最大类) - ⭐ Lost in Stories、⭐ StoryAlign、⭐ WritingBench、⭐ HelloBench、⭐ Narrative Flattening、⭐ Spoiler Alert、⭐ 中文同质化 — 以及创意/多样性一批:⭐ Calibrated Surprise、⭐ Automated Creativity Eval、⭐ Conditional Surprise、⭐ DRAT、⭐ TTCW、⭐ CASPER、⭐ EvolvR、⭐ Style over Story、⭐ AI Fiction in the Wild - 未读留意:LitBench(2025-07)、LongEval(2025-02)、Are LLMs Capable of Human-Level Narratives?(EMNLP 2024)、Art or Artifice?(CHI 2023,奠基)

I. 数据 / 综述(32) - ⭐ Story Evaluation Survey(2024-08)、⭐ #00 生成综述(EMNLP 2025)、⭐ CAT-LLM(2024-01,中文风格迁移)、⭐ NCP(2025-03,RLVR 奖励)、⭐ CreAgentive(2025-09,超长连载引擎) - 未读留意:Narrative Theory-Driven LLM Methods: A Survey(2026-02)、What Makes a Good Story(2024-08)、Weaver(2024)、STORM(2024)、WritingPrompts(ACL 2020)

J. 开源项目(10) — 无论文的实用项目,详见仓库对应章节。