
{
  "schemaVersion": 1,
  "slug": "llm-story-generation",
  "language": "zh-CN",
  "title": "大模型故事生成研究图谱",
  "subtitle": "从时间线、核心洞见、方法演进、评价体系到 47 篇论文精读笔记",
  "updatedAt": "2026-08-03",
  "allowExternalNotePaths": true,
  "scope": {
    "summary": "综合梳理大模型故事生成中的长文本规划、一致性、创造力、评价与人机协作研究。",
    "boundaries": [
      "聚焦故事与小说生成，不把一般代码、数学或工具调用能力作为主体。",
      "引用次数采用固定快照，仅表示外部传播度，不代表论文质量。"
    ],
    "paperCount": 47
  },
  "privacy": {
    "forbiddenTerms": [
      "创业计划",
      "融资计划",
      "商业模式",
      "客户名单",
      "营收预测",
      "市场进入"
    ]
  },
  "tags": [
    "生成与规划",
    "评价",
    "状态与一致性",
    "长上下文",
    "创造力",
    "人机协作"
  ],
  "insights": [
    {
      "id": "I01",
      "title": "好故事不是流畅文本，而是跨层叙事能力",
      "explanation": "新版证据反复显示，句子顺滑、局部切题与整篇故事成立并不是同一件事。模型还要维持跨章事实、人物变化、节奏、张力和早先承诺的兑现。",
      "implication": "评价时应把语言质量、结构完整、状态一致和读者体验分开，避免用开头几段或一个总分代替整本判断。",
      "evidencePaperIds": [
        "01",
        "17",
        "21",
        "23",
        "37",
        "43"
      ]
    },
    {
      "id": "I02",
      "title": "写得长、读得长、记得住是三种能力",
      "explanation": "长样本训练能解锁输出长度，分段代理能处理更长输入，外部状态能减少遗忘；三者都不会自动带来小说级连贯或文学质量。",
      "implication": "系统报告至少要拆开长度遵从、长上下文理解、状态一致性和作品质量，不能把标称窗口或字数当成综合能力。",
      "evidencePaperIds": [
        "01",
        "05",
        "09",
        "12",
        "15",
        "22",
        "42",
        "43"
      ]
    },
    {
      "id": "I03",
      "title": "规划经常有效，但收益不全来自规划",
      "explanation": "大纲、事件图和符号承诺在多项实验中改善了长度、完整性或自动一致性；但多数系统同时增加调用、上下文、检索与修订预算，消融也常不等成本。",
      "implication": "应让规划维护宏观承诺，同时用等预算对照区分结构表示、更多计算和评委偏好各自贡献。",
      "evidencePaperIds": [
        "02",
        "03",
        "04",
        "07",
        "10",
        "11",
        "24",
        "38",
        "46"
      ]
    },
    {
      "id": "I04",
      "title": "多智能体外化的是流程，不是集体智慧",
      "explanation": "较可信的收益来自分段写作、共享状态、候选比较和定点修订，而不是给同一模型增加角色名称。现有证据又常把 agent 数量与更多 token、调用和专用提示混在一起。",
      "implication": "引入 agent 前先定义状态、决策权和失败处理，并用单模型多轮等预算基线检验多角色是否真的必要。",
      "evidencePaperIds": [
        "02",
        "12",
        "14",
        "35",
        "42",
        "44"
      ]
    },
    {
      "id": "I05",
      "title": "创造力指标测到的多是代理，不是作品本身",
      "explanation": "熵、语义差异、不可预测性和结构选择能诊断发散、张力或模式坍缩，却都可能把噪声、措辞偏好或评分器特性误当成创造力。",
      "implication": "先说明指标测的是探索、收敛还是受约束意外，再用独立人评和下游作品验证增量效度。",
      "evidencePaperIds": [
        "17",
        "21",
        "25",
        "27",
        "28",
        "29",
        "30",
        "37",
        "45",
        "46"
      ]
    },
    {
      "id": "I06",
      "title": "评价器既是尺子，也是偏差放大器",
      "explanation": "动态 rubric、专用奖励和轨迹评测提供了有用代理，但不少主榜存在 judge—benchmark 闭环、弱人类相关或同源训练；结构化选择偏好也不能直接外推到真实生成与评分。",
      "implication": "把自动评价当作可审计的代理：报告效度边界、隔离训练与测试，并用结构检查、专用指标和人类锚点交叉验证。",
      "evidencePaperIds": [
        "01",
        "08",
        "19",
        "20",
        "22",
        "23",
        "31",
        "32",
        "36",
        "44",
        "45"
      ]
    }
  ],
  "landscape": [
    {
      "title": "生成与规划",
      "question": "如何把主题扩展为跨章节可控、可验证又不僵化的故事？",
      "paperIds": [
        "02",
        "03",
        "04",
        "05",
        "06",
        "07",
        "10",
        "11",
        "12",
        "14",
        "18",
        "24",
        "38",
        "39",
        "41",
        "46"
      ]
    },
    {
      "title": "长度、状态与理解",
      "question": "如何区分写得长、读得长、记得住和真正理解整本叙事？",
      "paperIds": [
        "01",
        "05",
        "09",
        "12",
        "15",
        "16",
        "22",
        "38",
        "40",
        "42",
        "43"
      ]
    },
    {
      "title": "评价与效度",
      "question": "自动分数测到了什么，能否外推到真实作品、读者和训练闭环？",
      "paperIds": [
        "01",
        "08",
        "17",
        "19",
        "20",
        "22",
        "23",
        "27",
        "28",
        "31",
        "32",
        "37",
        "44",
        "45"
      ]
    },
    {
      "title": "创造力、作者与读者",
      "question": "如何保留合理意外、人物差异与作者控制，又不把请求日志或代理指标误当体验？",
      "paperIds": [
        "17",
        "21",
        "25",
        "26",
        "27",
        "28",
        "29",
        "30",
        "33",
        "34",
        "36",
        "37",
        "45",
        "46"
      ]
    }
  ],
  "bottlenecks": [
    {
      "title": "长文本不等于长期记忆",
      "summary": "输出长度、长上下文读取、跨章状态和整本理解是不同能力；扩大样本、窗口或调用链不会自动消除漂移。",
      "evidencePaperIds": [
        "01",
        "05",
        "09",
        "15",
        "22",
        "38",
        "42",
        "43"
      ]
    },
    {
      "title": "方法收益与计算预算经常混在一起",
      "summary": "规划、状态图和多代理系统常同时增加 token、调用、检索与修订；不等预算消融使组件因果贡献难以分配。",
      "evidencePaperIds": [
        "02",
        "03",
        "07",
        "10",
        "11",
        "12",
        "14",
        "24",
        "35"
      ]
    },
    {
      "title": "评价器的效度弱于它的精确分数",
      "summary": "自动评委常依赖同源训练、弱人类相关或自构 gold；精确小数不代表真实作品质量、读者体验或跨域稳定。",
      "evidencePaperIds": [
        "01",
        "08",
        "19",
        "20",
        "22",
        "23",
        "28",
        "32",
        "37",
        "44"
      ]
    },
    {
      "title": "代理变量容易被误写成心理与文学结论",
      "summary": "不可预测、语义差异、结构化选择和请求重复都提供线索，却不能单独证明张力、创造力、真实生成偏好或用户体验。",
      "evidencePaperIds": [
        "17",
        "27",
        "28",
        "29",
        "30",
        "36",
        "45",
        "46"
      ]
    }
  ],
  "evolution": [
    {
      "stage": "01",
      "title": "显式计划与符号骨架",
      "summary": "先规划、再起草、重排和编辑，建立长篇故事生成的基本流水线。",
      "tradeoff": "更可控，但静态骨架容易僵化。",
      "paperIds": [
        "38",
        "46"
      ]
    },
    {
      "stage": "02",
      "title": "层次大纲与事件图",
      "summary": "把情节拆成多尺度大纲、事件节点和动态实体关系。",
      "tradeoff": "结构更清晰，但维护复杂度增加。",
      "paperIds": [
        "03",
        "06",
        "07",
        "10"
      ]
    },
    {
      "stage": "03",
      "title": "状态记忆与可定位验证",
      "summary": "显式记录人物、世界状态、伏笔和场景层次，并为冲突返回证据。",
      "tradeoff": "检查器常与系统共享表示或在合成错误上验证，真实召回仍受限。",
      "paperIds": [
        "01",
        "02",
        "04",
        "15",
        "40",
        "43"
      ]
    },
    {
      "stage": "04",
      "title": "流程外化与定点修订",
      "summary": "规划、分段生成、评审与修订被拆成可观察步骤，并通过共享状态接续。",
      "tradeoff": "多代理收益常与更多调用和专用提示混杂，成本与失败传播上升。",
      "paperIds": [
        "02",
        "12",
        "14",
        "35",
        "44"
      ]
    },
    {
      "stage": "05",
      "title": "搜索、奖励与合理意外",
      "summary": "用迭代规划、树搜索和可验证奖励探索非平庸但合约束的路径。",
      "tradeoff": "探索能力增强，同时放大评价器偏差。",
      "paperIds": [
        "18",
        "24",
        "27",
        "39",
        "44"
      ]
    },
    {
      "stage": "06",
      "title": "专用训练、效度审计与作者工具",
      "summary": "长篇数据、奖励模型、轨迹基准和可编辑界面开始共同塑造创作系统。",
      "tradeoff": "更贴近工作流，但闭环评价、数据来源和跨域外推成为主要风险。",
      "paperIds": [
        "05",
        "08",
        "19",
        "20",
        "21",
        "28",
        "31",
        "32",
        "33",
        "34",
        "36"
      ]
    }
  ],
  "systemLayers": [
    {
      "number": "01",
      "title": "表示与规划",
      "responsibility": "把主题转成事件、场景、节拍与因果结构",
      "methods": "分层大纲 · 事件图 · Story Prototype · ASP",
      "risk": "模板僵化，结构先验压缩意外空间",
      "paperIds": [
        "03",
        "06",
        "07",
        "10",
        "18",
        "24",
        "38",
        "41",
        "46"
      ]
    },
    {
      "number": "02",
      "title": "状态与一致性",
      "responsibility": "跟踪事实、人物、关系、时间与叙事承诺",
      "methods": "世界状态图 · KG 记忆 · 伏笔账本 · 场景树",
      "risk": "隐含意义难以结构化，维护成本持续上升",
      "paperIds": [
        "01",
        "02",
        "04",
        "07",
        "15",
        "40",
        "43"
      ]
    },
    {
      "number": "03",
      "title": "探索与修订",
      "responsibility": "产生候选、比较路径，并在局部定点修复",
      "methods": "MCTS · debate · critic · rerank · 定点重写",
      "risk": "成本高，评价器偏差与更多计算预算会被搜索放大",
      "paperIds": [
        "12",
        "14",
        "24",
        "35",
        "39",
        "44"
      ]
    },
    {
      "number": "04",
      "title": "文体与人物呈现",
      "responsibility": "控制声音、人物类型、情感与叙事复杂度",
      "methods": "风格定义 · 非线性编排 · 人物维度 · 反扁平指标",
      "risk": "模仿替代原创，表面风格遮蔽内容贫乏",
      "paperIds": [
        "21",
        "25",
        "26",
        "27",
        "28",
        "37",
        "45"
      ]
    },
    {
      "number": "05",
      "title": "人机交互",
      "responsibility": "保留作者控制，支持构思、诊断与迭代",
      "methods": "可编辑图 · Gardener/Architect · 轨迹式交互",
      "risk": "自动重写夺走控制权，单一路径不适配所有作者",
      "paperIds": [
        "31",
        "33",
        "34",
        "36"
      ]
    }
  ],
  "evaluationMethods": [
    {
      "method": "动态 rubric + LLM 评委",
      "strength": "按任务拆解要求，适合解释和成对比较",
      "limitation": "绝对分效度弱；可能形成 judge—benchmark 闭环",
      "examples": [
        "WritingBench",
        "POLARIS"
      ]
    },
    {
      "method": "专用奖励模型",
      "strength": "比通用评委更聚焦故事偏好和专用维度",
      "limitation": "混合金标、同源评测与 reward hacking 风险",
      "examples": [
        "StoryAlign",
        "EvolvR"
      ]
    },
    {
      "method": "结构化检查器",
      "strength": "可定位事实、时间、世界状态与硬约束错误",
      "limitation": "常在合成错误上验证，也可能与生成器共享表示偏差",
      "examples": [
        "Lost in Stories",
        "Magnet/Atlas"
      ]
    },
    {
      "method": "叙事学专用指标",
      "strength": "能观察通用总分遗漏的张力、人物与叙事功能",
      "limitation": "代理通常只覆盖窄构念，不能直接等同文学质量",
      "examples": [
        "Spoiler Alert",
        "CASPER"
      ]
    },
    {
      "method": "信息论指标",
      "strength": "诊断探索范围、模式坍缩与受约束意外",
      "limitation": "依赖 scorer 和样本协议，高熵也可能只是噪声",
      "examples": [
        "Calibrated Surprise",
        "Decan"
      ]
    },
    {
      "method": "可执行 / 轨迹式评测",
      "strength": "能暴露多轮记忆、用户抵触和交互过程中的失败",
      "limitation": "共享脚手架、环境设计和小样本限制模型归因",
      "examples": [
        "NARRA-Gym",
        "Fabula"
      ]
    }
  ],
  "judgments": [
    {
      "id": "J01",
      "title": "规划常改善可检查结果，但因果贡献仍未拆净",
      "evidence": "Re3、DOME、StoryWriter 与 CFPG 在各自协议中改善了完整性、长度、自动一致性或承诺兑现。",
      "boundary": "这些系统通常同时增加调用、上下文、检索和修订；多项消融不等预算，检查器还可能复用系统表示。",
      "conclusion": "用规划维护宏观承诺，但应以等预算对照和独立评价区分结构表示与更多计算的收益。",
      "evidencePaperIds": [
        "02",
        "03",
        "04",
        "07",
        "10",
        "11",
        "24",
        "38",
        "46"
      ]
    },
    {
      "id": "J02",
      "title": "多智能体的可迁移价值是流程外化",
      "evidence": "Agents’ Room、Magnet、CogWriter 与短剧流水线显示，分段生成、共享状态、候选比较和定点修订能改善特定任务。",
      "boundary": "现有实验常把角色数量、调用次数、token 预算和专用提示一起改变，样本量与人工评价也偏小。",
      "conclusion": "先定义状态、决策权和失败处理，并用单模型多轮等预算基线验证多个 agent 是否必要。",
      "evidencePaperIds": [
        "02",
        "12",
        "14",
        "35",
        "42",
        "44"
      ]
    },
    {
      "id": "J03",
      "title": "写得长、读得长与保持状态必须分开",
      "evidence": "LongWriter 解锁长度遵从，Chain-of-Agents 和 Storyline Trees改善长输入处理，状态图方法减少部分冲突。",
      "boundary": "HelloBench 的自动质量相关有限，TLDM 没有人类真值，Lost in Stories 的检查器主要在注入错误上验证。",
      "conclusion": "分别报告输出长度、长上下文理解、跨章状态、结构完整和文学吸引力。",
      "evidencePaperIds": [
        "01",
        "05",
        "09",
        "12",
        "15",
        "22",
        "42",
        "43"
      ]
    },
    {
      "id": "J04",
      "title": "自动评价是代理，不能自己证明自己的效度",
      "evidence": "WritingBench 的动态 criterion 在受限成对实验中更贴近人工偏好；专用评委和轨迹评测也能暴露通用总分遗漏的问题。",
      "boundary": "WritingBench 主榜存在 judge—benchmark 闭环，POLARIS 依赖 LLM judge；Style over Story 的结构化选择不能外推到真实生成或评分。",
      "conclusion": "自动评委用于基础诊断与筛选，最终结论需要隔离数据、独立人评和多种互补测量。",
      "evidencePaperIds": [
        "08",
        "17",
        "19",
        "20",
        "22",
        "23",
        "31",
        "32",
        "44",
        "45"
      ]
    },
    {
      "id": "J05",
      "title": "创造力研究首先是构念效度问题",
      "evidence": "多项研究分别测量语义分叉、模式覆盖、不可预测性、叙事功能与受约束意外，并揭示后训练后的分布收窄。",
      "boundary": "高熵可能是噪声，不可预测不等于张力，结构差异不等于质量；多数代理缺少独立专家和跨任务验证。",
      "conclusion": "明确指标测的是探索、收敛还是作品质量，再报告它对独立人评与下游创作的增量效度。",
      "evidencePaperIds": [
        "17",
        "21",
        "25",
        "27",
        "28",
        "29",
        "30",
        "37",
        "45",
        "46"
      ]
    },
    {
      "id": "J06",
      "title": "作者、读者与系统目标必须先被声明",
      "evidence": "综述、NARRA-Gym、Fabula 与 GraphStory 表明，独立生成、作者辅助和互动叙事需要不同成功标准。",
      "boundary": "AI Fiction in the Wild 只观察请求行为，不能推出阅读体验或用户心理；学生与重度用户样本也不能代表全部作者和读者。",
      "conclusion": "共享基础质量门槛，但按作者控制、互动目标和目标读者分别定义最终评价。",
      "evidencePaperIds": [
        "00",
        "31",
        "33",
        "34",
        "36",
        "37"
      ]
    }
  ],
  "openQuestions": [
    "用等 token、等调用和等模型基线拆开规划、多代理与更多计算的贡献",
    "建立带人类真值的整本状态、一致性、张力和人物演化基准",
    "验证自动评委对独立人评、跨体裁和真实创作结果的增量效度",
    "隔离 judge 训练数据、benchmark query 与被评模型，审计评价闭环污染",
    "联合测量长度遵从、长上下文理解、跨章状态和整本作品质量",
    "区分发散、收敛、不可预测性与文学质量，验证创造力代理的构念效度",
    "把作者控制、用户抵触和长期创作收益纳入轨迹式评测",
    "让事件图、世界状态和场景树成为可编辑、可追溯而非隐藏的系统对象",
    "同时报告质量、调用次数、token、延迟、失败率和人工修订成本"
  ],
  "readingPaths": [
    {
      "label": "A",
      "title": "理解长篇生成系统",
      "description": "从奠基流水线走向状态闭环与主动搜索。",
      "paperIds": [
        "38",
        "14",
        "03",
        "10",
        "02",
        "24",
        "05"
      ]
    },
    {
      "label": "B",
      "title": "理解一致性与上下文边界",
      "description": "区分“写得长”“记得住”和“能验证”。",
      "paperIds": [
        "09",
        "01",
        "04",
        "15",
        "43",
        "42"
      ]
    },
    {
      "label": "C",
      "title": "建立故事评价体系",
      "description": "从分类学、通用评委走向专用指标与轨迹评测。",
      "paperIds": [
        "23",
        "22",
        "20",
        "19",
        "17",
        "21",
        "31"
      ]
    },
    {
      "label": "D",
      "title": "理解创造力与文学性",
      "description": "拆开发散、收敛、意外、同质化与人物多样性。",
      "paperIds": [
        "27",
        "28",
        "29",
        "30",
        "25",
        "37",
        "33"
      ]
    }
  ],
  "papers": [
    {
      "id": "00",
      "title": "A Survey on LLMs for Story Generation",
      "role": "按主作者权划分生成与共创路线的领域入口",
      "tags": [
        "生成与规划",
        "评价"
      ],
      "noteHref": "../pdfs/00_survey_llm_story_generation_精读.md",
      "firstPublished": "2025-11-01",
      "venue": "EMNLP 2025 Findings",
      "importance": 5,
      "importanceReason": "给出双范式分类学和领域地图；结论边界受纳入范围与非系统综述方法约束。",
      "sourceUrl": "https://aclanthology.org/2025.findings-emnlp.750/",
      "identifiers": {
        "doi": "10.18653/v1/2025.findings-emnlp.750"
      }
    },
    {
      "id": "01",
      "title": "Lost in Stories",
      "role": "长篇一致性基准与错误定位",
      "tags": [
        "状态与一致性",
        "长上下文",
        "评价"
      ],
      "noteHref": "../pdfs/01_lost_in_stories_精读.md",
      "firstPublished": "2026-03-06",
      "venue": "arXiv preprint",
      "importance": 5,
      "importanceReason": "把长篇一致性转成可检查基准；检查器效度主要由注入错误验证。",
      "sourceUrl": "https://arxiv.org/abs/2603.05890",
      "identifiers": {
        "arxiv": "2603.05890"
      }
    },
    {
      "id": "02",
      "title": "From Personas to Plot: Magnet",
      "role": "角色提案—叙述者提交的状态闭环与 Atlas 检测",
      "tags": [
        "状态与一致性",
        "生成与规划"
      ],
      "noteHref": "../pdfs/02_from_personas_to_plot_magnet_精读.md",
      "firstPublished": "2026-07-01",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "闭合角色行动、世界状态与一致性检测；长篇优势仍来自少量样本和模型评审。",
      "sourceUrl": "https://arxiv.org/abs/2607.00918",
      "identifiers": {
        "arxiv": "2607.00918"
      }
    },
    {
      "id": "03",
      "title": "DOME",
      "role": "动态分层大纲与时序 KG 记忆",
      "tags": [
        "生成与规划",
        "状态与一致性"
      ],
      "noteHref": "../pdfs/03_dome_精读.md",
      "firstPublished": "2024-12-18",
      "venue": "NAACL 2025",
      "importance": 4,
      "importanceReason": "动态大纲与时序知识图谱是重要系统路线，但部分增益混有预算不等的因素。",
      "sourceUrl": "https://arxiv.org/abs/2412.13575",
      "identifiers": {
        "arxiv": "2412.13575"
      }
    },
    {
      "id": "04",
      "title": "Codified Foreshadowing and Payoff",
      "role": "伏笔—触发—兑现的符号化控制",
      "tags": [
        "状态与一致性",
        "生成与规划"
      ],
      "noteHref": "../pdfs/04_codified_foreshadowing_payoff_精读.md",
      "firstPublished": "2026-01-11",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "首次把伏笔、触发与回收编码成可维护的叙事承诺。",
      "sourceUrl": "https://arxiv.org/abs/2601.07033",
      "identifiers": {
        "arxiv": "2601.07033"
      }
    },
    {
      "id": "05",
      "title": "Book Writing Capability",
      "role": "从公版书反演规划轨迹的长篇专用训练",
      "tags": [
        "生成与规划",
        "长上下文"
      ],
      "noteHref": "../pdfs/05_book_writing_capability_精读.md",
      "firstPublished": "2026-05-16",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "从真实书籍反演多尺度脚手架；首章规则诊断和规划遵循下降限定其外推范围。",
      "sourceUrl": "https://arxiv.org/abs/2605.17064",
      "identifiers": {
        "arxiv": "2605.17064"
      }
    },
    {
      "id": "06",
      "title": "Ex3",
      "role": "从真实小说抽取结构并树状扩写",
      "tags": [
        "生成与规划"
      ],
      "noteHref": "../pdfs/06_ex3_精读.md",
      "firstPublished": "2024-08-16",
      "venue": "ACL 2024",
      "importance": 4,
      "importanceReason": "把小说结构抽取、领域微调与树状扩写串成完整训练管线。",
      "sourceUrl": "https://arxiv.org/abs/2408.08506",
      "identifiers": {
        "arxiv": "2408.08506"
      }
    },
    {
      "id": "07",
      "title": "STORYTELLER",
      "role": "SVO 情节节点与动态实体图",
      "tags": [
        "生成与规划",
        "状态与一致性"
      ],
      "noteHref": "../pdfs/07_storyteller_精读.md",
      "firstPublished": "2025-06-03",
      "venue": "ACL 2025 Findings",
      "importance": 4,
      "importanceReason": "以 SVO 节点和动态实体图管理叙事状态；主要证据来自 200 个提示与 GPT-4o 评审。",
      "sourceUrl": "https://arxiv.org/abs/2506.02347",
      "identifiers": {
        "arxiv": "2506.02347"
      }
    },
    {
      "id": "08",
      "title": "POLARIS",
      "role": "人类参考注入与 16 维 LLM 奖励的长篇 RL",
      "tags": [
        "评价"
      ],
      "noteHref": "../pdfs/08_polaris_精读.md",
      "firstPublished": "2026-06-02",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "提供低算力写作强化学习配方；长度遵循有限且质量依赖 LLM 评审。",
      "sourceUrl": "https://arxiv.org/abs/2606.04095",
      "identifiers": {
        "arxiv": "2606.04095"
      }
    },
    {
      "id": "09",
      "title": "LongWriter",
      "role": "长样本合成、长度能力与长文基准",
      "tags": [
        "长上下文",
        "生成与规划"
      ],
      "noteHref": "../pdfs/09_longwriter_精读.md",
      "firstPublished": "2024-08-13",
      "venue": "arXiv preprint",
      "importance": 5,
      "importanceReason": "证明长输出受训练数据长度制约，并给出可复用的长文数据工程方案。",
      "sourceUrl": "https://arxiv.org/abs/2408.07055",
      "identifiers": {
        "arxiv": "2408.07055"
      }
    },
    {
      "id": "10",
      "title": "StoryWriter",
      "role": "事件图、非线性编排与历史压缩",
      "tags": [
        "生成与规划",
        "长上下文"
      ],
      "noteHref": "../pdfs/10_storywriter_精读.md",
      "firstPublished": "2025-06-19",
      "venue": "CIKM 2025",
      "importance": 4,
      "importanceReason": "事件图、非线性编排和历史压缩组成成熟的长篇多智能体流水线。",
      "sourceUrl": "https://arxiv.org/abs/2506.16445",
      "identifiers": {
        "arxiv": "2506.16445"
      }
    },
    {
      "id": "11",
      "title": "StoryBox",
      "role": "角色沙盒、涌现事件与异常因子",
      "tags": [
        "生成与规划",
        "创造力"
      ],
      "noteHref": "../pdfs/11_storybox_精读.md",
      "firstPublished": "2025-10-13",
      "venue": "AAAI 2026",
      "importance": 4,
      "importanceReason": "以角色沙盒和异常因子展示自底向上、涌现式故事生成。",
      "sourceUrl": "https://arxiv.org/abs/2510.11618",
      "identifiers": {
        "arxiv": "2510.11618"
      }
    },
    {
      "id": "12",
      "title": "CogWriter",
      "role": "规划—监控—复审的免训练脚手架",
      "tags": [
        "生成与规划",
        "状态与一致性"
      ],
      "noteHref": "../pdfs/12_cogwriter_精读.md",
      "firstPublished": "2025-02-18",
      "venue": "ACL 2025 Findings",
      "importance": 4,
      "importanceReason": "将规划、监控和复审认知过程落地为免训练长文脚手架。",
      "sourceUrl": "https://arxiv.org/abs/2502.12568",
      "identifiers": {
        "arxiv": "2502.12568"
      }
    },
    {
      "id": "13",
      "title": "MUSE",
      "role": "多模态叙事的验证—修订闭环",
      "tags": [
        "生成与规划",
        "评价"
      ],
      "noteHref": "../pdfs/13_muse_精读.md",
      "firstPublished": "2026-02-03",
      "venue": "arXiv preprint",
      "importance": 2,
      "importanceReason": "以多模态叙事验证闭环提供跨媒介参照，但与纯文本主题距离较远。",
      "sourceUrl": "https://arxiv.org/abs/2602.03028",
      "identifiers": {
        "arxiv": "2602.03028"
      }
    },
    {
      "id": "14",
      "title": "Agents’ Room",
      "role": "分段写作、共享 scratchpad 的多智能体基线",
      "tags": [
        "生成与规划",
        "人机协作"
      ],
      "noteHref": "../pdfs/14_agents_room_精读.md",
      "firstPublished": "2024-10-03",
      "venue": "ICLR 2025",
      "importance": 5,
      "importanceReason": "奠定编剧室式基线；证据更支持分段写作与共享状态，而非智能体数量本身。",
      "sourceUrl": "https://arxiv.org/abs/2410.02603",
      "identifiers": {
        "arxiv": "2410.02603"
      }
    },
    {
      "id": "15",
      "title": "Storyline Trees",
      "role": "场景级层次表示与长篇检索",
      "tags": [
        "长上下文",
        "状态与一致性"
      ],
      "noteHref": "../pdfs/15_storyline_trees_精读.md",
      "firstPublished": "2026-06-18",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "提供场景到主题的层次表示，为整本叙事检索与验证补上基础设施。",
      "sourceUrl": "https://arxiv.org/abs/2606.20900",
      "identifiers": {
        "arxiv": "2606.20900"
      }
    },
    {
      "id": "16",
      "title": "Skeleton Coherence",
      "role": "连贯建模粒度的负面结果",
      "tags": [
        "评价",
        "状态与一致性"
      ],
      "noteHref": "../pdfs/16_skeleton_coherence_精读.md",
      "firstPublished": "2026-04-02",
      "venue": "arXiv preprint",
      "importance": 2,
      "importanceReason": "负面结果澄清句子骨架并非更好的连贯判别粒度。",
      "sourceUrl": "https://arxiv.org/abs/2604.02451",
      "identifiers": {
        "arxiv": "2604.02451"
      }
    },
    {
      "id": "17",
      "title": "Spoiler Alert",
      "role": "100-Endings 张力指标",
      "tags": [
        "评价",
        "创造力"
      ],
      "noteHref": "../pdfs/17_spoiler_alert_精读.md",
      "firstPublished": "2026-04-10",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "用结局可预测性直接操作化叙事张力，补足通用评委的盲区。",
      "sourceUrl": "https://arxiv.org/abs/2604.09854",
      "identifiers": {
        "arxiv": "2604.09854"
      }
    },
    {
      "id": "18",
      "title": "Suspenseful Iterative Planning",
      "role": "通过削减脱困路径生成悬念",
      "tags": [
        "生成与规划",
        "创造力"
      ],
      "noteHref": "../pdfs/18_suspenseful_iterative_planning_精读.md",
      "firstPublished": "2024-02-27",
      "venue": "EACL 2024",
      "importance": 4,
      "importanceReason": "把经典悬念理论转化为可执行的迭代规划算法。",
      "sourceUrl": "https://arxiv.org/abs/2402.17119",
      "identifiers": {
        "arxiv": "2402.17119"
      }
    },
    {
      "id": "19",
      "title": "StoryAlign",
      "role": "混合金标的故事偏好基准与专用奖励模型",
      "tags": [
        "评价"
      ],
      "noteHref": "../pdfs/19_storyalign_精读.md",
      "firstPublished": "2026-05-06",
      "venue": "ICLR 2026",
      "importance": 5,
      "importanceReason": "建立故事偏好基准并暴露通用评委偏差；金标混合构造限制独立人类偏好解释。",
      "sourceUrl": "https://arxiv.org/abs/2605.04831",
      "identifiers": {
        "arxiv": "2605.04831"
      }
    },
    {
      "id": "20",
      "title": "WritingBench",
      "role": "动态 criterion 与 judge 闭环的效度案例",
      "tags": [
        "评价"
      ],
      "noteHref": "../pdfs/20_writingbench_精读.md",
      "firstPublished": "2025-03-07",
      "venue": "NeurIPS 2025",
      "importance": 5,
      "importanceReason": "验证随任务标准下的成对评价；评委复用提示与标准形成闭环，绝对分数有明显效度边界。",
      "sourceUrl": "https://arxiv.org/abs/2503.05244",
      "identifiers": {
        "arxiv": "2503.05244"
      }
    },
    {
      "id": "21",
      "title": "Narrative Flattening",
      "role": "后训练导致的主题、情感与风格收窄",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/21_narrative_flattening_精读.md",
      "firstPublished": "2026-05-27",
      "venue": "arXiv preprint",
      "importance": 5,
      "importanceReason": "用同基座检查点证明后训练会系统压平主题、情感和文体差异。",
      "sourceUrl": "https://arxiv.org/abs/2605.27878",
      "identifiers": {
        "arxiv": "2605.27878"
      }
    },
    {
      "id": "22",
      "title": "HelloBench",
      "role": "通用长文生成与分层评价",
      "tags": [
        "长上下文",
        "评价"
      ],
      "noteHref": "../pdfs/22_hellobench_精读.md",
      "firstPublished": "2024-09-24",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "较早系统揭示长度遵循失败；自动质量评估与人类结果的相关证据仍偏弱。",
      "sourceUrl": "https://arxiv.org/abs/2409.16191",
      "identifiers": {
        "arxiv": "2409.16191"
      }
    },
    {
      "id": "23",
      "title": "Story Evaluation Survey",
      "role": "故事评价维度与指标分类学",
      "tags": [
        "评价"
      ],
      "noteHref": "../pdfs/23_story_eval_survey_精读.md",
      "firstPublished": "2024-08-26",
      "venue": "ACM Computing Surveys",
      "importance": 5,
      "importanceReason": "系统整理故事评价维度、数据集和指标，是评价侧的总览地图。",
      "sourceUrl": "https://arxiv.org/abs/2408.14622",
      "identifiers": {
        "arxiv": "2408.14622"
      }
    },
    {
      "id": "24",
      "title": "BiT-MCTS",
      "role": "高潮优先的双向情节搜索",
      "tags": [
        "生成与规划",
        "创造力"
      ],
      "noteHref": "../pdfs/24_bit_mcts_精读.md",
      "firstPublished": "2026-03-15",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "以高潮为根节点进行双向搜索，为开放主题规划引入显式探索。",
      "sourceUrl": "https://arxiv.org/abs/2603.14410",
      "identifiers": {
        "arxiv": "2603.14410"
      }
    },
    {
      "id": "25",
      "title": "Chinese Literature Homogeneity",
      "role": "中文叙事功能与结构同质化",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/25_chinese_literature_homogeneity_精读.md",
      "firstPublished": "2026-03-15",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "从叙事功能而非词汇表面定位中文网文的结构同质化。",
      "sourceUrl": "https://arxiv.org/abs/2603.14430",
      "identifiers": {
        "arxiv": "2603.14430"
      }
    },
    {
      "id": "26",
      "title": "CAT-LLM",
      "role": "可解释的中文长文风格控制",
      "tags": [
        "生成与规划",
        "创造力"
      ],
      "noteHref": "../pdfs/26_cat_llm_精读.md",
      "firstPublished": "2024-01-11",
      "venue": "ACM journal version (2025)",
      "importance": 3,
      "importanceReason": "提供可解释的中文长文风格定义和迁移方法。",
      "sourceUrl": "https://arxiv.org/abs/2401.05707",
      "identifiers": {
        "arxiv": "2401.05707"
      }
    },
    {
      "id": "27",
      "title": "Calibrated Surprise",
      "role": "受约束意外的质量理论",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/27_calibrated_surprise_精读.md",
      "firstPublished": "2026-04-29",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "提出约束满足与意外性的可计算假设；小规模退化对照尚不能充当通用文学质量函数。",
      "sourceUrl": "https://arxiv.org/abs/2604.26269",
      "identifiers": {
        "arxiv": "2604.26269"
      }
    },
    {
      "id": "28",
      "title": "Automated Creativity Evaluation",
      "role": "发散 / 收敛创造力的分离测量",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/28_automated_creativity_eval_精读.md",
      "firstPublished": "2026-06-10",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "把创造力拆为发散与收敛两轴；自动指标仍是对文学创造力的代理测量。",
      "sourceUrl": "https://arxiv.org/abs/2606.11762",
      "identifiers": {
        "arxiv": "2606.11762"
      }
    },
    {
      "id": "29",
      "title": "Progressive Conditional Surprise",
      "role": "按 byte 归一的条件惊奇与多样性代理",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/29_progressive_conditional_surprise_精读.md",
      "firstPublished": "2026-06-01",
      "venue": "ICML 2026 Workshop (non-archival)",
      "importance": 3,
      "importanceReason": "提出无需参考答案的多样性指标，但证据仍限于早期工作坊规模。",
      "sourceUrl": "https://arxiv.org/abs/2606.01811",
      "identifiers": {
        "arxiv": "2606.01811"
      }
    },
    {
      "id": "30",
      "title": "Assessing Creativity",
      "role": "创造力测试的增量效度",
      "tags": [
        "创造力",
        "评价"
      ],
      "noteHref": "../pdfs/30_assessing_creativity_精读.md",
      "firstPublished": "2026-05-13",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "检验经典创造力测验的预测效度，说明单一指标无法覆盖全部构念。",
      "sourceUrl": "https://arxiv.org/abs/2605.13450",
      "identifiers": {
        "arxiv": "2605.13450"
      }
    },
    {
      "id": "31",
      "title": "NARRA-Gym",
      "role": "动态、多轮、轨迹式叙事评测",
      "tags": [
        "评价",
        "人机协作"
      ],
      "noteHref": "../pdfs/31_narra_gym_精读.md",
      "firstPublished": "2026-05-08",
      "venue": "Technical report",
      "importance": 4,
      "importanceReason": "把评测扩展为多轮全轨迹环境；分数反映共享脚手架中的系统表现，而非裸模型能力。",
      "sourceUrl": "https://arxiv.org/abs/2605.08503",
      "identifiers": {
        "arxiv": "2605.08503"
      }
    },
    {
      "id": "32",
      "title": "TTCW Literary Review",
      "role": "固定格式文学评论中的推理监督负面结果",
      "tags": [
        "评价"
      ],
      "noteHref": "../pdfs/32_ttcw_literary_review_精读.md",
      "firstPublished": "2026-05-19",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "提供大规模文学评审训练经验，并以负面结果警示推理监督和数据一致性问题。",
      "sourceUrl": "https://arxiv.org/abs/2605.20364",
      "identifiers": {
        "arxiv": "2605.20364"
      }
    },
    {
      "id": "33",
      "title": "Fabula",
      "role": "职业写作者参与设计与工具角色重定位",
      "tags": [
        "人机协作",
        "评价"
      ],
      "noteHref": "../pdfs/33_fabula_精读.md",
      "firstPublished": "2026-06-12",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "通过职业写作者参与设计，重新界定 AI 在创作工具中的合适角色。",
      "sourceUrl": "https://arxiv.org/abs/2606.14411",
      "identifiers": {
        "arxiv": "2606.14411"
      }
    },
    {
      "id": "34",
      "title": "GraphStory",
      "role": "图式构思、分支探索与作者控制",
      "tags": [
        "人机协作",
        "生成与规划"
      ],
      "noteHref": "../pdfs/34_graphstory_精读.md",
      "firstPublished": "2026-06-15",
      "venue": "arXiv preprint (ACM format)",
      "importance": 4,
      "importanceReason": "以可编辑事件图同时服务作者构思和模型上下文，代表共创界面方向。",
      "sourceUrl": "https://arxiv.org/abs/2606.16102",
      "identifiers": {
        "arxiv": "2606.16102"
      }
    },
    {
      "id": "35",
      "title": "One Sentence, One Drama",
      "role": "多模态短剧流水线、多评审与局部 patch",
      "tags": [
        "生成与规划",
        "评价"
      ],
      "noteHref": "../pdfs/35_one_sentence_one_drama_精读.md",
      "firstPublished": "2026-05-21",
      "venue": "arXiv preprint",
      "importance": 2,
      "importanceReason": "提供多模态短剧的评审重写系统参考；缺少评审一致性和显著性证据。",
      "sourceUrl": "https://arxiv.org/abs/2605.22144",
      "identifiers": {
        "arxiv": "2605.22144"
      }
    },
    {
      "id": "36",
      "title": "AI Fiction in the Wild",
      "role": "小说请求的高度集中、重复与行为边界",
      "tags": [
        "人机协作",
        "评价"
      ],
      "noteHref": "../pdfs/36_ai_fiction_in_the_wild_精读.md",
      "firstPublished": "2026-06-22",
      "venue": "MFS Cultural AI / Modern Fiction Studies",
      "importance": 4,
      "importanceReason": "真实日志揭示虚构请求的集中与重复；不能外推到读者体验、享受或心理效应。",
      "sourceUrl": "https://arxiv.org/abs/2606.22748",
      "identifiers": {
        "arxiv": "2606.22748"
      }
    },
    {
      "id": "37",
      "title": "CASPER Character Variety",
      "role": "人物呈现八维分类器及其混杂诊断",
      "tags": [
        "评价",
        "创造力"
      ],
      "noteHref": "../pdfs/37_casper_character_variety_精读.md",
      "firstPublished": "2026-06-21",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "把人物呈现操作化为八维诊断框架；中等一致性与来源、长度混杂需保留。",
      "sourceUrl": "https://arxiv.org/abs/2606.22454",
      "identifiers": {
        "arxiv": "2606.22454"
      }
    },
    {
      "id": "38",
      "title": "Re3",
      "role": "计划—起草—重排—编辑的奠基范式",
      "tags": [
        "生成与规划"
      ],
      "noteHref": "../pdfs/38_re3_精读.md",
      "firstPublished": "2022-10-13",
      "venue": "EMNLP 2022",
      "importance": 5,
      "importanceReason": "建立计划、起草、重排、编辑的长篇生成范式，是后续系统的直接起点。",
      "sourceUrl": "https://arxiv.org/abs/2210.06774",
      "identifiers": {
        "arxiv": "2210.06774"
      }
    },
    {
      "id": "39",
      "title": "Learning to Reason with NCP",
      "role": "下一章预测的可验证奖励",
      "tags": [
        "生成与规划",
        "评价"
      ],
      "noteHref": "../pdfs/39_learning_to_reason_ncp_精读.md",
      "firstPublished": "2025-03-28",
      "venue": "COLM 2025",
      "importance": 4,
      "importanceReason": "用下一章预测构造可验证奖励，代表从无标注书籍学习规划的新路线。",
      "sourceUrl": "https://arxiv.org/abs/2503.22828",
      "identifiers": {
        "arxiv": "2503.22828"
      }
    },
    {
      "id": "40",
      "title": "KG Literary Theory",
      "role": "长短期记忆与显式冲突注入",
      "tags": [
        "状态与一致性",
        "创造力"
      ],
      "noteHref": "../pdfs/40_kg_literary_theory_精读.md",
      "firstPublished": "2025-08-05",
      "venue": "arXiv preprint",
      "importance": 3,
      "importanceReason": "结合记忆、知识图谱和叙事障碍理论改善主题漂移与情节平淡。",
      "sourceUrl": "https://arxiv.org/abs/2508.03137",
      "identifiers": {
        "arxiv": "2508.03137"
      }
    },
    {
      "id": "41",
      "title": "CreAgentive",
      "role": "逻辑 / 文体解耦与超长多体裁生成",
      "tags": [
        "生成与规划",
        "长上下文",
        "创造力"
      ],
      "noteHref": "../pdfs/41_creagentive_精读.md",
      "firstPublished": "2025-09-30",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "展示超长连续生成的工程规模；文学质量证据弱于系统与流程主张。",
      "sourceUrl": "https://arxiv.org/abs/2509.26461",
      "identifiers": {
        "arxiv": "2509.26461"
      }
    },
    {
      "id": "42",
      "title": "Chain-of-Agents",
      "role": "长输入读取与汇总的顺序通信参照",
      "tags": [
        "长上下文",
        "生成与规划"
      ],
      "noteHref": "../pdfs/42_chain_of_agents_精读.md",
      "firstPublished": "2024-06-04",
      "venue": "NeurIPS 2024",
      "importance": 3,
      "importanceReason": "通用长上下文分段框架可供整本阅读参照，但并非故事生成证据。",
      "sourceUrl": "https://arxiv.org/abs/2406.02818",
      "identifiers": {
        "arxiv": "2406.02818"
      }
    },
    {
      "id": "43",
      "title": "TLDM",
      "role": "整本小说理解的长上下文压力测试",
      "tags": [
        "长上下文",
        "评价"
      ],
      "noteHref": "../pdfs/43_tldm_精读.md",
      "firstPublished": "2025-05-20",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "用整本小说揭示长短上下文表现断层；无人工真值，不能等同于总体叙事不理解。",
      "sourceUrl": "https://arxiv.org/abs/2505.14925",
      "identifiers": {
        "arxiv": "2505.14925"
      }
    },
    {
      "id": "44",
      "title": "EvolvR",
      "role": "成对推理评价器与部分成立的奖励闭环",
      "tags": [
        "评价",
        "生成与规划"
      ],
      "noteHref": "../pdfs/44_evolvr_精读.md",
      "firstPublished": "2025-08-08",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "将成对推理评估器接入部分奖励闭环，同时暴露开放域退化与奖励投机。",
      "sourceUrl": "https://arxiv.org/abs/2508.06046",
      "identifiers": {
        "arxiv": "2508.06046"
      }
    },
    {
      "id": "45",
      "title": "Style over Story",
      "role": "结构化选择中的风格偏好代理",
      "tags": [
        "评价",
        "创造力"
      ],
      "noteHref": "../pdfs/45_style_over_story_精读.md",
      "firstPublished": "2025-10-02",
      "venue": "arXiv preprint",
      "importance": 4,
      "importanceReason": "揭示结构化选择任务中的风格偏好；不能外推为真实生成或自由评审偏好。",
      "sourceUrl": "https://arxiv.org/abs/2510.02025",
      "identifiers": {
        "arxiv": "2510.02025"
      }
    },
    {
      "id": "46",
      "title": "ASP Story",
      "role": "符号约束带来的结构差异而非质量保证",
      "tags": [
        "生成与规划",
        "创造力"
      ],
      "noteHref": "../pdfs/46_asp_story_精读.md",
      "firstPublished": "2024-06-01",
      "venue": "ACL 2024 Workshop",
      "importance": 4,
      "importanceReason": "把符号结构与语言模型结合并提高结构多样性；尚无质量、连贯性和人工验证。",
      "sourceUrl": "https://arxiv.org/abs/2406.00554",
      "identifiers": {
        "arxiv": "2406.00554"
      }
    }
  ]
}
