paper_type: Benchmark 与数据集;方法与系统;实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Lost in Stories: Consistency Bugs in Long Story Generation by LLMs" authors: "Junjie Li; Xinrui Guo; Yuhao Wu; Roy Ka-Wei Lee; Hongzhi Li; Yutao Xie" year: 2026 source: "arXiv:2603.05890v1" pdf: "01_lost_in_stories.pdf"
ConStory-Bench:长篇故事的一致性错误如何累积
一句话总结:ConStory-Bench 用 2,000 个长篇故事提示、5 类 19 子类错误和带原文证据的 ConStory-Checker 衡量 8,000–10,000 词故事中的自相矛盾;它较好地揭示了事实与时间错误、长度累积和中段高发,但自动检测器只在人工注入错误上验证,且论文自身对人类基线 F1 的报告不一致。【阅读者推断】
TL;DR
- 【论文报告】任务覆盖 generation、continuation、expansion、completion 四种场景,共 2,000 个提示,目标长度均为 8,000–10,000 词。
- 【论文报告】错误体系包含 Timeline & Plot Logic、Characterization、World-building & Setting、Factual & Detail Consistency、Narrative & Style 五类和 19 个子类。
- 【论文报告】ConStory-Checker 由类别引导抽取、矛盾配对、证据链和 JSON 报告四阶段组成,使用 o4-mini 作为评估模型。
- 【论文报告】GPT-5-Reasoning 在主表中的 CED 最低,为 0.113;事实细节和时间情节逻辑是最常见错误。
- 【论文报告】错误数大致随输出长度线性增加;两种可复现 Qwen 模型的错误片段平均熵比全文基线高 12.03% 和 19.24%。
- 【阅读者推断】这是一套“一致性错误检测”基准,不是完整的文学质量基准;低错误密度不保证人物、主题、语言或审美质量更高。
1. 任务与数据从哪里来
【论文报告】作者从 WikiPlots 等故事材料构造提示,并用 o4-mini 将素材改写成四种任务:
| 场景 | 数量 | 占比 | 被测能力 |
|---|---|---|---|
| Generation | 751 | 37.5% | 从最小设定自由生成 |
| Continuation | 432 | 21.6% | 保留既有事实并续写 |
| Expansion | 422 | 21.1% | 将完整梗概扩成长篇 |
| Completion | 395 | 19.8% | 在给定开头与结尾间补全 |
【论文报告】构建过程使用 MinHash 去重,并以人工检查和自动启发式过滤低质量或过于简单的提示。
【阅读者推断】提示不是自然用户请求的原样抽样,而是从现有故事元素经过模型改写得到;因此基准更适合比较受控条件下的一致性,不足以代表所有真实创作需求。
2. 一致性如何被操作化
【论文报告】五个顶层类别进一步拆成 19 个错误子类:
- Timeline & Plot Logic:绝对时间、时长、同时性、无因之果、因果违规、遗弃情节。
- Characterization:记忆、知识、技能波动、遗忘能力。
- World-building & Setting:核心规则、社会规范、地理矛盾。
- Factual & Detail Consistency:外貌、命名、数量矛盾。
- Narrative & Style:视角、语气、风格漂移。
【阅读者推断】该分类的优势是可定位、可计数;边界是把一致性设为二元判断,难以区分真正错误与故意误导、不可靠叙述者、伏笔和反转。
3. ConStory-Checker 的信息流
- 【论文报告】Category-Guided Extraction 按五类提示扫描可能矛盾的文本片段。
- 【论文报告】Contradiction Pairing 将片段两两比较并判断 consistent / contradictory,以减少只看单句造成的误报。
- 【论文报告】Evidence Chains 保存冲突理由、两处原文及位置和错误类型。
- 【论文报告】JSON Reports 输出 quotation、position、pairing、category 和 explanation,并锚定到字符级偏移。
【作者主张】证据链使 LLM-as-a-judge 的判断比单一分数更可审计。
【阅读者推断】可审计不等于已验证正确;引用两段文本只能帮助复核,仍需检查抽取遗漏、错误配对和“后文改写前文设定”等合法叙事现象。
4. 指标:长度和提示难度如何进入分数
【论文报告】Consistency Error Density(CED)把每篇故事的错误数除以词数,再换算成每 10,000 词错误数,越低越好。
【论文报告】Group Relative Rank(GRR)先用 \(Q_{m,i}=w_{m,i}/(1+e_{m,i})\) 在同一提示的模型输出内排名,再对提示取平均,试图控制提示难度。
【阅读者推断】CED 会奖励“写得短但少犯错”,GRR 又把长度放进质量分子;两者共同报告比单一错误数合理,但仍没有直接测量是否完成故事、是否冗长或是否文学上值得读。
5. 主要结果
5.1 模型结果
【论文报告】主表关键结果如下:
| 模型 | CED ↓ | 平均词数 | 平均错误数 |
|---|---|---|---|
| GPT-5-Reasoning | 0.113 | 9,050 | 0.09 |
| Gemini-2.5-Pro | 0.305 | 5,584 | 0.16 |
| Claude-Sonnet-4.5 | 0.520 | 8,929 | 0.37 |
| GLM-4.6 | 0.528 | 4,949 | 0.18 |
| Qwen3-32B | 0.537 | 6,237 | 0.27 |
| LongWriter-Zero | 0.669 | 13,393 | 0.53 |
| SuperWriter | 0.674 | 6,036 | 0.38 |
| DOME | 1.033 | 8,399 | 0.84 |
【论文报告】Generation 场景通常比 continuation、expansion 和 completion 产生更高 CED;最主要的错误类别是事实细节与时间/情节逻辑。
5.2 长度、熵与位置结果
【论文报告】不同模型的错误数随故事长度近似线性增加,Claude-Sonnet-4.5 的长度—错误相关为 \(r=0.478\),DeepSeek-V3.2-Exp 为 \(r=0.973\)。
【论文报告】Qwen3-30B-A3B 和 Qwen3-4B 的错误片段平均 token entropy 分别比全文基线高 12.03% 和 19.24%。
【作者主张】高熵可以作为触发验证或自检的早期信号。
【阅读者推断】这里只分析两个 Qwen 模型,且比较“已被检测为错误的片段”与全文平均;它支持关联,不足以证明设置统一熵阈值就能预防错误。
【论文报告】矛盾位置主要集中在故事 40%–60% 区间;地理矛盾的平均事实—矛盾间距最大,为 31.0%,视角混淆最短,为 4.7%。
6. 检测器验证与报告冲突
【论文报告】作者让 Qwen3-235B-A22B-Thinking 生成 200 篇故事,并在五类错误中各注入 200 个错误,共 1,000 个;两名职业网文作者独立标注,每篇报酬 1 美元,两天内完成全部 200 篇。
【论文报告】Table 6 给出的 ConStory-Checker 总体 precision / recall / F1 为 0.884 / 0.550 / 0.678。
【论文报告】同一张表中,人类基线的总体 precision / recall / F1 为 0.660 / 0.139 / 0.229,平均真阳性为 138.5。
【论文报告】但紧邻正文写人类 Overall F1=0.281、检出 171/1,000 个错误;这与 Table 6 的 0.229 和 138.5 不一致。
【阅读者推断】应以表格明细作为更可审计的口径,同时把这处内部矛盾视为论文质量警报,不能原样复述“自动方法是人类的 3.2 倍”。
【阅读者推断】注入错误比自然叙事中的歧义更明确;检测器在合成诊断集上的高 precision 不自动等于它在真实长篇作品中同样可靠。
7. 局限与适用边界
- 【论文报告】基准只覆盖英语和偏西方叙事惯例。
- 【论文报告】一致/矛盾二元标签无法识别故意歧义、反转和延迟揭示。
- 【论文报告】只研究虚构故事,不能直接迁移到技术文档、学术文章或剧本。
- 【阅读者推断】2,000 个提示都经 o4-mini 改写,提示生成器可能带入统一语言风格和任务偏好。
- 【阅读者推断】模型排名高度依赖同一个自动检测器;没有对自然生成故事做足量的人类精确率/召回率审计。
- 【阅读者推断】基准未把一致性与完整性、可读性、原创性和审美质量联合验证。
8. 阅读者判断
【阅读者推断】这篇论文最有价值的不是排行榜,而是把“长篇不一致”拆成证据对、错误类别和位置分布。它适合作为长篇生成管线的单独诊断层:检测到问题后回到两段原文复核,而不应把 CED 当成总质量分。
【阅读者推断】若用于系统迭代,优先加入三项补充:自然错误的人类审计、对故意反转/不可靠叙述的对抗集、以及与完成度和文学质量并列的多目标报告。
关键原文定位
- 任务定义、四类场景与贡献:§1–2,pp.1–3
- 19 类错误与 ConStory-Checker:§2.2–2.3,pp.3–4
- CED、GRR 与主结果:§3.2.1,pp.4–6,Table 3
- 熵、共现和位置分析:§3.2.3–3.2.5,pp.6–8,Tables 4–5
- 论文局限:§6,p.9
- 注入错误验证:Appendix A.2,pp.12–14,Table 6
tags: [论文精读, 长篇故事, 一致性, Benchmark, LLM评委, 错误检测] related: [[09_longwriter]], [[22_hellobench]], [[20_writingbench]], [[16_skeleton_coherence]]