AI_writing/pdfs/01_lost_in_stories_精读.md

paper_type: Benchmark 与数据集;方法与系统;实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Lost in Stories: Consistency Bugs in Long Story Generation by LLMs" authors: "Junjie Li; Xinrui Guo; Yuhao Wu; Roy Ka-Wei Lee; Hongzhi Li; Yutao Xie" year: 2026 source: "arXiv:2603.05890v1" pdf: "01_lost_in_stories.pdf"

ConStory-Bench:长篇故事的一致性错误如何累积

一句话总结:ConStory-Bench 用 2,000 个长篇故事提示、5 类 19 子类错误和带原文证据的 ConStory-Checker 衡量 8,000–10,000 词故事中的自相矛盾;它较好地揭示了事实与时间错误、长度累积和中段高发,但自动检测器只在人工注入错误上验证,且论文自身对人类基线 F1 的报告不一致。【阅读者推断】

TL;DR

1. 任务与数据从哪里来

【论文报告】作者从 WikiPlots 等故事材料构造提示,并用 o4-mini 将素材改写成四种任务:

场景 数量 占比 被测能力
Generation 751 37.5% 从最小设定自由生成
Continuation 432 21.6% 保留既有事实并续写
Expansion 422 21.1% 将完整梗概扩成长篇
Completion 395 19.8% 在给定开头与结尾间补全

【论文报告】构建过程使用 MinHash 去重,并以人工检查和自动启发式过滤低质量或过于简单的提示。

【阅读者推断】提示不是自然用户请求的原样抽样,而是从现有故事元素经过模型改写得到;因此基准更适合比较受控条件下的一致性,不足以代表所有真实创作需求。

2. 一致性如何被操作化

【论文报告】五个顶层类别进一步拆成 19 个错误子类:

【阅读者推断】该分类的优势是可定位、可计数;边界是把一致性设为二元判断,难以区分真正错误与故意误导、不可靠叙述者、伏笔和反转。

3. ConStory-Checker 的信息流

  1. 【论文报告】Category-Guided Extraction 按五类提示扫描可能矛盾的文本片段。
  2. 【论文报告】Contradiction Pairing 将片段两两比较并判断 consistent / contradictory,以减少只看单句造成的误报。
  3. 【论文报告】Evidence Chains 保存冲突理由、两处原文及位置和错误类型。
  4. 【论文报告】JSON Reports 输出 quotation、position、pairing、category 和 explanation,并锚定到字符级偏移。

【作者主张】证据链使 LLM-as-a-judge 的判断比单一分数更可审计。

【阅读者推断】可审计不等于已验证正确;引用两段文本只能帮助复核,仍需检查抽取遗漏、错误配对和“后文改写前文设定”等合法叙事现象。

4. 指标:长度和提示难度如何进入分数

【论文报告】Consistency Error Density(CED)把每篇故事的错误数除以词数,再换算成每 10,000 词错误数,越低越好。

\[ CED_{m,i}=\frac{e_{m,i}}{w_{m,i}/10000} \]

【论文报告】Group Relative Rank(GRR)先用 \(Q_{m,i}=w_{m,i}/(1+e_{m,i})\) 在同一提示的模型输出内排名,再对提示取平均,试图控制提示难度。

【阅读者推断】CED 会奖励“写得短但少犯错”,GRR 又把长度放进质量分子;两者共同报告比单一错误数合理,但仍没有直接测量是否完成故事、是否冗长或是否文学上值得读。

5. 主要结果

5.1 模型结果

【论文报告】主表关键结果如下:

模型 CED ↓ 平均词数 平均错误数
GPT-5-Reasoning 0.113 9,050 0.09
Gemini-2.5-Pro 0.305 5,584 0.16
Claude-Sonnet-4.5 0.520 8,929 0.37
GLM-4.6 0.528 4,949 0.18
Qwen3-32B 0.537 6,237 0.27
LongWriter-Zero 0.669 13,393 0.53
SuperWriter 0.674 6,036 0.38
DOME 1.033 8,399 0.84

【论文报告】Generation 场景通常比 continuation、expansion 和 completion 产生更高 CED;最主要的错误类别是事实细节与时间/情节逻辑。

5.2 长度、熵与位置结果

【论文报告】不同模型的错误数随故事长度近似线性增加,Claude-Sonnet-4.5 的长度—错误相关为 \(r=0.478\),DeepSeek-V3.2-Exp 为 \(r=0.973\)

【论文报告】Qwen3-30B-A3B 和 Qwen3-4B 的错误片段平均 token entropy 分别比全文基线高 12.03% 和 19.24%。

【作者主张】高熵可以作为触发验证或自检的早期信号。

【阅读者推断】这里只分析两个 Qwen 模型,且比较“已被检测为错误的片段”与全文平均;它支持关联,不足以证明设置统一熵阈值就能预防错误。

【论文报告】矛盾位置主要集中在故事 40%–60% 区间;地理矛盾的平均事实—矛盾间距最大,为 31.0%,视角混淆最短,为 4.7%。

6. 检测器验证与报告冲突

【论文报告】作者让 Qwen3-235B-A22B-Thinking 生成 200 篇故事,并在五类错误中各注入 200 个错误,共 1,000 个;两名职业网文作者独立标注,每篇报酬 1 美元,两天内完成全部 200 篇。

【论文报告】Table 6 给出的 ConStory-Checker 总体 precision / recall / F1 为 0.884 / 0.550 / 0.678。

【论文报告】同一张表中,人类基线的总体 precision / recall / F1 为 0.660 / 0.139 / 0.229,平均真阳性为 138.5。

【论文报告】但紧邻正文写人类 Overall F1=0.281、检出 171/1,000 个错误;这与 Table 6 的 0.229 和 138.5 不一致。

【阅读者推断】应以表格明细作为更可审计的口径,同时把这处内部矛盾视为论文质量警报,不能原样复述“自动方法是人类的 3.2 倍”。

【阅读者推断】注入错误比自然叙事中的歧义更明确;检测器在合成诊断集上的高 precision 不自动等于它在真实长篇作品中同样可靠。

7. 局限与适用边界

8. 阅读者判断

【阅读者推断】这篇论文最有价值的不是排行榜,而是把“长篇不一致”拆成证据对、错误类别和位置分布。它适合作为长篇生成管线的单独诊断层:检测到问题后回到两段原文复核,而不应把 CED 当成总质量分。

【阅读者推断】若用于系统迭代,优先加入三项补充:自然错误的人类审计、对故意反转/不可靠叙述的对抗集、以及与完成度和文学质量并列的多目标报告。

关键原文定位

tags: [论文精读, 长篇故事, 一致性, Benchmark, LLM评委, 错误检测] related: [[09_longwriter]], [[22_hellobench]], [[20_writingbench]], [[16_skeleton_coherence]]