Lost in Stories: Consistency Bugs in Long Story Generation by LLMs
- arXiv: 2603.05890(2026-03)
- 作者: Junjie Li, Xinrui Guo, Yuhao Wu, Roy Ka-Wei Lee, Hongzhi Li, Yutao Xie
- 类型: 评估 / 实证诊断
- 一句话: 不提出新的生成方法,而是把 LLM 长篇生成里的"一致性 bug"当作研究对象,系统地分类、检测并刻画其规律。
1. 要解决的问题
LLM 已经能生成数万字的叙事,但经常自相矛盾:推翻自己前面立下的事实、改变人物设定、破坏世界观规则。 现有 benchmark 大多只看情节质量和流畅度,几乎忽略了"一致性违规"这一维度。本文补上这个缺口。
2. 方法 / 贡献
论文提出两个工具:
ConStory-Bench(评测基准)
- 2,000 条 prompt,覆盖 4 类任务场景。
- 配套一套一致性错误分类体系:5 大类 + 19 个细粒度子类(覆盖事实、时间、人物特质、世界规则等维度)。
ConStory-Checker(自动检测流水线)
- 自动识别文本中的矛盾点。
- 关键是能给出明确的文本证据(grounding),把每个被判定的不一致锚定到原文,而非只给一个分数。
3. 核心发现(规律)
作者用 5 个研究问题(RQ)驱动分析,得到几条有价值的经验规律:
- 位置规律:一致性错误更集中在叙事中段,而非开头或结尾。
- 维度倾向:事实类(factual)和时间类(temporal) 不一致最常见。
- 熵相关:错误更多出现在 token 级熵较高(即模型更不确定)的段落。
- 错误聚集:某些错误类型倾向于共现(co-occurrence)。
4. 数据与实验范围
- 2,000 prompt,跨多个 LLM 评测。
- 4 类任务场景,5 个 RQ 组织分析。
- 项目有配套 GitHub 页面。
5. 结论与意义
- 明确了长篇生成的一致性问题有可预测的分布规律(中段高发、事实/时间维度为主、高熵段落风险大)。
- 为后续改进指明方向:可以针对中段、针对高熵段落做额外的一致性校验或记忆增强。
6. 局限
- 摘要层面未详列局限;本质上是"诊断型"工作,不给生成侧解法。
- 检测器依赖 LLM 判断,其自身可靠性需要人工验证背书。
7. 对做产品 / 工程的启发
- 可直接借鉴的检查思路:把生成文本抽成"事实/时间断言",做前后比对来查矛盾——这正是很多长文写作产品缺的质量闸门。
- 重点监控叙事中段 + 高熵段落,性价比最高。
- 5 大类/19 子类的分类体系可作为质量评审 rubric 的现成模板。
关联
- 检测思路与 [[02_from_personas_to_plot_magnet]] 里的 Atlas 幻觉检测异曲同工(都做前后世界状态比对)。
- 与 [[03_dome]] 的 Temporal Conflict Analyzer(时序冲突分析)解决同类问题。