AI_writing/papers/01_lost_in_stories.md

Lost in Stories: Consistency Bugs in Long Story Generation by LLMs


1. 要解决的问题

LLM 已经能生成数万字的叙事,但经常自相矛盾:推翻自己前面立下的事实、改变人物设定、破坏世界观规则。 现有 benchmark 大多只看情节质量流畅度,几乎忽略了"一致性违规"这一维度。本文补上这个缺口。

2. 方法 / 贡献

论文提出两个工具:

ConStory-Bench(评测基准)

ConStory-Checker(自动检测流水线)

3. 核心发现(规律)

作者用 5 个研究问题(RQ)驱动分析,得到几条有价值的经验规律:

  1. 位置规律:一致性错误更集中在叙事中段,而非开头或结尾。
  2. 维度倾向事实类(factual)和时间类(temporal) 不一致最常见。
  3. 熵相关:错误更多出现在 token 级熵较高(即模型更不确定)的段落。
  4. 错误聚集:某些错误类型倾向于共现(co-occurrence)。

4. 数据与实验范围

5. 结论与意义

6. 局限

7. 对做产品 / 工程的启发

关联