Skeleton-based Coherence Modeling in Narratives
- arXiv/venue: 2604.02451(2026-04)
- 作者: Nishit Asnani, Rohan Badlani(Stanford University, Department of Computer Science)
- 类型: 叙事连贯度量(骨架 vs 整句的实证对比)
- 一句话: 提出用"句子骨架(skeleton)的一致性"来度量叙事连贯性,并设计 Sentence/Skeleton Similarity Network (SSN);结论是基于整句仍优于基于骨架——骨架虽有前景,但当前"用整句建模连贯"的主流方向是对的。
说明:本篇源于 Stanford CS224N 课程报告脉络,arXiv HTML 可解析,数值取自其结果表。
1. 要解决的问题
先前工作(Xu et al., 2018 的 skeleton-based 生成)表明:先从一句里抽出"骨架"(关键实体/关系/事件),再据此生成下一句,能提升叙事生成的连贯性。作者由此提问:"骨架在相邻句之间的一致性"能否作为刻画一段文本连贯度的好指标? 即把骨架从"生成辅助"提升为"连贯性度量"是否成立。
2. 方法 / 核心思路
(1)骨架抽取 - 复用 Xu et al. (2018) 的 input–skeleton–output 流水线:通过压缩任务 + 强化学习,从句子中抽取关键概念(实体、关系、事件)作为骨架(比整句短、且无严格顺序)。
(2)SSN:Sentence/Skeleton Similarity Network - 孪生网络(Siamese) 处理"句对"或"骨架对": - 输入:FastText 词向量(100 维) - 主干:2–3 层堆叠 LSTM(隐藏单元 50) - 可选 self-attention(softmax 归一化权重),带注意力的记为 SSNA - 训练:对比损失(contrastive loss),用归一化 L2 距离度量两嵌入的相似度
(3)连贯性如何被度量 - 对相邻句对打相似度分;整篇故事的连贯度 = 所有相邻句对相似度的平均。 - 三个评测口径:(a) 区分"相邻句对 vs 随机跨故事句对";(b) 偏好"原始顺序 vs 打乱顺序"的故事;(c) 以 0.5 阈值做"是否相邻"的二分类。 - 骨架路线的直觉:连贯叙事应保持"骨架/主题的连续性"。
3. 数据与实验
- Visual Storytelling 数据集:训练 40,153 篇、验证 4,990 篇、测试 5,054 篇;每篇最多 6 句。
- 正样本 = 同一故事的相邻句;负样本 = 跨故事随机配对。
4. 主要结果(带数值)
非参数基线(BERT + 余弦相似度): - 句子级:句序准确率 71.9% - 骨架级:61.6%
神经 SSN(主结果,三列 = 句序 / 故事序 / 句对分类):
| 方法 | Sentence Order | Story Order | Pair Classification |
|---|---|---|---|
| SSN-3(句子) | 92.9% | 69.6% | 82.2% |
| SSNA-2(句子) | 92.3% | 68.0% | 81.4% |
| SSNA-2(骨架) | 84.5% | 62.3% | 74.5% |
| SSN-3(骨架) | 84.2% | 62.9% | 73.8% |
- 句子级一致比骨架级高约 8–9 个百分点(跨所有指标)。
- 结论:骨架能建模连贯、但整句更强;现有以整句为单位的连贯建模方向是对的。
5. 局限
- 骨架质量依赖上游"高度复杂的神经模型",误差会传导。
- 骨架很短且无顺序,限制了其表达力。
- 评测故事很短(最多 6 句);作者建议在 500 词以上的更长文本上再验证。
6. 对做产品 / 工程的启发
- 一个可操作的连贯性自检指标:把"相邻单元相似度的平均/最低值"当作连贯度打分,用于长文写作的自动质检、章节顺序校验、"这段是不是接不上"的提示。
- "打乱顺序 vs 原始顺序" 的评测范式,可直接用作生成产品的连贯性回归测试。
- 反向教训:想省 token/走"抽骨架再比"的捷径未必更好——做连贯性判断时,保留整句语义通常更稳,别过度压缩。
- 若要度量"张力/连贯",与其只看局部句对相似度,不如结合前瞻式指标(见 [[17_spoiler_alert]])。
关联
- [[15_storyline_trees]]:都关乎"叙事骨架",但 15 用骨架做层级检索表示,本篇用骨架做连贯度量。
- [[01_lost_in_stories]]:连贯/一致性 bug 的度量与诊断,天然互补。
- [[17_spoiler_alert]]:同为叙事质量的自动度量,一个测连贯、一个测张力,可组合成评测面板。
- 本批次:[[18_suspenseful_iterative_planning]](悬念生成)、[[04_codified_foreshadowing_payoff]](伏笔结构)。