paper_type: 实证与评价, 方法与系统 type_confidence: 高 reading_depth: 标准精读 title: Skeleton-based Coherence Modeling in Narratives authors: Nishit Asnani, Rohan Badlani year: 2026 source: arXiv:2604.02451v1; Stanford CS224N course project pdf: 16_skeleton_coherence.pdf
Skeleton Coherence:一个重要的负结果
一句话总结:作者把相邻句“骨架一致性”从生成假设改造成判别实验,发现 Siamese LSTM 的句子输入在句序、故事序和配对分类上均优于骨架输入;但数据只有最多 6 句的短故事,负样本由随机句和乱序构造,因此它只能否定这一骨架实现,不能代表真实长篇连贯性。
TL;DR
- 【论文报告】Sentence/Skeleton Similarity Network(SSN)用共享 LSTM 编码两句或两骨架,以相似度和 contrastive loss 训练;另比较 FastText、自注意力与非参数 BERT 均值相似度(§3)。
- 【论文报告】最佳 sentence SSN 的 sentence-order/story-order/pair accuracy 为 92.9/69.6/82.2;skeleton 版本为 84.2/62.9/73.8(§5)。
- 【论文报告】自注意力没有显著提升;作者将骨架落后归因于骨架抽取误差、片段过短和词序丢失(§5)。
- 【阅读者推断】论文真正值得保留的是负结果:压缩表示若丢掉关系和顺序,未必比原句更适合连贯性检测。
研究问题与设计
【作者主张】若“前句骨架可指导后句生成”意味着骨架保存连贯信息,那么相邻骨架的相似性应能区分连贯与不连贯文本(§1–3)。
【论文报告】SSN 是 Siamese LSTM:两侧共享编码器,计算 embedding 相似度,并用正/负对 contrastive loss 学习;实验分别输入完整句子与由既有模型抽取的 skeleton(§3,图 2,公式 1–6)。
数据与指标
【论文报告】数据有 40,153/4,990/5,054 个 train/validation/test stories,每篇最多 6 句。正例为同故事相邻句;负例把其中一句换成其他故事的随机句。故事级负例则随机打乱原故事句序(§4.1)。
【论文报告】三项指标是:相邻句对排序、原故事优于乱序故事、句对二分类;故事分数为相邻对相似度平均,分类阈值固定 .5(§4.2)。
【阅读者推断】随机异故事负例通常主题都不同,可能让模型学到 topic similarity;乱序 6 句还可能保留原相邻对。指标比真实“局部合理但全局矛盾”的连贯错误容易。
核心证据与结果
| 方法 | Sentence order | Story order | Pair classification |
|---|---|---|---|
| SSN-3 sentences | 92.9 | 69.6 | 82.2 |
| SSNA-2 sentences | 92.3 | 68.0 | 81.4 |
| SSN-3 skeletons | 84.2 | 62.9 | 73.8 |
| SSNA-2 skeletons | 84.5 | 62.3 | 74.5 |
【论文报告】非参数 BERT 均值 + cosine 的 sentence/skeleton sentence-order accuracy 为 71.9/61.6,均低于 SSN;完整句在所有神经比较中优于 skeleton(§5)。
【论文报告】self-attention 与普通 3 层 LSTM 接近;注意力模型仅 2 层,作者承认受算力和时间限制,不能据此断言注意力无效(§5)。
局限与适用边界
- 【论文报告】这是 Stanford CS224N 课程项目,代码公开,但并非成熟长篇 Benchmark 或故事生成系统(§8–9)。
- 【论文报告】最长 6 句;作者自己引用建议 story-order 测试至少 16 句,并提出未来换长文数据(§5、§7)。
- 【阅读者推断】“相邻相似”不等于叙事连贯:合理故事常有场景切换,不合理故事也可能词汇高度相似。
- 【阅读者推断】骨架质量与连贯模型绑在一起,没有 oracle skeleton 对照,无法区分表示思想与抽取器实现的责任。
对当前项目的启示
【阅读者推断】不要用“相邻 embedding 相似”作为长篇连贯主指标。结构化摘要仍有用,但必须保留事件参数、因果、角色状态与时间顺序;评测负例应包含人物属性冲突、因果倒置、伏笔未兑付等困难扰动。
阅读者判断
这篇论文相关度有限但负结果清晰:抽取后更短不等于更好判断。它不能支持长篇连贯性结论,却能提醒项目在压缩故事状态时避免只保留无序关键词。
关键原文定位
- 假设与项目定位:Abstract、§1,PDF pp.1–2。
- SSN 与公式:§3,图 2、公式 1–6,PDF pp.2–4。
- 数据、指标与超参:§4,PDF pp.5–6。
- 结果和负结果解释:§5,PDF pp.6–7。
- 结论、未来工作与代码:§6–9,PDF pp.7–8。