AI_writing/pdfs/16_skeleton_coherence_精读.md

paper_type: 实证与评价, 方法与系统 type_confidence: 高 reading_depth: 标准精读 title: Skeleton-based Coherence Modeling in Narratives authors: Nishit Asnani, Rohan Badlani year: 2026 source: arXiv:2604.02451v1; Stanford CS224N course project pdf: 16_skeleton_coherence.pdf

Skeleton Coherence:一个重要的负结果

一句话总结:作者把相邻句“骨架一致性”从生成假设改造成判别实验,发现 Siamese LSTM 的句子输入在句序、故事序和配对分类上均优于骨架输入;但数据只有最多 6 句的短故事,负样本由随机句和乱序构造,因此它只能否定这一骨架实现,不能代表真实长篇连贯性。

TL;DR

研究问题与设计

【作者主张】若“前句骨架可指导后句生成”意味着骨架保存连贯信息,那么相邻骨架的相似性应能区分连贯与不连贯文本(§1–3)。

【论文报告】SSN 是 Siamese LSTM:两侧共享编码器,计算 embedding 相似度,并用正/负对 contrastive loss 学习;实验分别输入完整句子与由既有模型抽取的 skeleton(§3,图 2,公式 1–6)。

数据与指标

【论文报告】数据有 40,153/4,990/5,054 个 train/validation/test stories,每篇最多 6 句。正例为同故事相邻句;负例把其中一句换成其他故事的随机句。故事级负例则随机打乱原故事句序(§4.1)。

【论文报告】三项指标是:相邻句对排序、原故事优于乱序故事、句对二分类;故事分数为相邻对相似度平均,分类阈值固定 .5(§4.2)。

【阅读者推断】随机异故事负例通常主题都不同,可能让模型学到 topic similarity;乱序 6 句还可能保留原相邻对。指标比真实“局部合理但全局矛盾”的连贯错误容易。

核心证据与结果

方法 Sentence order Story order Pair classification
SSN-3 sentences 92.9 69.6 82.2
SSNA-2 sentences 92.3 68.0 81.4
SSN-3 skeletons 84.2 62.9 73.8
SSNA-2 skeletons 84.5 62.3 74.5

【论文报告】非参数 BERT 均值 + cosine 的 sentence/skeleton sentence-order accuracy 为 71.9/61.6,均低于 SSN;完整句在所有神经比较中优于 skeleton(§5)。

【论文报告】self-attention 与普通 3 层 LSTM 接近;注意力模型仅 2 层,作者承认受算力和时间限制,不能据此断言注意力无效(§5)。

局限与适用边界

对当前项目的启示

【阅读者推断】不要用“相邻 embedding 相似”作为长篇连贯主指标。结构化摘要仍有用,但必须保留事件参数、因果、角色状态与时间顺序;评测负例应包含人物属性冲突、因果倒置、伏笔未兑付等困难扰动。

阅读者判断

这篇论文相关度有限但负结果清晰:抽取后更短不等于更好判断。它不能支持长篇连贯性结论,却能提醒项目在压缩故事状态时避免只保留无序关键词。

关键原文定位