What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story Evaluation
- arXiv/venue: 2408.14622 (2024-08)
- 作者: Dingyi Yang, Qin Jin(中国人民大学)
- 类型: 综述 / 分类学(story evaluation 领域的系统 survey)
- 一句话: 系统梳理"什么算好故事、怎么量化好故事"——统一了故事生成任务、人类评估维度、评测数据集与评测指标(从 n-gram 到 LLM-based)的四层全景图,是做故事评测的地图册。
1. 要解决的问题
LLM 让"自动故事评估"变刚需:既要评机器生成故事的能力,也要分析人写/机写故事的质量。但故事评估比一般生成评测难得多——要评 overall coherence、character development、interestingness 等复杂且主观的维度,而非机器翻译那种只看 fluency。领域里任务/维度/指标/数据集各说各话,缺一张统一地图。本 survey 就是来补这张图。
2. 方法 / 核心思路(四层分类学)
2.1 故事生成任务分类(评测对象)
- Text-to-Text:故事补全(实体填空、结尾生成)、从标题/提示/提纲/情节生成、分层生成(提纲→细节)。
- Visual-to-Text:图像段落描述、图序视觉叙事、视频叙事。
- Text-to-Visual:故事可视化(生成图序)、连续故事可视化、故事配图。
2.2 人类评估维度("什么算好故事")
Relevance(相关性)、Fluency(流畅)、Coherence(连贯)、Character Development(人物塑造)、Interestingness/Engagement(趣味/吸引力)、Empathy(共情)、Surprise(悬念/意外)、Commonsense(常识)、Consistency(一致性)、Completeness(完整性)、Clarity(清晰)、Informativeness(信息量)、Diversity(多样性)。 ——注意后半部分(人物、趣味、共情、意外)正是故事区别于普通文本的核心,也是最难自动化评的。
2.3 评测指标分类学("怎么量化")
传统方法: - 词汇/n-gram:BLEU、ROUGE、METEOR、CIDEr、Distinct-n、Self-BLEU。 - 嵌入式:BERTScore、MoverScore、WMD、SMS、BaryScore、DepthScore、InfoLM。 - 概率式:Perplexity、BARTScore、CTRLEval。 - 训练式:BLEURT、COMET、RUBER、MAUVE、UNION、MANPLTS。 - 多模态:FID、FVD、ClipScore、EMScore。
LLM-based 方法: - 嵌入式:ada-002 余弦相似。 - 概率式:GPTScore、DeltaScore、Likelihood-Bias-Mitigation。 - 生成式:G-EVAL、ChatEval、FairEval、WideDeep、ICE、CheckEval。 - 训练式 LLM 评审:T5Score、UniEval、Prometheus、Auto-J、TIGERScore。
2.4 评测数据集(Benchmark)
| 数据集 | 规模 | 评什么 |
|---|---|---|
| OpenMEVA | 2,000 | 整体质量(相关/流畅/连贯) |
| HANNA | 1,056 | 多维(相关、连贯、共情、意外、趣味) |
| StoryER-Scale | 12,669 | 连贯、结尾、风格、人物、共情 |
| COHESENTIA | 500 | 细粒度连贯 |
| PERSE | 596 novels | 个性化评估(读者偏好) |
| VHED | 4,500 | 视觉故事评估 |
| ROCStories | 98,156 | 常识故事生成 |
| WritingPrompts | 303,358 | 长篇故事生成 |
| STORIUM | 5,743 | 带结构描述的小说 |
3. 数据与实验
综述性质,不做单一实验;贡献在于把上述任务/维度/指标/数据集归类整理并逐项讨论 merits & limitations。核心横切结论:传统自动指标与人类判断相关性低,尤其在主观维度上;LLM-based 评审是当下最有希望但仍带偏置的方向。
4. 主要发现 / 结果(综述结论)
- 评测标准混乱:coherence、interestingness 等维度定义模糊、各文不一,难以横向比较。
- 传统指标语义能力有限:n-gram/嵌入式指标与人评相关性低,尤其评不了共情、趣味等主观维度。
- LLM-based 是趋势但有偏:G-EVAL / Prometheus / Auto-J 等生成式与训练式 LLM 评审更贴合人类,但存在自偏好、位置偏置等问题。
- 数据集碎片化:现有 benchmark 各自覆盖不同维度、不同模态,缺统一标准。
5. 局限(作为综述)
- 覆盖到 2024-08,之后大量新工作(如 [[20_writingbench]]、[[19_storyalign]]、[[22_hellobench]])未纳入。
- 以分类整理为主,未给出统一的实证 benchmark 或推荐"该用哪个指标"的定论。
- 对长篇故事、多模态故事评估的成熟方案仍显不足(survey 自己也列为 open problem)。
6. 对做产品 / 工程的启发
- 当"评测维度词典"用:13 个人类评估维度可直接做成产品的质量评审 rubric 骨架(相关/流畅/连贯/人物/趣味/共情/意外/一致…)。
- 选指标有据可依:做质量闸门时,n-gram(BLEU/ROUGE)只适合表层比对,主观质量必须上 LLM-based 评审(G-EVAL / Prometheus 类)——本 survey 给出各指标适用边界。
- 数据集速查表:需要现成故事评测数据时,HANNA(多维)、OpenMEVA(整体)、StoryER-Scale(人物/风格)、PERSE(个性化)是首选。
- 未来方向(标准化维度、长文评估、个性化评估、人机协同评审、辨别 AI vs 人写)几乎就是一份产品 roadmap 清单。
关联
- 本篇是全批次的"总纲/地图":[[19_storyalign]](RM 评故事偏好)、[[20_writingbench]](广义写作评审)、[[22_hellobench]](长文生成评测)都是它所列方向的具体新实现。
- 归纳的 diversity / interestingness 维度退化,正被 [[21_narrative_flattening]] 实证。
- character development / consistency 维度对应 [[01_lost_in_stories]] 的一致性诊断与 [[02_from_personas_to_plot_magnet]] 的人物一致性。
- coherence / structure 维度与 [[03_dome]]、[[04_codified_foreshadowing_payoff]] 的生成侧结构化方法互补。