AI_writing/papers/23_story_eval_survey.md

What Makes a Good Story and How Can We Measure It? A Comprehensive Survey of Story Evaluation


1. 要解决的问题

LLM 让"自动故事评估"变刚需:既要评机器生成故事的能力,也要分析人写/机写故事的质量。但故事评估比一般生成评测难得多——要评 overall coherence、character development、interestingness 等复杂且主观的维度,而非机器翻译那种只看 fluency。领域里任务/维度/指标/数据集各说各话,缺一张统一地图。本 survey 就是来补这张图。

2. 方法 / 核心思路(四层分类学)

2.1 故事生成任务分类(评测对象)

2.2 人类评估维度("什么算好故事")

Relevance(相关性)、Fluency(流畅)、Coherence(连贯)、Character Development(人物塑造)Interestingness/Engagement(趣味/吸引力)Empathy(共情)Surprise(悬念/意外)、Commonsense(常识)、Consistency(一致性)、Completeness(完整性)、Clarity(清晰)、Informativeness(信息量)、Diversity(多样性)。 ——注意后半部分(人物、趣味、共情、意外)正是故事区别于普通文本的核心,也是最难自动化评的。

2.3 评测指标分类学("怎么量化")

传统方法: - 词汇/n-gram:BLEU、ROUGE、METEOR、CIDEr、Distinct-n、Self-BLEU。 - 嵌入式:BERTScore、MoverScore、WMD、SMS、BaryScore、DepthScore、InfoLM。 - 概率式:Perplexity、BARTScore、CTRLEval。 - 训练式:BLEURT、COMET、RUBER、MAUVE、UNION、MANPLTS。 - 多模态:FID、FVD、ClipScore、EMScore。

LLM-based 方法: - 嵌入式:ada-002 余弦相似。 - 概率式:GPTScore、DeltaScore、Likelihood-Bias-Mitigation。 - 生成式:G-EVAL、ChatEval、FairEval、WideDeep、ICE、CheckEval。 - 训练式 LLM 评审:T5Score、UniEval、Prometheus、Auto-J、TIGERScore

2.4 评测数据集(Benchmark)

数据集 规模 评什么
OpenMEVA 2,000 整体质量(相关/流畅/连贯)
HANNA 1,056 多维(相关、连贯、共情、意外、趣味)
StoryER-Scale 12,669 连贯、结尾、风格、人物、共情
COHESENTIA 500 细粒度连贯
PERSE 596 novels 个性化评估(读者偏好)
VHED 4,500 视觉故事评估
ROCStories 98,156 常识故事生成
WritingPrompts 303,358 长篇故事生成
STORIUM 5,743 带结构描述的小说

3. 数据与实验

综述性质,不做单一实验;贡献在于把上述任务/维度/指标/数据集归类整理并逐项讨论 merits & limitations。核心横切结论:传统自动指标与人类判断相关性低,尤其在主观维度上;LLM-based 评审是当下最有希望但仍带偏置的方向。

4. 主要发现 / 结果(综述结论)

5. 局限(作为综述)

6. 对做产品 / 工程的启发

关联