AI_writing/papers/19_storyalign.md

StoryAlign: Evaluating and Training Reward Models for Story Generation


1. 要解决的问题

LLM 生成的故事在复杂叙事结构人类偏好对齐上仍与人类作品有差距。核心原因:缺乏对"人类故事偏好"的有效建模——这种偏好高度主观、且此前很少被研究。 如果没有一个能可靠判断"哪篇故事更好"的奖励模型,就无法用 RLHF / best-of-n 等手段把生成推向人类喜欢的方向。本文把矛头指向这个被忽视的"奖励建模"环节。

2. 方法 / 核心思路

分两块:一个评测基准 StoryRMB 用来考奖励模型,一个专用奖励模型 StoryReward 用来解决问题。

2.1 StoryRMB 基准(考 RM 用)

2.2 StoryReward 奖励模型(解决问题用)

3. 数据与实验

4. 主要发现 / 结果

5. 局限

6. 对做产品 / 工程的启发

关联