StoryAlign: Evaluating and Training Reward Models for Story Generation
- arXiv/venue: 2605.04831 (2026-05;亦见 OpenReview a3JmkJtTDV)
- 作者: Haotian Xia, Hao Peng, Yunjia Qi, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li(清华大学)
- 类型: 奖励模型(Reward Model)评测 + 训练 —— 面向"故事偏好"的对齐工作
- 一句话: 首次系统研究"用奖励模型建模人类故事偏好",发现现有 RM 几乎选不对人类偏好的故事(最佳仅 66.3%),并给出评测基准 StoryRMB + 专用奖励模型 StoryReward。
1. 要解决的问题
LLM 生成的故事在复杂叙事结构和人类偏好对齐上仍与人类作品有差距。核心原因:缺乏对"人类故事偏好"的有效建模——这种偏好高度主观、且此前很少被研究。 如果没有一个能可靠判断"哪篇故事更好"的奖励模型,就无法用 RLHF / best-of-n 等手段把生成推向人类喜欢的方向。本文把矛头指向这个被忽视的"奖励建模"环节。
2. 方法 / 核心思路
分两块:一个评测基准 StoryRMB 用来考奖励模型,一个专用奖励模型 StoryReward 用来解决问题。
2.1 StoryRMB 基准(考 RM 用)
- 规模:1,133 个高质量、人工核验实例;每个实例 = 1 个 prompt + 1 篇 chosen + 3 篇 rejected。
- 来源:1,224 条前提(624 条 LLM 生成 + 600 条取自 WritingPrompts 的人写前提)。
- LLM 前提:由 GPT-4o、Gemini 2.5 Pro、Grok 3、Qwen-Long 四个先进模型各生成候选;由四个评审 LLM 一致性排名,最低者作为 rejected。
- WritingPrompts 前提:原始人写故事作 chosen,3 篇 LLM 生成故事作 rejected(直接考"能否识别人写 vs 机器写")。
- 五个评分维度:creativity(创意)、coherence(连贯)、fluency(流畅)、characterization(人物刻画)、relevance(相关性)。
- 维度归类用一个四阶段算法(均值差分析 → 与亚军的 margin → rejected 方差 → 序数兜底)。
2.2 StoryReward 奖励模型(解决问题用)
- 训练数据 ~100,000 对偏好,用四种方式构造,覆盖中英多域: 1. Premise Back-generation(~6,000 对):从豆瓣(中)、WritingPrompts(英)爬人写故事,按主题聚类配对,用点赞数定偏好标签。 2. Prompt-Guided Rewriting(~30,000 对):人写故事作 chosen,LLM 做受限改写(改结局/标题)得到 rejected。 3. Human-Guided Continuation(~10,000 对):人写开头作前提;有人类续写引导的 LLM 输出作 chosen,无引导的 LLM 输出作 rejected。 4. LLM Evaluation(剩余):两篇 LLM 故事对比,大模型输出作 chosen。
- 底座:Llama-3.1-8B-Instruct 与 Qwen3-8B(均为 8B 指令模型)。
3. 数据与实验
- 考题:1,133 实例 × 5 维度准确率(选对 chosen 记为正确)。
- 对比对象:GPT-4o / Gemini-2.5-Pro / Grok-3 等作 LLM-judge,以及若干通用奖励模型。
- 下游验证:对每个前提用 Llama-3.1-70B-Instruct 生成 16 篇故事,做 best-of-16 选择;人工标注排名,比较各 RM 的 head-to-head 胜率;并接入 EQ-Bench Creative Writing v3。
- 人工核验流程:LLM 排名一致性 τavg ≥ 0.6 时由标注员核验;τavg < 0.6 的 230 个实例做完整人工标注;另在 ~100 个 MoPS 前提上做双标注员 head-to-head 排名验证。
4. 主要发现 / 结果
- 现有 RM/LLM-judge 很弱:最佳基线 GPT-4o 平均仅 66.3%(coherence 63.4 / creativity 63.7 / characterization 66.0 / fluency 73.3 / relevance 67.6);Gemini-2.5-Pro 仅 56.8%,Grok-3 62.4%。约等于"比瞎猜好不了多少"。
- StoryReward 明显更强:StoryReward-Qwen 平均 75.0%(creativity 78.8 / coherence 77.5 领先最明显),比最佳基线 +8.7 个百分点,且体量远小于被比的大模型。StoryReward-Llama 平均 61.4%(弱于 Qwen 版,说明底座敏感)。
- 下游 best-of-16:StoryReward 两个版本"选到较差故事的比例 < 30%",显著优于其他 RM;EQ-Bench 创意写作分也更高。
- 人写 vs 机器写:在 Human-LLM 配对上 StoryReward 优于基线,说明它更贴合人类偏好(论文给了图,但未给出显式相关系数)。
5. 局限
- 未报告 StoryReward 分数与人类判断之间的显式相关系数(Kendall/Spearman),偏好一致性主要靠核验流程背书。
- StoryReward-Llama 与 -Qwen 差距大 → 结果对底座选择敏感,泛化性存疑。
- 偏好标签部分来自点赞数 / 大模型作 chosen 等弱信号,可能引入平台/规模偏置。
- 5 个维度为固定 rubric,主观维度(创意、趣味)本身难以客观化。
6. 对做产品 / 工程的启发
- 可直接当"质量闸门":把 StoryReward 类模型接在生成后做 best-of-n 重排,是低改造成本地提升成稿质量的现成做法(本文实测选中差稿概率 <30%)。
- 别迷信 GPT-4o 当裁判:通用大模型在"故事偏好"上仅 ~66%,做 A/B 评测或 RLHF 打分前,应先在自家 StoryRMB 式基准上验证裁判可靠性。
- 偏好数据构造模板可复用:点赞回标、受限改写造负样本、人类续写引导造正样本——这四招是低成本攒偏好对的实用配方。
- 训练自家奖励模型时,注意底座敏感:优先在 2-3 个底座上各训一版再选。
关联
- 与 [[23_story_eval_survey]] 是一体两面:survey 梳理"怎么评故事",本文落到"用 RM 评并训练对齐"。
- 五维度 rubric(连贯/创意/人物/流畅/相关)与 [[23_story_eval_survey]] 归纳的人类评估维度高度重合。
- best-of-n 选优思路可作为 [[01_lost_in_stories]] 一致性问题的补救手段(选一致性更好的候选)。
- 与 [[20_writingbench]] 同属"用模型给写作打分"路线,但后者面向广义写作而非故事偏好。
- 底座/数据构造经验可与 [[03_dome]] 的生成方法组合(生成侧 + 选优侧)。