paper_type: "Benchmark 与数据集, 方法与系统, 实证与评价" type_confidence: 高 reading_depth: 标准精读 title: "StoryAlign: Evaluating and Training Reward Models for Story Generation" authors: "Haotian Xia, Hao Peng, Yunjia Qi, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li" year: 2026 source: "ICLR 2026;arXiv:2605.04831v1(2026-05-06)" pdf: "19_storyalign.pdf"
StoryAlign:把故事偏好做成四选一基准,但“金标”仍是混合协议
一句话结论:StoryAlign 以 1,133 个 premise—四故事选择题评测故事奖励模型,并以 93,729 个自动构造的偏好对训练两个 8B STORYREWARD;在该基准的五维宏平均中,Qwen 版本为 75.0%,高于 GPT-4o 的 66.3%。但这 75.0% 衡量的是对“LLM 排序、分级人工核验和人类故事优先”的混合构造协议的拟合,而不是独立、完整人类文学偏好的直接测量。
核心问题
故事没有像数学题那样可验证的唯一答案:通用 reward model 能否在同一 premise 下,稳定选出更符合人类故事偏好的候选?若不能,怎样以可扩展的偏好对训练专用 reward model,同时避免“人类文本 vs. LLM 文本”的表层风格捷径?本文的论证依次是:先构造 STORYRMB 测量选择能力,再构造 STORYREWARD 训练对,最后用 benchmark 与 Best-of-16(BoN)检验它。(论文报告,摘要、§1–§5,PDF pp.1–8)
TL;DR
- 【实验方法】STORYRMB 有 1,133 个四候选实例;chosen 加三条 rejected 构成一次四选一。五个主区分维度的分母依次是 creativity 292、coherence 265、fluency 225、characterization 215、relevance 136。(论文报告,§2.2,PDF p.4)
- 【实验方法】624 个 LLM–LLM 项由四个裁判 LLM 排序:230 个
τavg < 0.6项完整人工排序,394 个低分歧项以四裁判 overall 分平均后的排序供人工确认;509 个 Human–LLM 项只核验人类故事是否最佳。(论文报告,附录 C,PDF pp.16–17) - 【实验结果】STORYREWARD-QWEN 的五维宏平均准确率为 75.0%,Qwen3-8B 为 53.5%、GPT-4o 为 66.3%;每题只在 reward 最高的一个故事恰为 chosen 时记对。(论文报告,§4.1、表1,PDF pp.6–7)
- 【作者主张】作者把相对通用 RM 的提升归因于从人类故事及其偏好信号构造的训练对,并认为其在 MoPS 的 Best-of-16 选择中也更对齐人类排序。(作者主张,§4–§5,PDF pp.7–8)
- 【阅读者推断】该结果是强有力的域内选择证据,却不等同于“75% 的独立人类文学判断准确率”:维度、chosen 和部分全排序都依赖同一批 LLM 分数及确认流程,且 BoN 的精确样本数和原始计数未报告。(阅读者推断)
从候选故事到 STORYRMB:测量的对象是什么
候选与样本来源。 主文先称用主题框架、“conflict or reversal”种子、扩写和人工过滤得到 624 个 premise,并从 WritingPrompts 随机抽样、过滤 600 个带原始人类故事的 premise。对 LLM premise,四个生成器各写一个候选;§2.1 列 GPT-4o、Gemini 2.5 Pro、Grok 4、Qwen-Long。对 WritingPrompts,附录 B 则明确为原人类故事加三条 LLM 故事。最终每项都是一个 premise、一个 chosen、三个 rejected,故评测不是两两偏好而是四选一。(论文报告,§2.1–§2.2,PDF pp.3–4;附录 B,p.16)
排序协议。 四个裁判 GLM-4.5、Qwen2.5-Max、Claude-3.5 与 DeepSeek-R1 对 creativity、coherence、fluency、characterization、relevance 及 overall 分别打分,以 overall 诱导四份候选排序。作者计算六个裁判对的 Kendall's Tau 均值:τavg < 0.6 定义为强分歧并完整人工排序,否则先将四个 overall 分数平均以得到最终排序,再让人工确认;确认者不能判定时保留原排序。作者称 τavg=0.6 约对应 80% concordant、20% discordant pairs,这只是经验启发式。(论文报告,§2.2,PDF p.4;附录 C,p.17)
人类故事的特殊处理。 600 个 WritingPrompts 项中,作者只给三个 LLM 故事做上述排序;人类故事因数据集质量控制和额外过滤而被预设为四者最高,只要求标注者验证这一点。短于 100 词者过滤;91 个被标为 unsure 后删除,留下 509 个 Human–LLM 项。另一侧的 624 个 LLM–LLM 项恰由 230 个完整人工排序和 394 个 LLM 排序后人工确认组成;624+509=1,133。(论文报告,附录 B–C,PDF pp.16–17)
维度不是独立人工标签。 每项最后只归入一个“最能区分 chosen 与 rejected”的维度:先取 chosen 对 rejected 平均分的最大 mean gap;若多个维度差距在 tie tolerance τ=0.5 内,再比 chosen 与最强 rejected 的最大 margin;仍平手时取 rejected 分数方差最小者;最后按预设 priority 兜底。论文没有列出这个 priority 的实际五维顺序。因此表中的五个分组反映的是裁判 LLM 分数的层级算法,而非独立人类对“这项主要因何更好”的标注。(论文报告,§2.2、式3–5,PDF pp.4–5;附录 F/算法1,pp.18、21)
| 主区分维度 | 实例数(即该维准确率分母) |
|---|---|
| Creativity | 292 |
| Coherence | 265 |
| Fluency | 225 |
| Characterization | 215 |
| Relevance | 136 |
| 合计 | 1,133 |
(论文报告,§2.2,PDF p.4)
构造记录中的内部矛盾
证据边界。 数量叙述无法完全同时为真:主文称 624 个 LLM premise,附录 B 却称 533 个 LLM-generated premises。后者与 600 相加恰为 1,133,却又不能解释 600 个中删去 91 个后仅余 509;前者与 509 相加正好为 1,133,且与 230+394=624 对齐。候选生成器亦有矛盾:§1 列 Grok 3,§2.1 列 Grok 4;实验表中的被测模型是 Grok-3。本文笔记采用可由末端计数复算的“624 LLM–LLM + 509 Human–LLM”,但不将附录的 533 或具体 Grok 版本悄然改写为已解决事实。(论文报告,§1–§2,PDF pp.2–4;附录 B–C,pp.16–17;表1,p.7)
从平台故事到 STORYREWARD:训练信号怎样构造
数据设计。 作者从中文 Douban、英文 WritingPrompts 与 LLM 生成收集训练资料;表9给出精确总量 93,729 对、平均/中位故事长度 2,802/1,858 词。摘要和正文的“约 100,000”是概称。四种来源有意混合真实人类文本、受控反例与 LLM–LLM 自动偏好,以同时追求现实覆盖和可扩展性。(论文报告,§3.1、表9,PDF pp.5–6、25)
Premise back-generation。 在 Douban 中,作者按平台 genre 或同一作者专栏聚类,从同簇抽两篇不同故事交给 GPT-4o 反推共同 premise;readership count 较高者为 chosen,极低参与度对会过滤,产量约 6,000 对。这里具体方法段写的是 readership count,不应改写成已证实的 upvote 排序。(论文报告,§3.1,PDF p.5)
Prompt-guided rewriting。 一篇人类故事及对应 premise 为 chosen;LLM 仅受控修改结尾、关键情节、人物动机、因果连贯性或语言等,形成仍可读但预期较弱的 rejected,约 30,000 对。其关键前提是人类原作通常更优,论文称随机检查 20 个样本以验证,但没有报告检查者、通过比例或置信区间。(论文报告,§3.1,PDF pp.5–6;附录 E.3,p.18)
Human-guided continuation。 两个生成设置共享 premise 与 prompt,只有一方可访问真实人类续文/开头作为引导;其生成被置为 chosen,未获引导的生成被置为 rejected,约 10,000 对。作者同样只报告随机抽 20 对后认定引导方更好。早期直接以完整人类原作为 chosen 的训练使 StoryRMB 平均准确率低于 30%;作者推测模型借由人机文本的表层分布差异走捷径,故改为这种人类引导、但仍由 LLM 输出的 chosen。(论文报告,§3.1,PDF p.6;附录 E.4,p.18)
LLM–LLM 自动对。 其余方法是让 LLM 为同一 premise 生成两故事,再由另一 LLM 标 chosen/rejected。附录例示 Llama-3.1 8B/70B、DeepSeek-R1-Distill-Llama 8B/70B、Qwen2.5-14B/QwQ-32B 的比较:既有大模型评两个小模型输出,也有大小模型输出直接相较。论文只给前三类约 6k/30k/10k 和总数 93,729,未报告第四类或四类各自的精确数量,不能把余数当作精确规模。(论文报告,§3.1,PDF p.6;附录 E.1,p.17;表9,p.25)
训练设置。 作者以 premise 为输入、故事偏好对为监督,分别用 Llama-3.1-8B-Instruct 与 Qwen3-8B 训练 STORYREWARD-LLAMA/QWEN:batch size 1、学习率分别 9×10^-6 和 2×10^-5、1 epoch。损失函数、优化器、最大长度、截断、随机种子、硬件和训练时长未报告。(论文报告,§3.2,PDF p.6)
评测协议与主结果:75.0% 实际表示什么
实验方法。 对一个四故事集合 {s1,s2,s3,s4},RM 分别赋分,只有 argmax_i f(si) 等于 benchmark chosen 才算正确。表1每列是相应维度的准确率;Average 是五个维度百分比的等权宏平均,并非对 1,133 项按样本数加权后的总体 accuracy。基线包含通用 RM 和生成式 LLM-as-judge。(论文报告,§4.1,PDF pp.6–7)
| 模型 | Coh. | Cre. | Char. | Flu. | Rel. | Avg. |
|---|---|---|---|---|---|---|
| InternLM2-20B-Reward | 17.0 | 25.1 | 21.9 | 17.3 | 41.2 | 21.3 |
| InternLM2-7B-Reward | 18.5 | 18.9 | 18.1 | 15.6 | 25.0 | 18.7 |
| Skywork-Reward-Gemma-2-27B-v0.2 | 36.6 | 29.8 | 22.8 | 40.0 | 34.6 | 32.7 |
| Skywork-Reward-Llama-3.1-8B-v0.2 | 29.4 | 32.3 | 26.5 | 36.0 | 30.9 | 31.0 |
| QRM-Llama3.1-8B-v2 | 15.1 | 17.9 | 9.3 | 13.3 | 19.9 | 14.9 |
| ArmoRM-Llama3-8B-v0.1 | 52.4 | 48.8 | 44.2 | 56.4 | 43.4 | 49.7 |
| GRM-Llama3.1-8B-rewardmodel-ft | 35.1 | 28.1 | 23.7 | 35.1 | 35.3 | 31.1 |
| WQRM | 16.6 | 27.1 | 24.2 | 31.1 | 19.9 | 24.0 |
| Llama3.1-8B-Instruct | 22.3 | 30.5 | 25.1 | 16.9 | 24.9 | 24.3 |
| Qwen3-8B | 55.8 | 53.1 | 47.0 | 60.4 | 48.5 | 53.5 |
| GPT-4o | 63.4 | 63.7 | 66.0 | 73.3 | 67.6 | 66.3 |
| Gemini-2.5-Pro | 57.7 | 51.7 | 57.2 | 64.4 | 52.2 | 56.8 |
| Grok-3 | 62.6 | 57.5 | 62.8 | 69.8 | 60.3 | 62.4 |
| STORYREWARD-LLAMA | 64.5 | 60.8 | 62.3 | 53.8 | 67.7 | 61.4 |
| STORYREWARD-QWEN | 77.5 | 78.8 | 71.6 | 74.2 | 69.1 | 75.0 |
(论文报告,表1,PDF p.7)
怎样理解提升。 在这套标签协议下,Qwen 版本较其 Qwen3-8B 基座高 21.5 个宏平均百分点,较表中最佳通用 LLM-as-judge GPT-4o 高 8.7 点。作者据此认为专门的故事偏好数据有效;这种归因由训练/基座对比支持,但本文没有训练随机种子、方差、置信区间或显著性检验,不能把单次表格差值写成已量化的稳定因果效应。(论文报告,表1,PDF p.7;作者主张,§4.1,p.6)
哪类训练对重要:替换式消融
实验结果。 消融不是简单删去一类数据:每次移除某类后,都以等量、由不同规模模型生成并让大模型输出作 chosen 的补充数据替换。以 Qwen3-8B 为底座重新训练后,完整模型宏平均 75.0;去 premise back-generation 为 73.9,去 human-guided continuation 为 72.8,去 prompt-guided rewriting 为 69.9。最后一项降幅最大,但替换数据本身也改变了训练分布,因而只能说明这套构造在该替换对照下最有贡献。(论文报告,附录 H.1、表2,PDF pp.19–20)
| 设置 | Coh. | Cre. | Char. | Flu. | Rel. | Avg. |
|---|---|---|---|---|---|---|
| 完整 STORYREWARD-QWEN | 77.5 | 78.8 | 71.6 | 74.2 | 69.1 | 75.0 |
| − Premise Back-Generation | 82.3 | 70.4 | 78.6 | 68.9 | 75.0 | 73.9 |
| − Human-Guided Continuation | 81.5 | 70.4 | 76.2 | 67.1 | 72.8 | 72.8 |
| − Prompt-Guided Rewriting | 73.4 | 68.1 | 71.3 | 65.2 | 68.7 | 69.9 |
(论文报告,表2,PDF p.20)
Best-of-16:另一套人工排序下的选择
实验方法。 作者取 MoPS 约 100 个 premise,令 Llama-3.1-70B-Instruct 以 temperature 1 各生成 16 篇,再由两名标注者独立给 16 篇排序、由资深标注者裁决分歧。每个 RM 从 16 篇中选一篇;两个 RM 的 head-to-head 以人类总排序位置更高者为胜。这里有独立于 STORYRMB 构造排序的人工终局排序,但仍只涵盖单一生成 policy,且论文没有报告精确 premise 数、原始计数或标注一致性。(论文报告,§5,PDF p.8)
| 对手 | Qwen:win / tie / lose | Llama:win / tie / lose |
|---|---|---|
| Skywork-Reward-27B | 72% / 3% / 25% | 68% / 3% / 29% |
| Skywork-Reward-8B | 69% / 9% / 22% | 68% / 5% / 28% |
| QRM-Llama3.1-8B | 75% / 11% / 14% | 75% / 5% / 20% |
| GRM-Llama3.1-8B | 68% / 6% / 26% | 65% / 5% / 31% |
| ArmoRM-Llama3-8B | 69% / 9% / 22% | 63% / 9% / 28% |
(论文报告,图3,PDF p.8)
证据边界。 图3给的是四舍五入百分比而不是计数;例如部分行加总为 101%,故不能将“约 100”误作精确分母。QWEN 对五个对手的 lose 都低于 30%,但若泛称两个 STORYREWARD 都如此则不对:LLAMA 对 GRM 的 lose 为 31%。因此此实验支持“在该 MoPS、该 16 候选池中通常选得更高”,不足以推出跨生成器、跨语言或跨部署条件的一般胜率。(论文报告,图3、§5,PDF p.8;阅读者推断)
人机偏好差异与 shortcut 分析
实验结果。 作者将 STORYRMB 分为 LLM–LLM 和 Human–LLM,称既有模型在人类 chosen、LLM rejected 的后者显著更差,因而可能偏向 LLM 文字;图2没有印出各模型的精确柱值,不能从正文恢复差值。以 CreativeWriting v3 的另一项自动评价,作者先在 STORYRMB 上获得 LLM–LLM 94%、Human–LLM 54%,再报告 STORYREWARD-QWEN/LLAMA 的分数 2.72/2.51;这不是对本文 benchmark 的人工复验。(作者主张,§4.2,PDF pp.7–8;论文报告,附录 H.3、表10,pp.19–20、26)
错误分析。 作者用句长分布 kurtosis 作为 linguistic burstiness 的代理。STORYREWARD-QWEN 错误预测时所选故事的 kurtosis 为 1.0149,比 STORYRMB ground-truth chosen 的 0.8999 高 12.8%;全部/正确预测分别为 1.0064(+11.8%)和 0.9958(+10.7%)。作者据此说训练含人类故事可能使模型把高 burstiness 当质量代理,并明确表示机制性分析超出本文范围;这是一项相关性提示,而非已证明的捷径因果机制。(论文报告与作者主张,附录 H.4、表8,PDF pp.20、25)
限制、数据治理与应如何使用
作者披露。 论文没有独立 Limitations 节。伦理段称:Douban 资料遵守其版权协议、WritingPrompts 遵守开源许可;数据已脱敏且不含标注者/原作者个人信息;GPT-4o 检查过人类故事的暴力或露骨等敏感内容且未 flag,另随机检查 10 篇也未发现;LLM 经付费 API 调用。作者称用途是改善故事生成,不应生成非法/违禁内容或用于商业获利;同时披露使用 ChatGPT 润色部分句子。(论文报告,Ethical Considerations,PDF p.10)
报告缺口。 精确训练分项、平台采集时段与语言比例、去重、WritingPrompts 在训练和 benchmark 间的重合/污染审计、标注人数和一致性、训练硬件/随机种子/损失函数、主表置信区间、BoN 精确分母及原始人评均未报告。数据和代码链接已列在首页,但论文并未在文中给出可复现实验所需的完整快照与版本细节。(论文报告,PDF pp.1–26)
关键原文定位
- 元数据、摘要、贡献与代码链接:PDF p.1;候选 LLM 的 Grok-3 写法:§1,p.2。
- STORYRMB premise、候选和排序算法:§2.1–§2.2,PDF pp.3–5;维度算法:附录 F/算法1,pp.18、21。
- 人工排序、509/230/394/91、标注者与约 $10,000 成本:附录 B–C,PDF pp.16–17。
- 四类训练对及训练超参:§3,PDF pp.5–6;构造细节和“低于30%”:附录 E,pp.17–18;总量和长度:表9,p.25。
- 四选一指标和主表:§4.1、表1,PDF pp.6–7;人类–LLM 分析:§4.2、图2,pp.7–8。
- BoN:§5、图3,PDF p.8;消融、额外 benchmark、kurtosis 分析:附录 H、表2/表8/表10,PDF pp.19–20、25–26。
阅读者判断
StoryAlign 的实用贡献是把“故事 RM 是否会从四篇里挑对一篇”变为具体、带分维分母的回归测试,并额外提供了人工排序的 BoN 场景。最可信的结论是:在其混合 benchmark 和固定 MoPS 生成池中,专用 8B RM 选择优于所列基线。应以中等信心接受它是有价值的域内模型选择器;不应将其当作唯一文学质量裁判或未经审计的跨域奖励。后续使用宜补充独立、全人工、多语言的偏好集,明确报告数据重叠和标注一致性,并检测长度、风格及 burstiness 等捷径。(阅读者分析)