AI_writing/pdfs/19_storyalign_精读.md

paper_type: "Benchmark 与数据集, 方法与系统, 实证与评价" type_confidence: 高 reading_depth: 标准精读 title: "StoryAlign: Evaluating and Training Reward Models for Story Generation" authors: "Haotian Xia, Hao Peng, Yunjia Qi, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li" year: 2026 source: "ICLR 2026;arXiv:2605.04831v1(2026-05-06)" pdf: "19_storyalign.pdf"


StoryAlign:把故事偏好做成四选一基准,但“金标”仍是混合协议

一句话结论:StoryAlign 以 1,133 个 premise—四故事选择题评测故事奖励模型,并以 93,729 个自动构造的偏好对训练两个 8B STORYREWARD;在该基准的五维宏平均中,Qwen 版本为 75.0%,高于 GPT-4o 的 66.3%。但这 75.0% 衡量的是对“LLM 排序、分级人工核验和人类故事优先”的混合构造协议的拟合,而不是独立、完整人类文学偏好的直接测量。

核心问题

故事没有像数学题那样可验证的唯一答案:通用 reward model 能否在同一 premise 下,稳定选出更符合人类故事偏好的候选?若不能,怎样以可扩展的偏好对训练专用 reward model,同时避免“人类文本 vs. LLM 文本”的表层风格捷径?本文的论证依次是:先构造 STORYRMB 测量选择能力,再构造 STORYREWARD 训练对,最后用 benchmark 与 Best-of-16(BoN)检验它。(论文报告,摘要、§1–§5,PDF pp.1–8)

TL;DR

从候选故事到 STORYRMB:测量的对象是什么

候选与样本来源。 主文先称用主题框架、“conflict or reversal”种子、扩写和人工过滤得到 624 个 premise,并从 WritingPrompts 随机抽样、过滤 600 个带原始人类故事的 premise。对 LLM premise,四个生成器各写一个候选;§2.1 列 GPT-4o、Gemini 2.5 Pro、Grok 4、Qwen-Long。对 WritingPrompts,附录 B 则明确为原人类故事加三条 LLM 故事。最终每项都是一个 premise、一个 chosen、三个 rejected,故评测不是两两偏好而是四选一。(论文报告,§2.1–§2.2,PDF pp.3–4;附录 B,p.16)

排序协议。 四个裁判 GLM-4.5、Qwen2.5-Max、Claude-3.5 与 DeepSeek-R1 对 creativity、coherence、fluency、characterization、relevance 及 overall 分别打分,以 overall 诱导四份候选排序。作者计算六个裁判对的 Kendall's Tau 均值:τavg < 0.6 定义为强分歧并完整人工排序,否则先将四个 overall 分数平均以得到最终排序,再让人工确认;确认者不能判定时保留原排序。作者称 τavg=0.6 约对应 80% concordant、20% discordant pairs,这只是经验启发式。(论文报告,§2.2,PDF p.4;附录 C,p.17)

人类故事的特殊处理。 600 个 WritingPrompts 项中,作者只给三个 LLM 故事做上述排序;人类故事因数据集质量控制和额外过滤而被预设为四者最高,只要求标注者验证这一点。短于 100 词者过滤;91 个被标为 unsure 后删除,留下 509 个 Human–LLM 项。另一侧的 624 个 LLM–LLM 项恰由 230 个完整人工排序和 394 个 LLM 排序后人工确认组成;624+509=1,133。(论文报告,附录 B–C,PDF pp.16–17)

维度不是独立人工标签。 每项最后只归入一个“最能区分 chosen 与 rejected”的维度:先取 chosen 对 rejected 平均分的最大 mean gap;若多个维度差距在 tie tolerance τ=0.5 内,再比 chosen 与最强 rejected 的最大 margin;仍平手时取 rejected 分数方差最小者;最后按预设 priority 兜底。论文没有列出这个 priority 的实际五维顺序。因此表中的五个分组反映的是裁判 LLM 分数的层级算法,而非独立人类对“这项主要因何更好”的标注。(论文报告,§2.2、式3–5,PDF pp.4–5;附录 F/算法1,pp.18、21)

主区分维度 实例数(即该维准确率分母)
Creativity 292
Coherence 265
Fluency 225
Characterization 215
Relevance 136
合计 1,133

(论文报告,§2.2,PDF p.4)

构造记录中的内部矛盾

证据边界。 数量叙述无法完全同时为真:主文称 624 个 LLM premise,附录 B 却称 533 个 LLM-generated premises。后者与 600 相加恰为 1,133,却又不能解释 600 个中删去 91 个后仅余 509;前者与 509 相加正好为 1,133,且与 230+394=624 对齐。候选生成器亦有矛盾:§1 列 Grok 3,§2.1 列 Grok 4;实验表中的被测模型是 Grok-3。本文笔记采用可由末端计数复算的“624 LLM–LLM + 509 Human–LLM”,但不将附录的 533 或具体 Grok 版本悄然改写为已解决事实。(论文报告,§1–§2,PDF pp.2–4;附录 B–C,pp.16–17;表1,p.7)

从平台故事到 STORYREWARD:训练信号怎样构造

数据设计。 作者从中文 Douban、英文 WritingPrompts 与 LLM 生成收集训练资料;表9给出精确总量 93,729 对、平均/中位故事长度 2,802/1,858 词。摘要和正文的“约 100,000”是概称。四种来源有意混合真实人类文本、受控反例与 LLM–LLM 自动偏好,以同时追求现实覆盖和可扩展性。(论文报告,§3.1、表9,PDF pp.5–6、25)

Premise back-generation。 在 Douban 中,作者按平台 genre 或同一作者专栏聚类,从同簇抽两篇不同故事交给 GPT-4o 反推共同 premise;readership count 较高者为 chosen,极低参与度对会过滤,产量约 6,000 对。这里具体方法段写的是 readership count,不应改写成已证实的 upvote 排序。(论文报告,§3.1,PDF p.5)

Prompt-guided rewriting。 一篇人类故事及对应 premise 为 chosen;LLM 仅受控修改结尾、关键情节、人物动机、因果连贯性或语言等,形成仍可读但预期较弱的 rejected,约 30,000 对。其关键前提是人类原作通常更优,论文称随机检查 20 个样本以验证,但没有报告检查者、通过比例或置信区间。(论文报告,§3.1,PDF pp.5–6;附录 E.3,p.18)

Human-guided continuation。 两个生成设置共享 premise 与 prompt,只有一方可访问真实人类续文/开头作为引导;其生成被置为 chosen,未获引导的生成被置为 rejected,约 10,000 对。作者同样只报告随机抽 20 对后认定引导方更好。早期直接以完整人类原作为 chosen 的训练使 StoryRMB 平均准确率低于 30%;作者推测模型借由人机文本的表层分布差异走捷径,故改为这种人类引导、但仍由 LLM 输出的 chosen。(论文报告,§3.1,PDF p.6;附录 E.4,p.18)

LLM–LLM 自动对。 其余方法是让 LLM 为同一 premise 生成两故事,再由另一 LLM 标 chosen/rejected。附录例示 Llama-3.1 8B/70B、DeepSeek-R1-Distill-Llama 8B/70B、Qwen2.5-14B/QwQ-32B 的比较:既有大模型评两个小模型输出,也有大小模型输出直接相较。论文只给前三类约 6k/30k/10k 和总数 93,729,未报告第四类或四类各自的精确数量,不能把余数当作精确规模。(论文报告,§3.1,PDF p.6;附录 E.1,p.17;表9,p.25)

训练设置。 作者以 premise 为输入、故事偏好对为监督,分别用 Llama-3.1-8B-Instruct 与 Qwen3-8B 训练 STORYREWARD-LLAMA/QWEN:batch size 1、学习率分别 9×10^-62×10^-5、1 epoch。损失函数、优化器、最大长度、截断、随机种子、硬件和训练时长未报告。(论文报告,§3.2,PDF p.6)

评测协议与主结果:75.0% 实际表示什么

实验方法。 对一个四故事集合 {s1,s2,s3,s4},RM 分别赋分,只有 argmax_i f(si) 等于 benchmark chosen 才算正确。表1每列是相应维度的准确率;Average 是五个维度百分比的等权宏平均,并非对 1,133 项按样本数加权后的总体 accuracy。基线包含通用 RM 和生成式 LLM-as-judge。(论文报告,§4.1,PDF pp.6–7)

模型 Coh. Cre. Char. Flu. Rel. Avg.
InternLM2-20B-Reward 17.0 25.1 21.9 17.3 41.2 21.3
InternLM2-7B-Reward 18.5 18.9 18.1 15.6 25.0 18.7
Skywork-Reward-Gemma-2-27B-v0.2 36.6 29.8 22.8 40.0 34.6 32.7
Skywork-Reward-Llama-3.1-8B-v0.2 29.4 32.3 26.5 36.0 30.9 31.0
QRM-Llama3.1-8B-v2 15.1 17.9 9.3 13.3 19.9 14.9
ArmoRM-Llama3-8B-v0.1 52.4 48.8 44.2 56.4 43.4 49.7
GRM-Llama3.1-8B-rewardmodel-ft 35.1 28.1 23.7 35.1 35.3 31.1
WQRM 16.6 27.1 24.2 31.1 19.9 24.0
Llama3.1-8B-Instruct 22.3 30.5 25.1 16.9 24.9 24.3
Qwen3-8B 55.8 53.1 47.0 60.4 48.5 53.5
GPT-4o 63.4 63.7 66.0 73.3 67.6 66.3
Gemini-2.5-Pro 57.7 51.7 57.2 64.4 52.2 56.8
Grok-3 62.6 57.5 62.8 69.8 60.3 62.4
STORYREWARD-LLAMA 64.5 60.8 62.3 53.8 67.7 61.4
STORYREWARD-QWEN 77.5 78.8 71.6 74.2 69.1 75.0

(论文报告,表1,PDF p.7)

怎样理解提升。 在这套标签协议下,Qwen 版本较其 Qwen3-8B 基座高 21.5 个宏平均百分点,较表中最佳通用 LLM-as-judge GPT-4o 高 8.7 点。作者据此认为专门的故事偏好数据有效;这种归因由训练/基座对比支持,但本文没有训练随机种子、方差、置信区间或显著性检验,不能把单次表格差值写成已量化的稳定因果效应。(论文报告,表1,PDF p.7;作者主张,§4.1,p.6)

哪类训练对重要:替换式消融

实验结果。 消融不是简单删去一类数据:每次移除某类后,都以等量、由不同规模模型生成并让大模型输出作 chosen 的补充数据替换。以 Qwen3-8B 为底座重新训练后,完整模型宏平均 75.0;去 premise back-generation 为 73.9,去 human-guided continuation 为 72.8,去 prompt-guided rewriting 为 69.9。最后一项降幅最大,但替换数据本身也改变了训练分布,因而只能说明这套构造在该替换对照下最有贡献。(论文报告,附录 H.1、表2,PDF pp.19–20)

设置 Coh. Cre. Char. Flu. Rel. Avg.
完整 STORYREWARD-QWEN 77.5 78.8 71.6 74.2 69.1 75.0
− Premise Back-Generation 82.3 70.4 78.6 68.9 75.0 73.9
− Human-Guided Continuation 81.5 70.4 76.2 67.1 72.8 72.8
− Prompt-Guided Rewriting 73.4 68.1 71.3 65.2 68.7 69.9

(论文报告,表2,PDF p.20)

Best-of-16:另一套人工排序下的选择

实验方法。 作者取 MoPS 约 100 个 premise,令 Llama-3.1-70B-Instruct 以 temperature 1 各生成 16 篇,再由两名标注者独立给 16 篇排序、由资深标注者裁决分歧。每个 RM 从 16 篇中选一篇;两个 RM 的 head-to-head 以人类总排序位置更高者为胜。这里有独立于 STORYRMB 构造排序的人工终局排序,但仍只涵盖单一生成 policy,且论文没有报告精确 premise 数、原始计数或标注一致性。(论文报告,§5,PDF p.8)

对手 Qwen:win / tie / lose Llama:win / tie / lose
Skywork-Reward-27B 72% / 3% / 25% 68% / 3% / 29%
Skywork-Reward-8B 69% / 9% / 22% 68% / 5% / 28%
QRM-Llama3.1-8B 75% / 11% / 14% 75% / 5% / 20%
GRM-Llama3.1-8B 68% / 6% / 26% 65% / 5% / 31%
ArmoRM-Llama3-8B 69% / 9% / 22% 63% / 9% / 28%

(论文报告,图3,PDF p.8)

证据边界。 图3给的是四舍五入百分比而不是计数;例如部分行加总为 101%,故不能将“约 100”误作精确分母。QWEN 对五个对手的 lose 都低于 30%,但若泛称两个 STORYREWARD 都如此则不对:LLAMA 对 GRM 的 lose 为 31%。因此此实验支持“在该 MoPS、该 16 候选池中通常选得更高”,不足以推出跨生成器、跨语言或跨部署条件的一般胜率。(论文报告,图3、§5,PDF p.8;阅读者推断)

人机偏好差异与 shortcut 分析

实验结果。 作者将 STORYRMB 分为 LLM–LLM 和 Human–LLM,称既有模型在人类 chosen、LLM rejected 的后者显著更差,因而可能偏向 LLM 文字;图2没有印出各模型的精确柱值,不能从正文恢复差值。以 CreativeWriting v3 的另一项自动评价,作者先在 STORYRMB 上获得 LLM–LLM 94%、Human–LLM 54%,再报告 STORYREWARD-QWEN/LLAMA 的分数 2.72/2.51;这不是对本文 benchmark 的人工复验。(作者主张,§4.2,PDF pp.7–8;论文报告,附录 H.3、表10,pp.19–20、26)

错误分析。 作者用句长分布 kurtosis 作为 linguistic burstiness 的代理。STORYREWARD-QWEN 错误预测时所选故事的 kurtosis 为 1.0149,比 STORYRMB ground-truth chosen 的 0.8999 高 12.8%;全部/正确预测分别为 1.0064(+11.8%)和 0.9958(+10.7%)。作者据此说训练含人类故事可能使模型把高 burstiness 当质量代理,并明确表示机制性分析超出本文范围;这是一项相关性提示,而非已证明的捷径因果机制。(论文报告与作者主张,附录 H.4、表8,PDF pp.20、25)

限制、数据治理与应如何使用

作者披露。 论文没有独立 Limitations 节。伦理段称:Douban 资料遵守其版权协议、WritingPrompts 遵守开源许可;数据已脱敏且不含标注者/原作者个人信息;GPT-4o 检查过人类故事的暴力或露骨等敏感内容且未 flag,另随机检查 10 篇也未发现;LLM 经付费 API 调用。作者称用途是改善故事生成,不应生成非法/违禁内容或用于商业获利;同时披露使用 ChatGPT 润色部分句子。(论文报告,Ethical Considerations,PDF p.10)

报告缺口。 精确训练分项、平台采集时段与语言比例、去重、WritingPrompts 在训练和 benchmark 间的重合/污染审计、标注人数和一致性、训练硬件/随机种子/损失函数、主表置信区间、BoN 精确分母及原始人评均未报告。数据和代码链接已列在首页,但论文并未在文中给出可复现实验所需的完整快照与版本细节。(论文报告,PDF pp.1–26)

关键原文定位

阅读者判断

StoryAlign 的实用贡献是把“故事 RM 是否会从四篇里挑对一篇”变为具体、带分维分母的回归测试,并额外提供了人工排序的 BoN 场景。最可信的结论是:在其混合 benchmark 和固定 MoPS 生成池中,专用 8B RM 选择优于所列基线。应以中等信心接受它是有价值的域内模型选择器;不应将其当作唯一文学质量裁判或未经审计的跨域奖励。后续使用宜补充独立、全人工、多语言的偏好集,明确报告数据重叠和标注一致性,并检测长度、风格及 burstiness 等捷径。(阅读者分析)