paper_type: 方法与系统;实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "POLARIS: Guiding Small Models to Write Long Stories" authors: "Rishanth Rajendhran; Jenna Russell; Mohit Iyyer; John Wieting" year: 2026 source: "arXiv:2606.04095v1" pdf: "08_polaris.pdf"
POLARIS:用人类参考锚定小模型的长篇创作 RL
一句话总结:POLARIS 用 16 维 Story Quality 在线奖励和 Human-Reference Injection(HRI)训练 Qwen3.5-9B,在约 1.4K 篇人类短篇、4 张 A100 上取得显著长篇增益;结果支持它优于基础 9B、接近 27B,但“跨到 8–12K 词仍保持质量”依赖 LLM judge,且模型实际只写到目标长度的约 72%。【阅读者推断】
TL;DR
- 【论文报告】训练数据为 1,388 个 prompt–story pair,来自 100 本商业购买短篇集、431 名作者,参考故事均不超过 4,000 词。
- 【论文报告】每个 GRPO group 包含 5 个策略 rollout 和 1 篇 teacher-forced 人类参考;参考不进入 group mean/std,但以 warmup 缩放后的 advantage 参与更新。
- 【论文报告】模型在 4×A100 80GB 上训练 160 steps、约 48 小时;单 checkpoint 总成本低于 500 美元。
- 【论文报告】在 8–12K 词请求上,POLARIS–9B 的 Story Quality 为 44.1,基础 9B 为 −11.8;长度遵从率分别为 0.72 和 0.88。
- 【论文报告】两名人评员更偏好 POLARIS 而非基础 9B,win rate 67.5%;与 Qwen3.5-27B 的比较约为平局。
- 【阅读者推断】POLARIS 同时改变了奖励、HRI 和合成 thinking trace;它证明了整套 recipe 有效,但没有完全隔离每个成分的因果贡献。
1. 要解决什么问题
【论文报告】小型开放权重模型在长篇创作中常见三类失败:明显写不够长、长度增长时质量下降、或为了凑长发生重复与漂移。
【作者主张】创作 RL 的两个核心障碍是奖励信号过于粗糙,以及开放式 rollout 逐渐同质化后 GRPO 组内奖励方差变小。
【阅读者推断】POLARIS 的目标不是从零获得文学能力,而是让已有 9B 基座更稳定地遵守长篇长度并靠近特定编辑 rubric 的偏好。
2. 方法一:结构化 Story Quality 奖励
【论文报告】奖励的正向维度共 6 项:prompt fulfillment、narrative arc and pacing、character depth and agency、voice、scene realization、thematic and emotional richness,总上限 100。
【论文报告】负向维度共 10 项:prompt violation、coherence/POV、generic language、over-summary、over-explanation、drift/bloat、dialogue、mechanics、predictability/cliché、overwrought prose,总惩罚上限 151;另有 bonus 与 catch-all penalty。
【论文报告】最终 composite reward 还加入 repetition、length mismatch、blank output 惩罚、严重畸形输出门控、子线性长度缩放和 \([-2,2]\) clipping。
【阅读者推断】这一奖励比单一总分更可诊断,但仍是明确的审美规范:它会奖励“场景化、独特声音、含蓄主题”,惩罚模板语言和过度修辞。训练结果应解释为对这套编辑观的对齐,而不是无条件的文学提升。
3. 方法二:Human-Reference Injection
【论文报告】普通 GRPO 每组采样 6 个策略输出;POLARIS 改为 5 个策略输出加 1 篇人类参考。参考故事由当前策略 teacher-force 计算概率,并由同一 reward 评分。
【论文报告】参考不参与策略 rollout 的均值和标准差,只通过 warmup 后的 reference advantage 进入更新。
【作者主张】高质量人类参考能维持组内学习压力,避免策略只在自己的输出分布中互相比低。
【论文报告】作者明确承认 HRI 是带偏的 demonstration-augmented GRPO update,而非无偏 on-policy estimator。
【阅读者推断】这是一种“把完整示范塞进相对奖励组”的实用训练技巧;其收益可能同时来自更好的内容、不同长度分布和 teacher-forced 似然信号。
4. 数据、训练与评测
4.1 训练资源
- 【论文报告】基础模型:Qwen3.5-9B。
- 【论文报告】训练集:1,388 对 prompt–story;故事来自 100 本短篇集,431 名作者。
- 【论文报告】写作 prompt 从故事反向生成,并为参考故事配对 Gemini 3 Flash 生成的 thinking trace。
- 【论文报告】4×A100 80GB、FSDP、batch size 8、160 steps、约 48 小时。
- 【论文报告】每次训练计算费约 400 美元,judge 约 60 美元,总计略低于 500 美元。
4.2 测试协议
【论文报告】主测试集包含 180 个未见 prompt,每个长度桶 30 个:1–2K、2–3K、3–4K、4–6K、6–8K、8–12K 词;1–4K 为训练长度内,4–12K 为长度 OOD。
【论文报告】自动评价覆盖 17 个模型和 5 套 benchmark/rubric:Story Quality、EQ-Bench Longform、EQ-Bench Creative、WritingBench D4、LongBench-Write。
【论文报告】训练奖励使用 Gemini 3 Flash;主要自动评价分由 GPT-5.4 或 Gemini 3.1 Pro 给出,试图减少对单一 judge 的过拟合。
【阅读者推断】不同模型的最大生成 token budget 并未完全统一,附录报告主测试中从 14,336 到 32,768 不等;长度比较因此包含模型配置差异。
5. 核心结果
5.1 训练方式结果与消融
| Qwen3.5-9B 变体 | Story Quality 全部 / 8–12K | EQ-LF 全部 / 8–12K | WritingBench | LongBench-Write |
|---|---|---|---|---|
| Base | 18.5 / −11.8 | 42.6 / 30.3 | 6.8 | 67.1 |
| SFT | −60.6 / −71.2 | 26.0 / 24.2 | 2.7 | 37.5 |
| GRPO | 49.7 / 37.7 | 58.2 / 51.6 | 7.8 | 82.1 |
| POLARIS | 52.1 / 44.1 | 59.8 / 54.3 | 7.9 | 81.2 |
【论文报告】SFT 严重退化;plain GRPO 已带来大部分增益,HRI 相对 GRPO 的主要额外优势出现在最远长度桶。
【阅读者推断】因此最强结论是“结构化 RL recipe 有效”;若单独宣称 HRI 是主要原因,证据强度较弱,因为聚合分差很小且只在一个基座上实验。
5.2 长度泛化结果
【论文报告】POLARIS 在 8–12K 词桶的 Story Quality 为 44.1,Qwen3.5-27B 为 24.6,基础 9B 为 −11.8。
【论文报告】同一长度桶中,POLARIS 的实际/目标词数比为 0.72,Qwen3.5-27B 为 0.82,基础 9B 为 0.88;Gemma 4 31B 只有 0.36。
【作者主张】POLARIS 避免了质量崩塌、重复性超写和严重欠写三种开放模型失败。
【阅读者推断】0.72 仍是明显欠写,所以“遵守 8–12K 长度”应改写成“比多数开放模型更好地联合保持质量与长度”,而非完成长度要求。
5.3 指标结果审计
【论文报告】作者发现 EQ-Bench Longform 的 canonical aggregation 会因 Forced Poetry 维度 5× 权重而奖励退化 SFT;改为 12 维等权后,Story Quality 与 EQ-LF 的 Pearson 相关从 0.54 提高到 0.86,Spearman 从 0.89 提高到 0.95。
【阅读者推断】这是论文中很有价值的负结果:一个看似标准的总分可以把“完全不尝试风格”误当成没有风格缺陷,排行榜必须审计聚合公式。
6. 人类评测
【论文报告】最终研究只有两名美国英语母语标注者,均有 copyediting 或 freelance writing 经验;他们从 UpWork 招募,先从 4 人筛到 2 人。
【论文报告】两人各完成 8 个练习和 60 个正式样本;正式集来自 20 个共享 prompt,每个 prompt 有 3 个模型输出,全部独立盲评。总成本 750 美元。
【论文报告】POLARIS 对基础 9B 的 win rate 为 67.5%;对 27B 为 51.2%,应视为平局。总体分的一致性为 quadratic-weighted \(\kappa=0.364\),ICC(A,2)=0.538。
【论文报告】正文给 POLARIS 对 27B 的 95% bootstrap CI 为 [38.8%, 58.8%],附录则为 [41.2%, 61.2%],两处不一致。
【阅读者推断】人评足以支持“比基础 9B 好”的方向性结论,但两名评分者、中等一致性和置信区间冲突不足以证明稳定等同于 27B。
【论文报告】人评常赞扬 atmosphere、voice、prompt fulfillment,也反复指出语言过载、术语太重和局部一致性问题。
7. 局限、版权与复现
- 【论文报告】主要评价仍依赖 LLM judge,rubric 不可能穷尽文学质量。
- 【论文报告】训练用商业短篇不能发布,只计划发布反推 prompt 和模型输出,降低了数据层面的完整复现性。
- 【论文报告】人评规模小,只验证最终模型对两个 Qwen 基线。
- 【论文报告】最远长度桶仍欠写,比例约 0.72。
- 【论文报告】没有单独消融 Gemini 生成 thinking trace 与人类参考注入。
- 【论文报告】只研究短篇故事,没有直接测试剧本、评论、散文等写作域。
- 【阅读者推断】只在 Qwen3.5-9B 上训练,没有 base-model ablation,无法确认 recipe 对其他家族的可迁移性。
8. 阅读者判断
【阅读者推断】POLARIS 最值得复用的是三件事:把审美 rubric 拆成可定位维度、把长度投机纳入奖励、用人类示范维持开放式 RL 的参照系。最不该照搬的是把自动 judge 高分直接叫作“文学质量”。
【阅读者推断】复现时应优先补做:相同 token budget、至少两个基座、HRI 与 thinking trace 正交消融、更多人类读者、以及对 8–12K 完整度和重复性的人工审计。
关键原文定位
- 方法总览与 Story Quality:§3、pp.3–4,Fig.2
- HRI 更新方式:§3.2,pp.4–5
- 数据、训练成本与评测集:§4,p.5
- 自动结果与长度泛化:§5.1–5.3,pp.6–7,Tables 1–3
- 人评和错误分析:§5.4–5.5,pp.7–8
- 局限与伦理:p.9
- 训练超参数与 token budget:Appendix A,pp.12–14
- Judge 与聚合审计:Appendix E,pp.18–20
- 人评完整协议:Appendix F,pp.20–22
tags: [论文精读, 长篇创作, 强化学习, GRPO, 人类参考, LLM评委] related: [[09_longwriter]], [[44_evolvr]], [[45_style_over_story]], [[20_writingbench]]