AI_writing/pdfs/08_polaris_精读.md

paper_type: 方法与系统;实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "POLARIS: Guiding Small Models to Write Long Stories" authors: "Rishanth Rajendhran; Jenna Russell; Mohit Iyyer; John Wieting" year: 2026 source: "arXiv:2606.04095v1" pdf: "08_polaris.pdf"

POLARIS:用人类参考锚定小模型的长篇创作 RL

一句话总结:POLARIS 用 16 维 Story Quality 在线奖励和 Human-Reference Injection(HRI)训练 Qwen3.5-9B,在约 1.4K 篇人类短篇、4 张 A100 上取得显著长篇增益;结果支持它优于基础 9B、接近 27B,但“跨到 8–12K 词仍保持质量”依赖 LLM judge,且模型实际只写到目标长度的约 72%。【阅读者推断】

TL;DR

1. 要解决什么问题

【论文报告】小型开放权重模型在长篇创作中常见三类失败:明显写不够长、长度增长时质量下降、或为了凑长发生重复与漂移。

【作者主张】创作 RL 的两个核心障碍是奖励信号过于粗糙,以及开放式 rollout 逐渐同质化后 GRPO 组内奖励方差变小。

【阅读者推断】POLARIS 的目标不是从零获得文学能力,而是让已有 9B 基座更稳定地遵守长篇长度并靠近特定编辑 rubric 的偏好。

2. 方法一:结构化 Story Quality 奖励

【论文报告】奖励的正向维度共 6 项:prompt fulfillment、narrative arc and pacing、character depth and agency、voice、scene realization、thematic and emotional richness,总上限 100。

【论文报告】负向维度共 10 项:prompt violation、coherence/POV、generic language、over-summary、over-explanation、drift/bloat、dialogue、mechanics、predictability/cliché、overwrought prose,总惩罚上限 151;另有 bonus 与 catch-all penalty。

\[ s_{raw}=P_{total}-N_{total}+B-D \]

【论文报告】最终 composite reward 还加入 repetition、length mismatch、blank output 惩罚、严重畸形输出门控、子线性长度缩放和 \([-2,2]\) clipping。

【阅读者推断】这一奖励比单一总分更可诊断,但仍是明确的审美规范:它会奖励“场景化、独特声音、含蓄主题”,惩罚模板语言和过度修辞。训练结果应解释为对这套编辑观的对齐,而不是无条件的文学提升。

3. 方法二:Human-Reference Injection

【论文报告】普通 GRPO 每组采样 6 个策略输出;POLARIS 改为 5 个策略输出加 1 篇人类参考。参考故事由当前策略 teacher-force 计算概率,并由同一 reward 评分。

【论文报告】参考不参与策略 rollout 的均值和标准差,只通过 warmup 后的 reference advantage 进入更新。

【作者主张】高质量人类参考能维持组内学习压力,避免策略只在自己的输出分布中互相比低。

【论文报告】作者明确承认 HRI 是带偏的 demonstration-augmented GRPO update,而非无偏 on-policy estimator。

【阅读者推断】这是一种“把完整示范塞进相对奖励组”的实用训练技巧;其收益可能同时来自更好的内容、不同长度分布和 teacher-forced 似然信号。

4. 数据、训练与评测

4.1 训练资源

4.2 测试协议

【论文报告】主测试集包含 180 个未见 prompt,每个长度桶 30 个:1–2K、2–3K、3–4K、4–6K、6–8K、8–12K 词;1–4K 为训练长度内,4–12K 为长度 OOD。

【论文报告】自动评价覆盖 17 个模型和 5 套 benchmark/rubric:Story Quality、EQ-Bench Longform、EQ-Bench Creative、WritingBench D4、LongBench-Write。

【论文报告】训练奖励使用 Gemini 3 Flash;主要自动评价分由 GPT-5.4 或 Gemini 3.1 Pro 给出,试图减少对单一 judge 的过拟合。

【阅读者推断】不同模型的最大生成 token budget 并未完全统一,附录报告主测试中从 14,336 到 32,768 不等;长度比较因此包含模型配置差异。

5. 核心结果

5.1 训练方式结果与消融

Qwen3.5-9B 变体 Story Quality 全部 / 8–12K EQ-LF 全部 / 8–12K WritingBench LongBench-Write
Base 18.5 / −11.8 42.6 / 30.3 6.8 67.1
SFT −60.6 / −71.2 26.0 / 24.2 2.7 37.5
GRPO 49.7 / 37.7 58.2 / 51.6 7.8 82.1
POLARIS 52.1 / 44.1 59.8 / 54.3 7.9 81.2

【论文报告】SFT 严重退化;plain GRPO 已带来大部分增益,HRI 相对 GRPO 的主要额外优势出现在最远长度桶。

【阅读者推断】因此最强结论是“结构化 RL recipe 有效”;若单独宣称 HRI 是主要原因,证据强度较弱,因为聚合分差很小且只在一个基座上实验。

5.2 长度泛化结果

【论文报告】POLARIS 在 8–12K 词桶的 Story Quality 为 44.1,Qwen3.5-27B 为 24.6,基础 9B 为 −11.8。

【论文报告】同一长度桶中,POLARIS 的实际/目标词数比为 0.72,Qwen3.5-27B 为 0.82,基础 9B 为 0.88;Gemma 4 31B 只有 0.36。

【作者主张】POLARIS 避免了质量崩塌、重复性超写和严重欠写三种开放模型失败。

【阅读者推断】0.72 仍是明显欠写,所以“遵守 8–12K 长度”应改写成“比多数开放模型更好地联合保持质量与长度”,而非完成长度要求。

5.3 指标结果审计

【论文报告】作者发现 EQ-Bench Longform 的 canonical aggregation 会因 Forced Poetry 维度 5× 权重而奖励退化 SFT;改为 12 维等权后,Story Quality 与 EQ-LF 的 Pearson 相关从 0.54 提高到 0.86,Spearman 从 0.89 提高到 0.95。

【阅读者推断】这是论文中很有价值的负结果:一个看似标准的总分可以把“完全不尝试风格”误当成没有风格缺陷,排行榜必须审计聚合公式。

6. 人类评测

【论文报告】最终研究只有两名美国英语母语标注者,均有 copyediting 或 freelance writing 经验;他们从 UpWork 招募,先从 4 人筛到 2 人。

【论文报告】两人各完成 8 个练习和 60 个正式样本;正式集来自 20 个共享 prompt,每个 prompt 有 3 个模型输出,全部独立盲评。总成本 750 美元。

【论文报告】POLARIS 对基础 9B 的 win rate 为 67.5%;对 27B 为 51.2%,应视为平局。总体分的一致性为 quadratic-weighted \(\kappa=0.364\),ICC(A,2)=0.538。

【论文报告】正文给 POLARIS 对 27B 的 95% bootstrap CI 为 [38.8%, 58.8%],附录则为 [41.2%, 61.2%],两处不一致。

【阅读者推断】人评足以支持“比基础 9B 好”的方向性结论,但两名评分者、中等一致性和置信区间冲突不足以证明稳定等同于 27B。

【论文报告】人评常赞扬 atmosphere、voice、prompt fulfillment,也反复指出语言过载、术语太重和局部一致性问题。

7. 局限、版权与复现

8. 阅读者判断

【阅读者推断】POLARIS 最值得复用的是三件事:把审美 rubric 拆成可定位维度、把长度投机纳入奖励、用人类示范维持开放式 RL 的参照系。最不该照搬的是把自动 judge 高分直接叫作“文学质量”。

【阅读者推断】复现时应优先补做:相同 token budget、至少两个基座、HRI 与 thinking trace 正交消融、更多人类读者、以及对 8–12K 完整度和重复性的人工审计。

关键原文定位

tags: [论文精读, 长篇创作, 强化学习, GRPO, 人类参考, LLM评委] related: [[09_longwriter]], [[44_evolvr]], [[45_style_over_story]], [[20_writingbench]]