POLARIS: Guiding Small Models to Write Long Stories
- arXiv: 2606.04095(2026-06)
- 类型: 强化学习训练配方(GRPO)
- 一句话: 用"前沿 LLM 当评委 + 人类范本注入"的低算力 GRPO 配方训练小模型,让 Qwen3.5-9B 写长篇故事的质量追平 27B 级别,并能外推到 3 倍训练长度仍不崩。
POLARIS = Policy Optimization with LLM-as-a-judge rewards and Anchored-Reference Injection for Storywriting
1. 要解决的问题
小型开源模型写长篇创意文本时:要么长度远不达标,要么长度一上去质量就崩,和前沿模型差距明显。目标是用低算力手段把小模型拉到接近前沿的水平。
2. 方法 / 核心思路
在 GRPO(一种 RL 优化)基础上加两味关键配料:
- LLM-as-a-judge 在线奖励:用一个前沿 LLM 评委 + 结构化的 Story Quality 评分 rubric,对生成故事在线打分作为奖励信号(而非训练一个单独奖励模型)。
- 人类范本注入 HRI(Human-Reference Injection):在每个 GRPO group 里,塞入一条teacher-forcing 的人类范文作为"高奖励锚点",给策略一个明确的高质量参照,稳定并抬高优化目标。
3. 数据与实验
- 基座:Qwen3.5-9B → 训练得到 POLARIS-9B。
- 数据:约 1.4K 条 prompt-story 对,来自 100 本短篇小说选集。
- 算力:仅 4×A100(强调低成本)。
- 训练故事长度上限约 4k 词。
4. 主要结果
- 盲测人评:POLARIS-9B 优于基座 Qwen3.5-9B,并与 Qwen3.5-27B 打平(用 9B 追平 27B)。
- 长度外推:虽只在 ≤4k 词上训练,但在要求达 3 倍训练长度(~12k 词)的 prompt 上仍能保质,而多数开源模型在此区间会明显崩(质量/长度/长度遵从至少崩一样)。
5. 局限
- 依赖前沿 LLM 当评委 → 有推理成本,且奖励受评委偏好影响。
- 训练语料是短篇选集,超长篇(整本书级)未直接验证。
6. 对做产品 / 工程的启发
- "评委 rubric 当在线奖励 + 人类范文当锚点" 是一套可复现、便宜的对齐长文质量的配方,值得自建写作模型时借鉴。
- 用 9B 追平 27B → 对成本敏感的写作产品很有价值:小模型 + 好的 RL 配方可能比硬上大模型划算。
- 长度外推能力说明:训练时不必凑齐目标长度,配方对了能外推。
关联
- 与 [[05_book_writing_capability]] 都在做"让专用/小模型逼近或超过前沿模型"。
- 评委 rubric 奖励与 [[19_storyalign]](训练奖励模型)、[[01_lost_in_stories]](质量诊断)互补。
- 长度稳定性问题与"长度波动"类评测(见评估方向)相关。