AI_writing/papers/08_polaris.md

POLARIS: Guiding Small Models to Write Long Stories

POLARIS = Policy Optimization with LLM-as-a-judge rewards and Anchored-Reference Injection for Storywriting


1. 要解决的问题

小型开源模型写长篇创意文本时:要么长度远不达标,要么长度一上去质量就崩,和前沿模型差距明显。目标是用低算力手段把小模型拉到接近前沿的水平。

2. 方法 / 核心思路

GRPO(一种 RL 优化)基础上加两味关键配料:

  1. LLM-as-a-judge 在线奖励:用一个前沿 LLM 评委 + 结构化的 Story Quality 评分 rubric,对生成故事在线打分作为奖励信号(而非训练一个单独奖励模型)。
  2. 人类范本注入 HRI(Human-Reference Injection):在每个 GRPO group 里,塞入一条teacher-forcing 的人类范文作为"高奖励锚点",给策略一个明确的高质量参照,稳定并抬高优化目标。

3. 数据与实验

4. 主要结果

5. 局限

6. 对做产品 / 工程的启发

关联