paper_type: 方法与系统, Benchmark 与数据集, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs" authors: Yushi Bai, Jiajie Zhang, Xin Lv, Linzhi Zheng, Siqi Zhu, Lei Hou, Yuxiao Dong, Jie Tang, Juanzi Li year: 2024 source: arXiv:2408.07055v1 pdf: 09_longwriter.pdf
LongWriter:用长输出对齐数据解锁长度遵从
一句话总结:LongWriter 通过受控 SFT 实验把约 2,000 词输出上限追溯到对齐数据的长度分布,再用 AgentWrite 合成 6,000 条 2k–32k 词样本训练 8B/9B 模型;它有力证明长输出数据能解锁长度遵从,但 GPT-4o 同时生成数据和评质量、基准偏通用写作,使结果不能直接等同于小说连贯或文学性。
TL;DR
- 【论文报告】GLM-4-9B 分别在最大 500/1,000/2,000 词的 SFT 子集上训练后,LongWrite-Ruler 的最大输出约为 600/900/1,800 词,显示训练长度与有效输出上限近似同步。
- 【论文报告】AgentWrite 先生成带目标字数的段落计划,再把历史正文带入每个子任务串行续写;GPT-4o 可由此生成最长约 20,000 词数据。
- 【论文报告】LongWriter-6k 含 6,000 条 2k–32k 词 SFT 样本;LongWriter-9B-DPO 在 LongBench-Write 综合分 84.0,GPT-4o 为 78.6、Claude 3.5 Sonnet 为 80.7。
- 【阅读者推断】最稳健结论是“输出长度是一种需要训练分布支持的能力”;论文没有证明单靠长度数据就能解决长篇故事的跨章结构与人物一致性。
病因诊断:输出长度受 SFT 分布约束
【论文报告】LongWrite-Ruler 用 8 条中英文指令乘以 6 个长度要求,形成 48 个 prompt;测试 4 个开源与 4 个闭源模型。温度为 0.5,作者检查了 API max-token 截断和明显重复,观测模型普遍在约 2k 词附近饱和(§2)。
【论文报告】受控实验从 180k 条 GLM-4 chat SFT 数据中删除超过 500/1,000/2,000 词的样本,分别保留原数据的 72%/98%/99.9%,再训练同一 9B 基座。输出上限随保留的最大样本长度增长(图 2)。
【阅读者推断】这个实验很有说服力,但三组数据量也同时变化,尤其 500 词组只保留 72%;因此它支持长度分布是关键因素,尚不能把全部差异严格归因于“单一最长样本”。
AgentWrite 与训练数据
长写作指令
→ Plan:拆成若干段落,给每段主题与目标字数
→ Write:按顺序生成段落 n,并携带此前正文
→ 拼接并清洗长输出
→ 与通用 SFT 混合训练
→ 额外构造长写作偏好对做 DPO
【论文报告】AgentWrite 每个子任务约 200–1,000 词。串行版相对并行版保持更好连贯性;并行写作虽然更快,但段落无法看到此前文本,Coherence/Clarity 指标下降(§3,表 2)。
【论文报告】6,000 条指令一半来自 GLM-4 SFT 池、一半来自 WildChat-1M,再由 GPT-4o 生成;约 0.2% 因过短或规划步数导致崩溃而被过滤。输出主要在 2k–10k 词间较均匀,最长 32k(§4.1)。
【论文报告】SFT 基座为 GLM-4-9B 与 Llama-3.1-8B,均支持 128k context;使用 8×H800、batch 8、学习率 1e-5、32k packing、4 epochs。loss 按目标 token 而非序列平均,防止长样本单 token 权重被稀释(§4.2)。
【论文报告】DPO 混合约 50k 通用偏好对和 4k 长写作对;每个指令采样 4 个候选,用质量分与长度分选正例,训练 250 steps。
LongBench-Write 与主结果
【论文报告】LongBench-Write 含 120 条指令,中文/英文各 60,覆盖 7 种写作文体和四个目标长度桶。长度分允许一定超写,但对明显短写惩罚更重;质量分由 GPT-4o 按 relevance、accuracy、coherence、clarity、breadth/depth、reading experience 评价,最终取长度与质量均值(§3.3)。
| 模型 | 综合分 | 4k–20k 长度分 | 4k–20k 质量分 |
|---|---|---|---|
| GPT-4o | 78.6 | 5.6 | 85.3 |
| Claude 3.5 Sonnet | 80.7 | 26.0 | 80.9 |
| LongWriter-8B | 79.8 | 77.9 | 79.9 |
| LongWriter-9B | 80.5 | 80.3 | 77.3 |
| LongWriter-9B-DPO | 84.0 | 90.3 | 81.6 |
【论文报告】去掉 LongWriter-6k 时综合分从 80.5 降至 62.6,2k–4k 长度分从 76.0 降至 25.7,4k–20k 从 80.3 降至 0。显式把 plan 拼到训练输出只小幅改善长度、降低质量;instruction backtranslation 数据也失败(表 4)。
【论文报告】DPO 相对 SFT 的长度分约 +4%、质量分约 +3%;人工成对比较中 DPO 版相对 LongWriter-9B 约 58% 获偏好,并与 GPT-4o 打平,但论文主文未清楚报告人工比较样本量与一致性。
局限与适用边界
- 【论文报告】作者承认 20k 词以上样本不足 100 条,模型最大输出仍约 10k–20k;更长输出还带来推理效率问题。
- 【论文报告】GPT-4o 负责合成长数据,也负责 LongBench-Write 质量评分;表 3 明确提示 GPT-4o 自评可能不公平。
- 【阅读者推断】NLL 随位置下降只说明可预测的长程依赖存在,不能证明情节因果、人物弧或无重复。
- 【阅读者推断】120 个 prompt 与单一 LLM 裁判不足以验证文学质量;基准把长度遵从占到最终分的一半,因此综合领先很大程度来自其他模型写不够长。
- 【阅读者推断】AgentWrite 每轮携带完整历史,随着长度增加会提高推理成本并重新遇到长上下文注意衰减。
阅读者判断
LongWriter 是长输出训练的基础论文。应引用它来支持“训练数据决定可达输出长度”和“分治合成可制造长样本”,而不是支持“9B 模型文学性超过 GPT-4o”。在小说系统中,它适合作为长度能力底座,还需独立的结构记忆、章节规划与专业人评。
关键原文定位
- 长度诊断与受控实验:§2,图 1–2,PDF pp.2–3。
- AgentWrite:§3,图 3、表 2,PDF pp.3–6。
- LongWriter-6k 与训练设置:§4.1–4.2,PDF pp.6–7。
- LongBench-Write 与主结果:§4.3,表 3,PDF pp.7–9。
- 数据消融与负结果:§4.3.2,表 4,PDF pp.9–10。
- 结论与未来边界:§6,PDF p.11。