AI_writing/pdfs/09_longwriter_精读.md

paper_type: 方法与系统, Benchmark 与数据集, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "LongWriter: Unleashing 10,000+ Word Generation from Long Context LLMs" authors: Yushi Bai, Jiajie Zhang, Xin Lv, Linzhi Zheng, Siqi Zhu, Lei Hou, Yuxiao Dong, Jie Tang, Juanzi Li year: 2024 source: arXiv:2408.07055v1 pdf: 09_longwriter.pdf

LongWriter:用长输出对齐数据解锁长度遵从

一句话总结:LongWriter 通过受控 SFT 实验把约 2,000 词输出上限追溯到对齐数据的长度分布,再用 AgentWrite 合成 6,000 条 2k–32k 词样本训练 8B/9B 模型;它有力证明长输出数据能解锁长度遵从,但 GPT-4o 同时生成数据和评质量、基准偏通用写作,使结果不能直接等同于小说连贯或文学性。

TL;DR

病因诊断:输出长度受 SFT 分布约束

【论文报告】LongWrite-Ruler 用 8 条中英文指令乘以 6 个长度要求,形成 48 个 prompt;测试 4 个开源与 4 个闭源模型。温度为 0.5,作者检查了 API max-token 截断和明显重复,观测模型普遍在约 2k 词附近饱和(§2)。

【论文报告】受控实验从 180k 条 GLM-4 chat SFT 数据中删除超过 500/1,000/2,000 词的样本,分别保留原数据的 72%/98%/99.9%,再训练同一 9B 基座。输出上限随保留的最大样本长度增长(图 2)。

【阅读者推断】这个实验很有说服力,但三组数据量也同时变化,尤其 500 词组只保留 72%;因此它支持长度分布是关键因素,尚不能把全部差异严格归因于“单一最长样本”。

AgentWrite 与训练数据

长写作指令
→ Plan:拆成若干段落,给每段主题与目标字数
→ Write:按顺序生成段落 n,并携带此前正文
→ 拼接并清洗长输出
→ 与通用 SFT 混合训练
→ 额外构造长写作偏好对做 DPO

【论文报告】AgentWrite 每个子任务约 200–1,000 词。串行版相对并行版保持更好连贯性;并行写作虽然更快,但段落无法看到此前文本,Coherence/Clarity 指标下降(§3,表 2)。

【论文报告】6,000 条指令一半来自 GLM-4 SFT 池、一半来自 WildChat-1M,再由 GPT-4o 生成;约 0.2% 因过短或规划步数导致崩溃而被过滤。输出主要在 2k–10k 词间较均匀,最长 32k(§4.1)。

【论文报告】SFT 基座为 GLM-4-9B 与 Llama-3.1-8B,均支持 128k context;使用 8×H800、batch 8、学习率 1e-5、32k packing、4 epochs。loss 按目标 token 而非序列平均,防止长样本单 token 权重被稀释(§4.2)。

【论文报告】DPO 混合约 50k 通用偏好对和 4k 长写作对;每个指令采样 4 个候选,用质量分与长度分选正例,训练 250 steps。

LongBench-Write 与主结果

【论文报告】LongBench-Write 含 120 条指令,中文/英文各 60,覆盖 7 种写作文体和四个目标长度桶。长度分允许一定超写,但对明显短写惩罚更重;质量分由 GPT-4o 按 relevance、accuracy、coherence、clarity、breadth/depth、reading experience 评价,最终取长度与质量均值(§3.3)。

模型 综合分 4k–20k 长度分 4k–20k 质量分
GPT-4o 78.6 5.6 85.3
Claude 3.5 Sonnet 80.7 26.0 80.9
LongWriter-8B 79.8 77.9 79.9
LongWriter-9B 80.5 80.3 77.3
LongWriter-9B-DPO 84.0 90.3 81.6

【论文报告】去掉 LongWriter-6k 时综合分从 80.5 降至 62.6,2k–4k 长度分从 76.0 降至 25.7,4k–20k 从 80.3 降至 0。显式把 plan 拼到训练输出只小幅改善长度、降低质量;instruction backtranslation 数据也失败(表 4)。

【论文报告】DPO 相对 SFT 的长度分约 +4%、质量分约 +3%;人工成对比较中 DPO 版相对 LongWriter-9B 约 58% 获偏好,并与 GPT-4o 打平,但论文主文未清楚报告人工比较样本量与一致性。

局限与适用边界

阅读者判断

LongWriter 是长输出训练的基础论文。应引用它来支持“训练数据决定可达输出长度”和“分治合成可制造长样本”,而不是支持“9B 模型文学性超过 GPT-4o”。在小说系统中,它适合作为长度能力底座,还需独立的结构记忆、章节规划与专业人评。

关键原文定位