一句话总结:写作评估的老问题是"用一套固定 rubric(流畅/连贯)打分所有任务"。WritingBench 提出 query-dependent 评估——对每条 query 现场生成 5 条专属评分标准,再由微调的 critic 模型据此打分,人一致性从静态标准的 67% 提到 84%;且用这个 critic 筛数据训出的 7B 模型反超 GPT-4o。
TL;DR 速览
- 问题:现有写作基准两大短板——① 任务范围窄(多单域、单句 prompt);② 评估指标僵(固定预设标准,测不了创意/论证强度/领域特性)。
- 方法: 1. WritingBench 基准:1,000 条 query、6 大域 × 100 子域(学术工程/金融商业/政法/文艺/教育/广告营销),带 style/format/length 要求,中英双语,输入几十到几千词。 2. query-dependent 评估:LLM 对每条 query 动态生成 5 条实例专属标准 → 微调 critic 模型按标准打分(1–10)。 3. 数据甄选验证:用该框架筛写作数据训小模型。
- 关键数字:
- 评估框架 人一致性 84%,显著超静态标准基线(67% / 58%)。
- critic 筛数据训的 7B 模型反超 GPT-4o(GPT-4o 在其榜单 6.81;榜首 Claude-3.7-thinking 7.91)。
- 一句话评价:"每条 query 现场造标准"比"一套 rubric 打天下"更贴合真实写作的多样性;且"critic 模型既能评分又能筛数据"验证了判别器的数据迭代闭环价值——但其标准偏"通用写作质量/指令遵循",不直接测创意/张力。
tags: [论文精读, 写作评估, 基准, critic模型, 数据甄选, 判别器] related: [[19_storyalign]], [[21_narrative_flattening]], [[17_spoiler_alert]], [[22_hellobench]], [[09_longwriter]]
摘要
- 作者/机构:Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li 等(阿里巴巴 X-PLUG*、中国人民大学、上海交大)。
- arXiv:2503.05244v4(2025-11-27,NeurIPS 2025)|代码 github.com/X-PLUG/WritingBench
[!PDF|] 20_writingbench.pdf, p.1
evaluate LLMs across 6 core writing domains and 100 subdomains
[!PDF|] 20_writingbench.pdf, p.1
query-dependent evaluation framework that empowers LLMs to dynamically generate instance-specific assessment criteria
1 问题:固定 rubric 测不了复杂写作
[!PDF|] 20_writingbench.pdf, p.2
narrow set of predefined criteria (e.g., fluency and coherence)
- 既有 LLM 评估多依赖一小撮预设标准(流畅、连贯),随模型越来越强,这种静态框架不足以评"创意、论证强度、领域特定要求"。
- 任务侧也窄:多单域、单句 prompt、同质材料,抓不住真实写作的定制化与复杂性。
[!tip] 什么是"query-dependent(查询相关)评估"?为什么它更对? 传统做法:定一套固定 rubric,所有故事/文档都用同样几条打分。问题是——评一篇法律合同和评一首诗,该看的东西完全不同。WritingBench 的思路是:先让 LLM 读这条具体 query,现场生成 5 条只属于它的评分标准(比如合同看"条款完备性",诗看"意象新颖度"),再让 critic 模型按这 5 条打分。"标准随任务走"比"一把尺子量所有"更贴合真实写作的多样性——这也是它人一致性能到 84% 的原因。
2 方法
[!note] 图 2 解读(query 构造流水线,坐标启发式需微调) 四阶段:LLM 生成并多样化写作 query → 从"精炼池"(5 类写作要求 + 1 类表达类型)勾选策略把初始 query 细化成多要求提示(彩色标注)→ 人工收集/优化配套材料(红色短语引用灰色材料)。产出覆盖广、要求多样、含异构源材料的任务集。
- 评估框架:query → LLM 生成 5 条实例标准 → 微调 critic 模型据标准打分(1–10)。
- 数据甄选:用该框架过滤写作数据,训小模型验证"能否识别高质量写作样本"。
3 结果
[!PDF|] 20_writingbench.pdf, p.2
achieves 84% human alignment, significantly surpassing static-criteria baselines
- 评估有效性:query-dependent + critic 打分,人一致性 84% vs 静态标准 67% / 58%。
[!PDF|] 20_writingbench.pdf, p.1
enables a 7B-parameter model to outperform the performance of GPT-4o in writing
Table 3 榜单(critic 打分,1–10):
| 模型 | Overall |
|---|---|
| Claude-3.7-thinking | 7.91 |
| Claude-3.7 | 7.85 |
| Deepseek-R1 | 7.70 |
| Qwen-Max | 7.16 |
| o1-Preview | 6.89 |
| GPT-4o | 6.81 |
| Deepseek-V3 | 6.35 |
| Gemini-1.5-Pro | 6.21 |
- 数据甄选的力量:用 critic 筛出的高质量写作数据训一个 7B 模型,写作得分反超 GPT-4o(6.81)——证明"好的判别器不仅能评分,还能当数据引擎"。
[!note] 一处口径提示 摘要/榜单宣传的 query 数在不同版本/材料里有 1,000 与 1,239 两种说法;正文贡献明确写 1,000 条(中英各半量级)。引用时以正文的 1,000 为准。
4 局限
- critic 模型本身是 LLM,仍可能继承 LLM 评委的偏置(如偏流畅、偏长)。
- 覆盖 6 大域是"通用写作",创意/文学维度只是其中之一(Literature & Art 一个域),标准偏"指令遵循 + 领域适配",不专测叙事创意/张力。
个人思考
① 工程关联:判别器设计与数据迭代闭环 - "query-dependent 5 标准 + critic 模型"是一种判别器设计模式:比固定 rubric 灵活,值得纳入专用判别器架构——尤其"让判别器先读任务、再定标准"这一步,能让同一个判别器覆盖法律/营销/小说等不同写作。 - "critic 既评分又筛数据 → 7B 超 GPT-4o"验证了数据迭代闭环:判别器不只是评测工具,也是训练数据过滤器。评估越准确,筛出的数据越可靠,进而能够训练出更强的生成模型。 - 但 WritingBench 的标准偏向通用质量与指令遵循,容易落入 [[21_narrative_flattening]] 所说的"连贯、可读、规范但扁平"。直接将其用于创意评估会奖励 competent-but-flat;更合理的做法是把它作为通用质量分支,另建创意与张力分支。
② 方法论启示(可迁移) - "标准随实例走":任何主观评估,与其硬定一套 rubric,不如让模型先理解具体任务再生成标准——更贴合、更高人一致。 - 判别器 = 评测器 + 数据过滤器:同一个 critic 两用,是低成本闭环的关键设计。 - 人一致性(84% vs 67%)是判别器质量的硬指标,建自己的判别器时应先测它。
③ 可复用的方法 - 判别器架构上采"query→动态标准→critic 打分",让一个判别器覆盖多写作场景;创意/张力维度单独加分支(接 19/21/17)。 - 用 critic 筛数据并训练生成器,可形成"判别器越好→数据越好→生成器越强"的迭代闭环,是把评估能力转化为生成能力的一条实现路径。
④ 开放问题 / 疑问 - 5 条实例标准由 LLM 生成——生成标准这一步本身的稳定性/偏置如何?换个 LLM 生成标准,打分会不会漂? - critic 打分 1–10 的绝对分对 reward 训练够用吗?还是要转成成对偏好(如 [[19_storyalign]])? - 六大域中"文艺"只占 1/6,创意评估被稀释;用于纯创意写作研究或系统时,需要单独验证领域适配度。
⑤ 局限 - critic 继承 LLM 偏置,且创意维度较弱;但 "query-dependent 标准 + critic 兼做数据过滤器" 仍是判别器设计与数据迭代的有效范式,可作为专用评估系统的通用质量分支。