WritingBench: A Comprehensive Benchmark for Generative Writing
- arXiv/venue: 2503.05244 (2025-03;NeurIPS 2025 Datasets & Benchmarks Track;代码 X-PLUG/WritingBench)
- 作者: Yuning Wu, Jiahao Mei, Ming Yan, Chenliang Li, Shaopeng Lai, Yuran Ren, Zijia Wang, Ji Zhang, Mengyue Wu, Qin Jin, Fei Huang(阿里 X-PLUG / 通义 + 人民大学 + 上海交大)
- 类型: 广义"生成式写作"评测基准 + 查询自适应评审框架 + 微调 critic 模型
- 一句话: 覆盖 6 大域 100 子域的写作评测集,核心创新是"每条 query 现场生成 5 条专属评分标准",再用微调 critic 打分,人一致性从静态 rubric 的 ~67% 提到 ~84%。
1. 要解决的问题
现有写作评测要么只看通用文本生成,要么写作任务覆盖太窄,抓不住"高质量书面内容在不同领域的多样化要求"。 更根本的问题:写作质量高度依赖具体任务(写法律意见书和写社媒文案的标准完全不同),用一套固定 rubric 打分必然失真。WritingBench 要同时解决"覆盖面"和"评分标准如何随任务变化"。
2. 方法 / 核心思路
2.1 覆盖面:6 大域 × 100 子域
六大核心域:Academic & Engineering(学术工程)、Finance & Business(财经商业)、Politics & Law(政治法律)、Literature & Arts(文学艺术)、Education(教育)、Advertising & Marketing(广告营销)。 子域示例:论文提纲、技术文档、市场分析、法律意见、人物设定、教案、社媒文案等(共 100 子域)。
2.2 数据构成
- 1,239 条 query(文中亦记 1,000 条主集:445 中文 + 555 英文,中英双语)。
- 平均 1,699 tokens,最长 19,361 tokens。长度分布:0–1K tokens 550 条 / 1–3K 292 条 / 3–5K 87 条 / 5K+ 71 条。
- 由人工标注员收集开源参考材料(部分 query 需外部材料,部分不需)——刻意还原真实写作常带资料的场景。
2.3 评审方式:query-dependent 动态标准
- 对每条 query 用 LLM(Claude-3.7)现场生成 5 条 instance-specific 评分标准,每条含:名称 + 描述 + 详细 rubric。
- 三类需求维度:style(风格)、format(格式)、length(长度)。
- 10 分制打分。
2.4 Critic 模型(自动打分器)
- 底座 Qwen-2.5-7B-Instruct。
- 用 Claude-3.7 打分的 155K 实例做训练数据,微调 3 epoch(16×A100,batch 64)。
- 输出 = 数值分 + 文字理由。
3. 数据与实验
- 人工评估:300 条 query,5 名受训语言学家做 pairwise 比较;标注员间一致性 κ = 0.69(substantial)。
- 对比"静态全局 rubric" vs "动态 query-dependent 标准"两种评审范式在人一致性上的差别。
- 数据甄选实验:用 critic 从 24K 生成 query 中按子域 top-50% 选出 12K 高质量样本,去微调一个 7B 模型,看能否超过 GPT-4o。
4. 主要发现 / 结果
- 动态标准显著更贴合人类:query-dependent 标准下人一致性 = 84%(critic 模型)/ 87%(Claude-3.7 裁判);而静态全局 rubric 仅 67%(Claude)/ 69%(GPT-4o)。这是本文最核心的结论。
- 榜单(WritingBench 分,10 分制,节选): | 模型 | 分数 | |---|---| | Claude-3.7-thinking | 7.91 | | Claude-3.7 | 7.85 | | DeepSeek-R1 | 7.70 | | Qwen-Max | 7.16 | | GPT-4o | 6.81 |
(更晚的 Qwen3-235B-A22B-Thinking-2507 在公开榜上刷到过 0.883 的归一化分,为当前最高之一。) - 7B 反超 GPT-4o:用 critic 甄选 12K 数据微调的 Qwen-2.5-7B-filtered 得 7.44,高于 GPT-4o 的 6.81——证明该框架不仅能评测,其数据甄选能力本身能提升模型。
5. 局限
- 动态标准由 Claude-3.7 生成、critic 由 Claude-3.7 标注蒸馏,存在"以某一强模型的偏好为准"的裁判偏置风险。
- 84% vs 87% 说明微调 critic 仍略逊于直接用 Claude-3.7 当裁判,成本/精度需权衡。
- 主集实为 1,000 条(中英),子域虽多但每子域样本数有限。
- style/format/length 三维偏"形式合规",对深层创意/思想深度的刻画较弱。
6. 对做产品 / 工程的启发
- "每任务现场生成评分标准"是可直接落地的评审范式:做写作产品的质量闸门时,与其维护一套僵化 rubric,不如让 LLM 按 query 现生成 5 条标准再打分——人一致性从 ~67% 跳到 ~84%。
- 可当评测集用:6 域 100 子域 + 双语,适合给自家写作模型做横向 benchmark;critic 已开源,可直接接 CI 做回归。
- 小模型 + 好数据 > 大模型:7B 经 critic 甄选数据后反超 GPT-4o,提示"用评审器反哺训练数据甄选"是高性价比路线。
- 注意把 critic 的裁判偏置(来自 Claude-3.7)纳入考量,关键决策仍需人抽检。
关联
- 与 [[19_storyalign]] 同为"用模型给写作打分",但本文面向广义写作、StoryAlign 专注故事偏好;两者的 critic/RM 可互为参照。
- 与 [[23_story_eval_survey]] 互补:survey 讲评测方法全景,本文是其中"LLM 生成式评审 + 微调 critic"分支的强实现。
- length 维度与 [[22_hellobench]] 的长文长度约束评测正面呼应(都发现"按长度要求写"很难)。
- "动态 rubric"思路可作为 [[01_lost_in_stories]] 一致性检查的补充维度。