AI_writing/papers/20_writingbench.md

WritingBench: A Comprehensive Benchmark for Generative Writing


1. 要解决的问题

现有写作评测要么只看通用文本生成,要么写作任务覆盖太窄,抓不住"高质量书面内容在不同领域的多样化要求"。 更根本的问题:写作质量高度依赖具体任务(写法律意见书和写社媒文案的标准完全不同),用一套固定 rubric 打分必然失真。WritingBench 要同时解决"覆盖面"和"评分标准如何随任务变化"。

2. 方法 / 核心思路

2.1 覆盖面:6 大域 × 100 子域

六大核心域:Academic & Engineering(学术工程)、Finance & Business(财经商业)、Politics & Law(政治法律)、Literature & Arts(文学艺术)、Education(教育)、Advertising & Marketing(广告营销)。 子域示例:论文提纲、技术文档、市场分析、法律意见、人物设定、教案、社媒文案等(共 100 子域)。

2.2 数据构成

2.3 评审方式:query-dependent 动态标准

2.4 Critic 模型(自动打分器)

3. 数据与实验

4. 主要发现 / 结果

(更晚的 Qwen3-235B-A22B-Thinking-2507 在公开榜上刷到过 0.883 的归一化分,为当前最高之一。) - 7B 反超 GPT-4o:用 critic 甄选 12K 数据微调的 Qwen-2.5-7B-filtered 得 7.44,高于 GPT-4o 的 6.81——证明该框架不仅能评测,其数据甄选能力本身能提升模型。

5. 局限

6. 对做产品 / 工程的启发

关联