AI_writing/papers/22_hellobench.md

HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models


1. 要解决的问题

LLM 的长文理解(long-context understanding)被研究得很多,但长文生成(long text generation)能力几乎没被系统评过。现实里"写一篇长报告/长故事"是刚需,却缺一个 in-the-wild、开放式的评测基准,也缺一个不靠海量人工就能可靠打分的方法。

2. 方法 / 核心思路

2.1 任务设计:Bloom 分类法驱动的 5 类任务

647 样本 / 5 子任务 / 38 子类: - Open-Ended QA:200 样本 - Summarization:100 样本(5 子类 ×20) - Chat:147 样本(15 子类) - Text Completion:~80 样本(3 子类) - Heuristic Text Generation(启发式生成,如续写/命题写作):~100 样本(5 子类 ×20)

强调 in-the-wild、开放式、需要自然流畅的长回答。

2.2 HelloEval:分层长文评估(核心方法)

用"学习权重的 checklist"把 LLM-as-Judge 校准到人类,分两阶段: - 准备阶段(Preparation): - 每个任务由标注员对 4–6 个 yes/no checklist 项打分,并给整体质量分。 - 用线性回归拟合各 checklist 项权重y = w₁x₁ + w₂x₂ + … + wₙxₙ(y=人类整体分,xᵢ=各 checklist 命中)。 - 数据来自 LLaMA-3.1-8B、Qwen-2-7B、Claude-3.5-Sonnet、GPT-4o-Mini 的输出。 - 执行阶段(Execution): - 用 GPT-4o 作 LLM-Judge 判定各 checklist 项,按学到的权重加权得最终分(分数从 [0,100] 重标到 [-300,100],放大区分度)。

2.3 长度约束实验

显式设 4 档字数要求:2K / 4K / 8K / 16K 词,考察"能不能按要求写这么长且不崩"。

3. 数据与实验

4. 主要发现 / 结果

5. 局限

6. 对做产品 / 工程的启发

关联