一句话总结:长上下文"理解"被研究烂了,但长文"生成"没人好好测。HelloBench 按 Bloom 认知分类学建了 5 类长文生成任务基准 + HelloEval 人对齐评测法,跑 ~30 个主流 LLM 发现:多数模型压根写不过 4000 词,能写长的也严重重复/降质;而 HelloEval 与人评相关性最高,远超 BLEU/ROUGE 和裸 LLM-as-Judge。
TL;DR 速览
- 问题:长上下文研究都聚焦"理解/检索长输入",长文生成能力被忽视;且缺好的长文评测。
- 方法: 1. HelloBench 基准:基于 Bloom 认知分类学,分 5 子任务——开放问答、摘要、对话、文本续写、启发式文本生成。in-the-wild、开放式。 2. HelloEval 评测法:分层、人对齐,大幅降低人评成本,同时与人评保持高相关。
- 关键发现(~30 个 LLM):
- 无论显式/隐式长度约束,多数 LLM 写不过 4000 词;
- 能写长的也常严重重复、质量降级;
- HelloEval 与人评相关性最高,超过 ROUGE/BLEU(近乎无关)和 LLM-as-Judge。
- 一句话评价:两点最重要:① 长文生成仍是普遍短板;② BLEU/ROUGE 对长文与故事几乎失效,需要结构化并与人类判断对齐的评估。
tags: [论文精读, 长文评估, 基准, HelloEval, 判别器, 长度问题] related: [[09_longwriter]], [[20_writingbench]], [[19_storyalign]], [[23_story_eval_survey]]
摘要
- 作者/机构:Haoran Que, Feiyu Duan, Liqun He 等(北航、上海 AI Lab、北大、M-A-P、南大、国科大)。
- arXiv:2409.16191(2024-09-24)|代码 github.com/Quehry/HelloBench
[!PDF|] 22_hellobench.pdf, p.1
five subtasks: open-ended QA, summarization, chat, text completion, and heuristic text generation
[!PDF|] 22_hellobench.pdf, p.1
most LLMs cannot generate text that is longer than 4000 words
方法
[!note] 图 1 解读(HelloBench 总览,坐标启发式需微调) 中间是 Bloom 认知分类学六层(remember→understand→apply→analyze→evaluate→create),对应 HelloBench 的 5 类任务:开放问答、摘要、对话、文本续写、启发式生成——每类给一个 prompt 模板。
[!PDF|] 22_hellobench.pdf, p.1
HelloEval has the highest correlation with human
[!tip] HelloEval 为什么比 BLEU/ROUGE 和裸 LLM-judge 好? BLEU/ROUGE 是词重叠指标,对开放式长文几乎无意义(近乎零相关);裸 LLM-as-Judge 又不稳定。HelloEval 的思路是分层 + checklist + 学到的权重 + LLM 打分——把"评一篇长文好不好"拆成可核对的清单项再加权聚合。这与 [[20_writingbench]] 的 query-dependent criteria、[[19_storyalign]] 的专用 RM 是同一方向:通用指标不够,要结构化 + 人对齐的评测。
局限
- HelloEval 仍用 LLM 打分,继承 LLM 评委偏置。
- 2024-09 的模型快照,长度上限结论会随新模型(如 LongWriter 后)变化。
- 面向"通用长文"(含问答/摘要),非纯创意/故事。
个人思考
① 评估与工程价值 - "BLEU/ROUGE 对长文基本失效"是硬结论:做长文/故事产品的评测,别用词重叠指标;要么用 HelloEval/WritingBench 式"结构化 checklist + 人对齐",要么用专用判别器([[19_storyalign]])。 - "多数模型写不过 4000 词"与 [[09_longwriter]] 的诊断互相印证,说明长度遵从应在长篇系统中单独监控。 - HelloEval 的"分层 + checklist + 学权重"可直接作为通用质量评估分支,再与创意、张力等专用分支组合。
② 关联 - HelloBench、WritingBench 与评估综述分别覆盖长文能力、通用写作和指标全景,三者可共同构成评测参照系。
③ 局限 & 相关度 - LLM 评委偏置、时间快照、非纯故事。相关度中等——主要价值是"BLEU/ROUGE 失效 + 长度普遍不足"两个可直接用的结论。