AI_writing/pdfs/28_automated_creativity_eval_精读.md

paper_type: "方法与系统;实证与评价" type_confidence: 高 reading_depth: 标准精读 title: "Automated Creativity Evaluation of Language Models Across Open-Ended Tasks" authors: "Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan" year: 2026 source: "arXiv:2606.11762v1(2026-06-10)" pdf: "28_automated_creativity_eval.pdf" code: "https://github.com/tanminsen/creativity-eval" license: "CC BY 4.0(PDF metadata)"


自动创造力评价:语义熵测到的是探索,还是不确定性

一句话结论:论文把创造力拆成发散探索与收敛完成两轴,用逐步采样的 Semantic Entropy 测语义分叉、用检索式三 Agent judge 测任务满足;两种机制在 MacGyver 小样本人评和两个低一致性多数票 gold 上显示出实用信号与约 63% token 节省,但尚不足以把语义熵确认为跨领域创造力指标,尤其文学验证只覆盖窄维度且没有专家标注。

核心问题与论证路线

开放任务没有唯一答案:只测正确性会漏掉探索宽度,只测多样性又可能奖励胡乱分叉。论文因此问,能否把 creativity 拆成 divergent creativity(发散创造力:能否探索不同语义方向)与 convergent creativity(收敛创造力:最终方案是否有用且符合约束),并用一个可跨任务复用的自动流程分别测量。

论证先把 Semantic Entropy 从 hallucination detection 重新解释为开放任务中的探索宽度,再设计一个只检索相关讨论片段的多 Agent judge;随后在 MacGyver、HypoGen、BookMIA 各 300 题上跑模型,并以小规模人评、指标相关性和 token 成本验证。关键不是两个分数谁更高,而是它们是否真的测到作者命名的两个构念。(论文报告,§1、§3–§6,PDF pp.1–9;阅读者分析)

TL;DR

1. 发散轴怎样从 token 概率变成语义探索

设计假设。 在单一正确答案任务中,概率散布到多个含义常表示不确定;在开放任务中,多个含义可能同时有效,因此作者把同一现象解释为探索不同 solution directions。这个解释依赖一项前提:被采样方向不仅不同,而且是合理的候选想法。(作者主张,§3.1,PDF p.3)

计算过程。 对某一步生成的候选 s,论文以平均 token log-probability 做长度归一化:

\[ \log P(s\mid x)=\frac{1}{N}\sum_{i=1}^{N}\log P(t_i\mid t_{<i},x). \]

若两个候选双向蕴含,就由 greedy clustering 放入同一语义类;同类样本概率相加并在已采样类别上归一化,最后计算:

\[ H(x)=-\sum_i P(C_i\mid x)\log P(C_i\mid x). \]

每步默认采样 n=10、temperature 1.0、top-p 0.9。系统用最高概率候选继续 greedy 展开,题级 SE 为步骤平均;附录另测只在第一步扩成五条轨迹的 multi-path variant。(论文报告,§3.2、§5、Appendix C.1–C.2/C.8,PDF pp.4–5、13、17–18)

测量边界。 SE 随温度、采样数、步骤切分、长度归一化、候选顺序与聚类器改变。它测的是“给定采样协议下,模型在局部下一步分配了多少概率到不同语义类”,不是单篇最终作品的 originality、value 或 reader impact。(阅读者分析)

2. 语义类本身可靠吗

聚类器选择。 三名人工标注者判断 55 对 MacGyver steps 是否互相蕴含,以多数票形成 26 positive/29 negative 的小型 gold;pairwise κ 为 0.49、0.60、0.74。tasksource/deberta-base-long-nli 准确率 78.1%,高于 GPT-4o 的 72.7%,因而成为聚类器。(论文报告,Appendix C.3、Tables 6–8,PDF pp.13–14)

这个选择集只含 Llama-3.1-8B 与 GPT-4o 的 MacGyver steps,却被直接用于科学假设和故事文本。聚类错误会同时改变类数、类概率和 SE;论文没有在 HypoGen 或 BookMIA 重新标定。因此“framework agnostic to entailment model”表示组件可替换,不表示当前分数跨域等价。(论文报告,Appendix C.3,PDF p.14;阅读者分析)

3. 收敛轴怎样避免多 Agent 对话无限增长

系统设计。 Problem Analyst 分析问题性质,Solution Analyst 审查候选方案,Criterion Analyst 细化评价标准。三者先生成 structured fragments 并写入 ChromaDB;讨论时用 stella_en_1.5B_v5 embedding 检索相关片段,而不是回放完整历史。参数为 j=4, k=5, l=8,每个 agent 回答最多 150 词,平均 confidence 超过 T=0.5 时提前停止,否则最多两轮;最高 confidence agent 依据检索片段对单个 criterion 给二元 verdict。(论文报告,§4、Appendix D.2,PDF pp.4、19–20)

任务仍然是领域化的。 三个 analyst 的机制可复用,但 criteria 是人工按域定义的:MacGyver 看 Feasibility/Safety/Effectiveness;HypoGen 看 Feasibility/Relevance/Scientific Accuracy;BookMIA 只看 Narrative Coherence、Emotional/Psychological Realism、Plot Completion。“domain-agnostic”因此只适用于框架骨架,不适用于测量定义或已有校准。(论文报告,§5、Appendix D.1,PDF pp.5、19;阅读者分析)

4. 三域 benchmark 实际评了什么

实验方法。 每个模型在每域处理 300 个问题,每一步 10 个候选用于 SE,greedy 路径作为最终答案,再由多 Agent judge 评分。MacGyver 是受材料限制的非常规解决方案;HypoGen 要从给定 Bit 推导目标 Flip;BookMIA 要在首句和尾句之间补写多段故事。实验使用 4×A100,较大模型走 API,但论文未报告完整 GPU-hours、美元成本、API 日期或所有闭源模型 snapshot。(论文报告,§5,PDF p.5)

文学构念。 BookMIA 的三项收敛指标只覆盖逻辑连贯、人物情绪/心理可信以及能否自然抵达给定尾句。它没有测语言声音、主题、惊奇质量、风格新颖、细节价值或整体阅读体验,因此不能把 BookMIA overall 直接叫作“文学创造力”。(阅读者分析)

5. 发散指标的效度证据

5.1 人类成对比较

三名独立标注者在 50 个 MacGyver 问题上比较 GPT-4o、Qwen3-32B thinking 与 non-thinking。每个模型提供五条完整 solution paths;每题三组模型 pairwise comparison,以多数票形成排序。自动指标与题级排序的 Cohen's κ 如下:(论文报告,Appendix C.8,PDF pp.17–18)

指标 Cohen's κ
Semantic Entropy(greedy) 0.56
Cosine similarity 0.49
Semantic Entropy(multi-path) 0.48
Distinct-1 0.37
Self-BLEU 0.35
Distinct-2 0.34

结果含义。 在这个小型三模型比较中,greedy path 周围的局部 SE 最接近学生对“五条完整路径谁更发散”的多数票,说明它比所列词面基线更有判别力。它没有验证另外两域、更多模型差异、单篇文学 originality 或跨文化评审。(论文报告,Table 14,PDF p.18;阅读者分析)

5.2 Novelty judge 与内部符号矛盾

五名标注者给 30 个 MacGyver problem–solution pair 做 novelty 排名,平均 pairwise Spearman 约 0.33–0.57;LLM pairwise novelty judge 与平均人类排名达到 Spearman ρ=0.80、Kendall τ=0.63。(论文报告,Appendix C.7、Table 13/Fig.7,PDF p.17)

论文随后用该 LLM judge 扩展 novelty 比较。Table 12 报告 SE 与 novelty 在 MacGyver/BookMIA 的正相关,例如 Qwen3-32B NT 为 0.456/0.478;但 Tables 15–16 对同组数值大量加上负号,同时又写“higher values indicate stronger alignment”,正文还按绝对值解释。这是 PDF 内部未澄清的方向/符号不一致,不能把这些表作为“SE 越大,novelty 必然越高”的无歧义证据。(论文报告,Tables 12、15–16,PDF pp.16、18–19;阅读者分析)

6. 收敛 judge 的准确率建立在怎样的 gold 上

Evaluator MacGyver BookMIA
ChatEval 76.7% 73.3%
Retrieval judge(GPT-4o) 84.7% 83.0%
人类个体范围 80.0%–84.7% 74.7%–87.0%

Gold 构造。 MacGyver 由五名学生给 50 个 solutions 的三项二元 verdict 投票,pairwise κ 多在 0.113–0.346;BookMIA 由三名学生评价 50 个 solutions,三对 κ 为 0.256/0.283/0.135,平均约 0.22。HypoGen 因专业知识要求没有人类验证。(论文报告,Table 2、Appendix D.4、Tables 18–20,PDF pp.7、20–21)

证据边界。 83.0% 表示 judge 与低一致性多数票的符合度,不是文学真值准确率。论文把每个 annotator 与包含其自身投票的 majority gold 比较,会机械抬高“individual human accuracy”,因此“匹配人类水平”只能理解为落在该内部比较范围内。所有标注者都是英语母语本科生、志愿且无报酬;作者也承认职业作家或文学研究者可能更权威。(论文报告,Appendix H,PDF p.26;阅读者分析)

7. 效率收益是真实的,但不是总成本

对 50 个 problem–solution pairs,ChatEval 每对平均输入/输出 token 为 66,944/8,634,检索框架为 23,758/3,796;输入下降约 64.5%,总 token 下降约 62.9%。(论文报告,Table 17,PDF p.20)

这个比较证明 fragment retrieval 大幅减少讨论 token,却没有计入 embedding、ChromaDB、三 agent 初始化、SE 每步十次采样、NLI 聚类和生成长轨迹的全部成本。论文自己也把 SE computational overhead 列为限制。(论文报告,§8,PDF p.9;阅读者分析)

8. 模型结果与可接受的解释范围

域 / 模型 SE Overall convergent
MacGyver / GPT-4o 2.08 0.63
MacGyver / Qwen3-32B thinking 2.02 0.52
MacGyver / Qwen3-32B non-thinking 2.08 0.44
HypoGen / GPT-4o 2.07 0.35
HypoGen / Qwen3-32B thinking 1.72 0.47
HypoGen / Qwen3-32B non-thinking 1.66 0.51
BookMIA / GPT-4o 2.17 0.33
BookMIA / Qwen3-32B thinking 2.19 0.48
BookMIA / Qwen3-32B non-thinking 2.19 0.38

(论文报告,Tables 3–5,PDF p.9)

作者观察到 convergent score 通常随规模、模型更新和 reasoning 提升,而 SE 不单调,并据此主张当前训练更偏向正确性和结构化推理、未扩大探索宽度。(作者主张,§6.1–§7,PDF pp.7–8)

这是跨若干不同模型 snapshot 的横截面对比,不是控制训练数据和架构的因果实验;HypoGen 中 non-thinking 还高于 thinking(0.51 vs 0.47)。更保守的结论是:在作者这套 SE 和 judge 下,两个维度的模型排序不同,不能用收敛完成度替代发散探索。(阅读者分析)

9. 局限与适用边界

作者限制。 SE 需要多次采样与聚类,成本高;LLM judge 受知识与偏好影响,可能把陌生但可行的方案判错;没有现实执行验证。(论文报告,§8,PDF p.9)

进一步限制。 三个域不足以证明 domain-general;NLI 只在 55 对 MacGyver 上校准;HypoGen 无人评;BookMIA 没有文学专家且只评三个维度;低 IAA 意味着 judge 的个位数优势可能不稳定。论文未报告人评报酬(明确为无报酬)、预注册、置信区间、模型调用日期和独立复现。(论文报告,Appendices C/D/H,PDF pp.13–21、26;阅读者分析)

关键原文定位

tags: [论文精读, 创造力评测, 语义熵, 多Agent评委, 发散思维, 收敛思维] related: [[30_assessing_creativity]], [[23_story_eval_survey]], [[19_storyalign]], [[37_casper_character_variety]]

阅读者判断

论文最可信的贡献是把“探索宽度”和“任务完成”分开报告,并证明检索式多 Agent 讨论可以显著节省 token。应以中等信心接受 SE 在 MacGyver 三模型比较中是有用的发散代理,以较低信心接受它已经跨领域测到 creativity:聚类器、人工标准、文学维度和符号报告都留下明显不确定性。

读完后最重要的认识更新是:自动创造力评价不应寻找单一总分。用于故事系统时,SE 可以作为“候选方向是否坍缩”的诊断信号,收敛 judge 可以检查基本可行性;两者之外仍需独立测量 reader novelty、惊奇是否有效、风格价值和整体体验,并用专家或目标读者校准。只有这些维度共同成立,才能从“分布更散”走到“作品更有创造力”。(阅读者分析)