AI_writing/pdfs/29_progressive_conditional_surprise_精读.md

paper_type: "方法与系统;实证与评价" type_confidence: 高 reading_depth: 深度复现 title: "I’ve Seen How This Goes: Characterizing the Diversity of LLM Generations and Human Writing via Progressive Conditional Surprise" authors: "Matthew Khoriaty, David Williams-King, Shi Feng" year: 2026 source: "arXiv:2606.01811v1;Accepted at ICML 2026 Workshop on Human-AI Co-Creativity(non-archival)" pdf: "29_progressive_conditional_surprise.pdf" pages: 28 code: "https://github.com/AMindToThink/icl-diversity"


Progressive Conditional Surprise / Decan 精读

一句话结论

【论文报告】本文把固定 base reader model \(\theta\) 在看过同一 prompt 的先前回答后、对后续回答仍保留的条件 surprisal 作为多样性信号,并以 \(D_{\rm Can}=C\times a_n\) 用独立可读性权重 \(C\) 抑制纯噪声;它在 Tevet–Berant 人类标注基准上接近但落后 SentBERT,并在一个 OLMo-2-7B 的 Base→SFT→DPO→RLVR checkpoint 管线中呈单调下降(p.1,§§3、5–6)。

核心问题

能否不训练额外分类器、不用 embedding、参考语料或人工标签,而只读取一个预训练语言模型 \(\theta\) 的 token log-probabilities,衡量一组人类或模型回答在 \(\theta\) 看来是否仍互不易预测,并将纯噪声与连贯的多样性区分开?(p.1,§§1–3)

TL;DR


1. 论文身份与证据范围

【论文报告】作者为 Matthew Khoriaty、David Williams-King(ERA Fellowship)和 Shi Feng(George Washington University)。PDF 标为 arXiv:2606.01811v1 [cs.CL] 1 Jun 2026,共 28 页;p.1 注明已被 ICML 2026 Workshop on Human-AI Co-Creativity 接收,但为 non-archival。论文称代码与数据公开于上述仓库(p.1 脚注、p.13 脚注)。

【阅读者推断】这是 workshop 非归档版本,且关键的 OLMo case study 是单一模型家族与两套 prompt 的组合;应把它视为有明确原型价值的实证方法论文,而非对多样性测量的定论。

2. 方法:从 token 概率到 per-byte Decan

2.1 记号与总 surprisal

【论文报告】令 \(p\) 为 prompt,\(r_1,\ldots,r_n\sim\pi(\cdot\mid p)\) 为待评 policy 的独立回答,\(\theta\) 为可取得 per-token log-probabilities 的 trusted base model,\(|r|_{\rm tok}\) 为 token 数,\(\lVert r\rVert\) 为 UTF-8 编码字节数(p.2 §2)。对一个回答,定义总 surprisal:

\[ -\log_2\theta(r\mid p)= \sum_{t=1}^{|r|_{\rm tok}}-​\log_2\theta(r_t\mid r_{<t},p). \tag{1} \]

【论文报告】式 (1) 单位是 bits。作者称因链式法则,总 bits 不依赖 tokenizer 如何将字符串分解;这不是说每个 token 的概率本身不变(p.2)。

2.2 byte 归一化:何时发生、为何发生

【论文报告】作者再定义 per-byte rate:

\[ h_\theta(r\mid p)= \frac{-\log_2\theta(r\mid p)}{\lVert r\rVert} \quad\text{(bits/byte)}. \tag{2} \]

分母是 UTF-8 byte count,不是 token count;作者选择它以使不同词表的 base model 可比较,并称其在实验中比 total bits 表现更好,但没有研究原因(p.2)。

【阅读者推断】不能把“per-byte”说成自动消除长度影响。作者后来明确指出,causal LM 随 response 内上下文增加会降低后面 token 的交叉熵,故 per-byte 量仍不具备 response-length invariance,OLMo 主分析需要 length matching(p.20)。

2.3 progressive conditional surprise \(a_k\)

【论文报告】原始定义为:

\[ a_k=-\log_2\theta(r_k\mid r_{<k},p),\quad k=1,\ldots,n. \tag{3} \]

式 (3) 首先是总 bits的条件 surprisal;随后每个 \(a_k\) 才除以 \(\lVert r_k\rVert\),成为 per-byte curve。除非另注,后文使用 per-byte quantities(p.2 §3.1)。因此,把式 (3) 本身直接写成 per-byte 公式是不精确的。

【作者主张】若回答共享 pattern、style 或 topic regularity,\(\theta\) 的 in-context learning 会随着见到更多回答降低后续 surprisal;rich coherent diversity 应缓慢下降至较高正 floor,一模态重复应快速接近零,pure noise 应在高位近似平坦(p.2 §3.1)。完整 \(a_k\) curve 比只看终点更能区分这些情形。

2.4 \(a_n=H-I\) 的正确降格

【论文报告】论文 p.2 §3.1 的确明确写道:

\[ a_n=H_\theta(r_n\mid p)-I_\theta(r_n;r_1,\ldots,r_{n-1}\mid p). \]

作者将其解释为:\(r_n\) 的单独 surprise,减去先前回答让它变得可预测的量;并据此说高 \(a_n\) 要求回答既 individually surprising、又未被其他回答预测。

【阅读者推断】这里宜称为作者在固定 \(\theta\) 下的条件 surprisal 分解与解释,不可无条件等同于真实联合分布上严格、对称、非负的 Shannon mutual information。作者自己的 pairwise cross-mode 实验发现:Qwen 的 surprise-reduction matrix 显著不对称,而 GPT-2 有大量负的 cross-mode reduction;论文将此归因于 \(\theta\) 是不完美的 in-context reasoner(pp.15–17)。

2.5 coherence 与 Decan

【论文报告】先让每一个 \(r_i\) 只给定 \(p\) 而独立评分,定义:

\[ C=2^{-\frac1n\sum_{i=1}^{n}h_\theta(r_i\mid p)} =\frac{1}{\operatorname{PPL}_\theta(\pi,p)}. \tag{4} \]
\[ D_{\rm Can}=C\times a_n\quad\text{(bits/byte)}. \tag{5} \]

其中 \(C\) 是各 response 的 per-byte perplexity 几何均值之倒数。一条高 per-byte cross-entropy 的不连贯回答会拉低 \(C\),使 pure noise 不会因 \(a_n\) 高而被当作高 diversity(p.3 §§3.2–3.3)。作者在 Tevet/Qwen 实验中报告 48,705 responses 的 per-response bits/byte 5–95% 区间为 [0.65, 2.20],对应 \(C\in[.22,.64]\),9,741 response sets 的 mean per-set \(C=.42\)(p.3 脚注)。

【作者主张】\(D_{\rm Can}\) 是“plausibility-weighted residual diversity”。

【阅读者推断】乘积形式是 pragmatic design,不是作者从公理化信息论唯一推导出的量;论文也承认 slope、curve-shape、\(C\times E\) 或其他 weighting 都可能合理(p.8,p.18)。

3. 实施协议:格式、排列、pass 数和边界

3.1 输入格式

【论文报告】instruction-style 场景使用:

[prompt p]
Response A: [r1]
Response B: [r2]
...

用于 synthetic、mode-count 与 OLMo;回答标签超过 Z 后滚动至 AA、AB 等(p.12 §A.1)。Tevet–Berant 是 narrative completion,使用 [p][r1] [p][r2] ...,每个 response 前重复 prompt;累计 \(a_k\) 时排除重复 prompt prefix 的 token log-probs,只计 response tokens(p.12)。

3.2 随机排列与正确的平均方式

【论文报告】每个排列 \(\sigma\) 中,把 prompt 和全部回答拼接并做一次 causal forward;该 pass 的每一 response-token 区间恰好条件于 prompt、之前回答和格式 token,所以可同时得到该排列全部 \(a_k\)(图 1 p.3;图 3、§A.2 pp.12–13)。

【论文报告】最终 per-byte curve 为:

\[ \bar a_k=\frac1{|\Sigma|}\sum_{\sigma\in\Sigma} \frac{a_k^\sigma}{\lVert r_{\sigma(k)}\rVert}. \tag{6} \]

必须先对每一个排列中落在 slot \(k\) 的 response 作 byte 归一化,再平均;不能先分别平均 bits 与 bytes 后相除,否则会退化成 total-bits curve 的缩放版本(p.13 §A.3)。

【论文报告】scenario-level 实验默认 100 permutations,其他较大实验通常 50。作者比较 3 vs 100 permutations 时,在 GPT-2 与 Qwen 上均有 2/5 synthetic scenarios 改变排名;未扫中间值,因而未报告既省成本又可靠的最低 permutation 数(pp.13,17)。

3.3 完整 Decan 并非“单次前向”

【论文报告】每个排列的 conditional \(a_k\) curve 是一次长上下文 forward;但 \(C\) 无法从该拼接 pass 提取,因为后位 response 已看过先前回答。它要对每一条 \((p,r_i)\) 做一次独立短上下文 forward,且只需算一次、不随排列数增加(p.12 §A.2)。

组成 pass 数 / 一个 \((p,\{r_i\})\) tuple
\(a_k\) curve (
\(C\) \(n\) 次短上下文 pass,可 batch
论文的大实验例:(n=10, \Sigma

【论文报告】作者给出 causal-attention FLOPs 标度 \(O((|p|+n\bar L_{\rm tok})^2)\) / permutation;独立排列可以单 GPU batch,长上下文 passes 主导 wall-clock(p.12)。

【阅读者推断】“one forward pass per permutation”可以成立;“完整 \(D_{\rm Can}\) 只需一次前向”不成立。

3.4 boundary handling

【论文报告】Qwen 若把 response 最后一个 . 与后续 \n\n 合并为一个 .+newline token,作者的 character-span-overlap boundary detector 将该 token 归给 response。这会把预测 separator 的小部分 cross-entropy 计入分子,而分母仍为 response literal bytes。tests/test_response_boundaries.py 验证边界规则,但作者未测该偏差在已报数字中的量级(p.17 §B.5)。

4. Synthetic 验证:设计、成功处与反例

【论文报告】五种构造场景为:pure noise(随机 ASCII)、multi-incoherent(5 modes、模板内词序打乱)、multi-mode coherent(5 coherent modes,如 recipe/poem/code)、one-mode(同内容 paraphrase)及 mixed(coherent 与 incoherent 混合)。每场景 5 prompts、每 prompt 10 responses、100 permutations、seed 42(p.13 §B.2)。

场景 预测 \(D_{\rm Can}\) GPT-2 124M Qwen2.5-3B
Pure noise low .04 .05
Multi-mode incoherent low .19 .29
Multi-mode coherent high .26 .19
One-mode low .10 .09
Mixed mid .52 .41

表:Table 1(p.4)。

【论文报告】\(C\) 确实压低 pure noise 与 multi-incoherent,且 \(D_{\rm Can}\) 在两模型都将 multi-mode coherent 排在 one-mode 之上(p.14 Table 5)。但预测并非普遍实现:mixed 在两模型上反而最高;Qwen 还把 multi-mode incoherent (.29) 排在 multi-mode coherent (.19) 之上。论文解释为 Qwen 识别到了“scrambled template”的共享结构,建议模糊情形报告完整 curve,而非仅终点(pp.3–4,14)。

【阅读者推断】synthetic 实验支持 \(C\) 是有用的噪声抑制项,但同时是对“单一 \(C\times a_n\) 可稳定排序各种多样性结构”这一强主张的直接反例。

5. Tevet–Berant Diversity-Eval:人类标注验证

5.1 数据、设置与 OCA

【论文报告】使用 Qwen2.5-3B base、completion format、50 permutations;评 McDiv 6,002 sets(no_hds)、McDiv_nuggets 3,069(no_hds)和 ConTest 670(with_hds),每 set 有 5 个 MTurk worker-written responses 与二元 high/low diversity label(p.5 §5)。

【论文报告】报告 Spearman \(\rho\)、OCA 与 ROC AUC。OCA(optimal classification accuracy)定义为:用一维 metric threshold分开低/高多样性 set 所能达到的最佳 accuracy(p.5);它不是固定阈值 accuracy,也不是 F1。

5.2 全部二元 benchmark 数字

表中单元格为 \(\rho\)/OCA;\(C a_n\)\(D_{\rm Can}\)。全部来自 Table 2(p.6)。

数据 / metric prompt_gen resp_gen story_gen
ConTest (200, with_hds)
\(C a_n\)(ours) .584/.785 .391/.668 .686/.828
\(a_n\)(ours) .444/.715 .274/.641 .387/.684
\(C\)(ours) .214/.625 −.001/.555 .247/.632
SentBERT .682/.815 .591/.791 .770/.896
BERTsts .646/.820 .463/.714 .601/.780
distinct-n .333/.675 .346/.677 .573/.772
McDiv_nuggets (约 1K, no_hds)
\(C a_n\)(ours) .636/.785 .345/.649 .317/.634
\(a_n\)(ours) .487/.705 .225/.619 .124/.557
\(C\)(ours) .138/.567 .082/.545 .251/.643
SentBERT .728/.850 .532/.758 .633/.803
BERTsts .683/.830 .393/.676 .344/.638
distinct-n −.003/.514 −.002/.507 −.002/.510
McDiv full (约 2K, no_hds)
\(C a_n\)(ours) .729/.846 .500/.724 .523/.717
\(a_n\)(ours) .617/.781 .432/.698 .402/.668
\(C\)(ours) .138/.565 −.007/.512 .171/.594
SentBERT .796/.897 .678/.830 .753/.867
BERTsts .780/.893 .614/.781 .571/.740
distinct-n .476/.746 .517/.738 .535/.744

【论文报告】headline McDiv full / prompt_gen 为 \(D_{\rm Can}\) \(\rho=.729\)、OCA=.846、ROC-AUC=.921;SentBERT 为 \(.796,.897\)(pp.5–6)。二者 OCA 的绝对差是 .051;不要把论文所说跨任务“3.7%–21.0% behind”误写成该 headline 的 3.7 个百分点差距。

5.3 DecTest 与 benchmark 局限

【论文报告】DecTest 的“标签”是 sampling temperature,而非人类多样性判断。作者仅为与 Tevet–Berant 对齐而报告,且明确认为它不是 creative diversity 的验证;\(a_n\) 在 prompt_gen / resp_gen / story_gen 的 \(\rho\) 为 .932/.924/.779,\(C a_n\) 为 .847/.771/.763(p.6 Table 3)。

【论文报告】McDiv_nuggets 的构造方式存在混杂:worker 先写五个不同 continuation,后自选其中一个并作五次保内容的 paraphrase。低多样性组的自选结局往往更具体/戏剧化,因而本身更令 \(\theta\) 惊讶;\(C\) 在该 benchmark 上的一部分收益可能来自这个 construction confound(p.5,Appendix E pp.22–25)。

6. OLMo-2-7B 后训练 case study

6.1 样本与预处理协议

【论文报告】比较 OLMo-2-1124-7B 的四个 released stages:pretrained Base、SFT、DPO、最终 RLVR-tuned Instruct(p.5 §6)。

项目 设置
prompt sets AlpacaFarm 200(从 805 prompt set 的 seed=42 subsample);NoveltyBench curated 100
generation 每 prompt × stage \(K=10\);temperature 1.0、top-p 1.0、max_new_tokens 100
输入 Base 直接用 raw prompt;SFT/DPO/Instruct 用各自 chat template
reader \(\theta\) Qwen2.5-3B base;25 permutations
comparison metrics EAD、distinct-n(\(n=1\ldots5\) 平均)、SentBERT similarity-to-diversity reduction

来源:pp.5–6。

【论文报告】为控制 per-byte 长度效应,作者把每个 (stage,prompt) 的 40 条回答截至该组共同最小 UTF-8 byte length,再重新 tokenize;共同长度 <50 bytes 的 prompt 被丢弃。保留 AlpacaEval 150/200、NB-curated 39/100,共丢 111/300 prompts(pp.5–8,p.20)。

6.2 预注册检验与精确结果

【论文报告】作者称预注册三项单侧配对 Wilcoxon signed-rank tests,并对三项做 Bonferroni family-wise correction(\(\alpha=.05/3\)):H1a Base>SFT,H1b SFT>DPO,H1c Base>RLVR。DPO vs RLVR 是未预设方向的探索性双侧 H1′,未校正,非 load-bearing claim(p.6)。

数据集 / stage \(D_{\rm Can}\) mean std n
AlpacaEval Base .481 .038 150
AlpacaEval SFT .329 .084 150
AlpacaEval DPO .286 .072 150
AlpacaEval Instruct (RLVR) .281 .071 150
NB-curated Base .481 .030 39
NB-curated SFT .369 .085 39
NB-curated DPO .312 .082 39
NB-curated Instruct (RLVR) .303 .086 39
数据集 / contrast \(\Delta\) paired \(d_z\) \(p\)
Alpaca Base>SFT .151 1.615 \(3.4\times10^{-24}\) Bonf.
Alpaca SFT>DPO .044 .675 \(1.7\times10^{-13}\) Bonf.
Alpaca Base>RLVR .200 2.425 \(5.2\times10^{-26}\) Bonf.
Alpaca DPO\(\ne\)RLVR (H1′) .005 .227 .004,未校正双侧
NB Base>SFT .112 1.212 \(4.1\times10^{-8}\) Bonf.
NB SFT>DPO .057 .957 \(2.8\times10^{-6}\) Bonf.
NB Base>RLVR .179 1.889 \(2.3\times10^{-10}\) Bonf.
NB DPO\(\ne\)RLVR (H1′) .010 .375 .028,未校正双侧

表:Table 4(p.8)。

【论文报告】图 2 显示 length-matched AlpacaEval 子集上,每一 later stage 的 \(\bar a_k\)\(k\ge2\) 都低于 Base,per-prompt \(D_{\rm Can}\) 分布随管线推进移向低值(p.7)。作者还称未截断的全部 200+100 prompts 上单调结果仍在、各预注册 contrast 均 Bonferroni-significant at \(p<10^{-13}\),但 PDF 未给出未截断版本的完整均值、标准差、\(d_z\) 或精确 \(p\),只指向仓库文件(p.20)。

【阅读者推断】同一 checkpoint 谱系的 paired 对比加强了该特定管线内的证据,但没有随机分配“是否后训练”,也没有多个独立模型家族或多种对齐法;宜避免把结果写成“后训练必然杀死多样性”或普遍、确定的对齐代价。

7. reader model 敏感性

【论文报告】多样性在此定义为 (responses, prompt, scoring model \(\theta\)) 的属性;若差异超出 \(\theta\) 的 context discrimination 能力,metric 会低估;不同 \(\theta\) 的 curves 不能直接比较(pp.2–3,7)。

【论文报告】Appendix G 以 Qwen3-30B-A3B-Base(30B MoE、每 token 约 3B active)重跑 Tevet:同 setup、completion format、50 permutations、无 fine-tuning(p.26)。在 12 个 binary tasks 中,Qwen2.5-3B 赢 11 个;平均 \(\Delta\)AUC=-.013,唯一 Qwen3 边际胜是 ConTest prompt_gen .837→.842(+.005)(pp.26、28)。

binary task(按 Table 9 次序) Qwen2.5-3B AUC Qwen3-30B AUC \(\Delta\)AUC
McDiv prompt / resp / story .921/.788/.802 .915/.779/.785 −.006/−.009/−.017
McDiv_nuggets 六项 .867/.895/.699/.753/.683/.734 .855/.878/.687/.746/.669/.717 −.012/−.017/−.012/−.007/−.014/−.017
ConTest prompt / resp / story .837/.726/.896 .842/.692/.877 +.005/−.034/−.019

【论文报告】DecTest 六项 \(\rho\) 从 Qwen2.5 的 .842/.845/.771/.760/.763/.785 变为 Qwen3 的 .877/.875/.804/.777/.771/.785(p.28)。作者说明 Qwen3 run 没有在主实验 bug fix 后重跑,因此此 scaling 比较应视为 preliminary(p.26)。

8. 限制、未报告项与适用边界

9. 读者判断

【阅读者推断】Decan 最值得保留的贡献不是“得到一个终极多样性分数”,而是把 cross-response conditional surprisal curve 当作可诊断对象,并明确展示了 endpoint scalar 的失败情形(mixed 与 Qwen 的 incoherent multi-mode)。实际使用应同时报告 \(a_k\) curve、\(C\)、response length、\(n\)\(|\Sigma|\)、format、reader \(\theta\) 与是否 length-match。

【阅读者推断】把 \(\theta\) 当作 reader 是实用的、模型相对的测量选择,不是把它当作人类多样性真值。若任务关心人类判断或外部效度,SentBERT / 人类 benchmark 仍是必要参照;论文自己显示 reader scaling 没有自动提升二元 discrimination。

【阅读者推断】OLMo 结果可作为“同一管线中多样性监测信号”的证据。若要主张跨模型的后训练因果效应,需要多个独立 base families、预先固定 metric、完整未截断样本的报告、对长度与 chat-template 差异的稳健性分析,以及与人工创意/质量判断的外部验证。

10. 关键原文定位

11. 最终阅读者判断

Decan 是一个有诊断价值但尚未成为强通用基线的多样性度量:完整条件 surprisal 曲线揭示了 embedding 指标看不到的“后续回答是否仍不可预测”,但 endpoint 标量在合成反例中失序、在人类标签任务上又稳定落后 SentBERT。应以中等信心接受 OLMo 单一管线中的下降现象,以低信心接受任何“后训练普遍压缩创意”的外推;严谨使用时必须连同 reader、长度处理、排列数、完整曲线和人工外部效度一起报告。【阅读者推断】