paper_type: "方法与系统;实证与评价" type_confidence: 高 reading_depth: 深度复现 title: "I’ve Seen How This Goes: Characterizing the Diversity of LLM Generations and Human Writing via Progressive Conditional Surprise" authors: "Matthew Khoriaty, David Williams-King, Shi Feng" year: 2026 source: "arXiv:2606.01811v1;Accepted at ICML 2026 Workshop on Human-AI Co-Creativity(non-archival)" pdf: "29_progressive_conditional_surprise.pdf" pages: 28 code: "https://github.com/AMindToThink/icl-diversity"
Progressive Conditional Surprise / Decan 精读
一句话结论
【论文报告】本文把固定 base reader model \(\theta\) 在看过同一 prompt 的先前回答后、对后续回答仍保留的条件 surprisal 作为多样性信号,并以 \(D_{\rm Can}=C\times a_n\) 用独立可读性权重 \(C\) 抑制纯噪声;它在 Tevet–Berant 人类标注基准上接近但落后 SentBERT,并在一个 OLMo-2-7B 的 Base→SFT→DPO→RLVR checkpoint 管线中呈单调下降(p.1,§§3、5–6)。
核心问题
能否不训练额外分类器、不用 embedding、参考语料或人工标签,而只读取一个预训练语言模型 \(\theta\) 的 token log-probabilities,衡量一组人类或模型回答在 \(\theta\) 看来是否仍互不易预测,并将纯噪声与连贯的多样性区分开?(p.1,§§1–3)
TL;DR
- 【实验方法】对同一 prompt 的 \(n\) 个回答随机重排;每个排列把 prompt 与全部回答拼接,单次 causal-LM forward 同时读出每个位置的条件 surprisal,再按 UTF-8 bytes 归一化并跨排列平均。另以 \(n\) 个短前向独立计算 coherence \(C\)(pp.2–3,12–13)。
- 【实验结果】在 McDiv full / prompt_gen,\(C\times a_n\) 得到 \(\rho=.729\)、OCA=.846、ROC-AUC=.921;SentBERT 为 \(.796,.897\)(pp.5–6)。在 length-matched OLMo 子集,Base→SFT→DPO→RLVR 的均值在两个 prompt set 都单调下降,三项预注册单侧检验经 Bonferroni 后显著(pp.6–8)。
- 【作者主张】\(a_n\) 是“单个响应的 surprise 减去先前响应使它可预测的量”,而 \(C\) 使 random noise 不会被记为 high diversity;该框架是 embedding metric 的原则性补充而非替代(pp.2–3,7)。
- 【阅读者推断】这些结果支持“在这个 scorer、这两个 prompt set 与这个 OLMo checkpoint 序列中,后续 checkpoint 的 \(D_{\rm Can}\) 较低”,但不足以证明所有后训练、RLHF 或对齐都会因果地降低一般意义的创意多样性。
1. 论文身份与证据范围
【论文报告】作者为 Matthew Khoriaty、David Williams-King(ERA Fellowship)和 Shi Feng(George Washington University)。PDF 标为 arXiv:2606.01811v1 [cs.CL] 1 Jun 2026,共 28 页;p.1 注明已被 ICML 2026 Workshop on Human-AI Co-Creativity 接收,但为 non-archival。论文称代码与数据公开于上述仓库(p.1 脚注、p.13 脚注)。
【阅读者推断】这是 workshop 非归档版本,且关键的 OLMo case study 是单一模型家族与两套 prompt 的组合;应把它视为有明确原型价值的实证方法论文,而非对多样性测量的定论。
2. 方法:从 token 概率到 per-byte Decan
2.1 记号与总 surprisal
【论文报告】令 \(p\) 为 prompt,\(r_1,\ldots,r_n\sim\pi(\cdot\mid p)\) 为待评 policy 的独立回答,\(\theta\) 为可取得 per-token log-probabilities 的 trusted base model,\(|r|_{\rm tok}\) 为 token 数,\(\lVert r\rVert\) 为 UTF-8 编码字节数(p.2 §2)。对一个回答,定义总 surprisal:
【论文报告】式 (1) 单位是 bits。作者称因链式法则,总 bits 不依赖 tokenizer 如何将字符串分解;这不是说每个 token 的概率本身不变(p.2)。
2.2 byte 归一化:何时发生、为何发生
【论文报告】作者再定义 per-byte rate:
分母是 UTF-8 byte count,不是 token count;作者选择它以使不同词表的 base model 可比较,并称其在实验中比 total bits 表现更好,但没有研究原因(p.2)。
【阅读者推断】不能把“per-byte”说成自动消除长度影响。作者后来明确指出,causal LM 随 response 内上下文增加会降低后面 token 的交叉熵,故 per-byte 量仍不具备 response-length invariance,OLMo 主分析需要 length matching(p.20)。
2.3 progressive conditional surprise \(a_k\)
【论文报告】原始定义为:
式 (3) 首先是总 bits的条件 surprisal;随后每个 \(a_k\) 才除以 \(\lVert r_k\rVert\),成为 per-byte curve。除非另注,后文使用 per-byte quantities(p.2 §3.1)。因此,把式 (3) 本身直接写成 per-byte 公式是不精确的。
【作者主张】若回答共享 pattern、style 或 topic regularity,\(\theta\) 的 in-context learning 会随着见到更多回答降低后续 surprisal;rich coherent diversity 应缓慢下降至较高正 floor,一模态重复应快速接近零,pure noise 应在高位近似平坦(p.2 §3.1)。完整 \(a_k\) curve 比只看终点更能区分这些情形。
2.4 \(a_n=H-I\) 的正确降格
【论文报告】论文 p.2 §3.1 的确明确写道:
作者将其解释为:\(r_n\) 的单独 surprise,减去先前回答让它变得可预测的量;并据此说高 \(a_n\) 要求回答既 individually surprising、又未被其他回答预测。
【阅读者推断】这里宜称为作者在固定 \(\theta\) 下的条件 surprisal 分解与解释,不可无条件等同于真实联合分布上严格、对称、非负的 Shannon mutual information。作者自己的 pairwise cross-mode 实验发现:Qwen 的 surprise-reduction matrix 显著不对称,而 GPT-2 有大量负的 cross-mode reduction;论文将此归因于 \(\theta\) 是不完美的 in-context reasoner(pp.15–17)。
2.5 coherence 与 Decan
【论文报告】先让每一个 \(r_i\) 只给定 \(p\) 而独立评分,定义:
其中 \(C\) 是各 response 的 per-byte perplexity 几何均值之倒数。一条高 per-byte cross-entropy 的不连贯回答会拉低 \(C\),使 pure noise 不会因 \(a_n\) 高而被当作高 diversity(p.3 §§3.2–3.3)。作者在 Tevet/Qwen 实验中报告 48,705 responses 的 per-response bits/byte 5–95% 区间为 [0.65, 2.20],对应 \(C\in[.22,.64]\),9,741 response sets 的 mean per-set \(C=.42\)(p.3 脚注)。
【作者主张】\(D_{\rm Can}\) 是“plausibility-weighted residual diversity”。
【阅读者推断】乘积形式是 pragmatic design,不是作者从公理化信息论唯一推导出的量;论文也承认 slope、curve-shape、\(C\times E\) 或其他 weighting 都可能合理(p.8,p.18)。
3. 实施协议:格式、排列、pass 数和边界
3.1 输入格式
【论文报告】instruction-style 场景使用:
[prompt p]
Response A: [r1]
Response B: [r2]
...
用于 synthetic、mode-count 与 OLMo;回答标签超过 Z 后滚动至 AA、AB 等(p.12 §A.1)。Tevet–Berant 是 narrative completion,使用 [p][r1] [p][r2] ...,每个 response 前重复 prompt;累计 \(a_k\) 时排除重复 prompt prefix 的 token log-probs,只计 response tokens(p.12)。
3.2 随机排列与正确的平均方式
【论文报告】每个排列 \(\sigma\) 中,把 prompt 和全部回答拼接并做一次 causal forward;该 pass 的每一 response-token 区间恰好条件于 prompt、之前回答和格式 token,所以可同时得到该排列全部 \(a_k\)(图 1 p.3;图 3、§A.2 pp.12–13)。
【论文报告】最终 per-byte curve 为:
必须先对每一个排列中落在 slot \(k\) 的 response 作 byte 归一化,再平均;不能先分别平均 bits 与 bytes 后相除,否则会退化成 total-bits curve 的缩放版本(p.13 §A.3)。
【论文报告】scenario-level 实验默认 100 permutations,其他较大实验通常 50。作者比较 3 vs 100 permutations 时,在 GPT-2 与 Qwen 上均有 2/5 synthetic scenarios 改变排名;未扫中间值,因而未报告既省成本又可靠的最低 permutation 数(pp.13,17)。
3.3 完整 Decan 并非“单次前向”
【论文报告】每个排列的 conditional \(a_k\) curve 是一次长上下文 forward;但 \(C\) 无法从该拼接 pass 提取,因为后位 response 已看过先前回答。它要对每一条 \((p,r_i)\) 做一次独立短上下文 forward,且只需算一次、不随排列数增加(p.12 §A.2)。
| 组成 | pass 数 / 一个 \((p,\{r_i\})\) tuple |
|---|---|
| \(a_k\) curve | ( |
| \(C\) | \(n\) 次短上下文 pass,可 batch |
| 论文的大实验例:(n=10, | \Sigma |
【论文报告】作者给出 causal-attention FLOPs 标度 \(O((|p|+n\bar L_{\rm tok})^2)\) / permutation;独立排列可以单 GPU batch,长上下文 passes 主导 wall-clock(p.12)。
【阅读者推断】“one forward pass per permutation”可以成立;“完整 \(D_{\rm Can}\) 只需一次前向”不成立。
3.4 boundary handling
【论文报告】Qwen 若把 response 最后一个 . 与后续 \n\n 合并为一个 .+newline token,作者的 character-span-overlap boundary detector 将该 token 归给 response。这会把预测 separator 的小部分 cross-entropy 计入分子,而分母仍为 response literal bytes。tests/test_response_boundaries.py 验证边界规则,但作者未测该偏差在已报数字中的量级(p.17 §B.5)。
4. Synthetic 验证:设计、成功处与反例
【论文报告】五种构造场景为:pure noise(随机 ASCII)、multi-incoherent(5 modes、模板内词序打乱)、multi-mode coherent(5 coherent modes,如 recipe/poem/code)、one-mode(同内容 paraphrase)及 mixed(coherent 与 incoherent 混合)。每场景 5 prompts、每 prompt 10 responses、100 permutations、seed 42(p.13 §B.2)。
| 场景 | 预测 \(D_{\rm Can}\) | GPT-2 124M | Qwen2.5-3B |
|---|---|---|---|
| Pure noise | low | .04 | .05 |
| Multi-mode incoherent | low | .19 | .29 |
| Multi-mode coherent | high | .26 | .19 |
| One-mode | low | .10 | .09 |
| Mixed | mid | .52 | .41 |
表:Table 1(p.4)。
【论文报告】\(C\) 确实压低 pure noise 与 multi-incoherent,且 \(D_{\rm Can}\) 在两模型都将 multi-mode coherent 排在 one-mode 之上(p.14 Table 5)。但预测并非普遍实现:mixed 在两模型上反而最高;Qwen 还把 multi-mode incoherent (.29) 排在 multi-mode coherent (.19) 之上。论文解释为 Qwen 识别到了“scrambled template”的共享结构,建议模糊情形报告完整 curve,而非仅终点(pp.3–4,14)。
【阅读者推断】synthetic 实验支持 \(C\) 是有用的噪声抑制项,但同时是对“单一 \(C\times a_n\) 可稳定排序各种多样性结构”这一强主张的直接反例。
5. Tevet–Berant Diversity-Eval:人类标注验证
5.1 数据、设置与 OCA
【论文报告】使用 Qwen2.5-3B base、completion format、50 permutations;评 McDiv 6,002 sets(no_hds)、McDiv_nuggets 3,069(no_hds)和 ConTest 670(with_hds),每 set 有 5 个 MTurk worker-written responses 与二元 high/low diversity label(p.5 §5)。
【论文报告】报告 Spearman \(\rho\)、OCA 与 ROC AUC。OCA(optimal classification accuracy)定义为:用一维 metric threshold分开低/高多样性 set 所能达到的最佳 accuracy(p.5);它不是固定阈值 accuracy,也不是 F1。
5.2 全部二元 benchmark 数字
表中单元格为 \(\rho\)/OCA;\(C a_n\) 即 \(D_{\rm Can}\)。全部来自 Table 2(p.6)。
| 数据 / metric | prompt_gen | resp_gen | story_gen |
|---|---|---|---|
| ConTest (200, with_hds) | |||
| \(C a_n\)(ours) | .584/.785 | .391/.668 | .686/.828 |
| \(a_n\)(ours) | .444/.715 | .274/.641 | .387/.684 |
| \(C\)(ours) | .214/.625 | −.001/.555 | .247/.632 |
| SentBERT | .682/.815 | .591/.791 | .770/.896 |
| BERTsts | .646/.820 | .463/.714 | .601/.780 |
| distinct-n | .333/.675 | .346/.677 | .573/.772 |
| McDiv_nuggets (约 1K, no_hds) | |||
| \(C a_n\)(ours) | .636/.785 | .345/.649 | .317/.634 |
| \(a_n\)(ours) | .487/.705 | .225/.619 | .124/.557 |
| \(C\)(ours) | .138/.567 | .082/.545 | .251/.643 |
| SentBERT | .728/.850 | .532/.758 | .633/.803 |
| BERTsts | .683/.830 | .393/.676 | .344/.638 |
| distinct-n | −.003/.514 | −.002/.507 | −.002/.510 |
| McDiv full (约 2K, no_hds) | |||
| \(C a_n\)(ours) | .729/.846 | .500/.724 | .523/.717 |
| \(a_n\)(ours) | .617/.781 | .432/.698 | .402/.668 |
| \(C\)(ours) | .138/.565 | −.007/.512 | .171/.594 |
| SentBERT | .796/.897 | .678/.830 | .753/.867 |
| BERTsts | .780/.893 | .614/.781 | .571/.740 |
| distinct-n | .476/.746 | .517/.738 | .535/.744 |
【论文报告】headline McDiv full / prompt_gen 为 \(D_{\rm Can}\) \(\rho=.729\)、OCA=.846、ROC-AUC=.921;SentBERT 为 \(.796,.897\)(pp.5–6)。二者 OCA 的绝对差是 .051;不要把论文所说跨任务“3.7%–21.0% behind”误写成该 headline 的 3.7 个百分点差距。
5.3 DecTest 与 benchmark 局限
【论文报告】DecTest 的“标签”是 sampling temperature,而非人类多样性判断。作者仅为与 Tevet–Berant 对齐而报告,且明确认为它不是 creative diversity 的验证;\(a_n\) 在 prompt_gen / resp_gen / story_gen 的 \(\rho\) 为 .932/.924/.779,\(C a_n\) 为 .847/.771/.763(p.6 Table 3)。
【论文报告】McDiv_nuggets 的构造方式存在混杂:worker 先写五个不同 continuation,后自选其中一个并作五次保内容的 paraphrase。低多样性组的自选结局往往更具体/戏剧化,因而本身更令 \(\theta\) 惊讶;\(C\) 在该 benchmark 上的一部分收益可能来自这个 construction confound(p.5,Appendix E pp.22–25)。
6. OLMo-2-7B 后训练 case study
6.1 样本与预处理协议
【论文报告】比较 OLMo-2-1124-7B 的四个 released stages:pretrained Base、SFT、DPO、最终 RLVR-tuned Instruct(p.5 §6)。
| 项目 | 设置 |
|---|---|
| prompt sets | AlpacaFarm 200(从 805 prompt set 的 seed=42 subsample);NoveltyBench curated 100 |
| generation | 每 prompt × stage \(K=10\);temperature 1.0、top-p 1.0、max_new_tokens 100 |
| 输入 | Base 直接用 raw prompt;SFT/DPO/Instruct 用各自 chat template |
| reader \(\theta\) | Qwen2.5-3B base;25 permutations |
| comparison metrics | EAD、distinct-n(\(n=1\ldots5\) 平均)、SentBERT similarity-to-diversity reduction |
来源:pp.5–6。
【论文报告】为控制 per-byte 长度效应,作者把每个 (stage,prompt) 的 40 条回答截至该组共同最小 UTF-8 byte length,再重新 tokenize;共同长度 <50 bytes 的 prompt 被丢弃。保留 AlpacaEval 150/200、NB-curated 39/100,共丢 111/300 prompts(pp.5–8,p.20)。
6.2 预注册检验与精确结果
【论文报告】作者称预注册三项单侧配对 Wilcoxon signed-rank tests,并对三项做 Bonferroni family-wise correction(\(\alpha=.05/3\)):H1a Base>SFT,H1b SFT>DPO,H1c Base>RLVR。DPO vs RLVR 是未预设方向的探索性双侧 H1′,未校正,非 load-bearing claim(p.6)。
| 数据集 / stage | \(D_{\rm Can}\) mean | std | n |
|---|---|---|---|
| AlpacaEval Base | .481 | .038 | 150 |
| AlpacaEval SFT | .329 | .084 | 150 |
| AlpacaEval DPO | .286 | .072 | 150 |
| AlpacaEval Instruct (RLVR) | .281 | .071 | 150 |
| NB-curated Base | .481 | .030 | 39 |
| NB-curated SFT | .369 | .085 | 39 |
| NB-curated DPO | .312 | .082 | 39 |
| NB-curated Instruct (RLVR) | .303 | .086 | 39 |
| 数据集 / contrast | \(\Delta\) | paired \(d_z\) | \(p\) |
|---|---|---|---|
| Alpaca Base>SFT | .151 | 1.615 | \(3.4\times10^{-24}\) Bonf. |
| Alpaca SFT>DPO | .044 | .675 | \(1.7\times10^{-13}\) Bonf. |
| Alpaca Base>RLVR | .200 | 2.425 | \(5.2\times10^{-26}\) Bonf. |
| Alpaca DPO\(\ne\)RLVR (H1′) | .005 | .227 | .004,未校正双侧 |
| NB Base>SFT | .112 | 1.212 | \(4.1\times10^{-8}\) Bonf. |
| NB SFT>DPO | .057 | .957 | \(2.8\times10^{-6}\) Bonf. |
| NB Base>RLVR | .179 | 1.889 | \(2.3\times10^{-10}\) Bonf. |
| NB DPO\(\ne\)RLVR (H1′) | .010 | .375 | .028,未校正双侧 |
表:Table 4(p.8)。
【论文报告】图 2 显示 length-matched AlpacaEval 子集上,每一 later stage 的 \(\bar a_k\) 在 \(k\ge2\) 都低于 Base,per-prompt \(D_{\rm Can}\) 分布随管线推进移向低值(p.7)。作者还称未截断的全部 200+100 prompts 上单调结果仍在、各预注册 contrast 均 Bonferroni-significant at \(p<10^{-13}\),但 PDF 未给出未截断版本的完整均值、标准差、\(d_z\) 或精确 \(p\),只指向仓库文件(p.20)。
【阅读者推断】同一 checkpoint 谱系的 paired 对比加强了该特定管线内的证据,但没有随机分配“是否后训练”,也没有多个独立模型家族或多种对齐法;宜避免把结果写成“后训练必然杀死多样性”或普遍、确定的对齐代价。
7. reader model 敏感性
【论文报告】多样性在此定义为 (responses, prompt, scoring model \(\theta\)) 的属性;若差异超出 \(\theta\) 的 context discrimination 能力,metric 会低估;不同 \(\theta\) 的 curves 不能直接比较(pp.2–3,7)。
【论文报告】Appendix G 以 Qwen3-30B-A3B-Base(30B MoE、每 token 约 3B active)重跑 Tevet:同 setup、completion format、50 permutations、无 fine-tuning(p.26)。在 12 个 binary tasks 中,Qwen2.5-3B 赢 11 个;平均 \(\Delta\)AUC=-.013,唯一 Qwen3 边际胜是 ConTest prompt_gen .837→.842(+.005)(pp.26、28)。
| binary task(按 Table 9 次序) | Qwen2.5-3B AUC | Qwen3-30B AUC | \(\Delta\)AUC |
|---|---|---|---|
| McDiv prompt / resp / story | .921/.788/.802 | .915/.779/.785 | −.006/−.009/−.017 |
| McDiv_nuggets 六项 | .867/.895/.699/.753/.683/.734 | .855/.878/.687/.746/.669/.717 | −.012/−.017/−.012/−.007/−.014/−.017 |
| ConTest prompt / resp / story | .837/.726/.896 | .842/.692/.877 | +.005/−.034/−.019 |
【论文报告】DecTest 六项 \(\rho\) 从 Qwen2.5 的 .842/.845/.771/.760/.763/.785 变为 Qwen3 的 .877/.875/.804/.777/.771/.785(p.28)。作者说明 Qwen3 run 没有在主实验 bug fix 后重跑,因此此 scaling 比较应视为 preliminary(p.26)。
8. 限制、未报告项与适用边界
- 【论文报告】\(D=C\times a_n\) 在看过完整 Tevet 后选定、没有 holdout;故 Tevet 成绩可能有乐观偏差。OLMo 在 metric 固定后评分,是较独立的验证(p.7)。
- 【论文报告】Tevet 九个 binary tasks 上 \(C\times a_n\) 落后 SentBERT 3.7%–21.0%(论文的跨任务相对差距表述);扩大 reader 至 Qwen3 未弥补差距。作者定位为 complement,而非 replacement(p.7)。
- 【论文报告】\(n\) 是 measurement parameter:太小会让 \(\theta\) 未利用结构而高估多样性,太大时有限 modes 的 policy 最终也会向零降;比较必须固定 \(n\),不存在可无条件视作不可约 floor 的真正 \(a_\infty\)(p.13)。
- 【论文报告】per-byte length matching 丢掉 111/300 prompts;被丢 prompt 反映的 stage-specific behavior 本身没有测量(p.20)。
- 【论文报告】单个 \(\theta\) 遇到长 context out-of-distribution 时可能产生 non-monotone curves;token-level ensembling 只是 future work,未验证(p.20)。
- 【论文报告】作者未系统评估 prompt-format optimization、metric disagreement cases 或 \(C^\alpha a_n\) 等替代 weighting(pp.18,20–21)。
- 【论文报告】未报告实际 GPU 型号、GPU-hours、wall-clock、throughput、显存、总 FLOPs/token、美元/API 成本或碳成本;只给出渐近 FLOPs 标度与 pass 数(p.12)。
- 【论文报告】boundary token 的 separator 泄漏偏差未量化(p.17)。
9. 读者判断
【阅读者推断】Decan 最值得保留的贡献不是“得到一个终极多样性分数”,而是把 cross-response conditional surprisal curve 当作可诊断对象,并明确展示了 endpoint scalar 的失败情形(mixed 与 Qwen 的 incoherent multi-mode)。实际使用应同时报告 \(a_k\) curve、\(C\)、response length、\(n\)、\(|\Sigma|\)、format、reader \(\theta\) 与是否 length-match。
【阅读者推断】把 \(\theta\) 当作 reader 是实用的、模型相对的测量选择,不是把它当作人类多样性真值。若任务关心人类判断或外部效度,SentBERT / 人类 benchmark 仍是必要参照;论文自己显示 reader scaling 没有自动提升二元 discrimination。
【阅读者推断】OLMo 结果可作为“同一管线中多样性监测信号”的证据。若要主张跨模型的后训练因果效应,需要多个独立 base families、预先固定 metric、完整未截断样本的报告、对长度与 chat-template 差异的稳健性分析,以及与人工创意/质量判断的外部验证。
10. 关键原文定位
- p.1,Abstract / §1:问题、\(D_{\rm Can}=C\times a_n\)、无 embedding/reference corpus/human labels、McDiv headline、OLMo 四阶段摘要、non-archival 状态。
- p.2,§§2–3.1:token-level total bits、UTF-8 byte normalization、式 (1)–(3)、\(a_n=H_\theta-I_\theta\) 的原文表述与 curve intuition。
- p.3,§§3.2–3.3、Figure 1:\(C\)、\(D_{\rm Can}\)、完整双轨 pipeline 与每排列 single pass 的范围。
- p.4,Table 1:五种 synthetic scenario 的预测与反例数值。
- pp.5–6,§§5–6、Tables 2–3:Tevet 数据、OCA 定义、所有 binary baselines、DecTest 解释、OLMo 采样协议和假设。
- pp.7–8,Figure 2、Table 4、§7:OLMo curve、完整 mean/std/\(d_z\)/\(p\)、主限制。
- pp.12–13,Appendix A:format、60-pass 成本例、排列均值的正确形式、\(n\) 的选择与风险。
- pp.14、17,Appendix B:synthetic 分解、permutation sensitivity、boundary handling。
- pp.15–18,Appendix B:reader 的 cross-mode 不对称、理想信息论性质为何不可直接套用、替代 metric。
- p.20,Appendix B.6 / C:length matching、111/300 丢弃、未截断显著性的非完整报告、future work。
- pp.22–25,Appendix E:McDiv construction confound 的机制与例证。
- pp.26、28,Appendix G / Table 9:Qwen3 reader scaling 的完整结论与数值。
11. 最终阅读者判断
Decan 是一个有诊断价值但尚未成为强通用基线的多样性度量:完整条件 surprisal 曲线揭示了 embedding 指标看不到的“后续回答是否仍不可预测”,但 endpoint 标量在合成反例中失序、在人类标签任务上又稳定落后 SentBERT。应以中等信心接受 OLMo 单一管线中的下降现象,以低信心接受任何“后训练普遍压缩创意”的外推;严谨使用时必须连同 reader、长度处理、排列数、完整曲线和人工外部效度一起报告。【阅读者推断】