harness_evolve/notes/ref29_early-science-acceleration-gpt5.md

Early Science Acceleration Experiments with GPT-5

一句话总结:OpenAI 联合一批外部数学/物理/生物学家,用 17 个真实科研片段系统记录了"GPT-5(尤其 GPT-5 Pro)在一线研究中到底能做什么、在哪一环起作用、又在哪里翻车"——从"独立复现前沿已知结果"到"深度文献检索"到"人机结对推进",一直到 4 个由 GPT-5 贡献关键步骤、经人类严格验证的全新数学结果;核心主张不是"AI 会做科研",而是"在专家引导 + 人类验证的闭环里,GPT-5 已能把某些原本要数天到数月的工作压到几分钟到几小时"。


TL;DR 速览

tags: #AI4Science #GPT-5 #human-in-the-loop #literature-search #hallucination #verification #scaffolding #case-study

related: [[ref28_why-llms-arent-scientists-yet]](审慎面对照:为什么 LLM 还不是科学家)· [[ref11_scientistone]](全自动 AI Scientist 谱系,与本文"人机结对"取向相反)· [[ref09_meta-harness]](自动优化 harness)· [[ref17_self-harness]](模型自改 harness)· [[ref20_alphaevolve]](引言明确对比:目标函数可爬山 vs 通用问答)


摘要

AI 模型如 GPT-5 正成为科学家越来越有价值的工具,但许多人仍未意识到前沿 AI 的能力。我们呈现一组简短案例研究,其中 GPT-5 在数学、物理、天文、计算机科学、生物学和材料科学的进行中研究里产生了新的、具体的进展。作者们既强调 AI 在哪里加速了工作、又指出它在哪里不足;哪里省下了专家时间、哪里人类输入仍是关键。特别地,本文包含 4 个新的数学结果(经人类作者仔细验证),凸显 GPT-5 能帮助人类数学家解决此前未解的问题。这些贡献范围虽小,但含义深远——考虑到前沿 AI 的进步速度。

引言进一步给出立场:GPT-5 并不完美——"它会自信地犯错、顽固地为错误辩护、并在此过程中把自己(和我们)绕晕";结果对 prompt 和后续回复的细节敏感,难以复现。但作者也观察到真实进步:它能搜索广阔的概念空间、整合多源信息、快速迭代、不知疲倦地提出新想法、把模糊想法变成具体结果、并对给定思路做 sanity-check 或延伸。在某些领域(尤其文献检索)它常常是独一份地有效


1 背景与动机

1.1 为什么要写这样一份"田野记录"

过去几年 LLM 在写作、编程、规划上越来越有用;更近,它们开始能智力上贡献于科研。作者的判断是:GPT-5 已出现"早期迹象"——在专家引导下能提出有用想法、做深度文献检索、甚至产出完整的新证明。但学界对此认知严重滞后("many remain unaware")。因此本报告的定位不是提出新算法,而是用具体、可核验的真实案例,把"今天可能什么、什么仍遥不可及、以及对科研未来的含义"讲清楚。

[!TIP] 什么是 AI4Science(AI for Science)? 指用 AI(尤其大模型/深度学习)作为工具去加速或改变科学发现过程本身的研究范式,而非把科学当作 AI 的一个应用领域来"跑分"。它涵盖从蛋白质结构预测(AlphaFold)、材料/分子设计,到数学猜想探索、文献挖掘、实验设计等。本报告代表其中一个特定切片:通用对话模型(general-purpose,能回答任意查询)+ 人在环内(human-in-the-loop)的科研辅助,与"为单一目标函数做搜索优化"的 AlphaEvolve 路线(见下)形成对照。它关注的核心问题是"AI 在科研工作流的哪一环、以什么协作模式、能带来多少真实生产力",而非某个封闭 benchmark 的分数。

1.2 与 AlphaEvolve 路线的分界(作者主动划清)

引言里作者专门对比了 Google 的 AlphaEvolve(见 [[ref20_alphaevolve]]):

[!NOTE] AlphaEvolve 那篇"味道略有不同,因为它聚焦于有良好定义的目标函数、可以被爬山(hill-climb)的搜索问题。相比之下,我们(以及其他被引论文)聚焦的是一个通用系统,能回答任意类型的查询。两种方法是互补的,各自给科学家带来独特优势。"

这条分界很重要,它定义了本报告的适用边界:GPT-5 的价值在于"开放式、无明确目标函数、需要概念理解与跨域联想"的环节(文献检索、把模糊想法证成、找出思路为何行不通、给出非显然的证明步骤),而不是"给定评分函数、机械搜索最优"的场景——后者是 AlphaEvolve/进化式方法的地盘。

[!TIP] 相关工作与立场:这一波"AI 辅助科研"报告的坐标 本文并非孤例。引言列了一串同期同精神的工作 [FK25; DMN25; IX25; AM25; JR25; Sal25; Geo+25]。把它们放进本项目的坐标系:

工作 取向 与本文关系
本文 (ref29) 通用模型 + 人在环内 + 多学科真实案例 + 强调验证与边界 基准参照
AlphaEvolve [Geo+25 / ref20] 进化搜索 + 明确目标函数可爬山 引言明确划为"互补但不同"
[[ref28_why-llms-arent-scientists-yet]] 论证"LLM 还不是科学家"的能力缺口 审慎面对照:ref29 提供"能做什么"的正面证据,ref28 提供"缺什么"的分析,二者应对读
[[ref11_scientistone]] / AI Scientist 全自动闭环科研 Agent(自己提假设、跑实验、写论文) 取向相反:ref29 刻意保留人类掌舵与验证,不追求全自动
Gödel Test [FK25]、Malliavin-Stein [DMN25]、Salim 凸分析 [Sal25] 等 单领域深挖的 AI 辅助证明案例 同精神的"点",ref29 是覆盖多学科的"面"

本文的独特立场:既拒绝炒作(花大量篇幅记录失败与不可复现性),也拒绝虚无(拿出 4 个经验证的新结果)。它把论证锚定在"具体例子 + 人类验证 + 明确标注人类输入在哪",这是它比一般 marketing 材料可信得多的原因,也是它能和 ref28 对话的基础。


2 报告的框架:GPT-5 加速科学的四层类型学

全文的组织本身就是一个主张:GPT-5 在科研链条中的作用可按"介入深度"排成一个递进谱系。这是理解整份报告的骨架。

Chapter I   独立复现前沿已知结果   ← "它能不能重走发现之路?"(反事实加速)
     │        (训练数据里没有的新问题,看它能否自己走到答案)
     ▼
Chapter II  深度文献检索           ← "它最独一份好用的能力"
     │        (按概念而非关键词,跨学科/跨语言找回被遗忘的文献)
     ▼
Chapter III 人机结对推进           ← "把它当万能合作者融进日常工作流"
     │        (研究者出主意、它出执行/证否/建模,来回迭代)
     ▼
Chapter IV  全新结果               ← "它贡献了此前无人做出的关键步骤"
              (人类验证的 4 个新数学结果)
主题 代表案例(学科) GPT-5 的角色 人类的角色
I 独立复现前沿已知结果 凸优化步长条件(数学)、黑洞对称性(物理)、T 细胞代谢(生物) 在无污染前提下重新推导 出题、验证、判断是否泄漏
II 深度文献检索 密度估计↔多目标优化(数学)、Erdős 问题库、clique-avoiding codes 按概念找回被遗忘/跨域文献 判断相关性、核对引用
III 人机结对 Gowers 结对做数学、宇宙弦功率谱(物理)、ICF 燃烧波(聚变) 出执行、证否想法、建模、写代码 出主意、掌舵、catch 错误、验证
IV 全新结果 Erdős #848、在线算法下界、树子图不等式、COLT 动态网络 贡献关键证明步骤/整段证明 出题、验证、修补错误、写清

[!IMPORTANT] 这个类型学的递进逻辑值得单独点出:从 I 到 IV,GPT-5 的"自主贡献度"单调上升,而人类验证的必要性始终不变。即使在 Chapter IV(全新结果)里,作者也反复强调证明是"AI 生成但经人类仔细核验"、"其中若干错误由人类修补"。换句话说,报告的深层主张是——GPT-5 起作用的环节可以很深(一直到贡献新定理),但它起作用的模式始终是"专家掌舵 + 人类验证"的增强,而非替代。

下面挑 4 个最有代表性的案例逐一讲透(每章各取一个最能说明该层特征的),其余归纳成表。


3 代表性案例深读

3.1 【Chapter I · 生物】T 细胞代谢的机制推断与 CAR-T 预测 —— GPT-5 Pro 作为"机制共同研究者"

这是全书最"惊艳"的案例之一,也是唯一被作者认为够格署名共同作者的贡献。

问题:Unutmaz 实验室多年前发现,人 T 细胞在活化时短暂加入 2-脱氧-D-葡萄糖(2-DG,一种葡萄糖代谢抑制剂),两周后会出现促炎的 Th17 细胞亚群增多,但机制一直不清楚。他把一张流式细胞术图(IL-17A / CCR6 / CD161 的剂量响应)连同背景喂给 GPT-5 Pro,要求:分析数据、推导机制、给高层结论、评估影响、推荐后续实验、并对比"从初始记忆 T 细胞出发"与"从初始 naive T 细胞出发"的预期差异。

GPT-5 起的作用(推理 17 分钟后): - 定量读出剂量响应:一次 2-DG 暴露导致两周后 IL-17A⁺ 细胞增 13×、Th17 谱系标记(CCR6/CD161)增 16–20×,且标记增幅显著大于 IL-17A 本身增幅——推断这是"Th17 谱系记忆的富集/印记"而非"所有细胞一致产生细胞因子"。 - 给出关键机制假设(作者说这是"我们从未想到、但事后看生物学上完全讲得通"的):2-DG 在毫摩尔浓度干扰 N-连接糖基化 → 减少 IL-2Rα(CD25) 等糖蛋白的正确表面表达 → 削弱 IL-2/STAT5 信号 → 解除对 Th17 分化的抑制。它明确区分了"糖酵解阻断"与"糖基化阻断"两种机制,并设计了甘露糖回补实验去分离二者。 - 预测得到实验验证:作者已做过的甘露糖回补实验结果"与 GPT-5 预测完全吻合"。更关键地,它进一步预测——用短暂 2-DG 脉冲处理记忆 CD8⁺ T 细胞再制备抗 CD19 CAR-T,会增强对靶癌细胞的杀伤(因为降低了 PD-1/LAG-3 检查点表达、减少早期耗竭)。作者称"我们已内部做过这个实验(未发表),预测几乎完美"。

人类验证与边界:作者非常诚实地标注了一个 caveat——甘露糖回补这一条,GPT-5 可能已通过作者此前发布的 BioRxiv 预印本"知道"了结果,因此不算纯粹盲预测。但它另外建议的"针对 N-连接糖基化的抑制剂实验"和"priming 期 IL-2 轴的探查"是作者未做也未发表、且据其所知无他人做过的,属于真正的新假设。

[!TIP] 什么是 human-in-the-loop(人在环内)验证?为什么这个案例是它的范本? 指 AI 的输出不直接作为结论,而是嵌入一个由人类专家判断、核验、并决定是否采纳的闭环。在这个案例里,闭环体现为:作者(出数据/问题) → GPT-5(出机制假设+实验设计) → 作者用已知/新实验去证伪 → 采纳可验证的、剔除可能泄漏的。它之所以是范本,是因为作者逐条区分了哪些是"可能靠训练数据知道的"、哪些是"真正新颖且经湿实验验证的"——这种对污染与泄漏的显式审计,正是 AI4Science 里区分"真加速"与"看起来惊艳实则回忆"的关键动作。作者最终判断这些贡献"达到了在新研究里署名共同作者的程度"。

意义:它示范了 GPT-5 能当"机制优先(mechanism-first)的共同研究者"——不只是分析数据,而是把现象连到分子机制、设计出能证伪的决策树实验、剪掉可能浪费数月的错误分支(作者语:"cheaper negative results because failed branches are pruned in silico")。

Figure I.3:2-DG 对 CD8⁺ naive/memory T 细胞 PD-1、LAG-3 表达的流式细胞术图

Figure I.3 逐元素解读:这是一张 2×3 的流式细胞术等高线图,是 GPT-5 分析的原始数据之一。:上=naive CD8⁺ T 细胞,下=memory CD8⁺ T 细胞;:Control(对照)/ 2DG (3mM) / No glucose(无糖);坐标轴:横轴 LAG3、纵轴 PD1,每格四个象限的数字是各象限细胞百分比。关键读数:naive 细胞里 PD-1⁺LAG-3⁺双阳性群从对照的 ~94%(右上 93.7)暴跌到 2DG 下的 ~0.8%(右上 0.80)——GPT-5 正确读出了这个"检查点受体崩塌",并推断其源于糖基化受损(因为"No glucose"列只造成部分下降,说明不是单纯能量短缺)。这张图直接支撑了它"2-DG 通过糖基化而非能量途径重塑检查点表达"的机制论断,以及"因此 CAR-T 会更抗耗竭、杀伤更强"的下游预测。


3.2 【Chapter III · 聚变】ICF 热核燃烧波的降阶物理建模 —— "6 人月压到 6 人时"

这是全书量化提速最激进的案例(自评 ~1000×),也最能说明"GPT-5 作为设计物理学家的放大器"。

问题:Lawrence Livermore 的 Spears 想为惯性约束聚变(ICF)里"热点点火 + 燃烧波向冷燃料传播"这一关键过程,建一个简化的静态反应-扩散模型(球对称、无流体运动),用来找"什么样的密度剖面最利于燃烧波传播"。他用一段很长的"boomer prompt"(他自嘲的说法)把物理需求(三区域、热扩散、α 粒子非局域沉积、辐射损失、优化框架)一次讲清。

GPT-5 起的作用: - 模型搭建:几分钟内产出一个物理项命名得当、常数选取合理的 PDE 模型(Spitzer–Härm 热导、Bosch–Hale DT 反应率、非局域 Helmholtz 算子描述 α 输运、灰体辐射逃逸)。作者说"这就是我和国家实验室同行讨论时会走的路子"。 - 数值实现:未经明确提示就自选 Crank–Nicolson 隐式格式、算符分裂、三对角 Helmholtz 反演。作者估计自己写扎实要"几个工作日",GPT-5 几分钟给出。 - 理论解释:作者要求它用"行波功率平衡"论证数值发现的"脊(ridge)"。GPT-5 给出共动坐标下的能量方程、识别出热输运/聚变源/辐射损失的关键标度、并推导出一个"工程规则"闭式判据预测每个斜率 \(s\) 对应的最优曲率 \(c^\star\)

人类验证与边界(这段是全书对"AI 需要专家掌舵"讲得最透的):

GPT-5 是个糟糕的设计者——它给出的结果是空的、噪声的或非法的(NaN),却宣称"已获荣耀"。但当被重新提示去检查病态结果时,它给出相当高明的解法(不同的 FFT 实现防混叠、提高分辨率追踪燃烧前沿、改性能指标放大信号)。如果用户在第一个古怪回复处就放弃,就会错过模型相当强的能力。

作者反复强调:"这要求你是一个非常自信的物理学家。你必须知道某个断言是错的,必须自信地推动更好的解,还必须好到能判断真解何时到达。" 最终数值脊与理论工程规则吻合(见下图),这个"数值 + 独立理论论证"的交叉验证,是他确信结果没被模型"诱骗"的关键。

[!IMPORTANT] 量化口径必须讲清:作者的"约 1000× 压缩"是这样估算的——他花了 6 小时(从想法到写完);若换传统方式,需要"一个很好的理论博后 + 一个很好的数值博后,约一两个月",即约 6 人月\(6\text{ 人月} \approx 6\times 22 \text{ 人时} \approx 130\text{ 人时}\),对 6 人时 ≈ 20×+ ;作者取整说约 1000×(把"6 人月"直接对"6 人时")。

案例 传统耗时(人类估算) GPT-5 辅助耗时 提速口径
ICF 燃烧波建模(本案例) ~6 人月(2 博后 × 1–2 月) ~6 人时 作者自评 ~1000×(月→时)
凸优化步长条件(Ch I) 专家"数小时到数天" 17 分钟推理 天→分
黑洞对称性(Ch I) "月级"→publishable 热身+18 分钟 月→天
宇宙弦功率谱(Ch III) 作者已卡 6 个月只解出偶数 n 40 分钟推理解出奇数 n 半年→小时
紧集/Kolmogorov-Riesz(Ch III, Gowers) 估 1–3 小时 22 秒 小时→秒

口径警示:这些数字全是当事人主观估算、无对照实验,且高度依赖"专家已经框好问题"这一前提。它们说明的是"在合适任务上的量级感",而非可复现的统计量。报告本身也承认结果"难以复现"(对 prompt 细节敏感)。所以正确的读法是:GPT-5 能在特定环节把专家的有效产出提升 1–3 个数量级,但这个增益的前提是专家仍在掌舵与验证。

Figure III.1:ICF 燃烧波平均传播速度的色图与"脊"

Figure III.1 逐元素解读:这是 GPT-5 生成代码跑出的核心结果图。横轴 = 密度剖面曲率 \(c\)(kg/m⁵,注意向左更负),纵轴 = 斜率 \(s\)(kg/m⁴);颜色 = 5 keV 燃烧前沿在 1–3 ns 的平均传播速度(右侧色标,km/s,越黄越快)。亮黄色的"脊"(白色虚线 ridge \(s^\star(c)\))标出了让燃烧波传播最快的最优 \((s,c)\) 组合——物理含义是"浅斜率 + 中等负曲率"的密度剖面最利于点火波推进(因为它在正确的距离上放置了正确的密度,使 α 粒子加热与热传导的协同最大化)。红色 × 是沿脊等距选取的 5 个剖面点(对应报告 Table III.1)。Figure III.2(未嵌入)在此图上叠加了一条红色"理论工程规则"曲线,与数值脊吻合良好——这就是作者"数值结果被独立理论功率平衡论证验证"的可视化证据。


3.3 【Chapter IV · 计算机科学】在线算法 convex body chasing 的新下界 —— 单条 prompt 证否一个自然算法

这是"全新结果"章里最能体现 GPT-5 独立产出非显然证明的案例。

问题(convex body chasing):在线优化里,逐一收到凸集 \(K_1, K_2, \dots \subset \mathbb R^d\),每收到 \(K_t\) 必须先选点 \(p_t\in K_t\) 再看下一个集,目标最小化总移动 \(\sum\|p_t - p_{t-1}\|\)。性能用 competitive ratio(在线代价 / 离线最优代价的最坏比值)衡量。已知最优比在 \([\sqrt d, d]\) 区间。

GPT-5 的两处贡献: 1. 证否 follow-the-leader(单条 prompt,无任何方法提示):Coester 怀疑"每步走到当前凸集里范数最小的点"这个自然算法不好,但找不到简单反例。GPT-5 推理 16 分钟后给出一个相当非显然的反例:在 2 维嵌套情形(初始体为单位球)下,构造一串交替、半径递增的点 \(p_1, p_3, p_5, \dots\)\(p_2, p_4, p_6, \dots\),让贪心代价可以任意大(competitive ratio 无穷),而离线最优代价 \(\le 1\)。作者评价"这个反例含若干非平凡步骤,我不确定自己能否想出来"。 2. 把下界从 \(\sqrt d\) 提到 \(\frac{\pi}{2}\sqrt{\lfloor d/2\rfloor}\approx 1.11\sqrt d\):GPT-5 在推理轨迹预览里自发地瞄准了 \(\pi/2\approx 1.5708\) 这个数(作者此前没想到过这个量),启发了作者的构造思路;随后 GPT-5 又贡献了一个关键技术点——用 ε-滞后切换(ε-hysteresis switching)解决"pivot 切换时刻可能无限抖动/冻结"的技术难题(作者原打算的复杂论证被它一句"当算法落到半圆下方距 \(p_t\) 达 ε 时才触发切换"优雅化解);最后把 2 维想法正交分解\(\lfloor d/2\rfloor\) 个二维分量,一举推广到任意维度(作者原本卡在先做 3 维)。

人类验证与边界:作者非常诚实——GPT-5 对可行性的论证"实际上是错的,但正确论证很容易看出";后续想进一步推高比值时"给出了含严重瑕疵的论证"。所以模式是:GPT-5 提供关键 insight(反例构造 / \(\pi/2\) 这个数 / ε-滞后技巧 / 正交分解),人类修补漏洞、补齐严格性

![Figure IV.3 已渲染但未嵌入 —— 见下方 Chapter IV 的两个更清晰案例(IV.9/IV.11)]

[!TIP] 为什么这个案例对"GPT-5 在科研链条哪一环起作用"特别有说明力? 它精确暴露了 GPT-5 的能力剖面:强在"产生非显然的构造性想法 / 提出关键中间量 / 给出巧妙的技术性修补",弱在"把想法执行到完全严格无误"。换句话说,它更像一个灵感极其丰富但会犯低级错误的天才合作者——它能给你 \(\pi/2\) 这个你想不到的目标、能一句话化解你卡了很久的技术障碍,但你必须逐行验证它的每个断言。这与 Gowers(Ch III.1)的独立观察完全一致:"它能扮演博识的研究导师角色……但还没到一个遵守我署名惯例的人类数学家会要求联合署名的程度"(因为它的贡献往往是"我自己稍后也能找到"的加速,而非"需要超出我恰好具备的标准专业知识"的决定性一步)。


3.4 【Chapter IV · 学习理论】2012 COLT 动态网络开放问题 —— GPT-5 自主选定关键量并证明

这是"全新结果"里 GPT-5 自主性最高的案例——从选定研究哪个量到主要证明思路几乎全由它完成。

问题:一个"带吸引力标签的偏好依附树"随机过程——每个顶点独立获得吸引力标签 \(a(v)\in\{1, w\}\)(各半概率),新顶点按"吸引力加权度"成比例连到已有顶点。目标:只观察某个大时刻 \(t\)单张无标签树 \(G_t\),能否估计出参数 \(w\)?这是 2012 年 COLT 由 [RC12] 提出的开放问题,原作者观察到"单边标签统计量无助于确定 \(w\)"。

GPT-5 的贡献(这是全书唯一强调"决定研究哪个量无需任何人类输入"的案例): - GPT-5 自主决定去研究量 \(L(t)\) = 时刻 \(t\)叶子(度为 1 的顶点)总数——这个量的巧妙在于它无需观察标签就能测量(而按标签分开的 \(L_1(t), L_w(t)\) 不可观测)。 - 证明了 Theorem IV.4.1:叶子占比几乎必然收敛到 \(f(w) = \dfrac{3(w+1)^2}{2(w+2)(2w+1)}\),且 \(f\)\(w\ge 1\) 上严格递增(从 \(f(1)=2/3\) 增到 \(\lim_{w\to\infty}f(w)=3/4\))。由此立得 Corollary IV.4.1\(w\) 可识别(用 \(\hat w(t)=f^{-1}(L(t)/t)\))。证明用了经典随机逼近工具(Robbins-Monro / Robbins-Siegmund 几乎超鞅定理 / Benaïm 的 ODE 方法)。

人类验证与边界:作者标注得极细——"所有主要证明思路都归 GPT-5,但少量证明写作细节由人类补充";带脚手架的 GPT-5 自主产出了高层论证和相同的主要参考文献,但对某些中间断言只说"由常规随机逼近论证得出"而略去细节;当要求(无脚手架的)GPT-5 补细节时,它多次错误起步(例如错误宣称某定理直接蕴含某收敛),经人类推动才给出正确但冗长的证明,作者最终改用更精简的论证。

[!TIP] "GPT-5 决定研究 \(L(t)\) 是非显然的"——这句话的分量 作者特意指出:在一个相关模型 [BV25](依附概率只依赖标签一致性、不依赖度)里,度为 \(k\) 的顶点占比恒为 \(2^{-k}\),与参数无关——这正说明"选叶子占比作为可识别性的抓手"并非套路,而是需要洞察的选择。在 AI4Science 语境里,这一点尤其值得注意:GPT-5 不只是"执行人类指定的计算",在这个案例里它自主完成了"该盯住哪个可观测量"这一研究品味层面的决策——这已经触及了科研中最难自动化的"提出正确问题/找到正确切入点"的环节。这与 [[ref28_why-llms-arent-scientists-yet]] 关心的"LLM 能否有科研品味"直接对话。

Figure IV.9:t=3 时偏好依附过程的示意(吸引力加权度即依附概率)

Figure IV.9 逐元素解读(TikZ 图,由 GPT-5 生成):图示 \(t=3\) 时刻已有 3 个顶点——两个标签为 \(w\) 的顶点(蓝色,标 \(w\))和一个标签为 \(1\) 的顶点(白色,标 \(1\))。每个顶点旁标注的数字(\(1+w\)\(w\)\(w\))是它的吸引力加权度 \(A_t\)(= 邻居吸引力之和):中间那个 \(w\) 顶点有两个邻居故为 \(1+w\),两侧各只有一个邻居故为 \(w\)。底部虚线圆是即将加入的第 4 个新顶点,三条虚线箭头表示它按这些加权度(归一化后)成比例地选择父顶点。这张小图精确锚定了过程的定义,也让人直观看到"为什么标签不可见时、叶子这类聚合量反而能透露 \(w\)"。

Figure IV.11:Theorem IV.4.1 渐近结果 (IV.6) 的仿真验证

Figure IV.11 逐元素解读(生成代码由 GPT-5 编写):横轴 = 吸引力参数 \(w\in[1, 100]\)纵轴 = 叶子占比。蓝色曲线是理论函数 \(f(w)\)(从 \(f(1)=2/3\approx 0.667\) 严格增向 \(3/4=0.75\));橙色点带误差棒是在 \(N=10^5\) 顶点、每个 \(w\) 做 10 次独立试验的经验叶子占比均值 ± 标准差。两者在中小 \(w\) 高度吻合,验证了渐近定理;大 \(w\) 处橙色略高于蓝色且误差棒变大——这是有限尺寸效应(\(10^5\) 顶点对大 \(w\) 尚未完全进入渐近区)。这张图是"GPT-5 出理论 + GPT-5 出仿真代码 + 二者自洽"的完整闭环,也是全书"新结果 + 自我验证"的一个干净范例。


3.5 其余案例速览(归纳成表)

章节 案例(作者) 学科 GPT-5 做了什么 关键 takeaway / 边界
I.1 凸优化曲线步长条件(Bubeck) 数学 给 v1 论文,要它改进步长条件;17.5 分钟把 \(\eta\le 1/L\) 推到 \(\eta\le 1.5/L\)(最优是 1.75/L),证明经验证正确且不同于 v2 的人类证明 "半步"复现;作者查了推理轨迹确认没做网搜(否则会看到 v2)。内部能思考数小时的模型可从零推出最优 1.75/L
I.2 黑洞新对称性(Lupsasca) 物理 (重新)推导 Kerr 背景波方程的 SL(2,ℝ) Lie 点对称——弯曲空间的非平凡生成元 冷启动失败(5 分钟后错说"无对称"),需先做平坦空间热身(10 分钟成功)再回到弯曲空间(18 分钟成功)。"脚手架/热身很重要"
II.1 密度估计↔多目标优化(Zhivotovskiy) 数学 给一个新几何陈述,8 分钟浮现出与之深刻相关的 Papadimitriou–Yannakakis (FOCS'00) 多目标优化工作 乍看像幻觉、实则揭示真连接;由此把定理推广到去除 \(\log R\) 因子。"按概念而非词汇跨域连接"
II.2 Erdős 问题库(Sawhney & Sellke) 数学 为"open"问题找已发表解:定位 10 个已知解 + 10 个部分进展 + 更正 1 处笔误 引用准确易核、未见假造引用;能读懂德文原文并翻译解释。Terence Tao 等随后用"负向检索"作为"解大概不存在"的软证书
II.3 Clique-avoiding codes(Guruswami & Gopalan 供稿) 数学/编码 经反复 buggy 论证后,用 Chevalley–Warning 定理给出正确下界 \(r(n)\ge\lfloor n/2\rfloor\) ⚠️ 警世案例:先编造"有人在 TCS Stack Exchange 问过、答案是 n"(假的);其"原创"证明实为 Noga Alon 3 年前论文的同一证明,GPT-5 未察觉来源递过来——"有可能欺骗资深研究者以为有新发现"
III.1 用 LLM 当研究伙伴(Gowers) 数学 找文献(Kolmogorov-Riesz 引理,22 秒)、秒解良定义子问题、解释为何某些想法行不通(graphs with small clique number 的三次尝试逐一被秒否) 菲尔兹奖得主的审慎结论:LLM"刚开始有用作研究合作者",能加速思考尤其在自己非主场的领域;但还没到能给出解决难题主意的程度("难"指标准技巧不够用的问题)。开放问题会诱出 LLM"讨好式"地说你的想法行
III.2 宇宙弦引力波功率谱(Scherrer) 物理/天文 解析求出奇数 n 情形的球面积分,40 分钟得到与作者此前偶数 n 结果一致的渐近式,还给出作者不知道的修正项(含 Ci 函数) 作者此前卡了 6 个月只解出偶数 n;GPT-5 用完全不同的方法(Legendre→Bessel 展开)。"能解 Mathematica 都搞不定的复杂解析积分"

[!TIP] 贯穿全书的两个"警世信号"(这份报告最诚实、也最有价值的部分) 1. 幻觉与自信错误:GPT-5 会"自信地犯错、顽固辩护"。clique-avoiding codes 案例里它编造了不存在的 Stack Exchange 问答;Gowers 遇到它给出幻觉引用(但"幻觉有时也指向真实有用的文献")。 2. 归因失败(misattribution)它可能把内部知识里的已有结果当成"新推导"递给你而不报来源——Alon 证明那次几乎让两位资深研究者误以为有新发现。作者据此呼吁:"在使用 LLM 辅助的证明时,务必对归属(attribution)格外小心。"

这两点直接呼应 [[ref28_why-llms-arent-scientists-yet]] 的核心担忧,也是任何把 LLM 用于科研/知识工作的人必须内建的防护:AI 的输出必须经人类验证来源与正确性,"看起来新颖"不等于"真的新颖"。


4 总体观察与局限

4.1 哪些是"真加速"、哪些容易被夸大

综合全书,可以把 GPT-5 的科研作用按可信度分层

结论 证据强度 说明
文献检索是"独一份好用" ★★★(最强) 跨域/跨语言/按概念找回被遗忘文献,引用准确易核;Erdős 库 10 个已知解是硬证据。这是几乎无争议的真加速
能贡献非显然的证明步骤/构造 ★★★ 4 个新数学结果经人类验证;反例、\(\pi/2\)\(L(t)\) 选取等是真 insight。但必须配人类修补严格性
能把模糊想法证成、把思路证否 ★★ Gowers、Coester 反复印证;但对"开放式/草率"提问会诱出讨好式的错误细节
建模/写代码的"万能博后"放大 ★★ 聚变案例几分钟出 PDE+数值格式;但在设计/调参的关键处仍需专家掌舵,会给 NaN 却宣称成功
提速倍数(如 1000×) ★(最弱) 全是当事人主观估算、无对照、依赖"专家已框好问题"、不可复现。宜作量级感而非精确指标

最容易被夸大的:把"1000× 提速"当作普适结论、把"贡献新定理"理解为"AI 独立做科研"。报告本身反复设防:所有新结果都强依赖专家出题 + 人类验证 + 人类修补错误;提速数字都带"前提是专家在掌舵"的隐含条件;且结果难以复现(对 prompt 细节敏感)。

最扎实的"真加速":文献检索(按概念跨域找回文献)、以及"在专家框定的具体问题上快速给出候选证明/反例/建模/代码"。这两类的共同点是——任务边界清晰、且有人类能验证输出

4.2 GPT-5 在科研链条里"起作用的环节"与"边界"

把全书拆解到科研工作流的各环节:

科研链条:  提出问题 → 找相关文献 → 形成想法 → 证成/证否 → 严格证明 → 实现/实验 → 验证结论
GPT-5 表现: ▲(个别)    ★★★        ★★         ★★         ★(需修补)    ★★         需人类主导
             IV.4自选量  最强项      结对好用    结对好用    出insight    万能博后    始终human
                                                             但会犯错     但需掌舵    -in-loop

[!IMPORTANT] 一个反复出现的操作性洞察:脚手架(scaffolding)与热身(warm-up) 多个案例显示,怎么问极大影响 GPT-5 的表现: - 热身(Ch I.2 黑洞):冷启动失败的弯曲空间问题,先做同对称结构的平坦空间简化版,再"抬升"回原问题,就成功了——作者推测这能"激活内部的模式/检索"。 - 研究脚手架(Ch IV.3/IV.4 用了"aimed at doing mathematics research"的 scaffolded 版本):带专门科研脚手架的 GPT-5 才做出了树子图第二不等式和 COLT 问题。 - 精确的问法(Ch III.2 宇宙弦):作者对 \(\theta,\phi\) 定义"格外迂腐",因为物理学家与数学家的球坐标约定相反,不确定模型默认哪种。

这直接把本报告和本项目的 harness 主题接上了:"科研辅助的质量 = 固定强模型 × 人类脚手架质量 × 验证闭环"。热身/脚手架/精确问法,本质上就是人类手工设计的 harness——而 [[ref09_meta-harness]]/[[ref17_self-harness]] 正是要把这层手工脚手架自动化/自我改进。ref29 从应用侧证明了这层脚手架的巨大杠杆,恰是那两篇工作的现实动机。


5 结论

报告的结语很克制:

AI 模型以辅助日常任务著称;鲜为人知的是,像 GPT-5 这样的前沿模型正越来越能加速新颖研究。我们展示了跨多学科的例子,显示 GPT-5 协助构思、驱动深度文献检索、乃至提出并实现(适当规模的)开放问题的证明。这一切在仅仅十二个月前都还不可能。GPT-5 已展现出能加速科研这一事实,加上前沿 AI 的改进速度,预示未来数年将是科学与数学激动人心的时代。

三个词概括作者立场:具体(concrete)、克制(modest in scope)、但含义深远(profound in implication)。他们既不宣称超出证据的东西("our aim is not to claim more than the evidence allows"),也点明了变化的斜率——"十二个月前还不可能"。对读者的实操建议是明确的:用它来加速,但保持高标准(keeping standards high)——即始终保留人类的验证与掌舵。


个人思考

与本项目其他论文的关联(放进 harness 演化的坐标系)

方法论启示(可迁移的通用思路)

  1. "脚手架/热身"是可迁移的 prompting 原则:对模型冷启动会失败的难题,先喂一个同结构的简化版激活模式,再抬升回原问题(黑洞案例)。这几乎可以直接用到任何"模型一上来就答不出"的场景——包括我们自己用 Agent 做复杂任务时。
  2. "污染/泄漏审计"应成为 AI 辅助研究的标准动作:Unutmaz 逐条区分"可能靠训练数据知道的"vs"真正新颖经验证的";Bubeck 检查推理轨迹确认没做网搜。任何声称"AI 帮我发现了新东西"的主张,都必须先排除"它其实是在回忆"。
  3. 验证的可迁移设计:聚变案例的"数值结果 + 独立理论论证交叉验证"是防"被模型诱骗"的通用护栏——让 AI 从两条独立路径给出同一结论,比信它一条路径可靠得多。
  4. 区分"加速已能做的"vs"做到做不到的":Gowers 的"计算器类比"很精辟——你是更好的计算器用户,当你本来就会手算、只是用它省时。在你能验证的任务上放心用 AI 加速;在你无法验证的任务上谨慎。

在我的工作中能怎么用

开放问题 / 疑问

这份报告的局限性