自主科研系统已从设想走向端到端闭环,是当前 AI for Science 最突出的演进方向
截至 2025 年的综述将“智能体科学(Agentic Science)”定位为 AI for Science 的演进阶段,即 AI 从部分协助走向完全科学能动性;自驱动实验室综述则报告,最先进的 SDL 已能自动化假设生成、实验设计、实验执行、数据分析、结论更新乃至下一轮假设迭代的几乎完整科学闭环。两篇综述在“AI 正在从任务特定工具变成自主研究伙伴”这一点上相互印证。
为什么重要:这改变了读者评估相关研究时的基本预期:不应只看单项模型精度,而应关注自主闭环、数据与实验基础设施的整合程度。
证据边界:仅基于两篇公开摘要的作者主张,未核验 SDL 的完整方法细节与真实自动化程度;不同实验室的自动化水平差异很大。
数据可用性是当前摘要扫描下最一致的 AI for Science 瓶颈
电池与能源存储综述明确列出数据短缺、网络基础设施不足、数据隐私、知识产权和伦理问题;材料发现综述将数据稀缺列为关键挑战;另有评论以“是否持续供应大规模高可用数据”作为释放 AI 科学潜力的首要问题;SciHorizon 还提出了包含质量、FAIR 性、可解释性和合规性的 AI 就绪数据评估框架。多篇来自不同领域的综述或评论独立指向同一卡点。
为什么重要:帮助读者识别 AI4Science 的真正卡点:数据治理不是边缘问题,而是决定模型能否落地的首要条件;科研资助和项目设计应优先投资数据基础设施。
证据边界:各论文领域和视角不同,未对具体瓶颈优先级做统一排序;AI 就绪数据评估框架属于单篇工作提出的框架。
生成式与逆设计是药物和材料两大核心分支的共同主线,但后期验证仍是共同短板
药物发现综述报告生成化学、机器学习和多属性优化已使若干化合物进入临床试验;材料科学综述报告生成模型可按目标性能从头设计催化剂、半导体、聚合物和晶体。两个分支的综述均把数据稀缺、可解释性以及后期可合成/临床验证列为未解瓶颈,说明生成式范式的进展与短板是跨分支共有的。
为什么重要:有助于读者用“从生成到验证是否闭环”作为统一标尺,评估不同材料/药物方向的成熟度。
证据边界:进入临床试验、可合成材料的具体数量与标准未在摘要中给出;部分进展来自单篇综述的作者报告;未核验任何具体药物管线或材料合成结果。
将领域知识嵌入神经网络是一条标志性的 AI for Science 方法学路线
物理信息神经网络(PINNs)通过把物理定律嵌入网络结构或损失函数来求解偏微分方程等复杂物理系统,被综述视为科学计算与深度学习中的变革性框架;另一篇综述则系统梳理了通过修改输入、损失函数和架构来纳入领域知识的做法,并报告这些技术能够显著改变深度神经网络性能。
为什么重要:它揭示 AI4Science 并非只会“数据拟合”,而是存在把物理第一性原理与数据结合的一整套方法学分支,直接影响建模路线的选择。
证据边界:两篇综述均为方法分类而非系统比较;“显著改变性能”不等于“一定提升”,具体增益因任务而异;未核验任何 PINNs 基准结果。
科学大语言模型已从零散建模走向有分类体系和基准评估的阶段
一项生物/化学领域综述按模型架构、能力、数据集和评估维度,系统梳理了面向文本知识、小分子、蛋白质、基因组序列的科学 LLM;SciHorizon 则从 AI 就绪数据与 LLM 科学能力(知识、理解、推理、多模态、价值观)两个角度提出评估框架,并已测评 50 多个开源与闭源 LLM。
为什么重要:说明科学 LLM 领域已有分类与基准意识,评估科学 LLM 强弱需要使用专门基准,而不是沿用通用 NLP 评测。
证据边界:科学 LLM 综述仅覆盖生物/化学;SciHorizon 的具体评估结果未在摘要中呈现;两者均属单篇工作,尚未成为统一共识。
AI 要从示范性创新扩散为普遍采用的科研方法,关键在开放数据科学这一“扩散引擎”而非算法本身
有论文提出需要构建跨学科思想供应链、通过开放研究快速转移技术能力、开发赋权研究者的 AI 工具并嵌入有效数据管理;Dagstuhl 研讨会报告也将跨学科共同体和人类—机器协作视为下一波进展的重要来源。两类来源都把开放基础设施与社区建设放在算法突破同等重要的位置。
为什么重要:这改变了推进策略判断:仅增加算力或模型投入不够,开放基础设施、数据管理和跨学科社区是同等重要的条件。
证据边界:这些来自观点性/综述性文献和研讨会报告,属于作者与参会社区的主张,缺乏对这些干预措施效果的实证检验。
自主 AI 科研系统已引发超出学术界的治理与认识论挑战
综述报告“云实验室”与自驱动实验室引出 AI 发明的可专利性问题(现行专利法只承认人类发明人)、安全与网络安全风险以及对技术劳动力的替代与创造效应;哲学讨论则指出,科学家对本质上不透明的 AI 应用形成认识论依赖,但 AI 不是可问责的行动者,现有科学信任理论难以覆盖这种关系。
为什么重要:提醒读者,AI4Science 的成熟度不仅取决于性能指标,还取决于专利、安全、劳动力和科学信任等制度框架能否跟上。
证据边界:劳动力影响的估计来自单篇综述的自身分析;哲学论文提出的是概念性批判而非实证结论;未核验任何专利判例或安全事件。
在控制方程发现上,符号—进化混合 AI 报告了可解释性与外推性的量化增益
一篇论文报告,结合符号主义与元启发式的“机器集体智能”方法可在确定性、随机和未表征动力学系统中自主恢复控制方程,将外推误差相对深度神经网络最多降低 6 个数量级,并把模型参数从约 50 万至 100 万压缩到 5 至 40 个可解释参数。
为什么重要:这是一个具体、可理解的量化证据,说明符号—进化混合 AI 可能在可解释性和外推性上弥补纯深度学习的短板,值得关注和复现。
证据边界:仅基于单篇公开摘要的作者报告,未核验具体实验设置、数据集和基线选择;结果不一定泛化到其他科学发现任务。