{
  "claims": [
    {
      "boundary": "仅基于两篇公开摘要的作者主张，未核验SDL的完整方法细节与真实自动化程度；不同实验室的自动化水平差异很大。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C1",
      "maturity": "reported",
      "statement": "AI for Science正在从任务特定的计算工具演进为端到端自主科研系统：截至2025年的综述将“智能体科学（Agentic Science）”定位为AI从部分协助走向完全科学能动性的阶段，而最先进的自驱动实验室（SDL）已能自动化假设生成、实验设计、实验执行、数据分析乃至结论更新与下一轮假设迭代的几乎完整科学闭环。",
      "supportingPaperIds": [
        "arxiv:2508.14111",
        "openalex:W4412468430"
      ],
      "whyItMatters": "这改变了读者对AI在科学中角色的基本预期：评估相关研究时不应只看单项模型精度，而应关注自主闭环、数据与实验基础设施的整合程度。"
    },
    {
      "boundary": "各论文领域和视角不同，未对具体瓶颈优先级做统一排序；AI就绪数据评估框架属于单篇工作提出的框架。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C2",
      "maturity": "reported",
      "statement": "跨领域多项综述一致将数据可用性列为AI for Science的主要瓶颈：电池与能源存储综述明确列出数据短缺、网络基础设施不足、数据隐私、知识产权和伦理问题；材料发现综述将数据稀缺列为关键挑战；另有评论以“是否持续供应大规模高可用数据”作为释放AI科学潜力的首要问题，并已出现面向数据就绪度的多维评估框架。",
      "supportingPaperIds": [
        "openalex:W4400411845",
        "arxiv:2508.03278",
        "openalex:W4402901051",
        "openalex:W4412875452"
      ],
      "whyItMatters": "帮助读者识别AI4Science的真正卡点：数据治理不是边缘问题，而是决定模型能否落地的首要条件；科研资助和项目设计应优先投资数据基础设施。"
    },
    {
      "boundary": "进入临床试验、可合成材料的具体数量与标准未在摘要中给出；部分进展来自单篇综述的作者报告；未核验任何具体药物管线或材料合成结果。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C3",
      "maturity": "reported",
      "statement": "在药物与材料两个核心分支中，AI生成式与逆设计已成为共同主线：药物发现综述报告生成化学、机器学习和多属性优化已使若干化合物进入临床试验，而材料科学综述报告生成模型可按目标性能从头设计催化剂、半导体、聚合物和晶体；两个分支的综述均强调数据稀缺、可解释性以及后期可合成/临床验证仍是主要未解瓶颈。",
      "supportingPaperIds": [
        "openalex:W4400656170",
        "arxiv:2307.06521",
        "arxiv:2507.03407",
        "arxiv:2508.03278",
        "openalex:W4362655746"
      ],
      "whyItMatters": "帮助读者看到AI for Science的主要成果分支共享同样的生成式范式与瓶颈，评估具体方向进展时可用“从生成到验证是否闭环”作为统一标尺。"
    },
    {
      "boundary": "两篇综述均为方法分类而非系统比较；“显著改变性能”不等于“一定提升”，具体增益因任务而异；未核验任何PINNs基准结果。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C4",
      "maturity": "reported",
      "statement": "将领域知识嵌入神经网络是AI for Science的一种标志性方法学路线：物理信息神经网络（PINNs）通过把物理定律嵌入网络结构或损失函数来求解偏微分方程等复杂物理系统，被综述视为科学计算与深度学习中的变革性框架；另一综述则系统梳理了通过修改输入、损失函数和架构纳入领域知识的做法，并报告这些技术能够显著改变深度神经网络性能。",
      "supportingPaperIds": [
        "openalex:W4412642369",
        "openalex:W4205511145"
      ],
      "whyItMatters": "它揭示AI4Science并非只会“数据拟合”，而是存在把物理第一性原理与数据结合的一整套方法学分支，影响研究人员选择建模路线。"
    },
    {
      "boundary": "科学LLM综述仅覆盖生物/化学；SciHorizon的具体评估结果未在摘要中呈现；两者均属单篇工作，尚未成为统一共识。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C5",
      "maturity": "reported",
      "statement": "科学大语言模型（LLM）已成为AI for Science在生物与化学领域的新兴分支：一项综述按模型架构、能力、数据集和评估维度系统梳理了面向文本知识、小分子、蛋白质、基因组序列的LLM；同时，SciHorizon基准提出了从AI就绪数据（质量、FAIR性、可解释性、合规性）与LLM科学能力（知识、理解、推理、多模态、价值观）两个角度评估AI4Science的整体框架，并已测评50多个开源与闭源LLM。",
      "supportingPaperIds": [
        "openalex:W4406828533",
        "openalex:W4412875452"
      ],
      "whyItMatters": "说明科学LLM领域已从零散建模走向有分类体系和基准评估的阶段，并提示“科学LLM能力强弱”需要用专门基准判断，而非沿用通用NLP评测。"
    },
    {
      "boundary": "这些来自观点性/综述性文献和研讨会报告，属于作者与参会社区的主张，缺乏对这些干预措施效果的实证检验。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C6",
      "maturity": "reported",
      "statement": "多项领域报告一致认为，AI要从示范性创新扩散为各学科普遍采用，关键在开放数据科学的“扩散引擎”而非算法本身：有论文提出需要构建跨学科思想供应链、通过开放研究快速转移技术能力、开发赋权研究者的AI工具并嵌入有效数据管理；Dagstuhl研讨会报告也把跨学科共同体和人类—机器协作为下一波进展的重要来源。",
      "supportingPaperIds": [
        "openalex:W4401726605",
        "openalex:W4323697696",
        "openalex:W4382775943"
      ],
      "whyItMatters": "改变读者对AI4Science推进策略的判断：仅增加算力或模型投入不够，开放基础设施、数据管理和跨学科社区是同等重要的条件。"
    },
    {
      "boundary": "劳动力影响的估计来自单篇综述的自身分析；哲学论文提出的是概念性批判而非实证结论；未核验任何专利判例或安全事件。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C7",
      "maturity": "reported",
      "statement": "自主AI科研系统已经引发超出学术界的治理与认识论挑战：综述报告“云实验室”与自驱动实验室引出AI发明的可专利性问题（现行专利法只承认人类发明人）、安全与网络安全风险以及对技术劳动力的替代与创造效应；哲学讨论则指出，科学家对本质上不透明的AI应用形成认识论依赖，但AI不是可问责的行动者，现有科学信任理论难以覆盖这种关系。",
      "supportingPaperIds": [
        "openalex:W4412468430",
        "openalex:W4389238386",
        "arxiv:2206.11076"
      ],
      "whyItMatters": "提醒读者，AI4Science的成熟度不仅取决于性能指标，还取决于专利、安全、劳动力和科学信任等制度框架能否跟上；这对政策制定和投资决策有直接影响。"
    },
    {
      "boundary": "仅基于单篇公开摘要的作者报告，未核验具体实验设置、数据集和基线选择；结果不一定泛化到其他科学发现任务。",
      "claimType": "author_claim",
      "contradictingPaperIds": [],
      "id": "C8",
      "maturity": "single_source",
      "statement": "在从观测数据中发现控制方程这一经典科学任务上，作者报告一种结合符号主义与元启发式的“机器集体智能”方法，可在确定性、随机和未表征动力学系统中自主恢复控制方程，将外推误差相对深度神经网络最多降低6个数量级，并把模型参数从约50万至100万压缩到5至40个可解释参数。",
      "supportingPaperIds": [
        "arxiv:2604.27297"
      ],
      "whyItMatters": "这是一个具体的、可理解的量化证据，说明符号—进化混合AI可能在可解释性和外推性上弥补纯深度学习的短板，值得关注和复现。"
    },
    {
      "boundary": "仅基于单篇公开摘要的作者报告；三种材料均为同一框架的首次报道，未说明长期循环稳定性、规模化生产或独立复现情况。",
      "claimType": "author_claim",
      "contradictingPaperIds": [],
      "id": "C9",
      "maturity": "single_source",
      "statement": "作者报告一个专家引导的LLM推理框架（ChatBattery）完成从假设到合成再到表征的完整材料发现闭环，成功识别、合成并表征了三种新型锂离子电池正极材料，其容量相对常用正极材料NMC811分别提高28.8%、25.2%和18.5%。",
      "supportingPaperIds": [
        "arxiv:2507.16110"
      ],
      "whyItMatters": "它提供了“LLM不仅能提出假设，还能走通合成验证”的具体实例，是评估AI驱动材料发现成熟度的重要单个证据。"
    },
    {
      "boundary": "数字来自单篇系统综述作者基于其纳入文献的计算；样本构成和任务定义可能影响结果，不能直接外推到所有科学文献自动提取场景。",
      "claimType": "author_claim",
      "contradictingPaperIds": [],
      "id": "C10",
      "maturity": "single_source",
      "statement": "在科学文献综述自动化这一AI for Science工具分支中，一项LLM辅助系统综述报告：ChatGPT/GPT类模型是最主流的综述自动化架构（占纳入研究73.2%），且GPT类模型在数据提取上的平均精确度为83.0%、召回率为86.0%，优于BERT类模型；但数值数据的提取准确性较低。",
      "supportingPaperIds": [
        "openalex:W4410157139"
      ],
      "whyItMatters": "给读者提供一个具体量化基准：用LLM辅助系统综述时，可预期GPT类模型在文本书目数据提取上有约83%至86%的精确率与召回率，但数值型数据仍需人工检查。"
    },
    {
      "boundary": "这是来自单一科学合作的白皮书作者主张，聚焦LSST/DESC；不同大科学项目的情况可能不同；未核验其中具体工作流的性能。",
      "claimType": "author_claim",
      "contradictingPaperIds": [],
      "id": "C11",
      "maturity": "single_source",
      "statement": "在大科学项目层面，AI/ML已嵌入核心科学工作流而不仅是外围分析：LSST暗能量科学合作的白皮书报告，AI/ML已用于光度红移、瞬变分类、弱透镜推断和宇宙学模拟，并且不同探针之间反复出现相同的方法论挑战（不确定性量化、协变量偏移、模型误设和可重复集成），因此跨案例的方法投资能同时惠及多个科学目标。",
      "supportingPaperIds": [
        "arxiv:2601.14235"
      ],
      "whyItMatters": "说明在精密宇宙学这类高风险科学场景，AI的可用性受制于不确定性量化和验证框架；读者的判断应从“AI多准”转向“AI的不确定性是否可信”。"
    },
    {
      "boundary": "证据来自2020年早期（截止2020年3月）的文献，后续研究可能改变图谱；两篇综述的筛选标准不同；未核验其中任何AI模型的真实性能。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C12",
      "maturity": "reported",
      "statement": "AI for Science还有一个与危机响应对应的公共卫生分支：2020年的两篇综述报告，AI已应用于COVID-19的分子（药物与靶点）、临床（诊断与预后）和社会（疫情追踪与虚假信息）多个尺度；其中一篇快速回顾仅纳入11项研究，并列出数据不足、内部/外部验证不足、伦理与法律障碍等局限，说明该分支在疫情早期应用面广但证据基础薄弱。",
      "supportingPaperIds": [
        "arxiv:2003.11336",
        "openalex:W3087747282"
      ],
      "whyItMatters": "防止读者将“应用面广”误读为“证据成熟”，也提示危机场景中AI部署需要同时考虑数据质量和验证设计。"
    }
  ],
  "evidenceMode": "abstract_only",
  "schemaVersion": 1
}
