{
  "claims": [
    {
      "boundary": "共识来自立场论文和研讨会报告，缺少对机制效果的定量验证；不同学科对开放共享的接受度和可行性存在差异。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C1",
      "maturity": "supported",
      "statement": "AI for Science 的核心共识是，其成功不仅依赖算法改进，还取决于跨学科社区建设、数据基础设施和开放科学机制；单纯方法突破不足以解决科学采用障碍。",
      "supportingPaperIds": [
        "openalex:W4323697696",
        "openalex:W4401726605",
        "arxiv:2509.02661",
        "arxiv:2310.18852"
      ],
      "whyItMatters": "这改变了将 AI for Science 视为纯技术问题的认知，指出组织与制度因素同样是瓶颈。"
    },
    {
      "boundary": "主要证据来自材料科学和生物化学综述，跨领域普适性尚未经过系统验证；数据充分性的定量阈值不存在。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C2",
      "maturity": "supported",
      "statement": "在材料科学和生物化学等领域，高质量、大规模且标准化的数据是 AI 模型性能的主要限制因素；仅遵循 FAIR 原则不足以保证 AI 就绪性，还需要评估数据充分性。",
      "supportingPaperIds": [
        "openalex:W4402901051",
        "openalex:W4406828533"
      ],
      "whyItMatters": "指导资源投入优先解决数据准备问题，而不是盲目追求更大模型。"
    },
    {
      "boundary": "主要基于立场论文和案例，未证明在所有科学任务中必须人类介入；ARU 标准本身尚未在大规模实践中检验。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C3",
      "maturity": "supported",
      "statement": "多个分支强调可解释性和人类专家介入对科学发现至关重要；仅靠事后解释不足以保证科学结论，需要结合准确性、可再现性和可理解性标准，并用实验进行裁决。",
      "supportingPaperIds": [
        "arxiv:2406.10557",
        "openalex:W3205208140",
        "arxiv:2509.02661"
      ],
      "whyItMatters": "防止把 AI 输出当作科学真理，推动建立可解释性和验证规范。"
    },
    {
      "boundary": "证据多为案例报告和综述二手信息，缺少系统比较和失败案例；闭环验证多在数字环境，物理实验自动化仍在路线图中。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C4",
      "maturity": "supported",
      "statement": "AI for Science 正在从单一预测模型向自主发现、闭环实验的‘代理科学’演进，但当前成功案例（如虚拟实验室、机器集体智能）主要是在受控基准或数字阶段的存在性证明，尚未形成可推广到物理实验的成熟能力。",
      "supportingPaperIds": [
        "arxiv:2508.14111",
        "arxiv:2604.27297",
        "arxiv:2608.02775",
        "arxiv:2607.09025"
      ],
      "whyItMatters": "帮助区分宣传与已验证能力，避免高估自主科学 AI 的现状。"
    },
    {
      "boundary": "结论基于单一综述的案例整理，未做跨方法定量比较；是否能替代传统求解器无定论，正面案例可能带有选择偏差。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C5",
      "maturity": "single_source",
      "statement": "物理信息神经网络（PINNs）通过将偏微分方程嵌入损失函数，在流体、固体力学等领域展现出作为数值求解器替代或补充的潜力，但在高维问题、可扩展性和可靠性方面仍存在显著未解决挑战。",
      "supportingPaperIds": [
        "openalex:W4412642369"
      ],
      "whyItMatters": "为科学计算研究者提供方法选择参考，并指出 PINN 尚未成熟的边界。"
    },
    {
      "boundary": "该综述仅覆盖生物/化学 Transformer 模型，排除图神经网络、扩散模型；其结论反映 2024 年状态，可能已过时。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C6",
      "maturity": "single_source",
      "statement": "生物与化学科学大语言模型已发展出文本、分子、蛋白质、基因组和多模态五类，但评估基础设施滞后：缺乏大学后水平基准，且计算指标不能直接代表湿实验有效性。",
      "supportingPaperIds": [
        "openalex:W4406828533"
      ],
      "whyItMatters": "提醒研究者不要仅凭基准分数判断科学 LLM 的实用价值，推动开发更贴近实验的评测。"
    },
    {
      "boundary": "基于 2021 年发表时的少数典型案例，不能量化错误率；随着版本更新，某些限制可能已改善，但模型缺乏能量最小化、无法涵盖翻译后修饰等边界可能仍然存在。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C7",
      "maturity": "single_source",
      "statement": "AlphaFold2 的高置信度预测并不等于生物学上正确的结构；部分预测（如 CENP-E、Mad2）与实验结构不符，说明实验结构生物学仍是判定生物学真实状态和构象的必要手段。",
      "supportingPaperIds": [
        "openalex:W3205208140"
      ],
      "whyItMatters": "纠正对 AI 蛋白结构预测的过度信任，支持继续投资实验基础设施和模型作为假设生成器的使用方式。"
    },
    {
      "boundary": "基准仅使用 1000 样本、加性同方差噪声和静态因果图，非线性类型有限；不能代表所有真实时间序列因果场景。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C8",
      "maturity": "single_source",
      "statement": "因果发现基准实验表明，时间序列因果推断方法（如 Granger、PCMCI、DYNOTEARS）的性能对因果充分性、线性、无瞬时效应等假设高度敏感；违反假设时 F1 显著下降，且超参数选择（如 PCMCI 的 p 值阈值）对结果影响强烈。",
      "supportingPaperIds": [
        "arxiv:2104.08043"
      ],
      "whyItMatters": "为因果发现方法选择提供实证依据，强调必须检查假设并进行超参数调优，避免盲目应用。"
    },
    {
      "boundary": "结果局限于所选数据集和超参数配置，能耗为事后估计而非实测，未做统计显著性检验，因此排名差异可能是探索性的。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C9",
      "maturity": "single_source",
      "statement": "更新版符号回归基准（SRBench）显示，没有任何单一符号回归算法在所有数据集上全面领先；能耗、超参数搜索空间和数据噪声对算法排名有实质性影响，且高复杂度模型可能只是拟合噪声。",
      "supportingPaperIds": [
        "arxiv:2505.03977"
      ],
      "whyItMatters": "推动符号回归研究从追求单一指标转向考虑资源效率和鲁棒性，为算法选型提供更现实依据。"
    },
    {
      "boundary": "结论基于对现有技术的综述和单一案例（AlphaFold2），并未量化科学领域内存技术未充分利用的程度，推广到其他科学架构需谨慎。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C10",
      "maturity": "single_source",
      "statement": "科学 Transformer 模型（如 AlphaFold2）的训练受‘AI 内存墙’制约，现有通用内存优化技术未充分应用于科学架构，需要针对 Evoformer、SE(3)-Transformer 等定制优化，如 AlphaFold2 中的序列维动态并行。",
      "supportingPaperIds": [
        "arxiv:2501.11847"
      ],
      "whyItMatters": "指出科学大模型扩展的计算基础设施瓶颈，为工程优化提供方向。"
    },
    {
      "boundary": "仅限于大语言模型，表格对比具有时效性且依赖模型版本；对象方向研究多为检测分类，缺乏机制解释。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C11",
      "maturity": "single_source",
      "statement": "在社会科学中，将 AI 作为工具在速度、成本、可重复性和可扩展性方面通常优于传统方法，但在效度、数值分析和机制解释方面较弱；LLM 能否替代人类受试者仍是开放问题，目前不能取代社会科学家。",
      "supportingPaperIds": [
        "arxiv:2401.11839"
      ],
      "whyItMatters": "为社会科学研究采用 AI 提供权衡框架，避免仅因效率而牺牲效度。"
    },
    {
      "boundary": "该框架是分析性工具而非可运行算法，其关于累积洞察力的主张是逻辑推断而非实证结果；社区级共享依赖尚未解决激励机制。",
      "claimType": "author_claim",
      "contradictingPaperIds": [],
      "id": "C12",
      "maturity": "single_source",
      "statement": "演化智能视角认为，累积科学发现的关键不仅在于候选解优化，还在于保留搜索历史和失败候选；失败实验和谱系记录可以作为科学证据，用于提炼设计规则和可测试假设。",
      "supportingPaperIds": [
        "arxiv:2607.09025"
      ],
      "whyItMatters": "改变对失败的认知，推动构建保留完整搜索过程的基础设施，提高研究可追溯性。"
    }
  ],
  "evidenceMode": "fulltext",
  "schemaVersion": 1
}
