{
  "claims": [
    {
      "boundary": "结论主要来自特定任务（报童、翻牌前RFI）和三个LLM家族，且人类基准数据较旧，向其他高风险场景的迁移有待验证。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C1",
      "maturity": "supported",
      "statement": "LLM在扑克和报童等决策任务中复制并放大了人类系统性偏差，例如GPT-4在报童任务中平均订购偏差比人类基准高70%，在扑克翻牌前决策中偏离GTO策略；这些偏差在提供最优公式后仍部分存在，表明其根源在于模型架构而非知识缺口。",
      "supportingPaperIds": [
        "arxiv:2512.12552",
        "arxiv:2308.12466"
      ],
      "whyItMatters": "这意味着在部署AI辅助决策时必须假定其会犯人类式错误，且更先进的模型不一定更可靠，需要额外校准和监督。"
    },
    {
      "boundary": "证据来自扑克和Liar's Dice等博弈任务，且PokerSkill可能对GTOWizard过拟合，规则化提示在其他领域的效果需要验证。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C2",
      "maturity": "supported",
      "statement": "在LLM辅助的不完全信息决策中，显式提供领域规则或求解器蒸馏策略能显著提升决策质量，例如SCCS将LLM与求解器策略的平均L1距离从0.211降至0.100，PokerSkill将GPT-5.5在HUNL中的损失从-132降至-57 mbb/hand，说明规则约束比模型自由推理更接近理性基准。",
      "supportingPaperIds": [
        "openalex:W7202230800",
        "openalex:W7162893802"
      ],
      "whyItMatters": "这为现实应用提供了低成本缓解AI决策偏差的路径：将专家知识编码为可执行规则，而非追求更大模型或更多训练。"
    },
    {
      "boundary": "证据来自简化扑克环境（Leduc、Kuhn）和综述性讨论，在完整德州扑克或非平稳对手下的适用性未知。",
      "claimType": "cross_paper_synthesis",
      "contradictingPaperIds": [],
      "id": "C3",
      "maturity": "supported",
      "statement": "在复杂不完全信息博弈中，精确GTO策略因计算不可行而无法直接应用，而针对次优对手的剥削性策略可以在保持对纳什均衡对手稳健性的同时获得更高收益，例如AlphaExploitem在Leduc Hold'em上对次优对手平均约+1.0 BBs/hand，而GTO基准收益低于此。",
      "supportingPaperIds": [
        "arxiv:2401.06168",
        "openalex:W7161090269"
      ],
      "whyItMatters": "这提示现实风险管理不能只追求不可剥削的防御性策略，还需要识别和利用对手或市场的系统性偏差，但需权衡模型风险。"
    },
    {
      "boundary": "结论基于LLM生成的生态任务和已发表行为数据，且未包含工作记忆等约束，生态先验可能存在分布偏差。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C4",
      "maturity": "single_source",
      "statement": "人类在函数学习、类别学习和决策制定中的行为可以通过元学习生态先验的模型（ERMI）优于经典认知模型来解释，例如在函数学习插值中MSE为0.0171，低于经典模型的0.0256，表明许多认知偏差可能是对环境统计结构的理性适应而非纯粹缺陷。",
      "supportingPaperIds": [
        "arxiv:2509.00116"
      ],
      "whyItMatters": "这改变对偏差的负面定性，提示设计决策支持系统时应考虑环境结构，而不是简单纠正表面行为。"
    },
    {
      "boundary": "该论文无实证，且'认知主权'未操作化，扑克与董事会情境在反馈结构和对手性质上可能差异很大。",
      "claimType": "evidence_boundary",
      "contradictingPaperIds": [],
      "id": "C5",
      "maturity": "single_source",
      "statement": "扑克训练被理论化为能够培育领导者的'认知主权'（包括概率推理、情绪调节和战略欺骗），但这一主张目前仅基于理论类比，缺乏任何实证数据，因此不能作为扑克技能迁移到现实领导决策的直接证据。",
      "supportingPaperIds": [
        "openalex:W4411621406"
      ],
      "whyItMatters": "提醒读者对'扑克智慧可迁移到商业'的流行说法保持警惕，需要实验证据而非仅靠类比。"
    },
    {
      "boundary": "理论保证仅限两人零和博弈，且使用固定下注大小抽象，扩展到多人或更复杂环境尚不可行。",
      "claimType": "direct_finding",
      "contradictingPaperIds": [],
      "id": "C6",
      "maturity": "single_source",
      "statement": "基于强化学习与搜索的算法（如ReBeL）在不完全信息博弈中能够达到超人水平，例如在双人无限注德州扑克中以165±69千分之一bb/手击败人类专家Dong Kim，但其训练需要128台机器每台8 GPU，表明完全理性算法在现实高风险决策中的直接应用受限于计算成本。",
      "supportingPaperIds": [
        "s2:df2b23787a58b10962951d4f663809eb20a828ea"
      ],
      "whyItMatters": "这为理解人类与AI决策差异提供基准，也提示资源受限场景下需要近似或启发式方法。"
    }
  ],
  "evidenceMode": "fulltext",
  "schemaVersion": 1
}
