研究综述

德州扑克里的决策课:偏差、规则与认知边界

用扑克和报童实验区分有证据支持的偏差结论与仅靠类比的领导力启示,并说明规则约束如何降低 AI 决策风险。

10 + 30精读 + 摘要扫描
2020–2026首次公开跨度
6主题标签
2026-08-20引用快照
10 篇全文精读30 篇摘要扫描2020–2026更新于 2026-08-20发起人 admin

现有证据表明,德州扑克为研究不完全信息下的决策偏差和风险管理提供了可量化的试验台,并且通过求解器蒸馏或规则约束能显著改善 AI 辅助决策,但将扑克技能迁移到现实领导力的结论仍缺乏实证。

  • · 不细化到具体牌桌上的心理技巧,而侧重领域级启示
  • · 不包含赌博成瘾的临床干预内容
未覆盖项与数据缺口
  • semantic_scholar
  • openalex
  • 补充检索后证据仍不足:德州扑克研究为理解人类在不确定条件下的期望值决策提供了哪些核心共识?这些共识如何挑战传统理性选择理论?
  • 补充检索后证据仍不足:扑克研究揭示的认知偏差结论向现实决策迁移时,存在哪些边界条件或不适用场景?扑克研究对决策心理学理论(如生态理性)的贡献与争议如何界定其结论的适用边界?
  • 补充检索后证据仍不足:扑克玩家的风险管理策略(如资金管理、止损规则)在金融投资等现实高风险决策中的有效性证据如何?在直觉与理性计算之间,扑克研究如何指导实践者的下一步选择?

Chronology

论文时间轴

按首次公开时间排列;星级表示编辑阅读价值,引用数表示外部传播度。

先看结论

核心洞见

先给出最重要、最能改变判断的结论,再展开正文。

I1

AI 决策复制并放大人类偏差

在库存决策和扑克翻牌前两个完全不同的任务里,GPT-4 与 ChatGPT 都表现出稳定偏离最优策略的模式,且偏离方向相反——一个过于保守,另一个过于激进。报童实验中,GPT-4 的订购偏差比人类基准高 70%,即使拿到最优公式后偏差仍部分存在,说明问题不在知识缺口,而在模型架构本身。

部署 AI 辅助决策时不能默认其可靠,需要额外校准和监督,尤其要警惕复杂模型因过度分析而犯错。

适用范围与来源

现有研究测量了报童库存和翻牌前 RFI 等单步决策,涉及三个 LLM 家族;未测量多轮互动、真实人类对手或金融投资等高风险场景。

I2

规则约束比自由推理更接近理性

两篇独立研究分别用求解器蒸馏规则和人类专家规则库约束 LLM 决策:前者将 LLM 与求解器策略的平均 L1 距离从 0.211 降到 0.100,后者将 GPT-5.5 在双人无限注德州扑克中的损失从 -132 改善到 -57 mbb/hand。两者共同表明,显式规则约束比让模型自己推理更有效。

在现实应用中应优先把专家知识编码为可执行规则或约束,而不是单纯追求更大模型或更多训练数据。

适用范围与来源

证据来自两人扑克和 Liar's Dice 等博弈任务,且 PokerSkill 可能对 GTOWizard 基准过拟合;未验证其他领域或真实人类对手。

I3

打最优牌不等于赚最多钱

AlphaExploitem 在 Leduc Hold'em 上利用对手的次优策略获得约 +1.0 BBs/hand,而严格 GTO 基线收益更低;综述也指出人类对手会无意偏离 GTO,剥削性策略可提高期望收益。这改变了“GTO 永远最优”的抽象认识,但需要识别对手偏差并承担模型风险。

风险管理不能只追求不可剥削的防御性策略,还应主动识别并利用对手或市场的系统性偏差,同时控制误判成本。

适用范围与来源

证据来自简化扑克环境(Leduc、Kuhn)和综述性讨论,未在完整德州扑克或非平稳对手下验证。

I4

认知偏差可能是适应而非缺陷

ERMI 模型通过元学习生态先验,在函数学习和类别学习任务上预测人类行为优于经典认知模型,例如函数学习插值 MSE 为 0.0171,低于经典模型的 0.0256。这与 C1 中 LLM 偏差源于架构缺陷形成对比,但本研究未直接比较人类与 LLM 的偏差来源。

设计决策支持系统时应考虑环境统计结构,把偏差视为环境适应的结果,而不是简单纠正表面行为。

适用范围与来源

结论基于 LLM 生成任务和已发表行为数据,未包含工作记忆等认知约束,且仅一篇研究,未在其他独立样本复制。

专题 01

当前研究版图

现有研究主要从哪些问题入口展开?

现有研究主要从三个问题入口展开:一是能否在计算资源有限时逼近不可剥削的均衡,又能否利用对手偏差超越均衡(对应主张 C3 与 C6);二是 LLM 在报童和扑克等不确定任务中是否复制人类偏差,以及结构化规则能否纠正这些偏差(C1 与 C2);三是把扑克当作认知实验室,追问人类偏差是否是对环境统计的适应,或扑克训练能否迁移到一般决策能力(C4 与 C5)。

两条技术路线形成鲜明对照:纯算法路线(如 ReBeL)以大量计算换取接近纳什均衡的策略,训练数据生成需要 128 台机器、每台 8 GPU(C6);而规则化 LLM 路线(如 PokerSkill 和 SCCS)无需训练或求解器即可将 GPT-5.5 在 HUNL 中的损失从 -132 降至 -57 mbb/hand,或把 8 种 LLM 配置对求解器策略的平均 L1 距离从 0.211 降到 0.100(C2)。前者提供理性上限但成本高昂,后者贴近应用但依赖专家规则并可能对基准过拟合。

第三个问题入口与“偏差是否合理”相连。一方面,GTO 综述指出精确均衡因限注德州扑克游戏树有 3.6×10^17 个节点而不可计算,剥削性策略可能比严格 GTO 获得更高收益(C3);另一方面,元学习生态先验模型显示,人类在函数学习等任务中的行为可由对环境统计结构的适应来解释,而非纯粹缺陷(C4)。这两个结论共同提示:现实决策需要结合对环境结构的估计和对对手偏差的识别,而不是盲目追求理论最优。

最后,扑克训练向领导力等现实场景迁移的入口仍是理论空档:一篇理论论文提出“认知主权”但没有任何实证数据(C5)。因此,当前版图中 AI 决策偏差与规则化缓解、均衡计算与剥削策略已有初步实验支撑,而扑克技能向人类现实决策的因果迁移尚无任何受控实验,这构成后续研究需要补足的具体缺口。

本节来源

专题 02

这些结论能相信到什么程度

当前证据没有回答什么?

当前证据没有回答扑克技能是否以及如何迁移到现实领导、投资或谈判决策;所有关于“认知主权”的论述都来自一篇无实证的理论文章,只建立了类比,没有在真人群体中测评扑克训练前后的决策变化。因此,从扑克研究到现实应用的直接因果推断目前是缺失的,而不是被反对的。

第二,关于LLM复制人类偏差的结论仅来自少数模型和特定任务:报童实验只测了GPT-4、GPT-4o和LLaMA-8B,人类基准是2000年的数据;扑克实验只覆盖翻牌前RFI,且未模拟对手建模。更重要的是,规则约束并非普遍有效:在报童实验中,提供最优公式后GPT-4仍出现正收敛斜率+1.191,而GPT-4o接近最优;这说明“提供规则就能修正偏差”的叙述在复杂模型上可能失效,但尚未在金融或医疗等高风险领域复现。当前证据只能支持LLM在这些任务中表现出偏差,不能支持所有AI辅助决策都会如此。

第三,关于剥削性策略优于GTO的证据全部来自Kuhn Poker和Leduc Hold'em这些低复杂度环境,对手是固定的、平稳的;AlphaExploitem在Leduc上对次优池约+1.0 BBs/hand,但训练一个种子要12小时,且未在完整德州扑克或会调整策略的真人对手上测试。同时,综述指出限注德州扑克游戏树有3.6×10^17种变化,精确GTO不可计算,但两者结合并不能推出在真实扑克中剥削性策略更好——因为真实对手会观察并反制,而简化环境中的泛化性未知。此外,完全理性算法如ReBeL虽达到超人水平,但其理论保证仅限两人零和博弈,训练需128台机器每台8 GPU,资源门槛使直接移植到组织决策不可行。

第四,关于人类偏差可能是生态理性适应的结论仅由单一来源ERMI支持:该研究用LLM生成任务训练元学习模型,在函数学习插值MSE=0.0171优于经典模型,但训练数据来自LLM可能存在分布偏差;模型没有包含工作记忆、注意力等约束,且部分类别学习任务中与人类行为不一致。因此,这一结论目前是单一来源的假设,没有被独立人类行为数据或非LLM生成生态任务检验,不能作为普遍认知原则。

本节来源

Core paper guide

核心论文导读

先用几分钟认识每篇核心论文:它解决什么问题、采用什么方法、得出了什么结果,以及阅读时需要留意什么。

01

The Psychology of the Poker Player: Neuro-Cognitive Models from Poker Table to the Boardroom

2025-01-01 · openalex

为扑克心理学与领导力决策提供理论桥梁,但证据强度低,需实证检验,主要用于提出研究问题而非回答它们。

怎么做文献综述与理论整合,无原始实验或数据采集。

主要发现
  • 论文未报告原始实证数据;所有发现均为基于文献的理论推论,如损失厌恶比例约2:1、工作记忆约4个信息块20秒等。

阅读时注意无实证数据支持,结论缺乏经验基础。

02

Are ChatGPT and GPT-4 Good Poker Players? -- A Pre-Flop Analysis

2023-08-23 · arxiv

实证揭示LLM在扑克决策中表现出类似人类风格的系统性偏差,为AI决策偏差研究提供基础案例。

怎么做通过OpenAI API对169种起手牌×8个位置进行查询,使用系统提示和用户提示,ChatGPT每组合10次、GPT-4每组合5次取多数决策,与GTO参考图表(Little)比较。

主要发现
  • ChatGPT和GPT-4在翻牌前RFI场景均偏离GTO策略:ChatGPT过于保守(频繁弃牌、出现limp),GPT-4过于激进(从不limp、加注范围过宽)。
  • 提示形式显著影响模型决策,如'A4s'与'4As'导致不同决策矩阵。

阅读时注意仅分析翻牌前RFI,最简单决策点,无法推断后续回合。

03

Beyond Game Theory Optimal: Profit-Maximizing Poker Agents for No-Limit Holdem

2025-09-28 · arxiv

探讨超越GTO的利润最大化路径,强调GTO作为防御基线的重要性,但剥削部分仅概念性,为后续剥削研究提供框架。

怎么做生成合成NLHE状态(特征street, equity, texture,分布0.4,0.3,0.2,0.1),用CFR、MCCFR、DeepCFR、NFSP自博弈训练,与GTO代理比较。

主要发现
  • 在合成NLHE决策状态上,MCCFR在单挑中500次迭代后Top-1=1.000、KL=0.015、CE=0.891,最接近GTO代理。
  • 3人局中CFR的Top-1=0.478,高于其他模型;6人局MCCFR的CE最低但Top-1与随机相同。

阅读时注意合成数据可能无法完全代表真实牌局。

04

Meta-learning ecological priors from large language models explains human learning and decision making

2025-08-28 · arxiv

提供生态理性分析框架解释人类决策偏差,支持'决策是适应环境结构'的观点,为理解扑克中的启发式与偏差提供理论背景。

怎么做使用LLM(Claude-V2)生成认知任务,通过元学习训练ERMI(Transformer架构),在函数学习、类别学习、决策制定上逐试验预测人类行为,并与多种认知模型比较。

主要发现
  • ERMI在函数学习插值中MSE=0.0171,显著低于MI的0.0256;在类别学习Shepard任务中MSE=0.03 vs 0.26。
  • 在决策制定任务中,ERMI的后验模型频率最高(双属性实验0.7299,四属性实验0.6284)。

阅读时注意LLM生成任务可能存在分布偏差或噪声,未系统评估影响。

05

Large Language Newsvendor: Decision Biases and Cognitive Mechanisms

2025-12-14 · arxiv

实证展示LLM复制并放大人类认知偏差,揭示'智能悖论',对理解AI辅助决策的风险和偏差管理有直接启示。

怎么做动态报童实验,15轮,三种需求分布(均匀、正态、对数正态),每条件10次重复,比较有无最优公式提示,使用温度1.0。

主要发现
  • 无公式提示下,LLMs复制'过低/过高'订购偏差,GPT-4在低利润均匀分布下偏差+100.25,比人类基准+59.06高70%。
  • 风险中性环境中偏差仍存在(GPT-4均匀高利润-1.16%,LLaMA-8B-10.95%,GPT-4o≤0.11%),证明偏差非源于风险规避。

阅读时注意模拟报童问题可能不反映现实供应链复杂性。

06

Solver-Guided Reasoning for Mixed-Equilibrium Strategies

2026-08-07 · openalex

展示如何将求解器知识转化为可理解规则来改善LLM决策,强调可解释性在决策辅助中的价值。

怎么做使用商业求解器生成250M+混合策略决策,训练混合策略决策树(MDT),用场景约束反事实采样(SCCS)提取对比规则,在NLH和Liar's Dice上评估LLM表现。

主要发现
  • SCCS规则将8种LLM配置的平均L1距离从0.211降至0.100,相对改善52.6%。
  • argmax动作一致率从直接提示的57.2%提升至SCCS的76.1%。

阅读时注意硬稀疏化导致保真度损失(硬MDT L1=0.087 vs 密集模型0.021)。

07

Combining Deep Reinforcement Learning and Search for Imperfect-Information Games

2020-07-27 · semantic_scholar

里程碑式工作,证明RL+搜索可在不完美信息博弈中达到超人水平,为AI在不确定环境下的决策提供方法原型。

怎么做将不完全信息博弈转换为公共信念状态(PBS)的完美信息博弈,训练值/策略网络,在深度受限子博弈内运行CFR搜索,训练和测试时均使用搜索,测试时随机选择迭代保证安全。

主要发现
  • ReBeL在TEH中250次迭代后利用性约0.01,相当于tabular CFR约125次迭代的水平。
  • 在HUNL中击败BabyTartanian8、Slumbot,并以165±69千分之一bb/手击败人类专家Dong Kim(7500手)。

阅读时注意输入维度随信息状态数量线性增长,在公共信息少的游戏中不可行。

08

PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers

2026-05-28 · openalex

展示LLM+人类规则的低成本路径达到专家级扑克,对AI辅助决策与人类专家知识结合具有启示。

怎么做构建由人类专家设计的分层技能库,上下文引擎检索相关技能并限制动作空间,ATT/DEF预算系统编码数值约束,LLM在受限选项中决策。

主要发现
  • PokerSkill将GPT-5.5 XHigh损失从-132降至-57 mbb/hand(57%改善),Claude Opus 4.6从-204降至-80(61%),Claude Opus 4.7从-170降至-87(49%)。
  • 纯规则基线(无LLM)达到-132±19 mbb/hand,与默认提示LLM相当,但远低于PokerSkill+LLM的-57。

阅读时注意Slumbot比较为间接,方差削减方法不同导致置信区间不可比。

09

A Survey on Game Theory Optimal Poker

2024-01-02 · arxiv

提供GTO扑克的理论背景和挑战,奠定后续将扑克作为AI决策试验台的理解基础。

怎么做文献综述,定性比较GTO与剥削策略、抽象技术、下注模型、多人游戏策略。

主要发现
  • 限注德州扑克游戏树有3.6×10^17种变化,精确GTO计算不可行。
  • 人类对手会无意偏离GTO,可被剥削性策略利用以提高EV。

阅读时注意缺乏定量比较数据。

10

AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play

2026-05-09 · openalex

实证展示利用跨手牌历史信息超越纳什均衡,为适应性决策和对手建模提供启示。

怎么做在AlphaHoldem架构上新增分层Transformer编码器处理过去手牌序列,训练中包含K-best联盟、固定弱策略池和动态长尾快照缓冲,在Kuhn和Leduc上评估。

主要发现
  • 在Leduc Hold'em上,AlphaExploitem对分布内玩具池奖励约+1.0 BBs/hand,AlphaHoldem约+0.5。
  • 掩蔽跨手牌上下文后,Leduc ID奖励从+1.10降至+0.54 BBs/hand,OOD从+1.16降至+0.52,约一半收益来自上下文。

阅读时注意仅评估平稳对手,未考虑非平稳策略。

研究地图与证据附录

Research coordinates

研究坐标与主题星云

先建立读懂该方向所需的知识地图,再从高区分度主题进入论文证据。

Claim ↔ evidence

核心主张—证据网络

只展示有直接证据关系的连接;● 表示支持,◆ 表示反对或冲突。悬停或聚焦主张可追踪对应论文。

结论主张

C6单一来源

基于强化学习与搜索的算法(如ReBeL)在不完全信息博弈中能够达到超人水平,例如在双人无限注德州扑克中以165±69千分之一bb/手击败人类专家Dong Kim,但其训练需要128台机器每台8 GPU,表明完全理性算法在现实高风险决策中的直接应用受限于计算成本。

Institution landscape

本论文集中的机构显著度

覆盖最终纳入的精读与摘要扫描论文,按论文覆盖数和编辑重要性汇总;摘要论文仅计基础权重,不代表全球机构排名或机构质量评价。

最终纳入集合的可信机构覆盖:8 / 40 篇论文

Citation waterfall

论文引用时间瀑布

覆盖最终纳入的精读与摘要扫描论文,仅显示由精确论文标识确认的集合内引用;缺少边不等于论文之间没有关系。

最终纳入集合的可验证关系覆盖:19 / 40 篇论文 · 26 条集合内引用边

全文精读摘要扫描

小屏幕可左右滑动查看完整时间网络。

20192020202120222023202420252026未知The role of affect in m…The role of affect in management decisions: A systematic review · 2019 · 摘要扫描QuLBIT: Quantum-Like Ba…QuLBIT: Quantum-Like Bayesian Inference Technologies for Cognition and Decision · 2020 · 摘要扫描Combining Deep Reinforc…Combining Deep Reinforcement Learning and Search for Imperfect-Information Games · 2020 · 全文精读Using Resource-Rational…Using Resource-Rational Analysis to Understand Cognitive Biases in Interactive Data Visualizations · 2020 · 摘要扫描Deciding Fast and Slow:…Deciding Fast and Slow: The Role of Cognitive Biases in AI-assisted Decision-making · 2020 · 摘要扫描Kuhn Poker with Cheatin…Kuhn Poker with Cheating and Its Detection · 2020 · 摘要扫描Rational AI: A comparis…Rational AI: A comparison of human and AI responses to triggers of economic irrationality in poker · 2021 · 摘要扫描AlphaHoldem: High-Perfo…AlphaHoldem: High-Performance Artificial Intelligence for Heads-Up No-Limit Poker via End-to-End Reinforcement Learning · 2022 · 摘要扫描Are ChatGPT and GPT-4 G…Are ChatGPT and GPT-4 Good Poker Players? -- A Pre-Flop Analysis · 2023 · 全文精读A Survey on Game Theory…A Survey on Game Theory Optimal Poker · 2024 · 全文精读Play the Man, Not the C…Play the Man, Not the Cards. (Homo)socialities and Masculine Positions in Poker · 2024 · 摘要扫描Preference-CFR$\:$ Beyo…Preference-CFR$\:$ Beyond Nash Equilibrium for Better Game Strategies · 2024 · 摘要扫描The Psychology of the P…The Psychology of the Poker Player: Neuro-Cognitive Models from Poker Table to the Boardroom · 2025 · 全文精读PokerBench: Training La…PokerBench: Training Large Language Models to become Professional Poker Players · 2025 · 摘要扫描Meta-learning ecologica…Meta-learning ecological priors from large language models explains human learning and decision making · 2025 · 全文精读Beyond Game Theory Opti…Beyond Game Theory Optimal: Profit-Maximizing Poker Agents for No-Limit Holdem · 2025 · 全文精读Large Language Newsvend…Large Language Newsvendor: Decision Biases and Cognitive Mechanisms · 2025 · 全文精读Predicting Biased Human…Predicting Biased Human Decision-Making with Large Language Models in Conversational Settings · 2026 · 摘要扫描On Creating Human Model…On Creating Human Models in Poker with Deep Learning and Regularized Search · 2026 · 摘要扫描StratFormer: Adaptive O…StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games · 2026 · 摘要扫描Analyzing Human Heurist…Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design · 2026 · 摘要扫描AlphaExploitem: Going B…AlphaExploitem: Going Beyond the Nash Equilibrium in Poker by Learning to Exploit Suboptimal Play · 2026 · 全文精读PokerSkill: LLMs Can Pl…PokerSkill: LLMs Can Play Expert-Level Poker without Training or Solvers · 2026 · 全文精读Limit Continuous Poker:…Limit Continuous Poker: A Variant of Continuous Poker with Limited Bet Sizes · 2026 · 摘要扫描Poker Arena: Multi-Axis…Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs · 2026 · 摘要扫描Variable Bound Tighteni…Variable Bound Tightening for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games · 2026 · 摘要扫描Projected Exploitabilit…Projected Exploitability Descent for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games · 2026 · 摘要扫描Player Psychology and D…Player Psychology and Decision-Making in Board Game COUP · 2026 · 摘要扫描QualGames: A Qualtrics …QualGames: A Qualtrics implementation and a database of behavioral game theory tasks · 2026 · 摘要扫描A Gold-Standard Study o…A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong · 2026 · 摘要扫描From Rules to Nash Equi…From Rules to Nash Equilibria: A Lean 4 Case Study in Game-Theoretic Analysis of a Competitive Trading Card Game · 2026 · 摘要扫描Using the game can't st…Using the game can't stop to inform the novel behavioural state of near-loss. · 2026 · 摘要扫描On the Power of Decepti…On the Power of Deception in Repeated Games · 2026 · 摘要扫描Agents That Certify The…Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation · 2026 · 摘要扫描AV-AIVAT: 74x Cheaper A…AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games · 2026 · 摘要扫描Solver-Guided Reasoning…Solver-Guided Reasoning for Mixed-Equilibrium Strategies · 2026 · 全文精读Beyond the Black Box: I…Beyond the Black Box: Interpretable Models of Human Randomisation Failures · 2026 · 摘要扫描Learning strategic poke…Learning strategic poker decision-making with Large Language Models · 2026 · 摘要扫描CoupVisor: Strategy Opt…CoupVisor: Strategy Optimization by Round and Challenge Decision Support · 2026 · 摘要扫描Omission matters: Refra…Omission matters: Reframing omission as action reduces apparent loss aversion · 未知 · 摘要扫描
研究问题核对(1 / 5 已覆盖)
RQ1部分回答

德州扑克研究为理解人类在不确定条件下的期望值决策提供了哪些核心共识?这些共识如何挑战传统理性选择理论?

2 直接研究2 定量结果1 反向/限定证据

仍缺:直接研究不足 2/3

查看证据卡摘要
  1. 直接研究

    通过LLM生成生态有效任务并用元学习训练得到的ERMI模型,在函数学习、类别学习和决策制定中逐试验预测人类行为均优于经典认知模型,表明人类决策可能是对环境统计结构的理性适应。

    ERMI在函数学习插值中MSE=0.0171(MI=0.0256),在Shepard类别学习MSE=0.03(MI=0.26),在决策制定后验模型频率最高。

  2. 直接研究

    在动态报童决策中,GPT-4、GPT-4o和LLaMA-8B复制并放大了人类订购偏差,且提供最优公式后偏差仍存在,说明LLM的决策偏差源于架构约束而非知识缺口,挑战了理性计算模型的预期。

    无公式提示下GPT-4在低利润均匀分布偏差+100.25,比人类基准+59.06高70%;风险中性环境中偏差仍存在;提供公式后GPT-4o收敛斜率接近零,GPT-4出现+1.191。

RQ2部分回答

扑克专家与新手之间的决策差异受哪些环境条件(如经验、反馈、压力)影响?这些条件如何在不同扑克情境(如现金局与锦标赛)中调节决策能力?

1 直接研究1 定量结果2 反向/限定证据

仍缺:直接研究不足 1/2

查看证据卡摘要
  1. 综合证据

    该文从理论层面提出,扑克专家通过训练获得概率推理、情绪调节和战略欺骗能力,而新手在这些方面可能不足,但这一专家优势的差异缺乏行为数据验证。

  2. 直接研究

    在合成NLHE决策状态中,不同CFR变体的GTO收敛指标随玩家数变化,CFR在3人局Top-1最高为0.478,而MCCFR在6人局Top-1与随机相同,说明博弈中的玩家数量会调节策略学习和均衡收敛。

    MCCFR单挑Top-1=1.000、KL=0.015、CE=0.891;3人局CFR Top-1=0.478;6人局MCCFR CE最低但Top-1与随机相同。

RQ3证据达标

在扑克研究中,理性博弈论最优策略与人类实际行为之间的差距体现了哪些权衡?这一差距对设计现实决策辅助工具(如AI建议系统)有何启示?

5 直接研究6 定量结果3 反向/限定证据
查看证据卡摘要
  1. 直接研究

    ChatGPT和GPT-4在翻牌前RFI决策中都偏离GTO,ChatGPT过于保守而GPT-4过于激进,且GPT-4在按钮位按要求采用GTO时会加注90%手牌,说明LLM实际行为与理性GTO基准存在明显差距。

    ChatGPT频繁弃牌并出现limp,GPT-4从不limp且加注范围过宽;两种模型均非GTO玩家。

  2. 综合证据

    精确GTO策略在限注德州扑克中因游戏树有3.6×10^17种变化而不可计算,实践者必须采用抽象、离散化下注和剥削性策略来近似或超越GTO,这体现了完全理性策略的计算不可行。

    CFR+在HULHE中的可剥削性为0.986毫大盲每局;Loki等系统通过对手建模实现剥削性玩法。

  3. 直接研究

    将求解器混合策略蒸馏为可解释规则后,8种LLM配置对求解器策略的L1距离从0.211降至0.100,相对改善52.6%,说明用规则化提示比直接给原始求解器输出更能弥合LLM与GTO之间的差距。

    SCCS使平均L1距离从0.211降至0.100;argmax一致率从57.2%升至76.1%;河牌端局MDT可剥削性低于Deep CFR。

RQ4部分回答

扑克研究揭示的认知偏差结论向现实决策迁移时,存在哪些边界条件或不适用场景?扑克研究对决策心理学理论(如生态理性)的贡献与争议如何界定其结论的适用边界?

0 直接研究0 定量结果1 反向/限定证据

仍缺:直接研究不足 0/2;独立场景不足 1/2

查看证据卡摘要
  1. 反例或质疑

    这篇理论论文主张扑克训练能培育领导者的认知主权,但它没有提供任何实证数据,并且将扑克与董事会情境直接类比可能过度简化,因此不能作为扑克技能迁移到现实领导决策的直接证据。

RQ5部分回答

扑克玩家的风险管理策略(如资金管理、止损规则)在金融投资等现实高风险决策中的有效性证据如何?在直觉与理性计算之间,扑克研究如何指导实践者的下一步选择?

1 直接研究1 定量结果0 反向/限定证据

仍缺:直接研究不足 1/3;独立场景不足 1/2

查看证据卡摘要
  1. 真实部署

    动态报童实验显示,提供结构化最优公式或规则化提示可以显著改善LLM的决策轨迹,而依赖模型自主推理可能放大偏差,因此在高风险决策中应引入规则约束和人机协同监督来管理AI建议风险。

    GPT-4o在提供公式后收敛斜率接近零;GPT-4仍出现正收敛斜率,表明公式不能保证复杂模型最优。

摘要线索(30 篇,默认折叠)

摘要级线索

AlphaHoldem: High-Performance Artificial Intelligence for Heads-Up No-Limit Poker via End-to-End Reinforcement Learning

2022-06-28 · semantic_scholar

方法:采用端到端自对弈强化学习框架,使用伪孪生架构直接从输入状态学习输出动作,引入了新的牌面和下注信息状态表示、多任务自对弈训练损失函数和模型评估选择指标。

  • AlphaHoldem在10万手牌研究中击败Slumbot和DeepStack,仅需一台PC训练三天。
  • 每次决策仅需2.9毫秒,比DeepStack快1000倍以上。

与本研究的关系:展示了在不完美信息博弈中通过自对弈强化学习实现高效决策的可行性,对理解人类在不确定性下的快速决策、风险管理和策略学习具有启示意义。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Preference-CFR$\:$ Beyond Nash Equilibrium for Better Game Strategies

2024-11-02 · openalex

方法:提出Preference-CFR方法,在反事实遗憾最小化中引入偏好度和脆弱度两个参数,使智能体在可接受性能损失范围内调整策略分布。

  • 在德州扑克实验中,Preference-CFR成功训练出激进和松散被动风格,性能与原始CFR策略相当但行为模式明显不同。
  • 在某些手牌场景中,产生的策略与传统专家启发式和原始CFR显著不同,可能为职业选手提供新见解。

与本研究的关系:说明在决策中考虑策略多样性和风险偏好的重要性,启示人类在风险管理中可以根据自身偏好调整决策风格,并在保持性能的同时探索非常规策略。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

2026-08-06 · openalex

方法:将AIVAT方差缩减技术与随时有效置信序列结合,形成AV-AIVAT,通过在线值模型从过去游戏中学习并避免自我校正,使用渐近置信序列和实证Bernstein置信序列进行认证。

  • 在名义95%水平和±1大盲目标精度下,原始结果所需手数中位数是AIVAT校正结果的74倍。
  • 在Leduc hold'em中建立了精确有限样本认证,在HUNL描述性运行中实现中位数1.37倍的停止时间比。

与本研究的关系:解决了在不完美信息博弈中评估智能体强弱时何时停止收集证据的问题,对现实决策中如何在不确定环境中高效地判断风险并做出及时结论具有启示。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Limit Continuous Poker: A Variant of Continuous Poker with Limited Bet Sizes

2026-05-31 · arxiv

方法:引入并分析限注连续扑克,推导该变体的纳什均衡策略,研究下注者与跟注者策略对下注大小限制的依赖关系。

  • 推导出限注连续扑克的纳什均衡策略,并揭示其如何随下注限制变化。
  • 当下注限制趋于极端值时,策略收敛到其他连续扑克变体,并将结论联系到现实扑克中有限下注的战略意义。

与本研究的关系:从理论层面剖析信息不对称、诈唬、平衡和注额限制的交互作用,为现实博弈中如何根据可用选项调整策略和风险管理提供数学基础。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation

2026-07-30 · semantic_scholar

方法:提出预算约束的置信度调度受限响应方法,使用随时有效置信序列跟踪对手动作频率,仅当置信区间与均衡参考分离时判定可剥削,通过受限响应求解生成候选策略,并用全树最佳响应在部署前评估生成安全证书。

  • 在Leduc hold'em中,CS-RNR获得6.2倍于金钱验证二元门控的稳态收益,同时保持每个部署策略在预算内。
  • 在所有36000手审计手中均满足报告的证书容差,证明了方法的安全性和可靠性。

与本研究的关系:展示了在不完美信息博弈中既利用对手弱点又严格控制风险的机制,对现实决策中如何在利用他人认知偏差的同时管理潜在损失具有重要启示。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games

2026-04-28 · openalex

方法:提出基于 Transformer 的元代理 StratFormer,采用两阶段课程学习:第一阶段在博弈论最优策略下训练对手建模头,第二阶段按可利用性驱动的正则化逐步转向最佳响应利用;架构使用双回合标记和桶率特征。

  • StratFormer 能同时建模和利用多种对手行为,平均对 GTO 获得 +0.106 大盲注/手的利用增益,对高度可利用对手峰值增益 +0.821。
  • 该模型在提升利用效果的同时保持接近均衡安全性。

与本研究的关系:通过德州扑克变体展示自适应对手建模与利用的可行性,启示现实决策中应结合对他人行为的预测与自身策略的稳健性,在风险与收益间取得平衡。

适用范围:仅在 Leduc Hold'em 小型扑克变体上验证,摘要未说明对大型扑克的泛化情况。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

On Creating Human Models in Poker with Deep Learning and Regularized Search

2026-02-01 · openalex

方法:结合深度神经网络与正则化搜索,以行为克隆为基础构建扑克玩家的人类模型。

  • 模型能够表达多种类似人类的行为。
  • 人类相似性与策略强度之间存在权衡,可以在低可利用性成本下提升近似均衡策略的人类相似性,或在低人类预测准确性成本下提升人类类似策略的强度。

与本研究的关系:展示了如何用计算模型刻画人类打牌行为,有助于理解人类决策模式,并为在现实场景中训练更拟人化的智能体或评估人类行为偏差提供思路。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Learning strategic poker decision-making with Large Language Models

2026-08-08 · openalex

方法:摘要未说明

  • 摘要未说明

与本研究的关系:标题指向使用大语言模型学习战略扑克决策,可能与利用语言模型改进决策相关,但摘要未提供实质内容。

适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Rational AI: A comparison of human and AI responses to triggers of economic irrationality in poker

2021-11-14 · arxiv

方法:使用常数相对风险厌恶效用函数的随机效用模型,估计 Pluribus 与人类玩家的潜在风险和理性参数,并比较触发经济损失/收益前后的决策。

  • Pluribus 在控制其他因素后会对经济得失调整打牌风格。
  • 经历触发后,Pluribus 变得更风险厌恶和理性,而人类变得更风险寻求和非理性。
  • 在双方都经历触发后,Pluribus 与人类在风险厌恶和理性维度上的风格差异尤其明显,可作为“行为特征”区分算法与人类决策者。

与本研究的关系:直接对比人工智能与人类在扑克中的损失/收益反应,揭示人类在风险决策中的非理性倾向,有助于理解认知偏差并设计更稳健的决策系统。

适用范围:分析基于 Pluribus 这一单一 AI 系统及其 10,000 手扑克数据,摘要未说明对其他算法的普遍性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

2026-06-11 · openalex

方法:构建 Poker Arena 无限注德州扑克平台,采用三层记忆架构(手内、会话、跨会话)和九轴认知画像,对七个前沿 LLM 进行 50 个会话(每会话 1000 手)的评估及受控记忆消融。

  • 锦标赛筹码排名与聚合轴得分排名不一致,如 Claude Opus 4.6 赢得最多筹码但平均轴得分仅排第五。
  • 多轴评估能揭示单一标量排行榜系统错排的能力结构,跨维度一致性比单轴峰值更重要。
  • 持久记忆对部分模型表现有帮助,对另一些反而有害。

与本研究的关系:通过德州扑克评估大语言模型的战略推理和记忆能力,说明在现实决策中应采用多维评估而非单一指标,并关注记忆与认知结构的相互作用。

适用范围:评估对象仅限前沿 LLM,未包含人类玩家;摘要未说明其他局限。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Play the Man, Not the Cards. (Homo)socialities and Masculine Positions in Poker

2024-08-28 · openalex

方法:使用访谈法,对瑞典男性扑克玩家进行质性研究,分析扑克中的男性位置与同性社交关系。

  • 扑克关联多种社会关系,从亲密友谊到相对匿名的在线关系。
  • 扑克会结构化人际关系,使其简化和形式化。
  • 竞争与情感疏离是核心特征,玩家被构建为“书呆子”而非“硬汉”,并形成书呆子式社交。

与本研究的关系:从社会学角度揭示扑克活动中的社会互动和情感规则,补充了对人类决策中社会因素和性别身份的理解,但未直接讨论认知偏差。

适用范围:样本仅限瑞典男性玩家,可能不具广泛代表性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Variable Bound Tightening for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games

2026-06-24 · semantic_scholar

方法:在多人不完全信息博弈的精确纳什均衡计算中,推导非线性互补公式中松弛变量和乘子变量的有限界,强化空间分支定界的凸松弛。

  • 提出的界能显著提升精确纳什均衡计算的求解效率,成功用于三人 Kuhn 扑克。

与本研究的关系:属于扑克博弈求解的算法优化,为理解多人不完全信息下的均衡计算提供工具,但对现实决策认知的直接启示有限。

适用范围:实验仅涉及小型三人 Kuhn 扑克,摘要未说明对完整版本游戏的适用性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Player Psychology and Decision-Making in Board Game COUP

2026-06-29 · semantic_scholar

方法:采用自收集的遥测数据,对 8 局 COUP 纸牌游戏进行观察分析,识别玩家心理与决策模式。

  • 玩家在游戏中撒谎的频率低于预期,且撒谎时失败多于成功。
  • 情绪因素如仇恨、复仇螺旋常压倒理性策略,玩家会针对曾伤害自己的对手。
  • 会出现非官方规则中的元游戏模式,通过经验学习传播。

与本研究的关系:通过牌类游戏验证风险敏感性、不确定性厌恶和情绪反应对人类决策的影响,说明现实决策中情绪和社会动态可能压倒纯理性计算。

适用范围:样本量小(8 个游戏会话),结果可能不具普遍性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

PokerBench: Training Large Language Models to become Professional Poker Players

2025-01-14 · arxiv

方法:构建含11,000个重要场景的PokerBench基准,场景分为翻牌前与翻牌后,与训练有素的扑克玩家合作设计;评估GPT-4、ChatGPT 3.5及多种Llama和Gemma系列模型,并通过对战验证分数与胜率的关系。

  • 所有最先进的大语言模型在最优扑克玩法上表现不足。
  • 微调后模型表现显著提升。
  • PokerBench得分越高,在真实扑克游戏中的胜率越高;简单监督式微调难以学到最优策略。

与本研究的关系:该基准直接评估大语言模型在德州扑克等不完全信息游戏中的策略能力,其发现表明现有AI在类似人类决策的复杂博弈中仍有不足,也为利用AI辅助决策与策略训练提供了评估工具和启示。

适用范围:摘要提及监督微调的局限性,但未全面说明其他局限。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design

2026-05-08 · arxiv

方法:对955个真实韩语对话(15,476个话语)进行决策编码,借助LLM辅助的编码流水线分析食物与旅行决策中的启发式和策略。

  • 人们更倾向于“满意即足够”而非最优化决策。
  • 最常见的启发式策略用于维持探索阶段的对话流畅,而罕见的规则型策略在利用阶段高效推动决策。
  • 存在启发式使用频率与决策效率之间的错配。

与本研究的关系:该研究揭示了日常决策中人类启发式与认知负荷管理的实际模式,为将德州扑克等博弈中的策略思维迁移到现实决策、并设计更符合人类启发式的AI辅助决策系统提供了实证基础。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Predicting Biased Human Decision-Making with Large Language Models in Conversational Settings

2026-01-16 · arxiv

方法:预注册实验(N=1,648),让参与者通过聊天机器人完成六个经典决策任务,并变化对话复杂度以操纵认知负荷;随后评估多种LLM(GPT-4、GPT-5及开源模型)对个体决策的预测能力。

  • 参与者表现出框架效应和现状偏见这两种经典认知偏见。
  • 对话复杂度增加导致报告的心智负荷上升,且认知负荷显著放大了偏见影响。
  • GPT-4系列在预测准确性和人类偏见模式保真度上均优于其他测试模型。

与本研究的关系:该研究直接证明认知负荷会放大决策偏见,并验证LLM能模拟人类偏见模式,这对理解德州扑克等高风险决策中的情绪与认知因素、以及设计适应性AI辅助决策工具有重要参考价值。

适用范围:摘要提及不同决策任务的预测结果不一致,但未明确其他局限性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

The role of affect in management decisions: A systematic review

2019-02-01 · semantic_scholar

方法:采用系统文献综述法,对123篇文章进行描述性分析和主题分析,主题分析采用混合归纳-演绎路径。

  • 识别出情感在管理决策中发挥的六种不同功能。
  • 提出一个基于共同进化机制的解释模型,说明情感如何影响管理决策。

与本研究的关系:该综述系统化了情感在管理决策中的作用,为将德州扑克中的情绪管理与风险决策研究拓展到组织管理场景提供了理论框架,有助于设计“知情决策架构”。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Kuhn Poker with Cheating and Its Detection

2020-11-09 · arxiv

方法:对Kuhn扑克的新变型(引入作弊与作弊检测)进行理论分析,推导关于策略变化的新解析结果。

  • 作弊会改变玩家的博弈策略。
  • 作者推导出新的解析结果,刻画了作弊存在时的策略变化。

与本研究的关系:该研究为不完全信息博弈中欺骗与检测的建模提供了理论基础,对理解德州扑克等游戏中的欺骗风险和应对策略具有直接意义,并可延伸至现实中的信息不对称决策。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Projected Exploitability Descent for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games

2026-06-28 · semantic_scholar

方法:提出投影可利用性下降(PED)算法,通过投影次梯度下降最小化多人广义可利用性的代理函数;在三玩家Kuhn扑克基准上实验,并与虚拟博弈(FP)和反事实遗憾最小化(CFR)比较。

  • PED在运行过程中表现出持续的近单调改进。
  • 在初始迭代中FP和CFR显著优于PED,但FP-PED混合算法结合了FP的快速初始化和PED的长期稳定改进。

与本研究的关系:该算法面向多人不完美信息博弈(如德州扑克多人局)的纳什均衡计算,为扑克AI策略求解提供了新的数值方法,也启示了现实中多主体竞争情境下的均衡思维。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Beyond the Black Box: Interpretable Models of Human Randomisation Failures

2026-08-07 · semantic_scholar

方法:利用84,060个决策(来自2,802对玩家)的数据集,对朴素模型、行为模型、可解释机器学习模型和深度学习模型进行基准比较;评估改进的EWA模型,并用LASSO诊断提出嵌套频率跟踪扩展。

  • 重复或避免行为(尤其是玩家对自己近期动作历史的管理)占据了大部分可解释且战略可利用的信号。
  • 频率跟踪在样本外预测中的增量贡献很小。

与本研究的关系:该研究揭示了人类在博弈中偏离混合策略均衡的系统性模式,为从行为经济学角度理解德州扑克等游戏中的决策偏差、并发展可解释的博弈策略模型提供了证据。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Using Resource-Rational Analysis to Understand Cognitive Biases in Interactive Data Visualizations

2020-09-28 · arxiv

方法:采用概念性论证,提出将资源理性分析(通过约束贝叶斯认知建模)整合到交互式数据可视化研究中,以解释认知偏见。

  • 提出用资源理性分析重新解释认知偏见,为可视化用户建立更现实的“有界理性”表征。
  • 给出了研究路线图,通过实验与理论的反馈循环研究数据可视化中的认知偏见。

与本研究的关系:该研究为理解人类在信息展示下的决策偏见提供了理论框架,与德州扑克策略中的有限理性、信息处理约束和风险判断直接相关,可用于改进决策辅助工具的设计。

适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

QualGames: A Qualtrics implementation and a database of behavioral game theory tasks

2026-07-06 · semantic_scholar

方法:开发了Qualtrics平台上行为博弈论任务模块化实施的详细实验方案和源代码,包含社会价值取向、囚徒困境、信任博弈及基线非社会风险偏好任务,并用新加坡和美国被试数据验证任务电池的有效性。

  • 被试反应质量良好,不同任务间表现出较高的收敛效度和区分效度,并符合行为决策理论(如反射效应、损失厌恶)和社会决策理论(如不平等厌恶、背叛厌恶)的基本预测。

与本研究的关系:该研究验证了风险决策和行为博弈任务的有效测量工具,为研究人类决策与风险管理提供了可靠的实验范式,但对德州扑克策略本身未涉及,可视为决策心理学方法论的间接支撑。

适用范围:摘要未说明样本代表性或文化差异的局限性。;摘要未说明任务电池在复杂博弈情境中的效度。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

QuLBIT: Quantum-Like Bayesian Inference Technologies for Cognition and Decision

2020-05-30 · arxiv

方法:提出了基于量子理论的统一认知决策框架QuLBIT,通过量子干涉效应量化和解释决策者的不确定性,并应用于违反确定原则(Sure Thing Principle)的情境。

  • 该框架能够处理人类决策中的悖论和非理性行为,比经典概率方法和有限理性模型更具解释力。

与本研究的关系:该研究为理解人类在风险决策中的非理性选择提供了新解释框架,可能有助于揭示德州扑克中玩家违反理性原则的认知机制。

适用范围:摘要未说明该框架在实证应用中的具体验证范围。;摘要未提及该框架在实时决策或博弈对抗中的可操作性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Using the game can't stop to inform the novel behavioural state of near-loss.

2026-07-20 · semantic_scholar

方法:使用商业“冒险”游戏Can't Stop作为实验范式,操纵先前结果(近失败 vs 完全胜利)和对手风格(谨慎 vs 鲁莽),测量玩家停止或继续掷骰的行为。

  • 先前结果与对手风格存在交互作用:仅当先前结果为近失败时,面对谨慎对手比面对鲁莽对手产生更多停止行为。
  • 对手行为的模仿可能与自动性和社会情境有关,停止行为可能源于对掷骰间相互依赖的错误感知。

与本研究的关系:该研究直接探索了近失败(near-loss)情境下的风险决策行为,类比扑克中的“接近失败”心理效应,对理解玩家在不利牌况下的决策偏差和风险管理具有启示。

适用范围:摘要未说明样本量或统计效力。;摘要未说明近失败定义的普适性在其他博弈中的适用性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

CoupVisor: Strategy Optimization by Round and Challenge Decision Support

2026-08-16 · semantic_scholar

方法:构建了隐藏信息卡牌游戏Coup的决策支持系统CoupVisor,结合角色可能性与持有牌数估计声明真实性,并比较规则跟随顾问与多种学习和启发式玩家在模拟游戏中的表现。

  • 奖励函数的选择是决定学习算法性能的关键:以最终获胜为导向的奖励产生的策略优于所有基线。
  • 以短期收益为导向的奖励策略表现不佳,说明长视风险判断对博弈表现的重要性。

与本研究的关系:尽管研究对象是Coup而非德州扑克,但同属隐藏信息博弈,该系统展示了如何在不确定信息中优化决策和风险权衡,对德州扑克策略中的信息利用与风险决策具有方法借鉴意义。

适用范围:摘要未说明系统在真实玩家交互中的外部效度。;摘要未说明除Coup外对其他卡牌游戏的泛化能力。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

From Rules to Nash Equilibria: A Lean 4 Case Study in Game-Theoretic Analysis of a Competitive Trading Card Game

2026-07-09 · semantic_scholar

方法:使用Lean 4证明助手对宝可梦卡牌游戏的真实锦标赛数据进行元游戏分析,包括纳什均衡计算、复制者动力学和类型桥计算。

  • 揭示了“流行度悖论”:最常使用的牌组(Dragapult)胜率仅46.7%,而较小众的Grimmsnarl胜率达52.7%。
  • 机器验证的纳什均衡将Dragapult权重定为0%,复制者动力学显示其面临向下适应压力,而Grimmsnarl有向上压力。
  • 敏感性分析表明核心支持牌组在超过96%的重采样均衡中出现,结果定性稳定。

与本研究的关系:该研究通过形式化验证将定性元游戏叙事转化为可检验的战略科学,展示了如何在竞争性博弈中应用均衡分析和动态模拟,可为德州扑克的策略分析和均衡求解提供方法论启示。

适用范围:摘要明确说明部分定理依赖native_decide,信任Lean编译器而非内核,存在可信边界。;摘要未说明该结果是否适用于其他卡牌游戏或德州扑克。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

On the Power of Deception in Repeated Games

2026-07-25 · semantic_scholar

方法:研究重复两人一般和博弈中对基于计数的学习者的欺骗策略,形式化欺骗与非欺骗行为,提出欺骗奖金概念,设计精确动态规划和近似算法,并证明逼近最优欺骗收益的困难性。

  • 在一般和博弈中,针对计数型学习者,最优欺骗策略可带来额外收益(欺骗奖金)。
  • 逼近针对经验风险最小化学习规则的最优欺骗收益是NP难问题。
  • 实证测量了随机博弈中的欺骗奖金。

与本研究的关系:该研究与德州扑克中的虚张声势(bluffing)和策略欺骗高度相关,揭示了在重复博弈中通过塑造对手预期来获利的结构性条件,为理解扑克中的欺骗策略提供了博弈论基础。

适用范围:摘要未说明模型对扑克这类不完全信息博弈的直接适用性。;摘要未说明人类玩家是否遵循计数型学习规则。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Deciding Fast and Slow: The Role of Cognitive Biases in AI-assisted Decision-making

2020-10-15 · arxiv

方法:基于认知科学知识对AI辅助决策中的认知偏差进行数学建模,提出统一框架,并针对锚定偏差实施基于时间的去锚定策略,设计时间分配策略并通过两个用户实验验证。

  • 去锚定策略和解释性时间分配策略能有效减少锚定偏差,并在AI模型低置信度且错误时提高人机协作性能。

与本研究的关系:该研究直接探讨认知偏差在人机决策中的作用并给出缓解方法,对理解德州扑克中玩家的锚定效应(如率先下注影响)及如何通过调整决策时间改善判断具有启示。

适用范围:摘要未说明框架对其他认知偏差的适用性。;摘要未说明实验环境与扑克情境的差异。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong

2026-07-07 · semantic_scholar

方法:通过强化学习训练金拉米纸牌游戏智能体,使用固定的规则专家作为基准测试,比较不同架构和训练技巧(信任区域更新、奖励设计、课程学习、热启动、最佳检查点等)对智能体强度的影响。

  • 信任区域更新、有明确目标的奖励、更难的对手课程、热启动和保留最佳检查点均能提升智能体强度,叠加后可使自对弈冠军对专家的胜率从30%提升到36%。
  • 短期和长期奖励塑形、学习状态嵌入、模仿学习及大语言模型对手未带来收益。
  • 增加网络容量未能突破性能上限,表明信息限制而非模型大小是关键瓶颈。

与本研究的关系:该研究系统分析了不完美信息博弈中训练智能体的关键因素,其关于奖励设计和信息瓶颈的发现可启发德州扑克策略研究中模型训练和评估方法,但对人类决策启示有限。

适用范围:摘要未说明在真实人类玩家中的泛化表现。;摘要未涉及人类决策偏差或风险管理的主题。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →

摘要级线索

Omission matters: Reframing omission as action reduces apparent loss aversion

semantic_scholar

方法:摘要所述方法:通过三项研究,共1345名参与者,在对称赌博任务中设置行动/不行动条件(提供“赌”与“不赌”的选择)和行动/行动条件(在两个赌博选项之间选择,两者都表述为行动),比较两种条件下的风险选择比例。

  • 参与者被要求必须从两个都表述为行动的选项中选择时,选择风险行动的比例高于在行动/不行动条件下选择“赌”的比例。
  • 通常被归因于损失厌恶的赌博风险规避,实质上主要由对不作为的偏好驱动,而非对损失本身的厌恶。

与本研究的关系:本研究直接揭示了一个影响风险决策的关键认知偏差——不作为偏好,与德州扑克策略中的决策心理学相关。它提示在理解玩家决策时,不能简单将保守行为归因于损失厌恶,而需考虑对主动行动的回避倾向;对现实场景中改进风险判断和调整行为选择具有启示意义。

适用范围:摘要未说明具体实验设计细节(如赌博金额、概率结构等)以及样本的代表性。;摘要未对“损失厌恶”概念本身在其他情境下的有效性进行讨论,也未说明结论的外部效度。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。

查看论文页面 →
编辑范围说明
  1. method_evolution

    未在规划阶段确认足够清晰的问题—方法—代价演进链。

  2. system_layers

    未在规划阶段确认稳定的系统层级关系。

Paper map

论文地图

按标题、角色、标签、年份或发表载体搜索;点击卡片打开精读笔记。

引用数据:Collected scholarly metadata · 快照于 2026-08-20;引用次数不等同于论文质量,星级为本综述的编辑判断。

2020

1 篇论文

2023

1 篇论文

2024

1 篇论文

2025

4 篇论文

2026

3 篇论文