摘要级线索
AlphaHoldem: High-Performance Artificial Intelligence for Heads-Up No-Limit Poker via End-to-End Reinforcement Learning
2022-06-28 · semantic_scholar
方法:采用端到端自对弈强化学习框架,使用伪孪生架构直接从输入状态学习输出动作,引入了新的牌面和下注信息状态表示、多任务自对弈训练损失函数和模型评估选择指标。
- AlphaHoldem在10万手牌研究中击败Slumbot和DeepStack,仅需一台PC训练三天。
- 每次决策仅需2.9毫秒,比DeepStack快1000倍以上。
与本研究的关系:展示了在不完美信息博弈中通过自对弈强化学习实现高效决策的可行性,对理解人类在不确定性下的快速决策、风险管理和策略学习具有启示意义。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Preference-CFR$\:$ Beyond Nash Equilibrium for Better Game Strategies
2024-11-02 · openalex
方法:提出Preference-CFR方法,在反事实遗憾最小化中引入偏好度和脆弱度两个参数,使智能体在可接受性能损失范围内调整策略分布。
- 在德州扑克实验中,Preference-CFR成功训练出激进和松散被动风格,性能与原始CFR策略相当但行为模式明显不同。
- 在某些手牌场景中,产生的策略与传统专家启发式和原始CFR显著不同,可能为职业选手提供新见解。
与本研究的关系:说明在决策中考虑策略多样性和风险偏好的重要性,启示人类在风险管理中可以根据自身偏好调整决策风格,并在保持性能的同时探索非常规策略。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games
2026-08-06 · openalex
方法:将AIVAT方差缩减技术与随时有效置信序列结合,形成AV-AIVAT,通过在线值模型从过去游戏中学习并避免自我校正,使用渐近置信序列和实证Bernstein置信序列进行认证。
- 在名义95%水平和±1大盲目标精度下,原始结果所需手数中位数是AIVAT校正结果的74倍。
- 在Leduc hold'em中建立了精确有限样本认证,在HUNL描述性运行中实现中位数1.37倍的停止时间比。
与本研究的关系:解决了在不完美信息博弈中评估智能体强弱时何时停止收集证据的问题,对现实决策中如何在不确定环境中高效地判断风险并做出及时结论具有启示。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Limit Continuous Poker: A Variant of Continuous Poker with Limited Bet Sizes
2026-05-31 · arxiv
方法:引入并分析限注连续扑克,推导该变体的纳什均衡策略,研究下注者与跟注者策略对下注大小限制的依赖关系。
- 推导出限注连续扑克的纳什均衡策略,并揭示其如何随下注限制变化。
- 当下注限制趋于极端值时,策略收敛到其他连续扑克变体,并将结论联系到现实扑克中有限下注的战略意义。
与本研究的关系:从理论层面剖析信息不对称、诈唬、平衡和注额限制的交互作用,为现实博弈中如何根据可用选项调整策略和风险管理提供数学基础。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Agents That Certify Their Own Exploits: Confidence-Scheduled Restricted Responses for Safe Opponent Exploitation
2026-07-30 · semantic_scholar
方法:提出预算约束的置信度调度受限响应方法,使用随时有效置信序列跟踪对手动作频率,仅当置信区间与均衡参考分离时判定可剥削,通过受限响应求解生成候选策略,并用全树最佳响应在部署前评估生成安全证书。
- 在Leduc hold'em中,CS-RNR获得6.2倍于金钱验证二元门控的稳态收益,同时保持每个部署策略在预算内。
- 在所有36000手审计手中均满足报告的证书容差,证明了方法的安全性和可靠性。
与本研究的关系:展示了在不完美信息博弈中既利用对手弱点又严格控制风险的机制,对现实决策中如何在利用他人认知偏差的同时管理潜在损失具有重要启示。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
StratFormer: Adaptive Opponent Modeling and Exploitation in Imperfect-Information Games
2026-04-28 · openalex
方法:提出基于 Transformer 的元代理 StratFormer,采用两阶段课程学习:第一阶段在博弈论最优策略下训练对手建模头,第二阶段按可利用性驱动的正则化逐步转向最佳响应利用;架构使用双回合标记和桶率特征。
- StratFormer 能同时建模和利用多种对手行为,平均对 GTO 获得 +0.106 大盲注/手的利用增益,对高度可利用对手峰值增益 +0.821。
- 该模型在提升利用效果的同时保持接近均衡安全性。
与本研究的关系:通过德州扑克变体展示自适应对手建模与利用的可行性,启示现实决策中应结合对他人行为的预测与自身策略的稳健性,在风险与收益间取得平衡。
适用范围:仅在 Leduc Hold'em 小型扑克变体上验证,摘要未说明对大型扑克的泛化情况。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
On Creating Human Models in Poker with Deep Learning and Regularized Search
2026-02-01 · openalex
方法:结合深度神经网络与正则化搜索,以行为克隆为基础构建扑克玩家的人类模型。
- 模型能够表达多种类似人类的行为。
- 人类相似性与策略强度之间存在权衡,可以在低可利用性成本下提升近似均衡策略的人类相似性,或在低人类预测准确性成本下提升人类类似策略的强度。
与本研究的关系:展示了如何用计算模型刻画人类打牌行为,有助于理解人类决策模式,并为在现实场景中训练更拟人化的智能体或评估人类行为偏差提供思路。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Learning strategic poker decision-making with Large Language Models
2026-08-08 · openalex
方法:摘要未说明
与本研究的关系:标题指向使用大语言模型学习战略扑克决策,可能与利用语言模型改进决策相关,但摘要未提供实质内容。
适用范围:摘要未说明;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Rational AI: A comparison of human and AI responses to triggers of economic irrationality in poker
2021-11-14 · arxiv
方法:使用常数相对风险厌恶效用函数的随机效用模型,估计 Pluribus 与人类玩家的潜在风险和理性参数,并比较触发经济损失/收益前后的决策。
- Pluribus 在控制其他因素后会对经济得失调整打牌风格。
- 经历触发后,Pluribus 变得更风险厌恶和理性,而人类变得更风险寻求和非理性。
- 在双方都经历触发后,Pluribus 与人类在风险厌恶和理性维度上的风格差异尤其明显,可作为“行为特征”区分算法与人类决策者。
与本研究的关系:直接对比人工智能与人类在扑克中的损失/收益反应,揭示人类在风险决策中的非理性倾向,有助于理解认知偏差并设计更稳健的决策系统。
适用范围:分析基于 Pluribus 这一单一 AI 系统及其 10,000 手扑克数据,摘要未说明对其他算法的普遍性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs
2026-06-11 · openalex
方法:构建 Poker Arena 无限注德州扑克平台,采用三层记忆架构(手内、会话、跨会话)和九轴认知画像,对七个前沿 LLM 进行 50 个会话(每会话 1000 手)的评估及受控记忆消融。
- 锦标赛筹码排名与聚合轴得分排名不一致,如 Claude Opus 4.6 赢得最多筹码但平均轴得分仅排第五。
- 多轴评估能揭示单一标量排行榜系统错排的能力结构,跨维度一致性比单轴峰值更重要。
- 持久记忆对部分模型表现有帮助,对另一些反而有害。
与本研究的关系:通过德州扑克评估大语言模型的战略推理和记忆能力,说明在现实决策中应采用多维评估而非单一指标,并关注记忆与认知结构的相互作用。
适用范围:评估对象仅限前沿 LLM,未包含人类玩家;摘要未说明其他局限。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Play the Man, Not the Cards. (Homo)socialities and Masculine Positions in Poker
2024-08-28 · openalex
方法:使用访谈法,对瑞典男性扑克玩家进行质性研究,分析扑克中的男性位置与同性社交关系。
- 扑克关联多种社会关系,从亲密友谊到相对匿名的在线关系。
- 扑克会结构化人际关系,使其简化和形式化。
- 竞争与情感疏离是核心特征,玩家被构建为“书呆子”而非“硬汉”,并形成书呆子式社交。
与本研究的关系:从社会学角度揭示扑克活动中的社会互动和情感规则,补充了对人类决策中社会因素和性别身份的理解,但未直接讨论认知偏差。
适用范围:样本仅限瑞典男性玩家,可能不具广泛代表性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Variable Bound Tightening for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games
2026-06-24 · semantic_scholar
方法:在多人不完全信息博弈的精确纳什均衡计算中,推导非线性互补公式中松弛变量和乘子变量的有限界,强化空间分支定界的凸松弛。
- 提出的界能显著提升精确纳什均衡计算的求解效率,成功用于三人 Kuhn 扑克。
与本研究的关系:属于扑克博弈求解的算法优化,为理解多人不完全信息下的均衡计算提供工具,但对现实决策认知的直接启示有限。
适用范围:实验仅涉及小型三人 Kuhn 扑克,摘要未说明对完整版本游戏的适用性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Player Psychology and Decision-Making in Board Game COUP
2026-06-29 · semantic_scholar
方法:采用自收集的遥测数据,对 8 局 COUP 纸牌游戏进行观察分析,识别玩家心理与决策模式。
- 玩家在游戏中撒谎的频率低于预期,且撒谎时失败多于成功。
- 情绪因素如仇恨、复仇螺旋常压倒理性策略,玩家会针对曾伤害自己的对手。
- 会出现非官方规则中的元游戏模式,通过经验学习传播。
与本研究的关系:通过牌类游戏验证风险敏感性、不确定性厌恶和情绪反应对人类决策的影响,说明现实决策中情绪和社会动态可能压倒纯理性计算。
适用范围:样本量小(8 个游戏会话),结果可能不具普遍性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
PokerBench: Training Large Language Models to become Professional Poker Players
2025-01-14 · arxiv
方法:构建含11,000个重要场景的PokerBench基准,场景分为翻牌前与翻牌后,与训练有素的扑克玩家合作设计;评估GPT-4、ChatGPT 3.5及多种Llama和Gemma系列模型,并通过对战验证分数与胜率的关系。
- 所有最先进的大语言模型在最优扑克玩法上表现不足。
- 微调后模型表现显著提升。
- PokerBench得分越高,在真实扑克游戏中的胜率越高;简单监督式微调难以学到最优策略。
与本研究的关系:该基准直接评估大语言模型在德州扑克等不完全信息游戏中的策略能力,其发现表明现有AI在类似人类决策的复杂博弈中仍有不足,也为利用AI辅助决策与策略训练提供了评估工具和启示。
适用范围:摘要提及监督微调的局限性,但未全面说明其他局限。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design
2026-05-08 · arxiv
方法:对955个真实韩语对话(15,476个话语)进行决策编码,借助LLM辅助的编码流水线分析食物与旅行决策中的启发式和策略。
- 人们更倾向于“满意即足够”而非最优化决策。
- 最常见的启发式策略用于维持探索阶段的对话流畅,而罕见的规则型策略在利用阶段高效推动决策。
- 存在启发式使用频率与决策效率之间的错配。
与本研究的关系:该研究揭示了日常决策中人类启发式与认知负荷管理的实际模式,为将德州扑克等博弈中的策略思维迁移到现实决策、并设计更符合人类启发式的AI辅助决策系统提供了实证基础。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Predicting Biased Human Decision-Making with Large Language Models in Conversational Settings
2026-01-16 · arxiv
方法:预注册实验(N=1,648),让参与者通过聊天机器人完成六个经典决策任务,并变化对话复杂度以操纵认知负荷;随后评估多种LLM(GPT-4、GPT-5及开源模型)对个体决策的预测能力。
- 参与者表现出框架效应和现状偏见这两种经典认知偏见。
- 对话复杂度增加导致报告的心智负荷上升,且认知负荷显著放大了偏见影响。
- GPT-4系列在预测准确性和人类偏见模式保真度上均优于其他测试模型。
与本研究的关系:该研究直接证明认知负荷会放大决策偏见,并验证LLM能模拟人类偏见模式,这对理解德州扑克等高风险决策中的情绪与认知因素、以及设计适应性AI辅助决策工具有重要参考价值。
适用范围:摘要提及不同决策任务的预测结果不一致,但未明确其他局限性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
The role of affect in management decisions: A systematic review
2019-02-01 · semantic_scholar
方法:采用系统文献综述法,对123篇文章进行描述性分析和主题分析,主题分析采用混合归纳-演绎路径。
- 识别出情感在管理决策中发挥的六种不同功能。
- 提出一个基于共同进化机制的解释模型,说明情感如何影响管理决策。
与本研究的关系:该综述系统化了情感在管理决策中的作用,为将德州扑克中的情绪管理与风险决策研究拓展到组织管理场景提供了理论框架,有助于设计“知情决策架构”。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Kuhn Poker with Cheating and Its Detection
2020-11-09 · arxiv
方法:对Kuhn扑克的新变型(引入作弊与作弊检测)进行理论分析,推导关于策略变化的新解析结果。
- 作弊会改变玩家的博弈策略。
- 作者推导出新的解析结果,刻画了作弊存在时的策略变化。
与本研究的关系:该研究为不完全信息博弈中欺骗与检测的建模提供了理论基础,对理解德州扑克等游戏中的欺骗风险和应对策略具有直接意义,并可延伸至现实中的信息不对称决策。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Projected Exploitability Descent for Nash Equilibrium Computation in Multiplayer Imperfect-Information Games
2026-06-28 · semantic_scholar
方法:提出投影可利用性下降(PED)算法,通过投影次梯度下降最小化多人广义可利用性的代理函数;在三玩家Kuhn扑克基准上实验,并与虚拟博弈(FP)和反事实遗憾最小化(CFR)比较。
- PED在运行过程中表现出持续的近单调改进。
- 在初始迭代中FP和CFR显著优于PED,但FP-PED混合算法结合了FP的快速初始化和PED的长期稳定改进。
与本研究的关系:该算法面向多人不完美信息博弈(如德州扑克多人局)的纳什均衡计算,为扑克AI策略求解提供了新的数值方法,也启示了现实中多主体竞争情境下的均衡思维。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Beyond the Black Box: Interpretable Models of Human Randomisation Failures
2026-08-07 · semantic_scholar
方法:利用84,060个决策(来自2,802对玩家)的数据集,对朴素模型、行为模型、可解释机器学习模型和深度学习模型进行基准比较;评估改进的EWA模型,并用LASSO诊断提出嵌套频率跟踪扩展。
- 重复或避免行为(尤其是玩家对自己近期动作历史的管理)占据了大部分可解释且战略可利用的信号。
- 频率跟踪在样本外预测中的增量贡献很小。
与本研究的关系:该研究揭示了人类在博弈中偏离混合策略均衡的系统性模式,为从行为经济学角度理解德州扑克等游戏中的决策偏差、并发展可解释的博弈策略模型提供了证据。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Using Resource-Rational Analysis to Understand Cognitive Biases in Interactive Data Visualizations
2020-09-28 · arxiv
方法:采用概念性论证,提出将资源理性分析(通过约束贝叶斯认知建模)整合到交互式数据可视化研究中,以解释认知偏见。
- 提出用资源理性分析重新解释认知偏见,为可视化用户建立更现实的“有界理性”表征。
- 给出了研究路线图,通过实验与理论的反馈循环研究数据可视化中的认知偏见。
与本研究的关系:该研究为理解人类在信息展示下的决策偏见提供了理论框架,与德州扑克策略中的有限理性、信息处理约束和风险判断直接相关,可用于改进决策辅助工具的设计。
适用范围:摘要未说明。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
QualGames: A Qualtrics implementation and a database of behavioral game theory tasks
2026-07-06 · semantic_scholar
方法:开发了Qualtrics平台上行为博弈论任务模块化实施的详细实验方案和源代码,包含社会价值取向、囚徒困境、信任博弈及基线非社会风险偏好任务,并用新加坡和美国被试数据验证任务电池的有效性。
- 被试反应质量良好,不同任务间表现出较高的收敛效度和区分效度,并符合行为决策理论(如反射效应、损失厌恶)和社会决策理论(如不平等厌恶、背叛厌恶)的基本预测。
与本研究的关系:该研究验证了风险决策和行为博弈任务的有效测量工具,为研究人类决策与风险管理提供了可靠的实验范式,但对德州扑克策略本身未涉及,可视为决策心理学方法论的间接支撑。
适用范围:摘要未说明样本代表性或文化差异的局限性。;摘要未说明任务电池在复杂博弈情境中的效度。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
QuLBIT: Quantum-Like Bayesian Inference Technologies for Cognition and Decision
2020-05-30 · arxiv
方法:提出了基于量子理论的统一认知决策框架QuLBIT,通过量子干涉效应量化和解释决策者的不确定性,并应用于违反确定原则(Sure Thing Principle)的情境。
- 该框架能够处理人类决策中的悖论和非理性行为,比经典概率方法和有限理性模型更具解释力。
与本研究的关系:该研究为理解人类在风险决策中的非理性选择提供了新解释框架,可能有助于揭示德州扑克中玩家违反理性原则的认知机制。
适用范围:摘要未说明该框架在实证应用中的具体验证范围。;摘要未提及该框架在实时决策或博弈对抗中的可操作性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Using the game can't stop to inform the novel behavioural state of near-loss.
2026-07-20 · semantic_scholar
方法:使用商业“冒险”游戏Can't Stop作为实验范式,操纵先前结果(近失败 vs 完全胜利)和对手风格(谨慎 vs 鲁莽),测量玩家停止或继续掷骰的行为。
- 先前结果与对手风格存在交互作用:仅当先前结果为近失败时,面对谨慎对手比面对鲁莽对手产生更多停止行为。
- 对手行为的模仿可能与自动性和社会情境有关,停止行为可能源于对掷骰间相互依赖的错误感知。
与本研究的关系:该研究直接探索了近失败(near-loss)情境下的风险决策行为,类比扑克中的“接近失败”心理效应,对理解玩家在不利牌况下的决策偏差和风险管理具有启示。
适用范围:摘要未说明样本量或统计效力。;摘要未说明近失败定义的普适性在其他博弈中的适用性。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
CoupVisor: Strategy Optimization by Round and Challenge Decision Support
2026-08-16 · semantic_scholar
方法:构建了隐藏信息卡牌游戏Coup的决策支持系统CoupVisor,结合角色可能性与持有牌数估计声明真实性,并比较规则跟随顾问与多种学习和启发式玩家在模拟游戏中的表现。
- 奖励函数的选择是决定学习算法性能的关键:以最终获胜为导向的奖励产生的策略优于所有基线。
- 以短期收益为导向的奖励策略表现不佳,说明长视风险判断对博弈表现的重要性。
与本研究的关系:尽管研究对象是Coup而非德州扑克,但同属隐藏信息博弈,该系统展示了如何在不确定信息中优化决策和风险权衡,对德州扑克策略中的信息利用与风险决策具有方法借鉴意义。
适用范围:摘要未说明系统在真实玩家交互中的外部效度。;摘要未说明除Coup外对其他卡牌游戏的泛化能力。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
From Rules to Nash Equilibria: A Lean 4 Case Study in Game-Theoretic Analysis of a Competitive Trading Card Game
2026-07-09 · semantic_scholar
方法:使用Lean 4证明助手对宝可梦卡牌游戏的真实锦标赛数据进行元游戏分析,包括纳什均衡计算、复制者动力学和类型桥计算。
- 揭示了“流行度悖论”:最常使用的牌组(Dragapult)胜率仅46.7%,而较小众的Grimmsnarl胜率达52.7%。
- 机器验证的纳什均衡将Dragapult权重定为0%,复制者动力学显示其面临向下适应压力,而Grimmsnarl有向上压力。
- 敏感性分析表明核心支持牌组在超过96%的重采样均衡中出现,结果定性稳定。
与本研究的关系:该研究通过形式化验证将定性元游戏叙事转化为可检验的战略科学,展示了如何在竞争性博弈中应用均衡分析和动态模拟,可为德州扑克的策略分析和均衡求解提供方法论启示。
适用范围:摘要明确说明部分定理依赖native_decide,信任Lean编译器而非内核,存在可信边界。;摘要未说明该结果是否适用于其他卡牌游戏或德州扑克。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
On the Power of Deception in Repeated Games
2026-07-25 · semantic_scholar
方法:研究重复两人一般和博弈中对基于计数的学习者的欺骗策略,形式化欺骗与非欺骗行为,提出欺骗奖金概念,设计精确动态规划和近似算法,并证明逼近最优欺骗收益的困难性。
- 在一般和博弈中,针对计数型学习者,最优欺骗策略可带来额外收益(欺骗奖金)。
- 逼近针对经验风险最小化学习规则的最优欺骗收益是NP难问题。
- 实证测量了随机博弈中的欺骗奖金。
与本研究的关系:该研究与德州扑克中的虚张声势(bluffing)和策略欺骗高度相关,揭示了在重复博弈中通过塑造对手预期来获利的结构性条件,为理解扑克中的欺骗策略提供了博弈论基础。
适用范围:摘要未说明模型对扑克这类不完全信息博弈的直接适用性。;摘要未说明人类玩家是否遵循计数型学习规则。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Deciding Fast and Slow: The Role of Cognitive Biases in AI-assisted Decision-making
2020-10-15 · arxiv
方法:基于认知科学知识对AI辅助决策中的认知偏差进行数学建模,提出统一框架,并针对锚定偏差实施基于时间的去锚定策略,设计时间分配策略并通过两个用户实验验证。
- 去锚定策略和解释性时间分配策略能有效减少锚定偏差,并在AI模型低置信度且错误时提高人机协作性能。
与本研究的关系:该研究直接探讨认知偏差在人机决策中的作用并给出缓解方法,对理解德州扑克中玩家的锚定效应(如率先下注影响)及如何通过调整决策时间改善判断具有启示。
适用范围:摘要未说明框架对其他认知偏差的适用性。;摘要未说明实验环境与扑克情境的差异。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
A Gold-Standard Study of What Makes a Lightweight Game-Playing Agent Strong
2026-07-07 · semantic_scholar
方法:通过强化学习训练金拉米纸牌游戏智能体,使用固定的规则专家作为基准测试,比较不同架构和训练技巧(信任区域更新、奖励设计、课程学习、热启动、最佳检查点等)对智能体强度的影响。
- 信任区域更新、有明确目标的奖励、更难的对手课程、热启动和保留最佳检查点均能提升智能体强度,叠加后可使自对弈冠军对专家的胜率从30%提升到36%。
- 短期和长期奖励塑形、学习状态嵌入、模仿学习及大语言模型对手未带来收益。
- 增加网络容量未能突破性能上限,表明信息限制而非模型大小是关键瓶颈。
与本研究的关系:该研究系统分析了不完美信息博弈中训练智能体的关键因素,其关于奖励设计和信息瓶颈的发现可启发德州扑克策略研究中模型训练和评估方法,但对人类决策启示有限。
适用范围:摘要未说明在真实人类玩家中的泛化表现。;摘要未涉及人类决策偏差或风险管理的主题。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →摘要级线索
Omission matters: Reframing omission as action reduces apparent loss aversion
semantic_scholar
方法:摘要所述方法:通过三项研究,共1345名参与者,在对称赌博任务中设置行动/不行动条件(提供“赌”与“不赌”的选择)和行动/行动条件(在两个赌博选项之间选择,两者都表述为行动),比较两种条件下的风险选择比例。
- 参与者被要求必须从两个都表述为行动的选项中选择时,选择风险行动的比例高于在行动/不行动条件下选择“赌”的比例。
- 通常被归因于损失厌恶的赌博风险规避,实质上主要由对不作为的偏好驱动,而非对损失本身的厌恶。
与本研究的关系:本研究直接揭示了一个影响风险决策的关键认知偏差——不作为偏好,与德州扑克策略中的决策心理学相关。它提示在理解玩家决策时,不能简单将保守行为归因于损失厌恶,而需考虑对主动行动的回避倾向;对现实场景中改进风险判断和调整行为选择具有启示意义。
适用范围:摘要未说明具体实验设计细节(如赌博金额、概率结构等)以及样本的代表性。;摘要未对“损失厌恶”概念本身在其他情境下的有效性进行讨论,也未说明结论的外部效度。;仅依据公开摘要,未核验全文方法、实验设置与结论边界。
查看论文页面 →