paper_type: 方法与系统 type_confidence: 高 reading_depth: 研究证据 reading_mode: research_evidence evidence_status: partial
Solver-Guided Reasoning for Mixed-Equilibrium Strategies
论文元数据
- 标题:Solver-Guided Reasoning for Mixed-Equilibrium Strategies
- 作者:Han Wang、Philippe Beardsell、Boning Li、Aaron Sasmita、Shuai Li、Hongyuan Zha、Baoxiang Wang
- 年份:2026
- 来源:OpenAlex
- PDF 文件:6b4beffe0a5c426115f5bb10.pdf
[!warning] 部分原文定位待核验 核心内容已保留;个别页码或逐字摘录未能通过本地匹配,不影响后续综述继续生成。
研究问题与核心答案
- 核心问题: 如何将求解器生成的混合策略转化为可理解、可转移的规则,以提升大语言模型在不完全信息博弈中的均衡推理能力?
- 核心答案: 本文提出混合策略决策树(MDT)和场景约束反事实采样(SCCS),将求解器策略蒸馏为稀疏对比规则,显著降低LLM对求解器策略的L1距离(降低52.6%)。
论证链
- 人类数据在混合策略均衡博弈中偏向纯策略,导致LLM学习到的策略较弱。
- 求解器输出提供最优混合策略,但原始数值不具可理解性。
- MDT将求解器策略蒸馏为稀疏决策树,生成可读的规则。
- SCCS通过对比同一公共场景下策略分化的手牌,提取局部决策边界。
- 在NLH中,SCCS规则使8种LLM配置的L1距离从0.211降至0.100(相对降低52.6%)。
- 在River完局和Liar's Dice中验证了战略保真度和可移植性。
研究条件
| 维度 | 论文报告 |
|---|---|
| 任务或领域 | 两人有限注德州扑克(NLH)翻牌后决策,以及两人Liar's Dice博弈 |
| 数据或样本 | 超过2.5亿个求解器标记的翻牌后决策样本(约1600万翻牌决策和2.35亿转牌决策),覆盖1755种翻牌面;Liar's Dice使用六折交叉拟合 |
| 基线或比较对象 | 直接提示、提示加原始摘要、Route-only(仅显示MDT路径)、Deep CFR(在完整河牌游戏中) |
| 指标或验证 | 动作平均L1距离(对求解器策略和MDT策略)、argmax动作一致率、精确可剥削性(作为根池百分比) |
决定性证据
E1 · benchmark_result - 发现: SCCS规则使8种LLM配置的平均L1距离从0.211降至0.100(相对改善52.6%),且所有配置下均优于Route-only。 - 支持: SCCS规则可提升LLM对混合策略的预测准确性 - 不支持: 直接提示和原始摘要无法有效提升性能(Direct+Summaries反而较差) - 原文定位: p.10,§6.3 Communicability on Unseen Target Hands;“Across eight LLM configurations, SCCS rules reduce average L1 to the solver target from 0.211 to 0.100, a 52.6% relative improvement over direct prompting.”
E2 · ablation - 发现: Route-only(仅显示路径)将L1从0.211降至0.173,而SCCS进一步降至0.100;在匹配诊断中SCCS相较于Route-only仍降低38.8%的L1。 - 支持: 对比性规则(SCCS)比仅路径更有效地传递策略信息 - 不支持: 仅显示路径不足以完全传达局部决策边界 - 原文定位: p.10,§6.3 Communicability on Unseen Target Hands;“SCCS also improves on Route-only: L1 falls from 0.173 to 0.100 relative to the solver and from 0.172 to 0.114 relative to MDT, reductions of 42.2% and 33.7%, respectively.”
E3 · benchmark_result - 发现: argmax动作一致率从直接提示的57.2%提升到SCCS的76.1%。 - 支持: SCCS规则不仅改善分布预测,也提高主要动作的准确性 - 不支持: 无直接对照,但表明SCCS在主导动作上也有效 - 原文定位: p.10,§6.3 Communicability on Unseen Target Hands;“Argmax-action agreement, defined as whether the highest-probability predicted action matches the highest-probability solver action, also rises from 57.2% to 76.1% from Direct to SCCS.”
E4 · benchmark_result - 发现: 在完整河牌端局中,Hard Top-5 MDT的可剥削性为0.3435%-0.3548%的根池,显著低于Deep CFR的0.8615%和0.3560%。 - 支持: MDT在完整局中保持战略保真度 - 不支持: Hard MDT比Soft MDT的可剥削性更高(约0.21个百分点) - 原文定位: p.12,§6.5 Exact Strategic Evaluation in Complete River Endgames;“Soft costs 0.1338–0.1467% of the root pot and Hard Top-5 costs 0.3435–0.3548%, making the measured Hard–Soft difference approximately 0.21 percentage points in both endgames.”
E5 · benchmark_result - 发现: 在Liar's Dice中,SCCS将L1从0.174降至0.105(相对降低39.7%),但相对于Route-only的改善较小(0.116→0.105)。 - 支持: 该流程可移植到其他不完全信息博弈 - 不支持: 在更稀疏的上下文中,SCCS的增量收益较小 - 原文定位: p.12,§6.6 Beyond NLH: Liar’s Dice;“On this exploratory surface, SCCS lowers solver L1 by 39.7% relative to Direct and has the lowest descriptive mean under both targets. Its incremental improvement over Route-only is smaller than in NLH.”
证据边界
- MDT的硬稀疏化导致保真度损失(见表1),最终硬MDT的L1为0.087,高于密集模型(0.021)。;影响:可能无法完全捕捉求解器策略的细微差别,但换取可解释性。。(论文报告,p.10,§6.2 Training Loss and Distillation Fidelity)
- L1距离度量是局部保真度,而非完整博弈的可利用性。;影响:低L1不一定保证低可利用性,但论文在河牌端局中补充了精确可剥削性评估。。(论文报告,p.11,§6.5 Exact Strategic Evaluation in Complete River Endgames)
- 在Liar's Dice中,SCCS相对于Route-only的改善较小,可能因为上下文内手牌类型较少。;影响:在更稀疏的决策空间中,对比规则可能不如在丰富上下文中有效。。(论文报告,p.12,§6.6 Beyond NLH: Liar’s Dice)
- 评估样本仅覆盖特定配置(如6人100BB无抽水),且翻牌后决策。;影响:结果可能无法推广到其他配置(如多人锅、不同筹码深度)或翻牌前决策。。(论文报告,p.9,§6.1 Solver Oracle Interface and Evaluation Samples)
- SCCS规则提取依赖MDT路由,且需要策略分离度阈值(τ_sep=0.20),这可能限制某些目标的可解释性。;影响:对于与参考手牌策略差异较小的目标,可能无法生成有效的对比规则。。(论文报告,p.24,§F.2 SCCS Sampling and Verification)
复现与实现
- 访问商业NLH求解器(如PioSOLVER,需具备Nash Distance <0.3% pot)
- 生成超过2.5亿个求解器标记的决策样本
- MDT训练:需实现软路由和硬路由两种模式
- SCCS提取:需实现对比采样算法和提示模板
- 评估设置:选用8种LLM配置,并实现匹配上下文测试集