paper_type: 实证与评价 type_confidence: 高 reading_depth: 研究证据 reading_mode: research_evidence evidence_status: partial
Meta-learning ecological priors from large language models explains human learning and decision making
论文元数据
- 标题:Meta-learning ecological priors from large language models explains human learning and decision making
- 作者:Akshay K. Jagadish、Mirko Thalmann、Julian Coda-Forno、Marcel Binz、Eric Schulz
- 年份:2025
- 来源:arXiv
- PDF 文件:fa7bb79f070920a7e012b4bf.pdf
[!warning] 部分原文定位待核验 核心内容已保留;个别页码或逐字摘录未能通过本地匹配,不影响后续综述继续生成。
研究问题与核心答案
- 核心问题: 人类的学习和决策行为是否可以被解释为对真实世界任务统计结构的理性适应?
- 核心答案: 通过LLM生成生态有效的任务并用元学习训练得到的ERMI模型,在15个实验中优于多种已有认知模型,表明人类认知可能反映对生态结构的自适应对齐。
论证链
- LLM生成的认知任务在统计性质上与真实世界任务相似,验证了其生态效度。
- 在这些生态有效任务上通过元学习训练得到ERMI模型,该模型内化生态先验并支持上下文学习。
- 在函数学习、类别学习和决策制定三个领域,ERMI复制了关键行为特征。
- ERMI在逐试验预测人类行为上优于多种已建立的认知模型。
- 因此,人类认知可能反映对生态结构的自适应对齐。
研究条件
| 维度 | 论文报告 |
|---|---|
| 任务或领域 | 函数学习、类别学习、决策制定 |
| 数据或样本 | 功能学习约10000个LLM生成任务;类别学习约10000个任务;决策制定每条件约7000个任务;人类数据来自多个已发表研究 |
| 基线或比较对象 | 元学习推理(MI)及其他领域特定模型(如RMC, GCM, PM, Rule等) |
| 指标或验证 | 均值平方误差(MSE)、后验模型频率(PMF)、学习曲线、错误概率等 |
决定性证据
E1 · controlled_experiment - 发现: ERMI在函数学习任务中复制了人的五种学习特征,优于MI模型。 - 支持: ERMI在插值和外推条件下的MSE均低于MI - 不支持: 无 - 原文定位: p.5,§Function learning;“ERMI achieved a lower MSE (MMSE=0.0171, SEM=0.0014, t = -9.9944, p < 0.01) compared to MI (MMSE=0.0256, SEM=0.0020) during interpolation”
E2 · controlled_experiment - 发现: ERMI在Shepard类型任务中显示与人类相似的学习难度排序,优于MI。 - 支持: ERMI的MSE=0.03,远低于MI的0.26 - 不支持: 无 - 原文定位: p.7,§Category learning;“ERMI (MSE = 0.03) captured human learning difficulties better than meta-learned inference with a hand-crafted prior (MI; MSE = 0.26)”
E3 · human_evaluation - 发现: 在Badham等研究中,ERMI的后验模型频率最高(0.43),优于其他认知模型。 - 支持: ERMI的PMF最高 - 不支持: 无 - 原文定位: p.7,§Category learning;“ERMI explains human choices more frequently (MPMF=0.43, SEM=0.05) compared to the other models”
E4 · controlled_experiment - 发现: ERMI在决策制定任务中根据条件使用相应的启发式策略,与人类策略一致。 - 支持: ERMI在不同条件下的Gini系数与人类策略相符 - 不支持: 无 - 原文定位: p.8,§Decision making;“ERMI trained on decision making problems from the ranking condition implements a one-reason decision making strategy (MGini = 0.3399, SEM = 0.0631)”
E5 · human_evaluation - 发现: 在决策制定实验中,ERMI的后验模型频率在双属性和四属性条件下均最高。 - 支持: ERMI的PMF分别为0.7299和0.6284,高于其他模型 - 不支持: 无 - 原文定位: p.8,§Decision making;“ERMI accounts for human responses most frequently in both the two-attribute experiment (MPMF=0.7299, SEM=0.0888) and the four-attribute experiment (MPMF=0.6284, SEM=0.0897)”
E6 · observational_analysis - 发现: LLM生成的任务与真实世界任务在统计属性上相似,验证了生态效度。 - 支持: 函数学习任务中线性、指数、二次、周期函数的比例与真实世界相似 - 不支持: 无 - 原文定位: p.3,§Function learning;“the generated functions comprised approximately 75% linear, 12% exponential, 7% quadratic, and 6% periodic relationships, a distribution that mirrors both environmental regularities and human difficulty rankings in function learning”
证据边界
- 训练数据由LLM生成,可能存在分布偏差或生成噪声,但未系统评估其影响。;影响:可能影响ERMI所内化的生态先验的准确性,从而影响泛化能力。。(论文报告,p.16,§Methods)
- ERMI模型在Shepard任务TYPE1和TYPE2上与人类数据有差异(如TYPE1错误率更高)。;影响:表明ERMI在某些特定类别结构上的拟合并不完美,可能缺乏某些认知过程。。(论文报告,p.23,§Table S3)
- ERMI未考虑认知约束(如工作记忆、注意力等),可能忽略人类决策中的系统性偏差。;影响:可能低估了认知限制对行为的影响,导致对某些实验的解释不完整。。(论文报告,p.9,§Discussion)
- LLM生成任务的特征选择可能不够全面,可能遗漏影响人类行为的环境特征。;影响:可能导致ERMI未捕捉所有相关生态先验,影响其预测准确性。。(论文报告,p.9,§Discussion)
复现与实现
- 生成任务所使用的LLM(CLAUDE -V2)及具体prompt(见SI)
- 元学习训练的超参数(如学习率3e-4、优化器、Transformer架构等)
- 模型评估数据和源代码(GitHub仓库)
- 人类数据来源(如Kwantes & Neal, Little et al., Badham et al.等)
- 模型拟合和比较的具体流程(最大似然估计、BIC、后验模型频率计算)