paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "Creating Suspenseful Stories: Iterative Planning with Large Language Models" authors: Kaige Xie, Mark Riedl year: 2024 source: EACL 2024; arXiv:2402.17119 pdf: 18_suspenseful_iterative_planning.pdf
悬念迭代规划:不断堵住主角的脱困路径
一句话总结:论文把认知叙事理论中的悬念操作化为“主角依次尝试越来越不可能的行动,而系统为每条行动生成失败条件”,用零样本迭代提示显著提升 ChatGPT/Llama 2 故事的悬念、独创与趣味;但自然度没有改善,行动概率递减只获 55.1% 感知支持,说明理论机制只被部分实现。
TL;DR
- 【论文报告】方法无需故事语料:先生成主角、目标和失败后果,再反复产生行动与使其失败的理由,最后把 action–reason 对扩为事件序列和正文。
- 【论文报告】ChatGPT 主实验中,相对直接提示 baseline,悬念胜/负/平为 84.9%/11.8%/3.3%,novelty 76.6% 胜,enjoyment 67.9% 胜;naturalness 只有 25.3% 胜且 56.1% 平。
- 【论文报告】相对 Llama 2 直接提示,悬念胜率 73.9%;相对 Re3 为 81.1%。 outline planning 与 detail elaboration 消融均支持完整系统。
- 【阅读者推断】最可靠贡献是把“悬念”转成可执行规划约束,而不是证明可生成任意长度或普适的文学悬念。
理论到算法
【论文报告】方法基于 Gerrig 与 Bernardo 的读者问题求解理论:当主角避免坏结局的可行路径越来越少、成功概率越来越低,读者更容易产生悬念;同时借用“读者与角色知识差”来控制失败信息何时揭示。
采样悬念体裁
→ 主角身份/职业 → 目标 → 未达成目标的严重后果
→ 生成最可能行动 a1 → 生成使 a1 失败的理由 r1
→ 在此前失败条件下生成较不可能行动 a2 → 失败理由 r2
→ 最后一轮不生成失败理由,允许主角成功
→ 每个 action–reason 对扩成章节摘要、事件序列和正文
【论文报告】为保持理性,后续行动必须以此前失败为条件,主角不能预先知道自己的计划会失败。可选设计包括在失败前埋小线索,以及在失败前或失败后向读者揭示原因(§3.2–3.3)。
【阅读者推断】迭代次数理论上可增加,但论文没有验证随长度增长的全局质量,因此“unlimited length”只表示流程没有固定轮数上限。
实验协议
【论文报告】实现使用 gpt-3.5-turbo-0613;附加实验使用 Llama-2-13b-chat。所有故事零样本生成,不使用外部故事语料。参与者来自 Prolific,位于美国、英语为第一语言,各研究使用互不重叠的人群并通过筛选题;研究经 IRB 批准。
【论文报告】主比较招募 90 人评价 30 对故事;每人读 10 对,每对由 30 人评价。维度为 suspense、novelty、enjoyment、logical sense、naturalness,采用 Wilcoxon signed-rank/sign test 并报告 Fleiss’ kappa(§4.1)。
核心证据
| 比较 | Suspense 胜/负/平 | Novelty 胜 | Enjoyment 胜 | Naturalness 胜/平 |
|---|---|---|---|---|
| 完整方法 vs ChatGPT baseline | 84.9/11.8/3.3 | 76.6 | 67.9 | 25.3/56.1 |
| 完整方法 vs Llama 2 baseline | 73.9/15.7/10.4 | 66.2 | 59.8 | 25.1/55.0 |
| 完整方法 vs Re3 | 81.1/6.8/12.1 | 84.7 | 70.8 | 28.4/59.6 |
【论文报告】上述悬念、独创和趣味优势大多达到 p<.01;相对 ChatGPT baseline 的 logical sense 为 49.2% 胜、27.8% 负、23.0% 平,p<.05。naturalness 主要表现为平局而非优势。
【论文报告】完整方法相对无 detail elaboration 的消融,悬念胜率 75.0%;相对同时简化 outline planning 的消融为 80.4%。但两种消融自身也显著胜过直接提示 baseline,说明简单的多步结构已经贡献很大。
机制检验与零结果
【论文报告】独立人评认为 96.5% 的行动与目标相关,89.8% 的失败理由合理;只有 55.1% 感知后续行动成功可能性下降,31.0% 认为不变、13.9% 认为上升(§4.3)。
【论文报告】加入失败线索时 57.9% 认为更悬念、10.9% 认为更差、31.2% 平,p<.05。提前揭示失败原因相对事后揭示为 42.1% vs 36.3%,差异不显著。作者还观察到高同理心常伴随高悬念,但未给出因果识别。
【阅读者推断】这些结果很重要:主系统有效不意味着理论链条每一步都成立。行动概率递减只略过半,提前/事后揭示是明确零结果,应保留而非只引用 84.9%。
局限与适用边界
- 【论文报告】只验证英文,理论来自西方叙事传统;迁移到其他语言需要重新做 prompt 与人评。
- 【阅读者推断】故事背景由模型自行采样,主要是明确目标与灾难后果的 thriller 式结构;日常、心理或悲剧悬念未覆盖。
- 【阅读者推断】反复“尝试—受挫”容易机械升级障碍,可能解释 naturalness 没有提升;单维优化还可能牺牲角色主动性和因果细腻度。
- 【阅读者推断】人评比较的是整套生成流程,不能完全区分理论、额外 token、更多规划步骤和更长输出的贡献。
阅读者判断
这是“把叙事技巧转成算法”的经典小而清晰案例。它强力支持对抗式失败规划能提高读者感知悬念,但也暴露出单维技巧优化的代价。实际系统应把脱困路径收敛作为候选规划信号,再用自然度、角色合理性和节奏评价器联合筛选,而非机械堵死每条路径。
关键原文定位
- 理论动机:§2.2,PDF pp.2–3。
- Background、Outline、Detail 三阶段:§3,表 1–2,PDF pp.3–6。
- 人评协议:§4,PDF p.6。
- 主结果、跨模型与消融:§4.1–4.2,表 3–6,PDF pp.7–8。
- 机制检验:§4.3,PDF p.8。
- 线索、揭示时机与同理心:§5,图 2,PDF pp.8–9。
- 局限与伦理:§7–8,PDF p.9。