AI_writing/papers/24_bit_mcts.md

BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation


1. 要解决的问题

开放式主题(如"梦""二十四节气")生成长篇线性小说是 LLM 的老大难。作者点出三重难点: 1. 叙事结构复杂:premise-based / 线性大纲法难以保证全局结构与节奏。 2. 缺文学理论支撑:模型不"懂"经典戏剧结构,情节容易平铺直叙、缺高潮。 3. 叙事空间庞大且未定义:从主题到成篇之间是一个巨大的、无系统搜索机制的可能性空间,直接让 LLM 一口气写就会失控。

对照 [[01_lost_in_stories]]:那篇诊断"写崩"(一致性 bug),本篇是从规划侧主动构造好结构来减少崩坏。

2. 方法 / 核心思路

核心隐喻是 Freytag 金字塔(五段式:开端—上升—高潮—下降—结局) + "高潮优先、双向扩展"。四阶段流水线:

Stage 1 · 冲突与高潮生成 LLM 先从主题抽出一句核心戏剧冲突,再生成一个场景级的高潮事件——作为 MCTS 的根节点。(先锚定高潮,保证全局节奏和情感落点。)

Stage 2 · 双向 MCTS 探索(核心创新) - 节点表示:每个节点 = 一份局部大纲 + 深度 + 访问次数 N(v) + 累积回报 W(v) + 终止/可扩展标志。 - 双向Forward MCTS 从高潮向后生成"下降动作/结局";Backward MCTS 从高潮向前生成"上升动作/开端"。 - Selection:UCB 公式,探索常数 c = 0.5。 - Expansion:每个节点生成 K = 4 个候选事件。 - Simulation:带引导的 rollout + 早停——只有当扩展不降低 reward 时才接受。 - Reward:LLM 打分器,从 10 个维度评估(人物塑造、场景描写、一致性、关联性、因果/时序关系、主题挖掘、可读性、创造性、重大缺陷识别、总体质量),归一到 [0,10]。 - Backpropagation:更新 N(v) 与 W(v)。

Stage 3 · 大纲精修 两步:先生成量身定制的开场/结尾场景,再用 LLM 自我批判修补逻辑漏洞、节奏、矛盾。

Stage 4 · 分段成文 分三段(开头/主体/结尾)生成,每段有专门指令,以管理上下文长度与文体控制。

关键超参:MCTS 迭代 50 次;最大搜索深度 d_max = 8;最大模拟深度 s_max = 3;每节点扩展 k_max = 4;采样温度 0.3–0.4(分阶段变化)。

3. 数据与实验

4. 主要结果 / 发现(带数值)

自动胜率(vs 基线,平均) - DeepSeek-V3:BiT-MCTS 47.2% vs StoryWriter 27.2% / Narrative Studio 27.0% - GPT-5-mini:BiT-MCTS 50.5% vs 31.5% / 12.0% - Gemini-2.5-Flash:BiT-MCTS 58.5% vs 16.8% / 13.5% - 分维度亮点:情节结构 PS 50.0–57.5%;人物塑造 CD 45.0–62.5%;多样性 DI 高达 77.5–92.5%

故事长度(tokens)——本方法显著更长: - GPT-5-mini:58,657 vs StoryWriter 15,008 - Gemini-2.5-Flash:25,374 vs 8,439 - DeepSeek-V3:8,060 vs 5,904

人工评测(平均胜率):BiT-MCTS 43.82% vs StoryWriter 26.23% / Narrative Studio 29.95%;主题 TH 51.67%、人物 CD 50.84%、情节 PS 46.67%、情感共鸣 ER 45.84%。

消融(loss rate,越高说明该组件越关键):去掉双向搜索 → 100% 输;去掉精修 → 94%;改用无双向的直接 MCTS → 93.5%;把顺序调反(先上升后下降)→ 97.25%;去掉早停 → 58.0%。⇒ 双向 + 高潮优先 + 精修 三者都不可或缺。

5. 局限

6. 对中文小说 / 中文写作的启发

关联