BiT-MCTS: A Theme-based Bidirectional MCTS Approach to Chinese Fiction Generation
- arXiv/venue: 2603.14410 / html v2(2026-03)
- 作者: Zhaoyi Li, Xu Zhang, Xiaojun Wan(北京大学 王选计算机研究所 / 外国语学院)
- 类型: 长篇中文小说生成方法(大纲规划 + 搜索)
- 一句话: 从一个开放式"主题"出发,先定"核心冲突 + 高潮",再用双向蒙特卡洛树搜索(MCTS)同时向前(下降/结局)和向后(铺垫/开端)扩展情节,生成结构完整、更长、更连贯的中文小说。
1. 要解决的问题
从开放式主题(如"梦""二十四节气")生成长篇线性小说是 LLM 的老大难。作者点出三重难点: 1. 叙事结构复杂:premise-based / 线性大纲法难以保证全局结构与节奏。 2. 缺文学理论支撑:模型不"懂"经典戏剧结构,情节容易平铺直叙、缺高潮。 3. 叙事空间庞大且未定义:从主题到成篇之间是一个巨大的、无系统搜索机制的可能性空间,直接让 LLM 一口气写就会失控。
对照 [[01_lost_in_stories]]:那篇诊断"写崩"(一致性 bug),本篇是从规划侧主动构造好结构来减少崩坏。
2. 方法 / 核心思路
核心隐喻是 Freytag 金字塔(五段式:开端—上升—高潮—下降—结局) + "高潮优先、双向扩展"。四阶段流水线:
Stage 1 · 冲突与高潮生成 LLM 先从主题抽出一句核心戏剧冲突,再生成一个场景级的高潮事件——作为 MCTS 的根节点。(先锚定高潮,保证全局节奏和情感落点。)
Stage 2 · 双向 MCTS 探索(核心创新) - 节点表示:每个节点 = 一份局部大纲 + 深度 + 访问次数 N(v) + 累积回报 W(v) + 终止/可扩展标志。 - 双向:Forward MCTS 从高潮向后生成"下降动作/结局";Backward MCTS 从高潮向前生成"上升动作/开端"。 - Selection:UCB 公式,探索常数 c = 0.5。 - Expansion:每个节点生成 K = 4 个候选事件。 - Simulation:带引导的 rollout + 早停——只有当扩展不降低 reward 时才接受。 - Reward:LLM 打分器,从 10 个维度评估(人物塑造、场景描写、一致性、关联性、因果/时序关系、主题挖掘、可读性、创造性、重大缺陷识别、总体质量),归一到 [0,10]。 - Backpropagation:更新 N(v) 与 W(v)。
Stage 3 · 大纲精修 两步:先生成量身定制的开场/结尾场景,再用 LLM 自我批判修补逻辑漏洞、节奏、矛盾。
Stage 4 · 分段成文 分三段(开头/主体/结尾)生成,每段有专门指令,以管理上下文长度与文体控制。
关键超参:MCTS 迭代 50 次;最大搜索深度 d_max = 8;最大模拟深度 s_max = 3;每节点扩展 k_max = 4;采样温度 0.3–0.4(分阶段变化)。
3. 数据与实验
- 测试集:40 个中文主题,来自官方作文/小说竞赛题目 + 常见主题。
- 骨干 LLM:GPT-5-mini、Gemini-2.5-Flash、DeepSeek-V3。
- 基线:StoryWriter(多智能体框架)、Narrative Studio(把 MCTS 改造成线性输出)、Vanilla LLM 直接生成。
- 自动评测:10 维基准(叙事复杂度、创造性、情感共鸣、情节结构、人物塑造、场景、语法、流畅度、多样性、总体质量),用 Qwen3-Max 当裁判,指标是胜率(win rate %)。
- 人工评测:8 位专家标注(6 名文学研究生 + 2 名资深教师),在 20 个主题上评 11 个维度。
4. 主要结果 / 发现(带数值)
自动胜率(vs 基线,平均) - DeepSeek-V3:BiT-MCTS 47.2% vs StoryWriter 27.2% / Narrative Studio 27.0% - GPT-5-mini:BiT-MCTS 50.5% vs 31.5% / 12.0% - Gemini-2.5-Flash:BiT-MCTS 58.5% vs 16.8% / 13.5% - 分维度亮点:情节结构 PS 50.0–57.5%;人物塑造 CD 45.0–62.5%;多样性 DI 高达 77.5–92.5%。
故事长度(tokens)——本方法显著更长: - GPT-5-mini:58,657 vs StoryWriter 15,008 - Gemini-2.5-Flash:25,374 vs 8,439 - DeepSeek-V3:8,060 vs 5,904
人工评测(平均胜率):BiT-MCTS 43.82% vs StoryWriter 26.23% / Narrative Studio 29.95%;主题 TH 51.67%、人物 CD 50.84%、情节 PS 46.67%、情感共鸣 ER 45.84%。
消融(loss rate,越高说明该组件越关键):去掉双向搜索 → 100% 输;去掉精修 → 94%;改用无双向的直接 MCTS → 93.5%;把顺序调反(先上升后下降)→ 97.25%;去掉早停 → 58.0%。⇒ 双向 + 高潮优先 + 精修 三者都不可或缺。
5. 局限
- 搜索昂贵:长程情节上的 MCTS 计算量大,API 延迟和 token 成本严重限制探索深度。
- 评测偏差:单一外部裁判(Qwen3-Max)可能有偏;人工评审仅 8 人、且只覆盖 20/40 主题(50%),一致性报告有限。
- 长度—质量权衡:极长序列上的一致性维持仍是挑战。
6. 对中文小说 / 中文写作的启发
- "高潮优先"是可直接借用的产品化写作范式:让用户先确定"最想写的那一幕",系统再双向补全前因后果——比"从头顺着写"更容易出戏剧张力,尤其契合网文/短篇竞赛这种要"抓人"的场景。
- 把大纲规划当搜索问题:不是让 LLM 一次生成大纲,而是在情节空间里采样—打分—回溯,用 10 维 reward 当"叙事品味"函数。中文长文写作工具可据此做"多方案情节树"供作者挑选。
- 多样性收益尤其突出(DI 77–92%),正面回应了 [[25_chinese_literature_homogeneity]] 指出的"LLM 情节同质化"——显式搜索能显著拉开情节分布,是对抗套路化的有效手段。
- 分段成文 + 段级指令:应对上下文长度和文体一致,是中文长篇工程化的实用套路。
- 与"伏笔—回收"结构([[04_codified_foreshadowing_payoff]])天然互补:BiT-MCTS 管全局骨架,伏笔编码管局部张力技巧,可叠加。
关联
- [[01_lost_in_stories]]:那篇诊断长篇一致性 bug;本篇从规划侧减少崩坏(互为"防守/进攻")。
- [[03_dome]]:同属"用叙事学结构(Campbell 五段式 / Freytag 金字塔)指导大纲"路线。
- [[04_codified_foreshadowing_payoff]]:全局骨架 vs 局部伏笔张力,可叠加。
- [[25_chinese_literature_homogeneity]]:本篇的高多样性结果正是对其"同质化"诊断的一种解法。