Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese Literature
- arXiv/venue: 2603.14430 / html v1(2026-03)
- 作者: Yuanchi Ma, Kaize Shi, Hui He, Zhihua Zhang, Zhongxiang Lei, Ziliang Qiu, Renfen Hu, Jiamou Liu(含 Civilised Agent Lab 相关成员;论文未列全部机构)
- 类型: 实证诊断 / 叙事学分析框架(评估型,不提生成新方法)
- 一句话: 用普罗普(Propp)叙事功能理论(扩展到 34 个叙事功能)解剖 LLM 生成的中文网络文学,证明其结构性同质化的根因是——模型并不真正理解叙事功能,只是套用僵化的生成范式。
1. 要解决的问题
LLM 写故事常常"结构性同质":情节事件的排列组合高度重复、结局刻板套路。作者指出现有诊断多停留在表层语言特征(词汇多样性等),抓不住底层的"结构性坍缩(structural collapse)"。
核心研究问题:当前 LLM 到底是"理解"了叙事功能,还是只是在复现僵化模板? 这是"创意收敛(好的趋同)"还是"模仿(坏的套路化)"之辩——标题即问题。
2. 方法 / 核心思路
把 Propp 原始 31 个叙事功能扩展为 34 个,以适配现代网文结构: - 保留经典功能:禁令(Interdiction)、加害(Villainy)、离家(Departure)、斗争(Struggle)、胜利(Victory)…… - 新增/改造:设定(Setting, Fr)、变身(Transformation, Ch)、失忆(Memory loss, Lo),以及网文特色的"金手指(Golden Finger)"(作为第一施赠者变体 M)。
测量手段: - 用符号标签对文本做叙事功能标注,标注者一致性 κ ≈ 0.83。 - 让各 LLM 做叙事功能识别,用 ACC / Recall / F1 衡量"模型是否读得懂功能"。 - 分析功能序列模式(情节范式)在不同题材中的分布。
研究的 5 大中文网文题材:奇幻(Fantasy)、仙侠(Xianxia)、言情(Romance)、穿越(Time Travel)、都市(Urban)。
3. 数据与实验
- 语料:100 部中文网络小说(每部 10 万至 1000 万+ 字)。
- 标注集:140 个种子 → 扩展到 1.0k 个标注片段;覆盖全部 34 个功能,每功能至少 4 个样本。
- 标注专家:1 名职业网文作者(5000+ 小时写作经验)+ 1 名题材评论者(10000+ 小时阅读)。
- 被测 LLM(很全):GPT-4o、GPT-4o-mini、Qwen3(8b/32b)、Doubao-pro、Xuanyuan、Qianfan、Kimi-v1、DeepSeek-V3、DeepSeek-R1。
4. 主要结果 / 发现(带数值)
叙事功能识别很差(Table 3): - 最好的 Qwen3-32b 和 Doubao-pro,整体准确率仅 0.364。 - 常见功能上 Qwen3 约 60%;罕见功能上 Doubao 仅 33.3%,多数模型在冷门功能上更低。 - ⇒ 模型根本没真正"读懂"叙事功能,遑论灵活运用。
情节范式高度套路(Table 4):识别出 6 种模板,各自出现率 ≥ 60%: - 战斗:(A)→(Q)→{O/S} - 情感:(Em)↪(Ch) - 难题:(Y)↪(Z) - 冒险:(P)↪{M/O} - 伪装:(W)→(De)↪(S) - 日常:(A)↪(Ch)
案例研究(Table 5):DeepSeek 续写稳定呈现 "A-Lo-E-Q-P-S" 之类序列;Doubao 在 5 次生成中给出"几乎相同"的叙事序列——僵化套模板,而非功能性理解。
结论:单一叙事逻辑 + 严重同质化的根因是——LLM 无法正确理解叙事功能的含义,而是死守固定的叙事生成范式。属"模仿"而非真正的"创意收敛"。
5. 局限
- 范围局限:主要针对中文网络文学的主流题材,排除诗歌、实验小说、非线性结构。
- 语言特定:该框架跨语言迁移需重构叙事功能分类。
- 覆盖缺口:小众/先锋作品仍未充分覆盖。
- 深度局限:每个叙事功能的内部构成尚未展开研究。
6. 对中文小说 / 中文写作的启发
- 这是"敌情报告":明确了 LLM 中文写作的病灶不在词句,而在情节功能序列的坍缩。做中文长文写作产品,评估维度必须上升到"叙事功能层",而不只看流畅度/词汇丰富度(正是 [[01_lost_in_stories]] 也强调的:光看情节质量+流畅度不够)。
- 34 个叙事功能可直接当"情节积木库/评审 rubric":既能给作者当情节生成的提示词骨架,也能反向检测"这段套了哪个模板",量化套路化程度。
- "金手指"等本土功能被形式化,对做中文网文(仙侠/穿越/都市)辅助写作尤其对口——可针对题材定制情节功能约束。
- 对抗同质化的直接思路:既然 LLM 会坍缩到 ≥60% 的少数模板,就应在生成侧显式打散情节分布——这正是 [[24_bit_mcts]] 用双向 MCTS 搜索、把多样性做到 77–92% 的价值所在,两篇可对读为"诊断 + 解法"。
- 可与一致性检测叠加:功能层套路是一种"宏观 bug",与微观事实/时序 bug([[03_dome]] 的时序冲突分析)互补,合起来构成"宏观结构 + 微观一致"的双层质量闸门。
关联
- [[24_bit_mcts]]:本篇诊断"情节同质化",那篇用双向 MCTS 搜索显著提升多样性——诊断 vs 解法。
- [[01_lost_in_stories]]:同为实证诊断型工作;一者查宏观情节套路,一者查微观一致性 bug。
- [[03_dome]]:叙事学结构显式建模路线;可把 Propp 功能层与其时序分析叠为双层质检。
- [[04_codified_foreshadowing_payoff]]:伏笔—回收是"功能层"技巧的一种具体编码,可纳入 34 功能体系。