AI_writing/pdfs/25_chinese_literature_homogeneity_精读.md

paper_type: "实证与评价;Benchmark 与数据集;理论与立场" type_confidence: 高 reading_depth: 标准精读 title: "Creative Convergence or Imitation? Genre-Specific Homogeneity in LLM-Generated Chinese Literature" authors: "Yuanchi Ma, Kaize Shi, Hui He, Zhihua Zhang, Zhongxiang Lei, Ziliang Qiu, Renfen Hu, Jiamou Liu" year: 2026 source: "arXiv:2603.14430v1(2026-03-15)" pdf: "25_chinese_literature_homogeneity.pdf" dataset: "https://anonymous.4open.science/r/acl26-ED4E/(论文给出的匿名仓库)"


中文网文“结构同质化”:叙事功能证据走到了哪一步

一句话结论:论文把 Propp 的叙事功能改造成 34 类中文网文标签,并用 1,000 条专家复核语料、两段功能识别测试和同一前文的模型续写案例诊断结构重复;它较好地证明了“功能序列是一种可用的同质化描述语言”,却没有建立“模型不理解功能 → 刚性序列 → 文学同质化”的因果链。

核心问题与论证路线

流畅度和词面重复不足以解释读者所说的“网文套路感”:两篇文字可以词汇不同,却仍沿着相同的冲突、升级和胜利结构前进。论文因此追问,能否用叙事学中的 narrative function(叙事功能)把这种深层结构重复操作化,并进一步解释 LLM 为什么生成同质化故事。

作者的回答分三步:先从 100 部中文网文归纳 34 类功能;再构造标注语料,测试模型能否识别功能;最后比较六类人类网文路径及三个模型对同一前文的五次续写。前两步建立测量工具,最后一步才试图支撑同质化解释;这三层证据不能混成一个结论。(论文报告,§1、§3–§4,PDF pp.1–8;阅读者分析)

TL;DR

1. 如何把“套路感”变成可标注对象

理论改造。 Propp 原本用 31 个相对稳定的功能描述俄国民间故事。作者认为中文连载网文的角色系统、升级机制和类型惯例不同,于是分析 100 部、单部约 10 万至 1,000 万词以上的热门作品,形成 34 类功能。新增或重释内容包括 Setting、Transformation、Memory Loss,以及把 First donor 延展为“golden finger”、把能力增长表达为 Get promoted 等。(论文报告,§3.1、Table 1,PDF pp.3–4)

分类规则。 标注者依次参考三个线索:句子在文章中的位置、片段达成的叙事目标、涉及角色的行为或状态。角色只区分主要和非主要人物,不沿用 Propp 的七类角色,从而降低长篇网文中角色歧义。(论文报告,§3.1,PDF pp.3–4)

常见功能的口径。 作者把 100 部作品随机分五组,每组抽四部、每部随机抽 2,000 个汉字;样本中功能共出现 332 次,频次超过每类平均约 10 次者被定义为 common,其余为 uncommon。这个“常见”是 20 部短片段中的相对阈值,不是五类网文总体 prevalence 的估计;章节位置和类型构成都可能改变结果。(论文报告,§3.1、Fig.3,PDF pp.4–5;阅读者分析)

2. 1,000 条语料怎样形成,能支持什么

标注流程。 一名职业网文作者和一名类型评论者对随机段落分配功能符号并写理由,报告 inter-annotator agreement 约 κ=0.83。初始语料只有 140 个 seed,在两个任务间均分,34 类每类至少有四个片段;随后用 DeepSeek-R1 扩展一次,得到 1,000 条,再由专家审阅和调整。附录称四人组还包括一名文学教授和一名文学专业研究生。(论文报告,§3.2、Appendix A.1,PDF pp.5、10)

质控缺口。 论文没有说明 κ=0.83 的具体统计类型、计算单位和置信区间,也没有报告扩展样本的人工修改比例、每条复核人数、分歧裁决、train/dev/test split、去重方式或数据许可证。匿名仓库提供可访问入口,但论文页内不足以证明完整资源治理。(阅读者分析)

因此,这套语料最稳妥的用途是训练或核验“按作者定义的 34 类功能做片段标注”的工具;它本身不是一个已经验证的文学同质化 benchmark。(阅读者分析)

3. 模型真的不理解这些功能吗

实验方法。 作者只选择两名人类作者写的两个段落,合计覆盖 10 个功能:四个 common 与六个 rare。每个模型从 34 类中识别出现的功能;实验重复 10 个 round,每轮生成五次预测,再报告均值和标准差。(论文报告,§4.2、Table 2,PDF pp.6–7)

模型 Common Acc. Rare Acc. Overall Acc. Overall F1
GPT-4o 0.200 0.167 0.182 0.167
GPT-4o-mini 0.200 0.000 0.091 0.167
Qwen3-8B 0.200 0.000 0.091 0.167
Qwen3-32B 0.600 0.167 0.364 0.282
Qianfan 0.400 0.167 0.273 0.276
Doubao-Pro 0.400 0.333 0.364 0.533
Xuanyuan 0.200 0.000 0.091 0.200
Kimi-v1 0.200 0.167 0.182 0.167
DeepSeek-V3 0.400 0.167 0.273 0.217
DeepSeek-R1 0.400 0.167 0.273 0.276

(论文报告,Table 3,PDF p.7)

作者解释。 作者把低准确率解释为现有 LLM 缺少对叙事理论、角色驱动意图和功能抽象的概念理解;Qwen3-32B 对 common 功能较高,则可能依赖更明显的表面线索。(作者主张,§4.2,PDF p.6)

替代解释。 五十次采样只减少同两个输入上的随机误差,不增加内容覆盖。低分还可能来自自定义标签未见过、定义或提示不清、功能可多标、两个段落不代表各类型等。实验没有与受训分类器或人类基线比较,因此它测到的是“特定 prompt 下对新标签体系的 zero-shot 适配”,而不是一般叙事理解能力。(阅读者分析)

4. 人类网文路径与模型续写:同质化证据有多强

人类文本的路径归纳。 作者从 100 部作品中随机选 60%,每部抽六个不超过 1,000 词的 plot instance,共形成 360 个片段。Qwen3 先标功能,再由人工复核。作者归纳出六类路径,并称每种范式在相应样本中的出现率至少为 60%。(论文报告,§4.2、Table 4、Appendix A.4,PDF pp.6–7、15)

情节类型 归纳的功能路径
Battle Initial situation → Struggle → Promotion / Victory
Emotional Emotion ↝ Transformation
Difficult task Difficult task ↝ Solution
Adventure Transfer ↝ Donor / Promotion
Pretending Unrecognized arrival → Exposure ↝ Victory
Daily life Initial situation ↝ Transformation

预实验。 附录 Fig.5 让 DeepSeek-R1、Qwen、Doubao 和 GPT-4o 在同一主题前文上各续写五次;专家把文本分解为环境描写、人物塑造和情节摘要,再对每一部分的五次输出计算 BERTScore 相似度。图中四个模型的三类相似度都偏高,但论文不印精确数值,也不提供人类续写、跨 prompt 分布或不确定性。(论文报告,Appendix A.1、Fig.5,PDF p.10)

案例实验。 正文用 Table 2 的同一前文,让 DeepSeek-R1、Qwen3-32B、Doubao-Pro 各续写五次。Doubao 五次几乎都走 A→J/E→Lo→M/N→O;另外两者也反复落到冲突、能力获得、标记和胜负。该案例清楚显示单一前文下的 model-internal structural repetition。(论文报告,§4.3、Table 5,PDF pp.7–8)

证据边界。 人类路径本身也高度模板化,作者并未在相同 prompt 下比较人类与模型的功能序列熵、编辑距离或分布差异。案例只能支持“这些模型在这个前文上重复”,不能支持模型总体比人类更同质,也不能证明识别低分导致生成重复。(阅读者分析)

5. 因果链在哪一环断裂

论文的核心解释可以写成:模型功能识别率低 → 模型不能理解功能语义与因果 → 模型机械复用高频功能组合 → 中文网文同质化。(作者主张,§4.3–§5,PDF pp.8–9)

但实验只观察到第一项和第三项,没有干预中间机制:没有训练模型理解功能后检验多样性是否提高,没有证明识别更好的模型生成更丰富,也没有排除 prompt、采样、类型惯例和训练数据模板等替代解释。Qwen3-32B 的 overall F1 只有 0.282,却被用于 360 个片段的初始标注;人工复核能缓解标签错误,但复核改变比例未报告。(阅读者分析)

因此,更可靠的结论是:34 类功能序列能显露词面指标之外的结构重复;“理解缺失是根因”仍是待检验假设,而非该论文已识别的因果机制。(阅读者分析)

6. 局限与适用边界

作者限制。 研究只覆盖中文主流网文,不能直接推广到诗歌、实验小说和非线性叙事;跨语言需要重建分类与数据;100 部热门作品遗漏小众和先锋作品;论文只建模功能间结构,没有研究单个功能内部的语言与事件组成。(论文报告,§6,PDF p.9)

进一步限制。 测量框架本身来自热门网文,因此可能把行业常见模板固化为坐标;“偏离 34 类”可能是创新,也可能是分类失败。数据由 DeepSeek-R1 扩展、实验又评估相近模型生态,存在标签自指风险。论文没有人类同 prompt 续写对照、序列显著性、跨 prompt 重复统计、许可细节或完整复现配置。(阅读者分析)

关键原文定位

tags: [论文精读, 中文网文, 叙事功能, Propp, 同质化, 数据集] related: [[21_narrative_flattening]], [[28_automated_creativity_eval]], [[37_casper_character_variety]]

阅读者判断

这篇论文最值得保留的是一个新的测量视角:用功能序列而非词汇相似度讨论“故事为什么像”。1,000 条语料和六类路径让该视角具备继续扩展的基础;但决定性证据仍然很窄——两个识别段落和一个续写前文无法支撑模型层面的根因结论。应以中等信心接受其 taxonomy 与诊断价值,以低信心接受“功能不理解导致同质化”的因果解释。

对写作系统的直接启示不是把 34 类当作硬评分表,而是把功能序列用作多样性审计:在同 prompt 多次生成后比较路径熵、转移分布和关键转折覆盖,并同时保留人类对照。只有当功能规划干预能稳定提高这些指标和人评质量时,才能把“结构理解”从解释升级为可验证机制。(阅读者分析)