AI_writing/papers/21_narrative_flattening.md

Narrative Flattening: How Post-Training Compresses Thematic, Affective, and Stylistic Variation in LLM Fiction


1. 要解决的问题

大家都感觉 LLM 的创意写作"平淡、千篇一律",但一直没搞清:这种"平"是预训练带来的,还是后训练(SFT/对齐/RL)造成的? 而且它对不同类型的小说(网文 vs 命题作文 vs 专业文学)影响是否一样? 本文要把"扁平化"的成因定位到具体训练阶段,并量化不同文学域的受损程度。

2. 方法 / 核心思路

2.1 受控对照设计(核心巧思)

4 个 OLMo-32B 检查点Base(仅预训练)→ SFT(监督微调)→ DPO(偏好优化)→ RLVR(可验证奖励的强化学习)。 四者共享架构、规模、tokenizer、预训练——因此彼此差异只来自后训练步骤,从而干净地隔离出 post-training 效应

2.2 匹配式故事续写范式(matched story-continuation)

在三个文学域上,给同一段开头,让各检查点续写,并与匹配的人类真实续写对比: - StoryStar:公共平台网文(业余)。 - TMAS:命题/提示引导的故事。 - The New Yorker:专业文学小说(专业作家)。

2.3 三个句子级测量维度

每篇续写沿三条轴测量,并与人类基线比"差距": 1. Thematic motion(主题运动):句间主题如何转移/推进——后训练后转移变更均匀(缺乏起伏)。 2. Affective prevalence(情感强度分布):高强度情绪 → 向中性塌缩。 3. Linguistic diversity(语言多样性):跨故事的文体多样性收缩(不同故事读起来越来越像)。

3. 数据与实验

4. 主要发现 / 结果

5. 局限

6. 对做产品 / 工程的启发

关联