CAT-LLM: Prompting Large Language Models with Text Style Definition for Chinese Article-style Transfer
说明:论文后续版本改名为 "CAT-LLM: Style-enhanced Large Language Models with Text Style Definition for Chinese Article-style Transfer"(发表于 ACM TKDD 2025,DOI 10.1145/3744250);内容一致,本笔记基于 arXiv v1/v2 全文。
- arXiv/venue: 2401.05707 / html v2(2024-01;期刊版 ACM TKDD 2025)
- 作者: Zhen Tao, Dinghao Xi, Zhiyu Li, Liumin Tang, Wei Xu(中国人民大学 / 上海财经大学 / 上海算法创新研究院 IAAR)
- 类型: 中文长文风格迁移方法(可插拔风格定义模块 + prompt 工程)
- 一句话: 提出可插拔的文本风格定义(TSD)模块,用一批机器学习算法从词级 + 句级量化目标文体特征,据此构造"风格增强 prompt"引导 LLM 完成长篇中文文章级风格迁移,兼顾迁移准确率与内容保真。
1. 要解决的问题
已有风格迁移研究大多聚焦英文单句,忽视中文长文的复杂性(丰富的修辞、篇章结构、文化语境),也缺平行语料难以评测。直接让 LLM"读一篇原文去模仿风格"效果差、易幻觉——模型难从少量文本里抽象出风格关系。CAT-LLM 要把"风格"从模糊感觉变成可量化、可注入的显式描述。
2. 方法 / 核心思路
核心是 TSD(Text Style Definition)模块,从两个粒度分析文体,产出特征后拼进 prompt:
词级特征 f_W:词性分布(名/动/形…)、词长模式、单双音节词占比、语气词频率、成语(正则匹配成语库)→ 拼接成词特征向量。
句级特征 f_S: - 平均句长;长/短句分类(阈值 20 词)。 - 情感:ERNIE 在 OCEMOTION 上微调,7 类情感。 - 句式:整句 vs 散句,用微调 MacBERT 判别。 - 修辞:比喻/拟人等,用微调 BERT 识别。 → 拼接成句特征向量。
风格树 & 动态扩展:TSD 支持"风格树"的动态扩展,可无缝加入新的风格定义(可插拔、易在后续研究里优化)。最终风格表示 F = f_W ⊕ f_S(词在前、句在后)。
Prompt 工程:把特征转成专业的自然语言描述(如"多用长句可增强文章的内涵与情感深度")注入 prompt,防止 LLM 误解风格标签。⇒ 本质是"先用小模型把风格量化成话,再让大模型照着写"。
3. 数据与实验
- 10 个平行数据集(用 ChatGPT 构造):
- 文学 5 部:《围城》(钱锺书)、《呐喊》(鲁迅)、《万历十五年》(黄仁宇)、《曾国藩家书》、《三体》(刘慈欣)。
- 非文学 5 域:News2016zh 新闻、中文维基、社媒帖子、CAIL2018 法律文书、CSL 科技文献摘要。
- 构造方式:每篇拆成"风格定义部分"与"迁移部分";用 ChatGPT 把风格定义部分改写成"无风格文本(styleless)"作平行参照。测试样本每域约 400 条,每条 120–140 字。
- 被测 LLM:GPT-3.5-Turbo、GPT-4-1106-preview、ChatGLM3-6B-chat、Baichuan-13B-chat。
- 基线(6 个传统模型):Style Transformer、RACoLN、StyleLM、SDR、DRAG、StoryTrans。
- 指标:
- 迁移准确率(Transfer Accuracy):BLEU-1/2、BERTScore(P/R/F1),比对生成文本与目标风格。
- 内容保真(Content Preservation):同套指标,比对生成文本与 styleless 文本。
- 人工评测:3 名文学博士生,就迁移准确率/内容保真/流畅度打分(0–100)。
4. 主要结果 / 发现(带数值)
《围城》主结果 · CAT+GPT-3.5-Turbo(最佳): - 迁移准确率 F1 = 79.36%(BERT),内容保真 F1 = 96.47%;BLEU-1 47.63%、BLEU-2 27.05%。 - 人工:迁移 93 / 内容保真 96 / 流畅 88。 - vs 基线:StoryTrans 迁移 F1 67.93% / 内容 94.86%;Style Transformer 迁移 F1 57.08% / 内容 96.69%(传统模型"内容高、迁移低",说明它们基本原样复制、几乎没改风格)。
跨域(CAT+GPT-3.5):新闻迁移 F1 84.47%(内容 95.37%);维基迁移 F1 85.43%(内容 92.72%)。
消融(《呐喊》+科技文献):仅词级 ≈ 57–60% 迁移 F1;仅句级 ≈ 52–57%;词+句 → 79.92%(呐喊)/ 84.70%(科技文献)。且"词在前、句在后"优于反序——细粒度语义应先于整体语境。
换骨干(《围城》):CAT+ChatGLM 迁移 F1 77.97%、CAT+Baichuan 76.59%——方法对不同 LLM 都适用。对照 prompt 法:Role-play+GPT-3.5 75.73%、Read(直接读原文)+GPT-3.5 仅 61.74%/内容 66.07%(直接读原文既不准又跑题)。
反直觉发现:GPT-4 反而不如 GPT-3.5(BLEU-1 35.12% vs 47.63%)——推理更强、"创作自由度"更高,反而偏离了严格的风格要求。
5. 局限
- 直接让 LLM 读原文提炼风格效果差 → LLM 难从少量样本抽象出风格关系,且易幻觉。
- GPT-4 的强推理反而降低风格迁移精度(创作自由度过高)。
- 传统基线迁移准确率低(约 30–70% F1)却内容保真极高(90%+),本质是原样复制、风格改动极小。
- 平行数据集由 ChatGPT 合成构造,"无风格文本"的中立性与评测公允性依赖构造质量。
6. 对中文小说 / 中文写作的启发
- "先量化风格、再注入 prompt"是极实用的产品化路径:想让 AI 写出某位作家/某种文体(鲁迅冷峻、钱锺书机锋、法律庄重)的味道,不要只丢一段范文让它模仿,而应先用小模型把词性/句长/句式/修辞/情感/成语这些可测特征抽出来,转成明确指令——本方法把《围城》风格迁移 F1 做到 79%,且内容保真 96%,正说明"显式化风格"远胜"隐式模仿"。
- 可插拔"风格树"= 中文写作产品的风格库雏形:把不同作家/题材的文体拆成可组合、可扩展的特征节点,供用户挑选混搭(例如"三体式硬冷叙述 + 言情式对白")。
- "GPT-4 更自由反而更跑偏"是重要工程警示:在强调忠实模仿既定风格的中文长文场景,更强的模型未必更好;需要用结构化约束"压住"其自由度(与 [[24_bit_mcts]] 用 reward/搜索约束生成、[[04_codified_foreshadowing_payoff]] 用结构约束是同一思路——给自由的模型套缰绳)。
- 词级先于句级的经验(细粒度语义先行)可迁移到其它中文长文控制任务的 prompt 设计。
- 与内容一致性检测([[01_lost_in_stories]])正交互补:一个保"风格像不像",一个保"事实对不对",长篇中文写作两者都要。
关联
- [[04_codified_foreshadowing_payoff]]:同属"给 LLM 生成加显式结构/约束"路线(一者约束叙事结构,一者约束文体特征)。
- [[24_bit_mcts]]:都在用外部结构/评分约束 LLM 的自由发挥;那篇管情节骨架,本篇管文体表层。
- [[01_lost_in_stories]]:风格保真 vs 内容一致,正交的两类质量维度。
- [[02_from_personas_to_plot_magnet]]:可把"人物专属文体/口吻"作为一种可注入的 TSD 特征,服务人物一致性。