AI_writing/papers/26_cat_llm.md

CAT-LLM: Prompting Large Language Models with Text Style Definition for Chinese Article-style Transfer

说明:论文后续版本改名为 "CAT-LLM: Style-enhanced Large Language Models with Text Style Definition for Chinese Article-style Transfer"(发表于 ACM TKDD 2025,DOI 10.1145/3744250);内容一致,本笔记基于 arXiv v1/v2 全文。


1. 要解决的问题

已有风格迁移研究大多聚焦英文单句,忽视中文长文的复杂性(丰富的修辞、篇章结构、文化语境),也缺平行语料难以评测。直接让 LLM"读一篇原文去模仿风格"效果差、易幻觉——模型难从少量文本里抽象出风格关系。CAT-LLM 要把"风格"从模糊感觉变成可量化、可注入的显式描述。

2. 方法 / 核心思路

核心是 TSD(Text Style Definition)模块,从两个粒度分析文体,产出特征后拼进 prompt:

词级特征 f_W:词性分布(名/动/形…)、词长模式、单双音节词占比、语气词频率、成语(正则匹配成语库)→ 拼接成词特征向量。

句级特征 f_S: - 平均句长;长/短句分类(阈值 20 词)。 - 情感:ERNIE 在 OCEMOTION 上微调,7 类情感。 - 句式:整句 vs 散句,用微调 MacBERT 判别。 - 修辞:比喻/拟人等,用微调 BERT 识别。 → 拼接成句特征向量。

风格树 & 动态扩展:TSD 支持"风格树"的动态扩展,可无缝加入新的风格定义(可插拔、易在后续研究里优化)。最终风格表示 F = f_W ⊕ f_S(词在前、句在后)。

Prompt 工程:把特征转成专业的自然语言描述(如"多用长句可增强文章的内涵与情感深度")注入 prompt,防止 LLM 误解风格标签。⇒ 本质是"先用小模型把风格量化成话,再让大模型照着写"。

3. 数据与实验

4. 主要结果 / 发现(带数值)

《围城》主结果 · CAT+GPT-3.5-Turbo(最佳): - 迁移准确率 F1 = 79.36%(BERT),内容保真 F1 = 96.47%;BLEU-1 47.63%、BLEU-2 27.05%。 - 人工:迁移 93 / 内容保真 96 / 流畅 88。 - vs 基线:StoryTrans 迁移 F1 67.93% / 内容 94.86%;Style Transformer 迁移 F1 57.08% / 内容 96.69%(传统模型"内容高、迁移低",说明它们基本原样复制、几乎没改风格)。

跨域(CAT+GPT-3.5):新闻迁移 F1 84.47%(内容 95.37%);维基迁移 F1 85.43%(内容 92.72%)。

消融(《呐喊》+科技文献):仅词级 ≈ 57–60% 迁移 F1;仅句级 ≈ 52–57%;词+句 → 79.92%(呐喊)/ 84.70%(科技文献)。且"词在前、句在后"优于反序——细粒度语义应先于整体语境。

换骨干(《围城》):CAT+ChatGLM 迁移 F1 77.97%、CAT+Baichuan 76.59%——方法对不同 LLM 都适用。对照 prompt 法:Role-play+GPT-3.5 75.73%、Read(直接读原文)+GPT-3.5 仅 61.74%/内容 66.07%(直接读原文既不准又跑题)。

反直觉发现GPT-4 反而不如 GPT-3.5(BLEU-1 35.12% vs 47.63%)——推理更强、"创作自由度"更高,反而偏离了严格的风格要求。

5. 局限

6. 对中文小说 / 中文写作的启发

关联