paper_type: "方法与系统;Benchmark 与数据集;实证与评价" type_confidence: 高 reading_depth: 深度复现 title: "CAT-LLM: Style-enhanced Large Language Models with Text Style Definition for Chinese Article-style Transfer" authors: "Zhen Tao; Dinghao Xi; Zhiyu Li; Liumin Tang; Wei Xu" year: 2025 source: "arXiv:2401.05707v2(2025-06-06);正式发表记录:ACM Transactions on Knowledge Discovery from Data, 19(7), Article 131, 1–33, DOI: 10.1145/3744250" pdf_file: "26_cat_llm.pdf" pdf: "26_cat_llm.pdf"
CAT-LLM:把统计式文本特征写进提示词,而非学习一个风格模型
一句话答案
CAT-LLM 将目标语料的词级、句级统计与分类器输出拼成一段自然语言“风格定义”,连同去风格化输入交给 LLM 零样本改写;在其由 ChatGPT 构造的平行参考上,CAT+GPT-3.5-turbo 于《围城》取得转移 BERTScore-F1 79.36、内容保真 BERTScore-F1 96.47,但这不是独立风格分类准确率,也不足以证明“风格树”或 GPT-4 失效原因。(论文报告,PDF p.1,§3–4)
核心问题
中文长文本的作者/体裁风格包含词汇、句法、修辞和文化表达。若只把若干原文片段塞给 LLM,作者认为会消耗 token、只覆盖局部风格且缺乏可解释的指导;那么,能否把可观察风格特征显式写入 prompt,并同时考察目标风格相似度与内容保留?(论文报告,§1,PDF pp.2–3)
TL;DR
- 【实验方法】TSD 不是端到端训练的风格表征:词级统计 POS、词长、单双音词、语气词、成语;句级统计句长/长短句、七类情绪、整散句和修辞,再按“词→句”顺序写入 prompt。(论文报告,§3.2–3.3,PDF pp.6–10)
- 【实验方法】十套“平行”数据由原有中文文本与 ChatGPT 去风格化文本构成;论文没有给出用于去风格化的 ChatGPT 具体版本、完整可复制 prompt、训练/验证/测试划分或泄漏审计。(论文报告,§3.1、§4.1,PDF pp.5、10–12)
- 【实验结果】《围城》CAT+GPT-3.5 的转移/保真 BERTScore-F1 是 79.36/96.47;47.63 vs 35.12 是转移 BLEU-1,不是 BERT-F1。(论文报告,表3,PDF p.15)
- 【实验结果】在三套主表数据中,GPT-3.5 的转移/保真 F1 均高于 GPT-4;但人评中 GPT-4 的流畅度更高。表5及附录两张人评表存在逐格重复数字,须把相关结论视为有报告质量风险的证据。(论文报告,表3–5、表A7–A8,PDF pp.15、17–18、27–28)
- 【作者主张】作者把 GPT-4 的较差自动分数归因于更大的“creative freedom”、训练数据和优化目标差异;这不是经由消融验证的因果解释。(作者主张,§4.5,PDF pp.14、16)
- 【阅读者推断】该工作最可复用的想法是“把可审计的风格约束写进提示词”;其有效性仍受合成参考、重叠式指标、缺失统计检验和未实现的风格树限制。(阅读者推断)
论文身份与版本边界
PDF 首页标为 arXiv:2401.05707v2 [cs.CL] 6 Jun 2025,作者为 Zhen Tao、Dinghao Xi、Zhiyu Li、Liumin Tang、Wei Xu,PDF 实有 34 页。arXiv 记录的 v1 为 2024-01-11,v2 为 2025-06-06;本笔记以 v2 为准。(论文报告,PDF p.1;arXiv 版本记录)
PDF p.1 的 ACM 式前页写有 J. ACM, Vol. 37, No. 4, Article 111 和占位 DOI 10.1145/nnnnnnn.nnnnnnn,不能作为正式引文。正式发表记录为 ACM Transactions on Knowledge Discovery from Data 19(7), Article 131, pp.1–33,DOI 10.1145/3744250;因此应区分“arXiv v2 的 34 页 PDF”和正式 33 页 article record。(外部书目记录;PDF p.1)
论证主线:从目标语料到受约束改写
任务和信息流。 对每种风格语料 (D_i),作者称将其分成 style-definition part (D_{i1}) 与 style-transfer part (D_{i2})。从 (D_{i1}) 提取总体 TSD;将 (D_{i2}) 去风格化得到 (D'{i2});将 (D'{i2}) 与 TSD 放入 LLM,生成 (D''_{i2});最后将生成结果与原始风格文本、去风格文本分别比较。论文把这称作八阶段框架。(论文报告,§3.1,图2,PDF pp.5–6)
构造说明的矛盾。 §3.1 的流程说去风格化的是 (D_{i2})(style-transfer part);§4.1 却写“transferring the style definition part into styleless text”。结合图2和评测描述,前一说法更连贯,但论文没有消除这一内部矛盾。(论文报告,§3.1、§4.1,PDF pp.5、11)
TSD 的实际算法和输出
词级特征 (f_W)。 使用 jieba 的 Cut 获取分词和词性,选择最高频 POS;统计 Top-4 词长,Top-2 单音词/多音词;利用语气词和成语数据库的正则匹配取 Top-6 语气词、Top-8 成语。随后按
拼接。这里没有“词级七情感”;七情感属于句级模块。(论文报告,§3.2.1,式1–7,PDF pp.6–8)
句级特征 (f_S)。 用句号、问号、感叹号切句,计算平均句长,并以 20 words 阈值判定长/短句主导类型。ERNIE 在 OCEMOTION 上微调,对每句的 sadness、happiness、disgust、anger、like、surprise、fear 打分并聚合;另由 ChatGPT 生成数据、以 MacBERT 微调“整句/散句”二分类器,以及“九类修辞+无修辞”的十分类器,取最常见 Top-2 修辞。最终
(论文报告,§3.2.2,式8–15,PDF pp.8–10)
所谓“风格树”。 摘要和引言称可“动态扩展 internal style trees”,但方法没有树的节点、层级、插入/检索算法、伪代码、复杂度或增量实验。可确认的实现是上述特征拼接与 prompt;不能将“风格树已实现且可无缝扩展”当作实验事实。(论文报告,摘要、§1、§3,PDF pp.1、3、5–10)
LLM 提示流程
提示结构。 style-enhanced prompt 包含 task description、original/styleless text、style definition、output indication 四部分。作者不直接罗列“词长/句式”统计,而将其翻译成专业描述,如“多长句使文章更有内涵、叙事具体、推理细致、情感丰富”;任务描述被设计为平衡改写与保留、避免新增内容。使用词级定义在前、句级定义在后。(论文报告,§3.3,图3,PDF pp.10–11)
实现缺口。 去风格化 prompt 只以图 A11 展示;正文没有报告其完整文本、ChatGPT 型号/版本、temperature、日期、重试与人工质量控制。生成端仅报告 LLM temperature=0.5、seed=42。(论文报告,图A11,PDF p.31;§4.2,PDF p.12)
数据:十种目标风格,但划分不可复现
来源和规模。 五类文学文本是《围城》《呐喊》《万历十五年》《曾国藩家书/家训》《三体》;五类非文学文本为 news2016zh News、中文 Wikipedia、百度 AI Studio Social Media、CAIL2018 Legal Document、CSL Scientific Literature。表1给出的不是 train/dev/test,而是 style-transfer examples / style-definition examples:(论文报告,§4.1,表1,PDF pp.10–12)
| 目标风格 | transfer examples | definition examples |
|---|---|---|
| Fortress Besieged | 623 | 946 |
| The Scream | 217 | 284 |
| The Fifteen Year of the Wanli Era | 413 | 617 |
| The Family Instructions of Zeng Guofan | 302 | 1,026 |
| The Three-Body Problem | 513 | 1,762 |
| News | 413 | 516 |
| Wikipedia | 221 | 112 |
| Social Media | 330 | 324 |
| Legal Document | 439 | 455 |
| Scientific Literature | 401 | 407 |
平行对的含义。 作者以 ChatGPT 将原有风格文本改成 styleless text,令这一合成文本和原风格文本成为评测参考对;每书约 400 个 test samples、每例 120–140 words 的说法与表1中 217、221、302 等数字并不完全对应。论文没有给出样本实际归属、训练/验证划分、分段规则、去重、泄漏检查、原始文本版本、版权许可或数据集许可证。(论文报告,§4.1,PDF pp.11–12)
实验协议与指标究竟测量什么
模型与资源。 使用 ChatGLM3-6B-chat、Baichuan2-13B-chat、GPT-3.5-turbo 和 GPT-4-1106-preview。句式二分类训练集每类 600 条,修辞十分类每类 600 条;两个 BERT/MacBERT 分类器在 4×RTX 3090 上分别微调。每种文本改写十次,自动指标取最终平均。未报告运行时、显存、API 成本、软件版本或传统基线重训配置。(论文报告,§4.2、表2,PDF pp.11–13)
比较组。 传统 baseline 为 Style Transformer、RALoCN/RACoLN(论文自身两种拼写)、StyleLM、SDR、DRAG、StoryTrans;LLM 另有 Role-play、Read(直接读文章片段)和 CAT。Read 的原文 token 数被约束为与 CAT 的 style-definition token 数一致。(论文报告,§4.4–4.5,PDF pp.13–14)
自动指标。 “Transfer Accuracy”是生成文本相对于原始带风格文本的 BLEU-1、BLEU-2、BERTScore Precision/Recall/F1;“Content Preservation”是同一组指标相对于 ChatGPT 生成的 styleless text。它们分别测量两个参考文本的词面/嵌入相似性,不是独立训练的风格分类准确率,也不是语义正确性的直接金标准。BERTScore 取 token embedding 的最大余弦相似度匹配。(论文报告,§4.3,式16–18,PDF pp.12–13)
人评。 3 位文学 PhD 对 18 种方法在《围城》、News、Wikipedia 上以 0–100 分评转移准确、内容保留、流畅度;其他三类人评在附录。未报告盲评、随机化、样本数、评分汇总方式、评审一致性、显著性或置信区间。(论文报告,§4.6,PDF pp.17–18)
关键结果:应相信到什么程度
自动主表:CAT 两个 GPT 版本与最强传统比较
下表是 BERTScore-F1(转移 / 保真)。《围城》的 79.36/96.47 即摘要数字的完整指标身份。(论文报告,表3,PDF p.15)
| 数据集 | CAT+GPT-3.5 | CAT+GPT-4 | StoryTrans |
|---|---|---|---|
| Fortress Besieged | 79.36 / 96.47 | 72.08 / 82.67 | 67.93 / 94.86 |
| News | 84.47 / 95.37 | 81.17 / 86.17 | 77.07 / 95.27 |
| Wikipedia | 85.43 / 92.72 | 83.80 / 87.52 | 81.21 / 93.92 |
GPT-4 的正确解读。 《围城》中 CAT+GPT-3.5 的转移 BLEU-1=47.63,CAT+GPT-4=35.12;相应转移 BERTScore-F1 才是 79.36 vs 72.08。News 的 84.47 vs 81.17 是转移 BERTScore-F1。作者推测 GPT-4 生成时会重写成它认为更适合的表达,提升可读/自然性却偏离风格;人评流畅度确实常为 GPT-4 95、GPT-3.5 88,但这不能证明上述机制,也不能概括到其他版本或模型。(论文报告,§4.5、表3,PDF pp.14–16;表4,PDF p.17)
消融:顺序比单独特征更好,但表格有异常
消融使用 GPT-3.5;下表为 BERTScore-F1(转移 / 保真)。(论文报告,§4.7,表5,PDF p.18)
| 数据集 | 句级 | 词级 | 句→词 | 词→句 |
|---|---|---|---|---|
| The Scream | 52.97 / 95.54 | 57.46 / 92.81 | 62.53 / 90.93 | 79.92 / 96.31 |
| Scientific Literature | 57.08 / 91.86 | 60.98 / 90.27 | 70.24 / 88.55 | 84.70 / 94.89 |
作者据此主张词级提示较句级强,且“词→句”最佳。(作者主张,§4.7,PDF pp.18–19)但是,The Scream 行中“句级、词级、句→词”三个配置的十个指标,分别逐格等同于附录表A5 Scientific Literature 的 Style Transformer、StyleLM、SDR 行;这是一项未解释的复制/标注异常。它不单凭 PDF 证明结果无效,但显著降低该消融的可审计性。(阅读者推断;表5,PDF p.18;表A5,PDF pp.26–27)
人评:自动“GPT-3.5 更好”不等于全面更好
下表按“转移 / 保真 / 流畅”列 CAT 结果。前三行来自主表,后三行来自附录。(论文报告,表4、表A6–A8,PDF pp.17、27–28)
| 数据集 | CAT+GPT-3.5 | CAT+GPT-4 |
|---|---|---|
| Fortress Besieged | 93 / 96 / 88 | 91 / 94 / 95 |
| News | 95 / 97 / 88 | 93 / 95 / 95 |
| Wikipedia | 96 / 92 / 88 | 94 / 93 / 95 |
| Social Media | 83 / 95 / 90 | 81 / 86 / 95 |
| Legal Document | 92 / 94 / 90 | 95 / 86 / 95 |
| Scientific Literature | 92 / 94 / 90 | 95 / 86 / 95 |
附录表A7(Legal Document)与表A8(Scientific Literature)不仅 CAT 行相同,整张 18 方法人评表逐项相同;论文未说明这是复用、误贴还是巧合。因而 Legal/Scientific 人评不能被当作两项独立、经报告验证的证据。(阅读者推断;表A7–A8,PDF pp.27–28)
证据边界、许可证与复现风险
论文明确限制。 CAT-LLM 当前只面向中文;复杂风格仍会引入无关/幻觉内容;作者计划补充多语、可读性与创造性指标,并加入领域知识。(论文报告,§4.10、§5,PDF pp.20–22)
未报告项。 没有标准差、置信区间、显著性检验、逐次生成结果;没有 TSD 分类器的独立测试表现;没有 ChatGPT 去风格化的模型版本和质控;没有人评一致性与盲法;没有数据、原文、代码许可证;没有风格树实现/实验。PDF 链接代码仓库,但公开仓库页面未列 LICENSE;arXiv 仅授予其非独占分发许可,不能推出数据或代码的再利用许可。(论文未报告;外部仓库与 arXiv 许可记录)
关键定位
| 要核查的说法 | 原文位置 |
|---|---|
| v2、作者、79.36/96.47、风格树主张 | 摘要,PDF p.1 |
| 框架分段、平行对生成与评测流程 | §3.1、图2,PDF pp.5–6 |
| 词级/句级特征与公式 | §3.2,PDF pp.6–10 |
| prompt 的四部分与自然语言说明 | §3.3、图3,PDF pp.10–11 |
| 十类数据、规模与训练资源 | §4.1–4.2、表1,PDF pp.11–12 |
| 指标定义、十次生成、模型版本/基线 | §4.3–4.5、表2,PDF pp.12–14 |
| 自动主表与 47.63/35.12 指标身份 | 表3,PDF p.15 |
| 人评与消融 | 表4–5,PDF pp.17–18 |
| 限制与未来工作 | §4.10、§5,PDF pp.20–22 |
| 其余自动结果、人评异常与去风格 prompt | 表A1–A8、图A11,PDF pp.25–31 |
阅读者判断
这篇论文对开头问题的实际回答是:以统计/分类器得到的可解释提示约束 LLM,可在作者构造的参考对上提高“接近原风格文本”与“接近去风格文本”的折中。最强的正面证据是表3中 CAT+GPT-3.5 在三个不同体裁上的 BERTScore-F1 同时优于 StoryTrans;但这仍是相对于 ChatGPT 生成平行参考的相似度证据,而不是与人类独立判断充分对齐的风格能力证明。(论文报告,表3,PDF p.15;阅读者推断)
可较有信心迁移的工程认识是:把品牌词汇、句长、修辞偏好等可审计规则转写为正向提示,能成为比“直接投喂示例”更小、更明确的控制接口。不能迁移的结论是“更强模型必然更不可控”或“风格树已经提供可扩展系统能力”:前者只来自特定 GPT 快照且作者仅作推测,后者没有实现细节;再加上表5、A7/A8 的重复数字,复现或产品采用前应先重建数据、盲评和统计协议。(阅读者推断)