AI_writing/papers/12_cogwriter.md

A Cognitive Writing Perspective for Constrained Long-Form Text Generation (CogWriter)


1. 要解决的问题

LLM 很难一次成型地生成满足严格约束的高质量长文。对照认知写作理论(Flower & Hayes 1981),当前 LLM 缺三样: - 缺分层规划:端到端直出,没有结构化任务分解。 - 缺复审能力:自回归生成无法回头修订/重构。 - 缺显式监控:生成中无法评估进度是否达标。

任务形态:生成一串相互关联的文本段、总量约 16,000 token,需同时满足三类指令——Single(指定位置放指定内容)/ Range(指定范围内内容)/ Periodic(按间隔重复出现的内容)

2. 方法 / 核心思路

把 LLM 受约束长文生成改造成"系统化认知写作范式",免训练。三类组件对应认知写作四过程:

人类写作过程 CogWriter 组件
分层规划 Planning Planning Agent 分解任务
转译 Translating Generation Agents 生成文本
复审 Reviewing 迭代修订函数
持续监控 Monitoring 外部评估机制

2.1 Planning Agent(分层规划)

生成分层初始计划 P_initial = {P1,…,Pn};再做 PlanRevise(对照任务约束 T 评估修订)与 FormatRevise(纠正语法/格式错误),产出结构化指导。

2.2 Generation Agents(并行生成)

多个 agent 同时并行,各负责一个段 D_i: - PlanAdjust:把局部计划与"剩余指令"对齐; - Generate:按计划生成文本; - LengthRevise:把输出长度调到目标 L 词。 (并行执行是其相对串行方法推理更快的来源。)

2.3 监控 + 复审机制

3. 数据与实验

4. 主要结果(带数值 vs baseline)

核心表(Table 1,backbone→+CogWriter): | Backbone | Comp. Rate | Avg. Acc. | 字数 | |---|---|---|---| | Qwen-2.5-14B | 0.29 → 0.79 | 0.44 → 0.61 | 1,817 → 10,091 | | GPT-4o | 0.63 → 0.91 | 0.47 → 0.74 | 9,055 → 11,618 | | Llama-3.3-70B | 0.99 → 1.00 | 0.48 → 0.70 | 9,431 → 12,051 | | GPT-4o-mini | 0.97 → 1.00 | 0.39 → 0.55 | 8,940 → 12,484 |

消融(Table 2,GPT-4o-mini,Avg.Acc.):Full 0.55;去 PlanRevise 0.50(Acc.Range 从 0.61 掉到 0.45);去 PlanAdjust 破坏最大 → 0.45;去 LengthRevise 0.54。说明规划相关修订(PlanRevise/PlanAdjust)是维持任务分解与约束对齐的关键。

5. 局限

  1. 算力开销大:约 2.8× 输出 token、10× 总 token(迭代规划/生成/复审所致,类似人类写作反复打磨)。但并行生成使推理反而快约 50%
  2. 依赖底模能力:Llama-3.1-8B 生成不了连贯计划;越强的模型(GPT-4o)越能吃到框架红利。
  3. 指令复杂度天花板:Single > Range > Periodic 的难度排序始终存在;指令数量越多,准确率越掉("instruction overload")。
  4. 架构单一:所有认知阶段用同一个 LLM,未针对规划/生成/复审做专门化(作者建议未来上 MoE / 分阶段专用模型)。

6. 对做产品 / 工程的启发

关联