A Cognitive Writing Perspective for Constrained Long-Form Text Generation (CogWriter)
- arXiv/venue: 2502.12568(2025-02;ACL 2025 Findings,aclanthology.org/2025.findings-acl.511)
- 作者: Kaiyang Wan, Honglin Mu, Rui Hao, Haoran Luo, Tianle Gu, Xiuying Chen(通讯)(MBZUAI 阿联酋 / 中科院大学 UCAS / 南洋理工 NTU;code: github.com/KaiyangWan/CogWriter)
- 类型: 免训练(training-free)多智能体框架,把"认知写作理论"(规划-转译-复审-监控)落地为分层规划 + 并行生成 + 监控复审
- 一句话: 借人类写作是"迭代规划/转译/复审/监控"的认知过程,用一个规划 agent 做分层任务分解、多个生成 agent 并行执行、再靠监控与复审纠偏,让受约束长文生成又长(>1 万词)又准(Qwen-14B 背景下复杂指令遵循超 GPT-4o 约 22%)。
1. 要解决的问题
LLM 很难一次成型地生成满足严格约束的高质量长文。对照认知写作理论(Flower & Hayes 1981),当前 LLM 缺三样: - 缺分层规划:端到端直出,没有结构化任务分解。 - 缺复审能力:自回归生成无法回头修订/重构。 - 缺显式监控:生成中无法评估进度是否达标。
任务形态:生成一串相互关联的文本段、总量约 16,000 token,需同时满足三类指令——Single(指定位置放指定内容)/ Range(指定范围内内容)/ Periodic(按间隔重复出现的内容)。
2. 方法 / 核心思路
把 LLM 受约束长文生成改造成"系统化认知写作范式",免训练。三类组件对应认知写作四过程:
| 人类写作过程 | CogWriter 组件 |
|---|---|
| 分层规划 Planning | Planning Agent 分解任务 |
| 转译 Translating | Generation Agents 生成文本 |
| 复审 Reviewing | 迭代修订函数 |
| 持续监控 Monitoring | 外部评估机制 |
2.1 Planning Agent(分层规划)
生成分层初始计划 P_initial = {P1,…,Pn};再做 PlanRevise(对照任务约束 T 评估修订)与 FormatRevise(纠正语法/格式错误),产出结构化指导。
2.2 Generation Agents(并行生成)
多个 agent 同时并行,各负责一个段 D_i: - PlanAdjust:把局部计划与"剩余指令"对齐; - Generate:按计划生成文本; - LengthRevise:把输出长度调到目标 L 词。 (并行执行是其相对串行方法推理更快的来源。)
2.3 监控 + 复审机制
- 持续监控:外部函数把输出对照约束做评估;
- 动态复审:LLM 评估,发现问题即触发修订,形成监控↔复审反馈环。
3. 数据与实验
- 基准 LongGenBench:400 实例(4 场景各 100)——日记、菜单(时序类);摩天楼设计、城市规划(空间类)。目标约 16,000 token(时序 200 词×52 周≈10,400 词;空间 150 词×100 单元≈15,000 词)。
- 指标:Completion Rate(顺序完成率)、Acc. Once / Range / Periodic 及 Avg. Acc.(指令遵循准确率)、Word Count(要求≥12,700 词)。
- backbone / 基线:开源 Qwen-2.5-14B-Instruct、Llama-3.3-70B-Instruct;闭源 GPT-4o、GPT-4o-mini;对比 LongWriter-Llama3.1-8B、Mixtral-8x7B,以及增强基线 Self-Refine、Chain-of-Thought。
- 实现:开源模型用 vLLM 跑在 4×A100-80G。
4. 主要结果(带数值 vs baseline)
核心表(Table 1,backbone→+CogWriter): | Backbone | Comp. Rate | Avg. Acc. | 字数 | |---|---|---|---| | Qwen-2.5-14B | 0.29 → 0.79 | 0.44 → 0.61 | 1,817 → 10,091 | | GPT-4o | 0.63 → 0.91 | 0.47 → 0.74 | 9,055 → 11,618 | | Llama-3.3-70B | 0.99 → 1.00 | 0.48 → 0.70 | 9,431 → 12,051 | | GPT-4o-mini | 0.97 → 1.00 | 0.39 → 0.55 | 8,940 → 12,484 |
- 招牌结论:Qwen-2.5-14B + CogWriter 的 Avg.Acc.=0.61,比 GPT-4o baseline(0.47)高约 22%(相对),且稳定生成 >1 万词。
- 提升最大的是 Completion Rate(Qwen 0.29→0.79,+0.51)与 Periodic 指令(GPT-4o 的 Acc.Periodic 0.17→0.67,+0.50)。
消融(Table 2,GPT-4o-mini,Avg.Acc.):Full 0.55;去 PlanRevise 0.50(Acc.Range 从 0.61 掉到 0.45);去 PlanAdjust 破坏最大 → 0.45;去 LengthRevise 0.54。说明规划相关修订(PlanRevise/PlanAdjust)是维持任务分解与约束对齐的关键。
5. 局限
- 算力开销大:约 2.8× 输出 token、10× 总 token(迭代规划/生成/复审所致,类似人类写作反复打磨)。但并行生成使推理反而快约 50%。
- 依赖底模能力:Llama-3.1-8B 生成不了连贯计划;越强的模型(GPT-4o)越能吃到框架红利。
- 指令复杂度天花板:Single > Range > Periodic 的难度排序始终存在;指令数量越多,准确率越掉("instruction overload")。
- 架构单一:所有认知阶段用同一个 LLM,未针对规划/生成/复审做专门化(作者建议未来上 MoE / 分阶段专用模型)。
6. 对做产品 / 工程的启发
- "认知写作四过程"是很好的 agent 拆分蓝图:Planning(分层分解)+ Generation(并行转译)+ Monitoring/Reviewing(校验纠偏),可直接映射到工程流水线。
- 并行生成 agent 是这套方法能"又长又快"的关键:把长文切段并行写,再用监控保约束,比串行 refine 更省墙钟时间。
- 规划层的两次修订(PlanRevise 对约束 + PlanAdjust 对剩余指令) 是保证"最终真的满足约束"的核心,消融证明去掉它掉分最多——值得在受约束写作产品里保留。
- 面向"结构化约束写作"场景(报告/菜单/规划/合规文档这类必须在特定位置/周期出现特定内容的长文)尤其适用,比纯创意写作更能体现价值。
- 成本警示:10× 总 token 是真实代价,产品化要权衡"约束达成率提升"与"账单"。
- training-free、开源,落地门槛低。
关联
- 与 [[10_storywriter]] 的 ReIO(压缩+改写)、[[03_dome]] 的动态大纲同属"规划+复审"思路,但本篇更强调并行生成 + 对硬性约束的监控,且面向"受约束长文"而非纯叙事。
- 分层规划 + 多 agent 协作,与 [[14_agents_room]] 的 planning/writing agent 分工、[[13_muse]] 的 plan-execute-verify-revise 闭环可横向对比(都是"规划→执行→复审"家族)。
- 监控/复审纠偏机制与 [[01_lost_in_stories]] 的一致性检测、[[04_codified_foreshadowing_payoff]] 的结构校验思路相通。
- 同批次可与 [[11_storybox]](自底向上模拟)对照:一个靠"涌现"、一个靠"严格规划+监控",代表长篇生成的两个极端。