AI_writing/pdfs/12_cogwriter_精读.md

paper_type: 方法与系统, 实证与评价 type_confidence: 高 reading_depth: 标准精读 title: "A Cognitive Writing Perspective for Constrained Long-Form Text Generation" authors: Kaiyang Wan, Honglin Mu, Rui Hao, Haoran Luo, Tianle Gu, Xiuying Chen year: 2025 source: manuscript; PDF 未标明 arXiv ID、DOI 或正式发表来源 pdf: 12_cogwriter.pdf code: https://github.com/KaiyangWan/CogWriter tags: [论文精读, 长文本生成, 约束遵循, 认知写作, 多智能体, 规划, 复审] related: [[38_re3]], [[42_chain_of_agents]], [[19_storyalign]], [[02_from_personas_to_plot_magnet]], [[04_codified_foreshadowing_payoff]]

CogWriter:长文本约束失败,不只是模型忘了,而是写作过程没有被外化

一句话答案:CogWriter 把认知写作理论中的规划、成文、监控和修订拆成计划代理、多个生成代理与外部检查—复审循环,在 LongGenBench-16K 的 400 个结构化任务上明显提高长度和位置约束准确率;但论文没有评估拼接后的整体连贯、文学质量或事实质量,而且方法约用基线 10 倍总 token,因此它证明的是“过程分解能改善可检查约束”,不是低成本地解决了开放式长篇写作。

为什么一次自回归生成很难同时照顾全局约束

问题诊断。长文本任务不仅要求继续写,还要求在某周、某层楼、某个区间或每隔若干单元重复满足约束。单次 LLM 调用把计划、写作和检查混在同一条 token 流里:它可以流畅地展开局部文字,却很难回头修订已经生成的结构,也没有独立监控器持续检查全局目标。(作者主张,§1–2)

CogWriter 借用认知写作模型,把问题改成一个可反复检查的过程:先把长任务拆成层次计划,检查计划是否覆盖约束,再让多个代理写局部单元,并在生成前后调整计划与长度。下文先把理论映射到实际模块,再看 LongGenBench 实验究竟测到了什么。

先给结论

认知写作理论怎样变成系统模块

认知写作过程 论文诊断的单次 LLM 缺口 CogWriter 的对应操作
分层规划 没有独立且可迭代的全局计划 Planning Agent 先生成单元计划,再按任务约束和格式反馈做 PlanRevise / FormatRevise
翻译/成文 LLM 擅长局部语言实现 多个 Generation Agents 根据各自局部计划生成文本单元
监控 没有显式检查目标与长度 外部 monitoring functions 检查任务约束、计划结构和单元长度,并把反馈送回复审
复审/修订 已生成 token 难以回头重构 全局修计划、局部 PlanAdjust,以及生成后的 LengthRevise / LengthReview

这套映射的重点不是让代理扮演心理角色,而是把可检查的中间状态显式化:约束先绑定到计划单元,成文前还能调整,长度不够时可单独返修。(论文报告,§2–4)

规划阶段。任务 prompt 被表示为场景、要求和位置等约束集合。Planning Agent 生成层次计划后,系统先检查任务约束覆盖,再检查计划结构与语法,分别通过 PlanRevise 和 FormatRevise 修改。论文称这些是 external monitoring functions,但没有在 PDF 中给出函数定义、阈值、失败规则或完整提示词,不能进一步称为“确定性监控器”。(论文报告,§4.1–4.2;阅读者分析)

生成阶段。每个计划单元先结合 residual information 做 PlanAdjust,再生成初稿,并用 LengthRevise 达到目标长度;最终各单元按顺序拼接。图 2 标为 Parallel Generation / Parallel Reviewing,正文也说多个代理并行,但算法 1 只是顺序 for each P_i,没有并发原语、代理数、上下文共享或调度细节。(论文报告,§4.3,图 2、算法 1;阅读者分析)

未解决的接口。算法没有展示拼接后的全文复审,也没有说明相邻单元冲突、跨单元指代、人物状态和伏笔怎样协调。因此并行能缩短墙钟时间,却可能把全局连贯性留在单元接口处;这正是后续实验需要单独测量的风险。(阅读者分析)

实验到底要求模型写什么

任务与数据。LongGenBench-16K 有 400 个测试实例。时间型任务包括 52 周日记和菜单设计,每周至少 200 words,总目标 10,400 words;空间型任务包括 100 单元的摩天楼和城市规划,每单元 150 words,总目标 15,000 words。约束分 SI(指定精确位置)、RI(指定区间)和 PI(周期重复)。(论文报告,§5.1)

指标。Completion Rate 检查输出是否完成规定结构;Once、Range、Periodic 分别测三类约束命中,Avg. Acc. 是其汇总;Word Count 检查长度。表 1 把平均长度门槛写成 Words (Req. ≥12700),它来自两类任务目标的平均值。正文另有“12,700 tokens”表述,与任务定义和表头的 words 混用,不能写成所有实例统一要求 12,700–15,000 tokens。(论文报告,§5.1–5.2,表 1;阅读者分析)

模型与基线。普通基线包括 LongWriter-Llama3.1-8B、Llama 3.1 8B/70B、Mixtral-8x7B、Qwen-2-72B、GPT-4o 和 GPT-4o-mini;增强方法比较 SELF-REFINE、CoT 与 CogWriter。CogWriter 分别套在 GPT-4o-mini、GPT-4o、Qwen-2.5-14B 和 Llama-3.3-70B 上。开源模型用 vLLM 和 4×A100-SXM4-80GB,GPT 走官方 API。(论文报告,§5.1)

论文未报告具体 temperature、top-p、max tokens、随机种子、每实例调用次数、失败重试、表 1 跨 run 方差或 API 费用。附录的“三次”只出现在推理时间/token 分析语境,不能据此假定所有主结果都重复三次。(阅读者分析)

过程分解带来了多大提升

Backbone 方法 Completion Once Range Periodic Avg. Acc. Words
GPT-4o-mini 原始 .97 .54 .48 .16 .39 8,940
GPT-4o-mini + CogWriter 1.00 .74 .61 .31 .55 12,484
Qwen-2.5-14B 原始 .29 .53 .54 .24 .44 1,817
Qwen-2.5-14B + CogWriter .79 .70 .65 .47 .61 10,091
Llama-3.3-70B 原始 .99 .59 .63 .21 .48 9,431
Llama-3.3-70B + CogWriter 1.00 .76 .79 .55 .70 12,051
GPT-4o 原始 .63 .63 .60 .17 .47 9,055
GPT-4o + CogWriter .91 .80 .76 .67 .74 11,618

结果显示,CogWriter 同时改善完成长度与三类位置约束,周期重复约束的增幅尤其大。Qwen-2.5-14B + CogWriter 的 Avg. Acc. .61 高于原始 GPT-4o 的 .47,说明过程脚手架在这个任务上可以弥补一部分模型规模差距。(论文报告,§5.2,表 1)

论文摘要称 14B 配置比 GPT-4o “高 22%”,但表 1 的可复算口径是绝对 +.14 points,或以 .47 为分母相对 +29.8%;22% 的分母和计算方式没有交代。最稳妥的写法应直接报告 .61 对 .47,而不是继承宣传百分比。(阅读者分析)

消融。以 GPT-4o-mini + CogWriter 为例,完整方法 Avg. Acc. .55、12,484 words;移除 PlanRevise 后 .50、12,472;移除 PlanAdjust 后 .45、12,341;移除 LengthReview 后 .54、11,549。结果支持三个部件均有作用,尤其局部计划调整,但没有移除整个监控层、没有交互消融,也没有显著性检验,不能据此断言“监控闭环而非规划才是唯一关键”。(论文报告,§5.3,表 2;阅读者分析)

免训练不等于低成本

CogWriter 无需额外训练或强化学习,这一点成立;代价被转移到推理阶段。附录报告它约产生基线 2.8 倍 output tokens 和 10 倍 total tokens,多轮规划、生成与复审显著增加计算和调用开销。(论文报告,附录 A.2)

并行又确实能降低墙钟时间:在只保留 100% completion 输出的 Llama-3.3-70B 测试中,单实例由 585.2s 降到 307.1s,四实例由 327.1s 降到 142.7s,约快一半。这个结果证明的是吞吐优势,不是 token 或金钱成本更低,而且依赖 4×A100 和未充分公开的并发实现。(论文报告,附录 A.2,图 6;阅读者分析)

哪些问题实验没有回答

论文报告的限制。多轮规划、生成和复审需要额外计算资源;所有阶段使用同一个 LLM,没有为规划、写作和审查分别专门化。作者还提醒模型会继承训练数据偏差、生成不准内容,并可能被滥用于欺骗性文本,需要人工监督。(论文报告,§8–9)

只测可检查约束。日记周数、楼层单元、字数和位置约束都容易程序化验证,正好匹配 CogWriter 的监控设计。论文没有人工评估可读性、文学性、全局叙事连贯、重复、人物一致性或事实正确性,也没有给出拼接后的失败案例。因此结果不能直接推广成“长篇故事质量更高”。(阅读者分析)

统计不确定性。表 1、表 2 没有 p 值、置信区间、标准差或跨 run 方差;生成采样、失败重试和缺失输出处理也未报告。数值差异很大时仍有工程意义,但无法判断小差异是否稳定。(阅读者分析)

并行与全局依赖。多个单元如果彼此独立,适合并行;真正的小说章节却共享人物状态、事件因果、语气和伏笔。CogWriter 没有展示一个随写作更新的全局世界状态,也没有全文级最终 revision。这不是论文实证发现,而是其架构尚未覆盖的关键开放问题。(阅读者分析)

原文定位(附录)

读完后的判断

CogWriter 给出的最可靠结论是:对于可以分配到明确单元、又能自动检查的长文本约束,把计划、局部写作和返修外化,确实比要求单次 LLM “自己记住一切”有效。它也说明小模型与强流程的组合可以在结构遵循上超过更大的裸模型。

但当前证据仍是“长表格/规划文档式写作”的成功,而不是开放式长篇叙事的成功。若迁移到小说系统,应保留层次计划和 residual informing,同时补上共享世界状态、跨章依赖、拼接后全文审查与作者审批;评估也必须加入人物一致性、因果连贯、重复、风格和盲法人评。工程上还应同时报告 token、费用和墙钟时间,避免把并行更快误写成总体更便宜。