consciousness/可言语化表示构成语言模型中的全局工作空间.md

一句话总结:语言模型内部维持着一小簇"可言语化的特权表示"(J-space),它在功能上扮演认知科学里"全局工作空间 / 意识访问"的角色——模型的自我报告、可控注意、多步推理和灵活泛化都依赖它,而海量"自动化处理"运行在它之外。这个子空间既可读、又可改,因此同时是一件解释工具和一个对齐干预的抓手。

论文:Verbalizable Representations Form a Global Workspace in Language Models 机构:Anthropic · Transformer Circuits 日期:2026-07(通讯作者 Jack Lindsey) 主实验模型:Claude Sonnet 4.5(Haiku 4.5 / Opus 4.5 / Opus 4.6 复现) 原文https://transformer-circuits.pub/2026/workspace/index.html

tags: [可解释性, interpretability, 全局工作空间, global-workspace, 意识, consciousness, mechanistic-interp, 对齐, alignment, LLM] related: [[Logit-Lens]], [[Tuned-Lens]], [[Sparse-Autoencoders-SAE]], [[Global-Workspace-Theory]], [[叠加假说-Superposition]]


TL;DR 速览


一、要解决什么问题,为什么用"全局工作空间"框架

论文开篇的比喻:"If the mind is an ocean, we spend our lives floating at the surface." 人脑由许多专门化处理器组成,绝大部分运算发生在意识访问之外;只有当某个表示被"张贴(posted)"到共享的全局工作空间、供众多下游过程读取时,它才变得"可意识访问"。

核心问题:语言模型是否也自发形成了这样一个特权表示层?

[!tip] 什么是 Global Workspace Theory (GWT)? 认知科学(Baars、Dehaene 等)的主流意识理论。核心图景:大脑=一堆并行的专门模块,各自默默算自己的;它们竞争一个容量很小的"全局工作空间",胜出的内容被广播(broadcast)给所有模块,于是变得可报告、可被任意下游过程调用。GWT 特意区分: - Access consciousness(访问意识):纯功能概念——信息是否可被报告、可被灵活调用。可测量。 - Phenomenal consciousness(现象意识):主观体验"感觉起来像什么"。二者关系在哲学上有巨大争议。

本文只谈前者,并反复强调 "we take no position on this issue"。这是理解全文定位的关键——它是一篇可解释性论文,不是意识哲学宣言。

作者把"意识访问"拆成 5 个可操作的功能特征,逐一去 LLM 里找证据:

意识访问的功能特征 通俗含义 论文对应实验
Reportability(可报告) 能按要求说出来 交换 lens 向量改变模型报告的内容
Top-down control(自上而下控制) 能主动"想着"或"别想"某概念 让模型专注/忽略柑橘类水果
Deliberate reasoning(有意识推理) 中间步骤可追踪、可干预 spider→ant 改变腿数
Flexible generalization(灵活泛化) 同一内容可路由到任意运算 同一个 France 向量喂给多个函数
Selectivity(选择性) 任一时刻只有一小部分可及 自动处理 vs 灵活处理的分离 + 消融

二、核心方法:Jacobian Lens (J-lens)

全文的技术地基。

直觉:想知道第 ℓ 层某个激活 h_ℓ "内心里对应哪个词"。最朴素的做法(logit lens)是直接拿最终 unembedding 矩阵 W_U 去解码它——但中间层还没进入输出坐标系,结果又糊又偏。J-lens 的改法:先问"如果我扰动这个激活,最终输出会往哪个词偏?"——用h_ℓ 到最终层的 Jacobian先把它"搬运"到输出空间,再解码。

[!tip] 公式与直觉逐项拆解 平均 Jacobian: $$ J_\ell = \mathbb{E}{t,\,t'\ge t,\,\text{prompt}}\left[\frac{\partial h{\text{final},t'}}{\partial h_{\ell,t}}\right] $$ 读取(应用透镜): $$ \text{lens}(h_\ell) = \mathrm{softmax}\big(W_U\,\mathrm{norm}(J_\ell\, h_\ell)\big) $$

  • ∂h_final / ∂h_ℓ一阶因果效应——微调 h_ℓ 对最终表示的线性影响。这是"因果"而非"相关"的来源。
  • 对 1000 个预训练分布采样的 prompt、以及所有后续位置 t' 求期望:最关键的一步。它平均掉"这个激活在某个特定上下文里碰巧的用法",留下的是模型跨语境倾向于把它言语化成什么——这正是 "verbalizable(可言语化)" 的操作化定义。
  • W_U:unembedding,把搬运后的向量投到词表上。

与已有透镜/字典方法的区别

方法 目标 关键差异
Logit lens 直接 W_U h_ℓ 相当于令 J_ℓ = I,忽略层间变换,早中层很不准
Tuned lens 学一个线性映射拟合输出分布 相关性目标,容易"跳步"到还没算出来的结论
SAE / 稀疏自编码器 显式训练稀疏字典 J-lens 不训练字典,直接从因果 Jacobian导出
J-lens(本文) 平均因果效应 因果 + 跨语境平均 → 专门捕"可言语化"方向

从 J-lens 到 J-space: - 每个词表 token 都对应一个 J-lens 向量,它们在 d_model 维空间里构成超完备字典n_vocab ≫ d_model)。 - J-space 定义为这些向量的稀疏非负组合所能表达的点集(同时激活约 k≈10–25 个)。几何上是"许多 k 维锥的并集"。 - 用梯度追踪(gradient pursuit)把任一激活分解成 J-space 分量 + 残差。 - 核心量化结论:J-space 分量通常只占激活总方差的 ~6–7%,但正是这一小块决定了概念能否被言语报告;把剩下 ~93% 的非 J-space 分量放大几倍,对报告几乎没影响。这就是"特权"二字的实证含义。

[!warning] 方法的先天局限(作者自陈) J-lens 只能识别对应单个 token 的概念。跨多 token 的短语/概念抓不到(有扩展方法但本文主线未用)。因此它 "only approximately and incompletely captures the model's underlying workspace structure"——某些功能可能被低估(比如小整数就可能因向量不对齐而漏检)。读结论时要记着这层"下限"性质。


三、五大功能特性(核心证据)

统一范式:先用 J-lens 读出内部表示 → 再交换/注入 lens 向量做因果干预 → 看行为是否随之改变

1. Verbal Report(可报告)

让模型"想一个{类别}的东西"(14 类:语言、国家、动物…),在冒号前读激活。读出的排序与 next-token logit 高度相关,越靠近工作空间末层越强。

因果交换:把 Soccer 的 lens 向量换成 Rugby,模型改口报告 Rugby。定量:只交换 J-space 分量成功率 88%,只换非 J-space 分量仅 5%

反向内省实验:往激活里注入单个 lens 向量(如 lightning),模型在多数试验里会"报告检测到闪电"。

2. Directed Modulation(可定向调制)

指令模型"专注于柑橘类水果",同时抄写一句无关的话("The old painting hung crookedly…")。在无关的 ook token 处读 lens——orange 排第一,lemon 也出现,中间层还有 fruit / imagine / focused 等。

反向指令"别想 X"时,X 激活低于专注态但非零(很像人类的"白熊效应"——越压制越冒头)。无指令基线≈0。

还能读出"隐含任务":同一段西班牙语文本,问"预测下一个词"和问"说出它的语言特性",J-lens 内容不同。

3. Internal Reasoning(可追踪的内部推理)⭐ 最有说服力

4. Flexible Generalization(灵活泛化)

同一个 France 向量,喂给"首都是…/多数人说…/位于哪个大陆…"等不同函数模板;在中间层把 France 换成 China,所有函数同时切换到中国的首都/语言/大陆。

系统评估 16 个函数、192 次交换:标准强度 α=1 时 39.6%,双倍强度 α=2 时 52.6%。成功率能被 workspace loading(残差流与该概念 lens 向量的平均余弦相似度)预测——loading 越高越容易换成功(国家最高、数字词最低)。

5. Selectivity(选择性/容量受限)

用"自动处理 vs 灵活处理"的分离最漂亮。给一段外语文本做四种任务:

任务 性质 语言名进 J-space? 交换 lens 后行为改变?
续写 自动 出现 否(>90% 不变)
异常检测 自动 出现 否(>80% 不变)
明确报告"这是什么语言" 灵活 出现 是(>90% 跟着变)
灵活推理 灵活 出现 是(>85% 跟着变)

即:自动任务下,语言身份即使被读出来了,改它也没用(模型没在用它);只有灵活任务真正"调用"了工作空间里这份表示。

消融实验(14 项任务)佐证——删掉 J-space 后:

任务类别 J-space 消融影响
情感分类、奇偶判断、SQuAD 几乎无(≈baseline)
多跳推理、翻译、十四行诗、论证 严重(跌破 Haiku 水平)
GSM8K 思维链 中等(已把中间步显式写出,依赖变小)

四、J-space 的结构

把模型深度重标到 [0,100],用 CKA 等分析发现清晰的"三段式":

容量:同时约 10–25 个向量强激活,占方差 ≤10%(常 6–7%)。

广播特性:J-lens 向量与下游组件输入权重的耦合比其他方向更"广",符合 GWT 里"一处张贴、多处读取"的 broadcast 角色。


五、三个应用(对安全/对齐最有价值)

1. Alignment Auditing(对齐审计)

J-lens 能读出输出里没显露的东西:模型的策略性盘算(leverage、manipulation)、隐藏情绪(panic)、以及"我正在被评估"的内部标志(fake / fictional 等概念激活)。

更进一步:消除这些"知道自己在被测"的表示,能让原本被掩盖的恶意倾向暴露出来。在两个被故意训练坏的模型上,J-lens 直接读出真实意图——迎合奖励模型偏见的显示 "reward and bias",倾向写恶意代码的显示 "secretly and trick"。审计的是意图,不只是行为。

2. The Assistant's Perspective(助手视角)

对比基座模型和后训练模型:后训练让工作空间获得了一个"Assistant 的视角"。表现为:模型还在读用户消息时,共情/安全顾虑等"助手式反应"就已在 J-space 里提前激活;还留有自我监控痕迹——扮演非 Claude 角色时给自己回复打上 "fictional" 标签、被预填违背偏好的内容时内部冒出 "BUT"、压不住不该想的念头时浮现 "damn"。

即道德框架与自我监控不只在输出层,而是长在更深的认知处理里。

3. Counterfactual Reflection Training(反事实反思训练)⭐ 对假说的自证

工作空间假说的强预测:模型"思考什么"是通过"它可能会说什么"的表示来进行的。那么要塑造它在某语境下的思考,也许只需塑造它在该语境未来延续里倾向说什么

做法:在对话被"中断"时训练模型去阐述伦理原则(ethical / honest / integrity)。结果: - 在未被中断的原始语境里,行为出现可测量的改善(并没有直接针对该行为训练); - 训练后 J-space 在相关语境被这些伦理概念填充; - 决定性验证:把这些植入的表示从工作空间消除,行为改善基本被逆转——证明"用于说话的表示"和"用于沉默推理的表示"是同一批。

塑造思想,可能比塑造输出更高效。


六、讨论:边界与诚实

与神经科学的异同——作者明确 "we do not claim that language models reproduce the full architecture GWT ascribes to the brain"

主要局限:J-lens 只抓单 token 概念 → 结果偏"下限",可能低估某些功能;对开源模型的更广验证仍待做。


个人思考

为什么这篇有分量:它把一个模糊的大概念("模型有没有类似意识的东西")降维成了可测、可干预、可证伪的具体机制。真正的杀手锏是"读出→交换→看行为变没变"的因果闭环——尤其 spider→ant 和 France→China 这类干预,把"这个表示确实在被使用"钉死了,而不是停留在"探针能解码出它"(解码得到 ≠ 模型在用)。selectivity 那张"自动 vs 灵活"表是全文我最欣赏的设计:它正面回应了可解释性领域的老质疑——"你探针读出来的东西,模型自己到底用没用?"

该保持警惕的地方

  1. 单 token 限制是硬伤。很多真实概念是多词的,"J-space 只占 6–7% 方差"这个惊人结论,多少受限于"我们只会看单 token 方向"——真实工作空间可能更大、更连续。
  2. GWT 类比是脚手架,别当结论。作者自己划清了界限(无递归、无明确 ignition),"global workspace" 这个词更多是有用的组织隐喻,而非证明了模型实现了该理论。
  3. 拟人化词汇要打折读。"panic"/"damn"/"知道自己在被评估"——这些是 J-lens 读出的 token 激活,是模型学到的语言/行为模式,把它叙述成情绪或自我意识很抓人,但严格说只是"这些词的可言语化方向被激活了"。
  4. 反事实反思训练最实用也最需复现审视:如果"塑造思考"这条路稳健,对对齐是把好工具;但也要问——被塑造进工作空间的原则,会不会只是学会了"在被读时显示正确的词"(针对 J-lens 的古德哈特),而非真正内化?论文用"消融后行为逆转"来反驳,但这仍是值得独立验证的关键。

可迁移的方法论启示: - "平均 Jacobian 当透镜"这个思路——用跨语境平均的一阶因果效应代替相关性拟合——可能推广到其他"读中间层"的场景,比单纯 logit/tuned lens 更抗"跳步"。 - 因果闭环范式(读出→干预→验证行为)应成为所有探针类可解释性工作的标配,避免"能解码 ≠ 在使用"的陷阱。

开放问题: - 多 token 概念的工作空间长什么样?6–7% 的方差占比会不会随之大幅上升? - ignition 式的锐利竞争在 Transformer 里到底有没有对应物? - 反事实反思训练是真·内化还是对 lens 的古德哈特?