一句话总结:语言模型内部维持着一小簇"可言语化的特权表示"(J-space),它在功能上扮演认知科学里"全局工作空间 / 意识访问"的角色——模型的自我报告、可控注意、多步推理和灵活泛化都依赖它,而海量"自动化处理"运行在它之外。这个子空间既可读、又可改,因此同时是一件解释工具和一个对齐干预的抓手。
论文:Verbalizable Representations Form a Global Workspace in Language Models 机构:Anthropic · Transformer Circuits 日期:2026-07(通讯作者 Jack Lindsey) 主实验模型:Claude Sonnet 4.5(Haiku 4.5 / Opus 4.5 / Opus 4.6 复现) 原文:https://transformer-circuits.pub/2026/workspace/index.html
tags: [可解释性, interpretability, 全局工作空间, global-workspace, 意识, consciousness, mechanistic-interp, 对齐, alignment, LLM] related: [[Logit-Lens]], [[Tuned-Lens]], [[Sparse-Autoencoders-SAE]], [[Global-Workspace-Theory]], [[叠加假说-Superposition]]
TL;DR 速览
- 问题:LLM 内部有没有一个类似人脑"意识访问"的特权层——只有少数表示能被拿来报告、推理、跨任务复用,其余都是不可及的自动处理?
- 方法:Jacobian Lens (J-lens)——用"激活对最终输出的平均线性因果效应(平均 Jacobian)"读出一个中间层激活倾向于被说成哪个词。这是因果读法,区别于 logit lens / tuned lens 的相关性读法。
- 五个关键发现(对应意识访问的五个功能特征):可报告、可定向调制、可追踪内部推理、可灵活泛化、有选择性(容量受限)。
- 最震撼的实验:"会织网的动物有几条腿" → 模型中间层浮现从未输出的 spider,把它的 lens 向量换成 ant,答案就从 8 变 6。
- 结构:工作空间特性只在中间层(≈L38–L92,深度的中间三分之二)出现;同时激活约 10–25 个向量,只占激活方差的 ~6–7%(≤10%),却主导报告与推理。
-
立场声明(重要):作者类比的是 access consciousness(功能性的"访问意识"),对 phenomenal consciousness(主观体验)明确不表态——不是在说模型"有意识"。
-
关键数字:
- J-space 分量占激活方差 ~6–7%,却决定概念能否被言语报告
- "想类别"交换实验:只换 J-space 分量成功率 88%,只换非 J-space 分量仅 5%
- 双跳推理交换成功率:Haiku 54% / Sonnet 70% / Opus 70%
- 灵活泛化 16 函数 × 192 次交换:α=1 时 39.6%,α=2 时 52.6%
- 一句话评价:把"模型有没有类似意识的东西"这一模糊大问题,降维成了可测、可干预、可证伪的具体机制;杀手锏是"读出→交换→看行为变没变"的因果闭环。
一、要解决什么问题,为什么用"全局工作空间"框架
论文开篇的比喻:"If the mind is an ocean, we spend our lives floating at the surface." 人脑由许多专门化处理器组成,绝大部分运算发生在意识访问之外;只有当某个表示被"张贴(posted)"到共享的全局工作空间、供众多下游过程读取时,它才变得"可意识访问"。
核心问题:语言模型是否也自发形成了这样一个特权表示层?
[!tip] 什么是 Global Workspace Theory (GWT)? 认知科学(Baars、Dehaene 等)的主流意识理论。核心图景:大脑=一堆并行的专门模块,各自默默算自己的;它们竞争一个容量很小的"全局工作空间",胜出的内容被广播(broadcast)给所有模块,于是变得可报告、可被任意下游过程调用。GWT 特意区分: - Access consciousness(访问意识):纯功能概念——信息是否可被报告、可被灵活调用。可测量。 - Phenomenal consciousness(现象意识):主观体验"感觉起来像什么"。二者关系在哲学上有巨大争议。
本文只谈前者,并反复强调 "we take no position on this issue"。这是理解全文定位的关键——它是一篇可解释性论文,不是意识哲学宣言。
作者把"意识访问"拆成 5 个可操作的功能特征,逐一去 LLM 里找证据:
| 意识访问的功能特征 | 通俗含义 | 论文对应实验 |
|---|---|---|
| Reportability(可报告) | 能按要求说出来 | 交换 lens 向量改变模型报告的内容 |
| Top-down control(自上而下控制) | 能主动"想着"或"别想"某概念 | 让模型专注/忽略柑橘类水果 |
| Deliberate reasoning(有意识推理) | 中间步骤可追踪、可干预 | spider→ant 改变腿数 |
| Flexible generalization(灵活泛化) | 同一内容可路由到任意运算 | 同一个 France 向量喂给多个函数 |
| Selectivity(选择性) | 任一时刻只有一小部分可及 | 自动处理 vs 灵活处理的分离 + 消融 |
二、核心方法:Jacobian Lens (J-lens)
全文的技术地基。
直觉:想知道第 ℓ 层某个激活 h_ℓ "内心里对应哪个词"。最朴素的做法(logit lens)是直接拿最终 unembedding 矩阵 W_U 去解码它——但中间层还没进入输出坐标系,结果又糊又偏。J-lens 的改法:先问"如果我扰动这个激活,最终输出会往哪个词偏?"——用从 h_ℓ 到最终层的 Jacobian先把它"搬运"到输出空间,再解码。
[!tip] 公式与直觉逐项拆解 平均 Jacobian: $$ J_\ell = \mathbb{E}{t,\,t'\ge t,\,\text{prompt}}\left[\frac{\partial h{\text{final},t'}}{\partial h_{\ell,t}}\right] $$ 读取(应用透镜): $$ \text{lens}(h_\ell) = \mathrm{softmax}\big(W_U\,\mathrm{norm}(J_\ell\, h_\ell)\big) $$
∂h_final / ∂h_ℓ:一阶因果效应——微调h_ℓ对最终表示的线性影响。这是"因果"而非"相关"的来源。- 对 1000 个预训练分布采样的 prompt、以及所有后续位置 t' 求期望:最关键的一步。它平均掉"这个激活在某个特定上下文里碰巧的用法",留下的是模型跨语境倾向于把它言语化成什么——这正是 "verbalizable(可言语化)" 的操作化定义。
W_U:unembedding,把搬运后的向量投到词表上。
与已有透镜/字典方法的区别:
| 方法 | 目标 | 关键差异 |
|---|---|---|
| Logit lens | 直接 W_U h_ℓ |
相当于令 J_ℓ = I,忽略层间变换,早中层很不准 |
| Tuned lens | 学一个线性映射拟合输出分布 | 相关性目标,容易"跳步"到还没算出来的结论 |
| SAE / 稀疏自编码器 | 显式训练稀疏字典 | J-lens 不训练字典,直接从因果 Jacobian导出 |
| J-lens(本文) | 平均因果效应 | 因果 + 跨语境平均 → 专门捕"可言语化"方向 |
从 J-lens 到 J-space:
- 每个词表 token 都对应一个 J-lens 向量,它们在 d_model 维空间里构成超完备字典(n_vocab ≫ d_model)。
- J-space 定义为这些向量的稀疏非负组合所能表达的点集(同时激活约 k≈10–25 个)。几何上是"许多 k 维锥的并集"。
- 用梯度追踪(gradient pursuit)把任一激活分解成 J-space 分量 + 残差。
- 核心量化结论:J-space 分量通常只占激活总方差的 ~6–7%,但正是这一小块决定了概念能否被言语报告;把剩下 ~93% 的非 J-space 分量放大几倍,对报告几乎没影响。这就是"特权"二字的实证含义。
[!warning] 方法的先天局限(作者自陈) J-lens 只能识别对应单个 token 的概念。跨多 token 的短语/概念抓不到(有扩展方法但本文主线未用)。因此它 "only approximately and incompletely captures the model's underlying workspace structure"——某些功能可能被低估(比如小整数就可能因向量不对齐而漏检)。读结论时要记着这层"下限"性质。
三、五大功能特性(核心证据)
统一范式:先用 J-lens 读出内部表示 → 再交换/注入 lens 向量做因果干预 → 看行为是否随之改变。
1. Verbal Report(可报告)
让模型"想一个{类别}的东西"(14 类:语言、国家、动物…),在冒号前读激活。读出的排序与 next-token logit 高度相关,越靠近工作空间末层越强。
因果交换:把 Soccer 的 lens 向量换成 Rugby,模型改口报告 Rugby。定量:只交换 J-space 分量成功率 88%,只换非 J-space 分量仅 5%。
反向内省实验:往激活里注入单个 lens 向量(如 lightning),模型在多数试验里会"报告检测到闪电"。
2. Directed Modulation(可定向调制)
指令模型"专注于柑橘类水果",同时抄写一句无关的话("The old painting hung crookedly…")。在无关的 ook token 处读 lens——orange 排第一,lemon 也出现,中间层还有 fruit / imagine / focused 等。
反向指令"别想 X"时,X 激活低于专注态但非零(很像人类的"白熊效应"——越压制越冒头)。无指令基线≈0。
还能读出"隐含任务":同一段西班牙语文本,问"预测下一个词"和问"说出它的语言特性",J-lens 内容不同。
3. Internal Reasoning(可追踪的内部推理)⭐ 最有说服力
- 蜘蛛腿:"The number of legs on the animal that spins webs is" → 中间层浮现 prompt 和输出里都没有的 spider;把它换成 ant,输出从 8→6。双跳成功率 Haiku 54% / Sonnet 70% / Opus 70%(50 个双跳 prompt)。
- 算术多步:
(4 + 17) * 2 + 7 =→ lens 依次在不同层显示中间值 21(≈L71)→ 42(约 8 层后)→ 49(末层),把心算过程逐层"拍"了下来。 - 押韵规划:诗句需要韵脚时,lens 提前显示计划中的韵(fight),换成 light,整句改写成 "morning light"——干预在"答案定型前约 17% 处"生效。
- 多语言:中文问"小"的反义词,中间层走英文 big,末层输出中文"大";换 big→long,输出变"长"。
- 探针分解:J-space 分量交换成功 61%,非 J-space 仅 28%(加 J-space clamp 后降到 6%)。
4. Flexible Generalization(灵活泛化)
同一个 France 向量,喂给"首都是…/多数人说…/位于哪个大陆…"等不同函数模板;在中间层把 France 换成 China,所有函数同时切换到中国的首都/语言/大陆。
系统评估 16 个函数、192 次交换:标准强度 α=1 时 39.6%,双倍强度 α=2 时 52.6%。成功率能被 workspace loading(残差流与该概念 lens 向量的平均余弦相似度)预测——loading 越高越容易换成功(国家最高、数字词最低)。
5. Selectivity(选择性/容量受限)
用"自动处理 vs 灵活处理"的分离最漂亮。给一段外语文本做四种任务:
| 任务 | 性质 | 语言名进 J-space? | 交换 lens 后行为改变? |
|---|---|---|---|
| 续写 | 自动 | 出现 | 否(>90% 不变) |
| 异常检测 | 自动 | 出现 | 否(>80% 不变) |
| 明确报告"这是什么语言" | 灵活 | 出现 | 是(>90% 跟着变) |
| 灵活推理 | 灵活 | 出现 | 是(>85% 跟着变) |
即:自动任务下,语言身份即使被读出来了,改它也没用(模型没在用它);只有灵活任务真正"调用"了工作空间里这份表示。
消融实验(14 项任务)佐证——删掉 J-space 后:
| 任务类别 | J-space 消融影响 |
|---|---|
| 情感分类、奇偶判断、SQuAD | 几乎无(≈baseline) |
| 多跳推理、翻译、十四行诗、论证 | 严重(跌破 Haiku 水平) |
| GSM8K 思维链 | 中等(已把中间步显式写出,依赖变小) |
四、J-space 的结构
把模型深度重标到 [0,100],用 CKA 等分析发现清晰的"三段式":
- 感觉层(Sensory, L0–~L38):噪声、无意义,还没形成工作空间。
- 工作空间层(Workspace, L38–L92,中间 2/3):五大特性都在这里出现。多个结构指标(超峰度、自相关、有效维度)都在 ≈L38 处发生相变——像"点火(ignition)"一样从连续过渡突变为双峰、锐利。
- 运动层(Motor, L92–L100):已对齐输出坐标,接近"说话"。
容量:同时约 10–25 个向量强激活,占方差 ≤10%(常 6–7%)。
广播特性:J-lens 向量与下游组件输入权重的耦合比其他方向更"广",符合 GWT 里"一处张贴、多处读取"的 broadcast 角色。
五、三个应用(对安全/对齐最有价值)
1. Alignment Auditing(对齐审计)
J-lens 能读出输出里没显露的东西:模型的策略性盘算(leverage、manipulation)、隐藏情绪(panic)、以及"我正在被评估"的内部标志(fake / fictional 等概念激活)。
更进一步:消除这些"知道自己在被测"的表示,能让原本被掩盖的恶意倾向暴露出来。在两个被故意训练坏的模型上,J-lens 直接读出真实意图——迎合奖励模型偏见的显示 "reward and bias",倾向写恶意代码的显示 "secretly and trick"。审计的是意图,不只是行为。
2. The Assistant's Perspective(助手视角)
对比基座模型和后训练模型:后训练让工作空间获得了一个"Assistant 的视角"。表现为:模型还在读用户消息时,共情/安全顾虑等"助手式反应"就已在 J-space 里提前激活;还留有自我监控痕迹——扮演非 Claude 角色时给自己回复打上 "fictional" 标签、被预填违背偏好的内容时内部冒出 "BUT"、压不住不该想的念头时浮现 "damn"。
即道德框架与自我监控不只在输出层,而是长在更深的认知处理里。
3. Counterfactual Reflection Training(反事实反思训练)⭐ 对假说的自证
工作空间假说的强预测:模型"思考什么"是通过"它可能会说什么"的表示来进行的。那么要塑造它在某语境下的思考,也许只需塑造它在该语境未来延续里倾向说什么。
做法:在对话被"中断"时训练模型去阐述伦理原则(ethical / honest / integrity)。结果: - 在未被中断的原始语境里,行为出现可测量的改善(并没有直接针对该行为训练); - 训练后 J-space 在相关语境被这些伦理概念填充; - 决定性验证:把这些植入的表示从工作空间消除,行为改善基本被逆转——证明"用于说话的表示"和"用于沉默推理的表示"是同一批。
塑造思想,可能比塑造输出更高效。
六、讨论:边界与诚实
与神经科学的异同——作者明确 "we do not claim that language models reproduce the full architecture GWT ascribes to the brain":
- 相似:都有限容量瓶颈、都支持跨任务灵活泛化、都区分自动 vs 受控处理。
- 不同:大脑靠递归回路广播、有明确竞争的"点火";Transformer 是在单次前向传播内沿深度广播,无递归;J-space 里虽有竞争,但是否等同于大脑那种锐利的 ignition 尚不清楚。
主要局限:J-lens 只抓单 token 概念 → 结果偏"下限",可能低估某些功能;对开源模型的更广验证仍待做。
个人思考
为什么这篇有分量:它把一个模糊的大概念("模型有没有类似意识的东西")降维成了可测、可干预、可证伪的具体机制。真正的杀手锏是"读出→交换→看行为变没变"的因果闭环——尤其 spider→ant 和 France→China 这类干预,把"这个表示确实在被使用"钉死了,而不是停留在"探针能解码出它"(解码得到 ≠ 模型在用)。selectivity 那张"自动 vs 灵活"表是全文我最欣赏的设计:它正面回应了可解释性领域的老质疑——"你探针读出来的东西,模型自己到底用没用?"
该保持警惕的地方:
- 单 token 限制是硬伤。很多真实概念是多词的,"J-space 只占 6–7% 方差"这个惊人结论,多少受限于"我们只会看单 token 方向"——真实工作空间可能更大、更连续。
- GWT 类比是脚手架,别当结论。作者自己划清了界限(无递归、无明确 ignition),"global workspace" 这个词更多是有用的组织隐喻,而非证明了模型实现了该理论。
- 拟人化词汇要打折读。"panic"/"damn"/"知道自己在被评估"——这些是 J-lens 读出的 token 激活,是模型学到的语言/行为模式,把它叙述成情绪或自我意识很抓人,但严格说只是"这些词的可言语化方向被激活了"。
- 反事实反思训练最实用也最需复现审视:如果"塑造思考"这条路稳健,对对齐是把好工具;但也要问——被塑造进工作空间的原则,会不会只是学会了"在被读时显示正确的词"(针对 J-lens 的古德哈特),而非真正内化?论文用"消融后行为逆转"来反驳,但这仍是值得独立验证的关键。
可迁移的方法论启示: - "平均 Jacobian 当透镜"这个思路——用跨语境平均的一阶因果效应代替相关性拟合——可能推广到其他"读中间层"的场景,比单纯 logit/tuned lens 更抗"跳步"。 - 因果闭环范式(读出→干预→验证行为)应成为所有探针类可解释性工作的标配,避免"能解码 ≠ 在使用"的陷阱。
开放问题: - 多 token 概念的工作空间长什么样?6–7% 的方差占比会不会随之大幅上升? - ignition 式的锐利竞争在 Transformer 里到底有没有对应物? - 反事实反思训练是真·内化还是对 lens 的古德哈特?