精读综述 · 9 篇论文 · 认知科学 × 机制可解释性

当一个语言模型
把想法广播给自己

Anthropic 发现大模型内部维持着一小簇可言语化的特权表示(J-space),功能上像认知科学里的"全局工作空间 / 意识访问"——可报告、可调制、可追踪推理。本页把这篇主论文,与围绕它精读的 9 篇意识理论文献放在一起,看它们如何呼应,又如何相互反驳。

阅读论文原文 · transformer-circuits.pub
9
篇深度精读
4+1
意识理论
~6–7%
J-space 方差占比
L38–92
工作空间层区
01 / 锚点 · 主论文

J-space:在 Transformer 里"涌现"的工作空间

主论文用一套统一范式立论——读出内部表示 → 交换/注入向量 → 看行为是否随之改变。核心工具 J-lens(雅可比透镜)用"激活对输出的平均线性因果效应"读出一个中间层激活倾向被说成哪个词。它证明这个只占极小方差的子空间,却主导了报告与推理。

五个工作空间特性

对应认知科学"意识访问"的功能特征 · 悬停查看

关键证据

6–7%
J-space 占激活方差,却决定概念能否被言语报告
88 / 5
交换 J-space 分量成功率 88%,非 J-space 仅 5%
10–25
同时激活的向量数(容量受限)
L38
工作空间特性开始出现的相变层
最有说服力的一击:问"会织网的动物有几条腿",模型中间层浮现从未输出的 spider;把它的 lens 向量换成 ant,答案就从 8 → 6。中间表示确实在被使用,而不只是能被解码。
02 / 精读文库

围绕 J-space 的九篇文献

从意识理论的奠基作、竞争理论,到把工作空间搬进深度学习的工程尝试。点击卡片展开 TL;DR、关键 takeaway 与"与 J-space 的关联"。

03 / 交互 · 理论透镜

换一个理论,J-space 的判词就翻转

"J-space 算不算意识相关"没有统一答案——取决于你戴哪副理论眼镜。选一个理论,看它如何评判主论文的发现,以及它落在 access ↔ phenomenal 光谱的哪一端。

04 / 跨论文综述

一个反复涌现的计算母题

抛开哲学分歧,从神经科学到深度学习,五个系统独立收敛到同一个机制骨架。主论文的贡献是证明它能在单个 LLM 里自发长出来、且可读可改。

全局
工作空间
母题

五个系统——生物的 GNW、工程的 Shared Workspace / Global Latent Workspace、Bengio 的 Consciousness Prior,以及主论文的 J-space——都共享同一骨架:

▸ 容量受限的瓶颈(bottleneck) ▸ 向全网广播(broadcast) ▸ 可被任意下游灵活调用

Goyal 的实验甚至给出倒 U 曲线:slot 数太多反而变差——"限带宽"不是工程妥协,而是有益的归纳偏置。

张力一

涌现 vs 设计

Goyal / VanRullen-Kanai 把工作空间显式设计进网络,回答"加瓶颈是否有用"(有用);主论文声称它在标准训练中自发涌现,回答"网络是否自己造一个"(会)。但涌现版是否具备设计版的全部功能,仍需更强对照。

张力二

报告 ≠ 体验

AST 与 IIT 从两个方向敲警钟:J-space 能读出/改变模型的"自我报告",但报告可能只是一个自我模型(attention schema)的产物,而前馈系统的整合信息 Φ 可能根本为零。主论文只认 access、对 phenomenal 不表态,正是对这条张力的正确回应。

05 / 推荐阅读路径

从地图到主线,再到对照

1
建立地图
Seth & Bayne 2022 — 四大意识理论全景,先看清战场。打开笔记 ↗
2
吃透主线
Dehaene 2011(GNW / ignition / broadcast,主论文类比的源头)。打开笔记 ↗
3
接到 AI
Butlin & Long 2023 → VanRullen & Kanai 2021 → Goyal 2022 → Bengio 2017 → Chalmers 2023。
4
对照视角
Tononi 2004(IIT)与 Webb & Graziano 2015(AST)——它们对 J-space 给出与 GWT 相反的判词。