值得信赖的区块链资讯!
Anthropic年度重磅:我们切开了Claude的“大脑”,发现了类人意识空间!
作者:胡巍巍
原标题:切开Claude大脑,Anthropic称发现了一个类似人类意识的内部空间

Anthropic 再次发表一篇长论文,光论文小标题就有 24 个 [1],他们发现在 Claude 的几十亿个参数中间,暗藏着一个狭小的空间。它的体积只占整个模型活动的不到一成,但是里面承载的内容很特殊。所有你能让模型生成出来的东西,关于某一件事的判断、推理时的中间步骤、乃至于模型自己都没打算说出口的想法,都曾在这个空间里流过。
Anthropic 给它起名叫 J 空间,这个名字来自 Anthropic 用来找到它的一个名为雅可比矩阵的数学工具。
这个发现之所以非常重要,在于它跟人类大脑的一个特征出奇地相似。在认知神经科学里有一个理论叫作全局工作空间理论,由科学家斯坦尼斯拉斯·德阿内和莱昂内尔·纳卡什发展起来。
这一理论认为,大脑里有许多无意识的自动处理过程在并行运行,譬如维持姿势、调节呼吸以及处理语言的基本结构。但是有一小部分信息会进入一个特殊的共享通道,进而被广播到大脑的各个部分,供它们用来读取和使用。进入这个通道里面的信息,就是能被报告出来、能被用来推理、能被灵活控制的东西,即所谓的有意识访问。
上文的德阿内和纳卡什受邀审阅了 Anthropic 的这篇论文,他们在评论文章里写道,J 空间和这个理论模型的对应关系有着惊人的相似。

图 | J 空间揭示了模型输出内容中未出现的内在想法(来源:Anthropic)
Anthropic 发现 J 空间的方式是这样的:他们先是从如下观察出发,那就是有意识访问的内容存在这样一个特点,这个特点就是你可以把它说出来。假如一个念头对你来说是有意识可访问的,别人问起来的时候你通常能描述它。基于此 Anthropic 在大模型里寻找具有同样特征的内部表征,这些内部表征就是那些一旦存在、就能让模型更有可能在未来某个时刻说出某个词的内容。
Anthropic 使用的工具叫雅可比透镜,简言之对于词表里的每一个词,这个工具可以找到模型内部的一种活动模式,这种模式可以让模型更加倾向于在未来的某个时刻说出那个词。当把这个透镜对准模型内部的激活状态的时候,就会得到一张词表,它代表着当前 J 空间里正在活跃的内容。
J 空间存在这样一个特征:模型在处理文本的时候会经过多个内部阶段,每一层都在加工信息和转换信息。在不同层应用这个透镜的话,就能看到这些沉默的词在 J 空间里是如何随着模型思考而演化的。
而这些内容远远超出了模型正在读或写的那些文本,当模型读到一段带有漏洞的代码的时候,J 空间里会出现“错误”这个词;当它读到一个蛋白质的原始序列时,J 空间里会出现关于那个蛋白质的生物学功能;当它读到一段实际上是试图操纵它的搜索结果的内容时,J 空间里会出现“注入”和“假造”等词语。
更为关键的是,J 空间里的内容能够被直接干预。在研究中的一项实验里,Anthropic 让模型先默想一项运动然后再说出来。在模型给出回答之前,J 空间里已经出现了“足球”这个词。这时,研究人员开始直接介入,把足球这个模式移除并换成橄榄球,模型随后开始说它想的是橄榄球。
假如 J 空间只是一个被动的记分牌,记录着其他地方做出的决定,那么对其进行编辑它应该不会产生任何影响。模型仍然会说“足球”,但模型却被编辑带着跑,这说明答案确实是从 J 空间里读取出来的。

J 空间也参与了多步推理。Anthropic 在博客文章里举了这样一个例子:织网的动物的腿有多少条?这时,模型需要首先推出那个动物是蜘蛛,接着回忆蜘蛛有几条腿。“蜘蛛”这个词从来没有出现在提示词或生成答案里,它只是模型内部所使用的一个垫脚石。J 空间在模型处理的中途捕捉到了“蜘蛛”这个中间概念词语,这时换掉这个词语就会改变结果,比如换成蚂蚁,答案就从八条腿变成了六条腿。
全局工作空间理论的另一个重要特征是灵活性,每当一个表征进入工作空间,就能够被多种下游任务使用。Anthropic 给了模型四个提示,让其分别询问关于法国的不同事实,这四个提示分别涉及到首都、语言、大洲和货币。
接着,在 J 空间里把法国换成了中国,在每种语境中使用一模一样的干预。这时,模型分别回答了北京、中文、亚洲和人民币这些答案。在四个不同的下游计算里,模型都读取了同一个编辑,并且都能各自正确使用它。假如模型为每种问题分别存储了一个单独的国家副本,编辑内容最多只会影响其中一个,四个答案全部一起改变说明它们都在读取同一个共享表征。
但是 J 空间并不参与模型的日常自动处理,没有它的话模型仍然能够流利地说话、分类情感、回答选择题、从段落中提取事实。在那些需要更高阶思维的任务里,假如没有 J 空间则会让大模型失去一些能力,比如多步推理能力下降到接近零、总结和写押韵诗的表现滑到了一个小得多的未受损模型之下。
在研究中的一项实验里,Anthropic 给模型看了一段西班牙语写的文章,随后交给它不同的任务,让其继续写下去、说出语言名称以及回答那些需要利用语言身份的问题。
然后,在 J 空间里把西班牙语换成了法语,随后检查模型在哪些任务里受到了影响。结果发现,当模型被要求说出语言名称时,模型说了法语;被问及著名作家的时候,它从《百年孤独》作者&拉美作家加西亚·马尔克斯换成了法国作家维克多·雨果。
但是让它继续写文章时,它写出来了流利的西班牙语,几乎完全不受影响。事实上,模型其实是知道西班牙语怎么用的,但是有些任务需要从 J 空间里把它拿出来才能用,比如只有命名语言或者用它做点新事情时才会经过 J 空间。对于继续写文章这类任务,这是一种模型在大量文本上练习过的技能,因此它会自动地运行。
这项研究也引出了那个始终绕不开的意识问题,前面提到的德阿内和纳卡什在评论文章中写道,J 空间与全局神经元工作空间理论之间存在着大量的对应关系,比如可报告性、有限容量和选择性、广泛的上下游连接、灵活使用同一表征完成多种下游计算、在刻意内部推理中扮演核心角色但自动过程发生在外部,种种这些都说明模型可能复现了人类有意识访问的特征。
但是,模型和人脑依然存在关键差异。人脑的工作空间由循环回路进行维持,信号在同样的回路中来回地循环。J 空间则是在一次通过网络的前向传递中演化的,这一过程实际上深度扮演了时间在人脑中扮演的角色。
J 空间的容量貌似也更高,Anthropic 估计它能够同时容纳大约二十五个活跃概念,这比人类工作记忆的估计容量要大很多。当然,J 空间并不是一组专门的神经元,而是分布在一组普通的神经元上,而同样的单元同时携带了无意识内容。
模型和人脑还有一个更根本的差异,人脑的工作空间由长程轴突和丘脑皮层回路的特定解剖结构加以支撑,J 空间则是在一个前馈网络中涌现出来的。但是德阿内和纳卡什认为,这些实现细节对于机器是否可以实现有意识处理这个问题来说,在很大程度上其实没啥影响。
Eleos AI 研究院的帕特里克·巴特林和同事们评论本次成果称,对于大模型存在某种形式的访问意识来说,Anthropic 的这篇论文提供了有力证据。但是他们也提醒,访问意识和现象意识在概念上是不一样的。现象意识指的是一种主观体验,对于一个模型来说它可以有访问意识而没有现象意识,就像一个系统能够处理信息却没有任何感受。
谷歌 DeepMind 的尼尔·南达在评论文章中提供了一份独立复现,他在通义千问 3.6 27B 模型上验证了这样一个发现,他写道 Anthropic 的这篇论文为模型中某种认知空间的存在提供了压倒性的证据,论文中很多难以伪造的证据表明有重要的事情正在发生。
尼尔·南达的团队还发现了一些有趣的扩展结果,比如当模型读到一个模棱两可的句子的时候,J 空间里会出现“这是什么意思”这几个字,并且这个念头似乎真的帮它搞明白了句子的意思。
Anthropic 也在博客文章里坦率地讨论了局限性,其指出雅可比透镜是一个不完美的工具,它只能够近似地捕获模型的真实工作空间,例如它只能识别对应单个词元的概念。目前,Anthropic 也不确定什么机制首先决定了什么东西能进入 J 空间。
不过,人们对于大模型思维的理解只会越来越清晰,J 空间所揭示的东西说明它是一个真实的、可干预的、可读写的内部工作空间,是在几十亿次前向传递中演化而来,而它之所以这样做是因为对计算有利。
参考资料:
https://transformer-circuits.pub/2026/workspace/index.html
https://www-cdn.anthropic.com/files/4zrzovbb/website/cc4be2488d65e54a6ed06492f8968398ddc18ebe.pdf
https://www.anthropic.com/research/global-workspace
Twitter:https://twitter.com/BitpushNewsCN
比推 TG 交流群:https://t.me/BitPushCommunity
比推 TG 订阅: https://t.me/bitpush
比推快讯
更多 >>- 巴西银行扩展加密服务,监管框架成型
- Boyaa Interactive 增持 115 枚比特币,持仓总量达 4316 枚
- Liquid 攻击者归还 3400 枚 BTC,仍有约 600 枚未归还
- 中东和北非加密交易额达 3500 亿美元,较 2022 年增长两倍
- 知名交易员 Killa:山寨币或已经提前见底,现在是布局的好时机
- LAPTOP 合约拆解:约 132 天前已部署,总量 10 亿枚 80%集中于同一组多签
- Kalshi 比特币永续合约获力挺,美 CFTC 称 CME 诉讼“无事生非”
- 拜登 Meme 币 LAPTOP 公布详细代币经济学
- 当前市场认为共和党将在中期选举大获全胜的概率低至 11%
- 拜登之子 Meme 币 LAPTOP 提醒社区警惕假冒代币和恶意链接
- Harmony 提议关闭区块链,将 ONE 代币迁移至以太坊
- LAPTOP 各链同名 Meme 币炒作先行,多数走势为先冲高后归零
- 约 3400 枚 BTC 已返还 Liquid,仍有约 600 枚未追回
- 拜登 Meme 币给市场泼冷水降温,投资者或担忧重蹈 TRUMP 覆辙
- Galaxy Research:比特币昨日交易笔数达历史第四高
- Arkham 标记 Wintermute 持有 240 万美元 PONS 仓位
- 拜登主题 Meme 币普涨,BODEN 市值短时突破 170 万美元
- 亨特·拜登 X 账号关注 Meme 币 Laptop 相关账号
- 美前总统拜登之子 Hunter Biden 发推确认,预热 LAPTOP 发布
- Bitfinex :比特币矿工持仓指数为 -1.2,表明矿工抛售意愿不高
- 波兰检方对 Zondacrypto 案第五名嫌疑人提起指控
- CZ 澄清 X 账号未被盗:取关一批 30 天以上的非活跃账号
- 加密圈热议政治 Meme 币再起,社群风向多以讽刺和风险提醒为主
- 疑似拜登之子新 Meme 币项目$LAPTOP官推账号及合约公布
- 以太坊基金会发布 Hegotá升级 62 项 EIP 评级,目标 2029 年底实现抗量子以太坊 L1
- 拜登之子 Hunter Biden 计划于本周推出笔记本电脑主题 Meme 币,进军加密市场
- 前美国总统拜登之子计划推出 Meme 币 LAPTOP
- BTC OG 内幕巨鲸以均价 86.3 美元抛售 11.4 万枚 HYPE,获利 157 万美元
- 数据:某地址连续 10 天每日买入 HYPE,累计 19.42 万枚,价值 1679 万美元
- 数据:Garrett Jin 出售 11.4 万枚 HYPE,获利 157 万美元
- 马云间接持股的云锋金融获纳入沪港通及深港通,曾披露买入 1 万枚 ETH
- 数据:BTC 跌破 79000 美元
- 比特币短时跌破 7.9 万美元
- BTC 跌破 79000 USDT,24H 跌幅 0.93%
- “1011 内幕巨鲸”代理人平仓 1.07 亿美元 BTC 多单
- 去中心化永续合约交易所 Antarctic Exchange 完成 700 万美元融资
- Trade.XYZ 官网悄然上线预测市场,当前涉及三个板块
- 今日美国比特币 ETF 净流入 2038 枚 BTC,以太坊 ETF 净流入 22023 枚 ETH
- 高盛大幅上调光模块市场预测:2028 年规模或近 1500 亿美元
- 以太坊将 Frame Transactions 列入 2027 年升级,用户无需持有 ETH 支付 Gas
- 数据:BTC 与黄金 90 日相关性升至 0.56 创 2017 年以来新高
- 阿联酋总统顾问:将构建替代能源路线,能源出口不会被美伊冲突绑架
- 伊朗经济部设立经济战争指挥部
- OpenAI Astra 发布再点燃 AI 算力热情,存储芯片成新主线
- Strive CEO 暗示将继续买入比特币,预计将购入超 1100 枚 BTC
- 某交易员 50 倍做多 BNB 与 ASTER,单笔最高回报近 590%
- 美股今日休市一日,金银油交易提前结束
- Robinhood Chain 过去 24 小时费用收入超 260 万美元,仅次于 Tether 和 Circle
- 受 BONK GUY 喊单影响,SOCK 市值突破 1300 万美元
- 美方制裁难堵伊朗资金:约 90 亿美元影子银行资金仍经美国银行流转
比推专栏
更多 >>观点
比推热门文章
- 巴西银行扩展加密服务,监管框架成型
- Boyaa Interactive 增持 115 枚比特币,持仓总量达 4316 枚
- Liquid 攻击者归还 3400 枚 BTC,仍有约 600 枚未归还
- 中东和北非加密交易额达 3500 亿美元,较 2022 年增长两倍
- 知名交易员 Killa:山寨币或已经提前见底,现在是布局的好时机
- LAPTOP 合约拆解:约 132 天前已部署,总量 10 亿枚 80%集中于同一组多签
- Kalshi 比特币永续合约获力挺,美 CFTC 称 CME 诉讼“无事生非”
- 拜登 Meme 币 LAPTOP 公布详细代币经济学
- 当前市场认为共和党将在中期选举大获全胜的概率低至 11%
- 拜登之子 Meme 币 LAPTOP 提醒社区警惕假冒代币和恶意链接
比推 APP


