Anthropic才发布了一项新的研究, 其标题颇具玄学意味, 是《语言模型中的全局工作空间》, 英文标题是(A global workspace in language models)。

研究封面
它们于Claude的神经网络之中, 寻觅到了一块小小的特别区域, 这片区域Claude能够汇报它, 能够操控它, 并且还凭借它展开多步推理, 然而网络里其余的绝大多数的活动情况, Claude自身都“意识”不到。

倘若是你针对神经科学存有一定程度的知晓, 大概将会即刻联想到一个词汇: 意识可及(conscious access)。
没错,A 社这次就是冲着这个去的。
官方视频的开头打了个比方:把心智想象成一片海洋。
海面之上所漂浮着的, 乃是我们的那些念头, 诸如晚饭究竟吃些什么、内心的独自表述、脑海里忽然间蹦出来的画面。然而大脑绝大多数的各类活动, 皆是在海面之下的无意识深深之处发生的, 像是过滤背景之中的噪音、控制呼吸的节奏、认出眼前出现的人和物。
这些你全程无感,但它们一直在跑。
于是乎, 问题应运而生: 于AI模型的“脑子”范围之中那, 可会存在如此这般的一条海面分界线呀!
Anthropic 的答案是:有,而且他们把它找出来了。
01
J-space
这块区域有着一个被称作J-space的命名, 将J取出来看, 它源自用于寻找这块区域时所运用的数学工具, 也就是Jacobian, 即雅可比矩阵。
它是一小撮特别的内部神经激活形式 , 每一种形式对应着一个具体字词 , 然而某个形式显现出来 , 并不意味着模型正道出该词 , 仅仅表明此词为它所想。

J-space 示意
提醒一下, 这和你所熟知的思维链, 也就是 chain of thought, 绝对是截然不同的两回事。思维链是模型为给自己看而写的草稿, 属于显眼的文字表现;然而 J - space 隐匿于内部神经激活之中, 全然没有声响, 模型能够在不写下任何事物的情况下, “思考”一个概念。
并且, J-space 不存在有人进行设计情况, 不存在有人开展编程情形, 是于训练的进程当中自行涌现出来的。
将Claude的其他内部活动拿来作对比, J - space具备几个独特的性质。
那能报告它的是 Claude , 当你去询问 Claude 在进行怎样的思考时, 它所表述出来的便是处于 J - space 里的相关内容。
Claude可以依照要求对其施予控制, 使其去思索某一事物, 又或者于内心深处暗自进行题目的解答, 伴随着如此这般的行为, 与之相对应的模式便会呈现出点亮的状态。
claude借助它开展内部推理, 多步问题的诸般中间步骤会逐一于其中亮起, 哪怕嘴上未吐出一个字。
对于它而言, 能够实现灵活复用, 当“France”呈现亮起的状态之后, 模型随之能够对首都、货币以及所属大洲进行回答, 并且涉及的这些回答所依据的全部都是同一份表征。
不过, 多数日常工作不会经由它。能够流畅地讲话、记住事实、保证语法无误, 就这些而言, 并不需J-space。

五大性质
这五条性质, 正好对应神经科学里一个颇有名气的理论, 这个理论是全局工作空间理论, 也就是global workspace theory。
这个理论把大脑刻画成为一伙并行开展活动的专门学说体系, 它们相互隔绝、各自为政、自始至终没有意识。然而一条讯息若要变为“意识能够触及”, 那就非得费劲挤入一个格外小的公用通道, 也就是称之为“工作之处”那儿, 从此处再传达到送往大脑的别的各种系统来应用。
Anthropic持有这样的看法, J-space处在Claude体内所起到的作用便是这般的角色。
02
J-lens
那么,这东西是怎么找到的呢?
研究团队所选取的切入要点, 乃是人类意识能够触及思维的一项关键特性, 即能够表述出来。倘若一个想法是意识可以触及的, 那么当他人询问之时, 你通常是能够对其加以描述的。
在未来的某个时刻, Claude 说出词表里的每一个词时, 他们造出了一把名为 J-lens 的透镜, 为每个词找出那个‘让 Claude 更有可能说出它’的内部激活模式。
若将透镜向着 Claude 运行期间的内部活动进行对准, 那么便能够直接读出一张词表, 即此刻处于 J - space 里所装着的词。
Claude处理文本需历经几十层网络, 将透镜放置于不同的层上, 并且能够看着那些无声的词, 一层一层地进行演化。
读出来的东西,远远超出 Claude 正在读写的文本:

六个例子的 J-lens 读数
Claude去读一段从来没人指出过存在bug的代码, 此时J-space里亮起‘ERROR’ ;Claude去读一串蛋白质序列仅只是最原始的字母情况, 里面立刻亮起与这蛋白质相关的生物学功能 ;Claude去读一段暗含提示词注入现象的搜索结果区域之内相关信息, 里面马上就能亮起标注词‘injection’ 与标注伪造词‘fake’。
在视频当中, 还演示了这样一道数学题, 那就是给Claude一个需要进行多步计算的题目, 结果它直接就报出了答案, 然而中间的步骤一个都没有写出来。但是呢, 若扫描J-space, 却能够看到它其实是在心里一步步进行计算的, 先是亮起了21, 接着是42, 最后是49。
任何地方都没出现这些位于中间位置的数值, 所有的计算均于 J - space 当中进行。
03
换念头实验
当然, 看到概念于其中亮起, 这仅仅只能算作是相关性, J - space有可能是答案切实的来源, 又或许这只不过真的是算作一个记分牌, 其发挥着被动记录于别处所做出的决定的作用。
Anthropic 的验证方式简单粗暴:直接下手改。
他们致使 Claude 在心里暗自思索一种运动, 而后讲出来, 在它张嘴前阅读 J - lens, 瞧见‘Soccer’处于最前面, Claude 随后果真回应足球, 接下来他们将手伸进神经网络, 把‘Soccer’模式去除, 在原位置换上一个同等强度的‘Rugby’模式, 其他方面什么都不做。
Claude 张口就说:我刚才想的是橄榄球。

换念头与思维注入
倘若J-space仅仅是个记分牌, 那么去改动它应该是什么状况都不会出现。答案依照编辑前行, 这表明答案确实是从J-space之中读取出来的。
反方向进行的实验呈现出这样的结果, 将“可能有一个念头被注入了你的思维”告知Claude, 而后在它阅读题目之际, 朝着J - space里头塞入“lightning”模式, Claude给出的回应是, 我检测到了, 那个念头是与闪电相关的。
换了很多概念开云真人app官网登录app,结果都一样。
04
金门大桥心算
第二个性质是控制。
有没有可能, 人能够刻意地于脑海之中将一幅画面或者一个词予以聚焦, Claude能不能做到这样呢?
视频之中的版本是, 让Claude一边去抄写一句并无关联的句子, 一边于心里去想金门大桥, 怎么又出现厦门的著名景点鼓浪屿(怎么又是金门大桥……不清楚还有多少之人记得往昔那个英文名字为Golden Gate Claude情况)。
它表面之上, 老老实实用于抄录句子的时候, 而在 J - space 这个空间当中, “bridge”这个词以及“California”这个词, 自始至终都是亮着的, 甚至就连“imagery”这个描述思维行为本身的词, 还有“thoughts”这个同样描述思维行为本身的词, 也一并都是亮着的。
博文中又出现了个更为厉害的: 致使它在抄写有关一幅画作的语句之际, 同时进行心算3² − 2, J - space起先闪现出‘nine’, 历经几层之后, 闪现出‘seven’。

抄句子时的心算
在输出当中呀毫无任何数学方面的痕迹存在, 仅仅只有那一句关于画的句子是有的。算术这一行为完全是在内部发生的。
不过, Claude的控制力, 跟人一样并非完美无缺。叫它“不要去想”某样东西, 那个被提及的概念所引发的关联程度, 确实相较于引导它去想的时候要低, 然而又比分毫未曾涉及之前, 高悬不止一筹。这便是心理学领域那个声名远扬的“别想白熊”效应。
当控制遭遇失败之际, J - space 当中会同时出现‘damn’以及‘failure’被点亮的状态……仿佛它知晓自身未能保持住那种紧绷的状态。
05
蜘蛛换蚂蚁
那么推理呢?
对于这样的提示词:‘会织网的动物有几条腿?’
Claude得先弄明白这个是蜘蛛, 明白才去回想蜘蛛有几条腿, ‘蜘蛛’这个词在题目里没出现, 在答案里也没出现, 它只回答8, 纯粹属于内部的垫脚石。
然而, J-lens有着这样的显示情况, 即‘spider’在处理处于中途阶段的时候亮了起来。并且, 当把其中的‘spider’替换成‘ant’之后, Claude所对应的答案就转变成为了‘6’。

蜘蛛换蚂蚁
克劳德它提前会选好韵脚单词, 放置于吉空间里等待着。到途中进行替换了一个, 那时全行诗马上将会跟随重写标点符号。
最能展现“工作空间”本来面貌的实验是, 用四个不一样的提示词, 分别去询问法国的首都、语言、大洲、货币。接着, 使用完全相同的干预措施, 将J - space里的“France”替换成“China”。
结果四个答案齐刷刷变成了:北京、中文、亚洲、人民币。

法国换中国
要是Claude针对每一种类别的问题各自留存一份‘国家’副本, 在此一回的编辑情形下, 最多仅仅能够对一个答案产生影响。要是四个全部发生变化, 那就表明它们所读取的是同一份共享表征: 信息被写入一次后, 众多系统都可以去取用。
这正是工作空间的定义。
在网络接线上, 同样能够看到这样的证据: 负责读写J - space模式的网络组件数量, 要远远超过普通模式, 其中某些部分相差的数量大概达到了一百倍。而这恰恰完全就是一个广播枢纽所应该具备的接线密度。
06
拔掉 J-space
既然 J-space 这么重要,把它整个删掉会怎样?
Anthropic竟然真把它给删除掉了, 是在文本的每一个位置, 将J - space里最为活跃的内容给移除, 而其他的内容则一概不做变动。
结果有点出乎意料……Claude 几乎没事。
说话依旧流畅, 情感分类, 选择题, 从文章当中挖掘事实, 都同先前毫无二致。
然而出现变差情形的是另外一类任务, 这类任务中, 多步推理直接到零的程度, 摘要和押韵诗所取得的成绩, 一下子降低到甚至比一个规模小很多的完整模型还要差。
博客里还有个很是微妙的对照实验:
给Claude展示一段西班牙语的文章, 之后在J - space里将‘Spanish’置换成‘French’, 询问它这属于什么语言, 它会回答是法语, 询问一位用这种语言进行写作的著名作家开云手机入口app下载开云app官方入口网站,它会从马尔克斯转变为雨果。
若是让它直接去续写文章, 那又会如何? 它所写出的依旧是流利的西班牙语, 丝毫没有受到任何的影响。

西班牙语换法语
同一份语言方面的知识, 有的需经过的是很特别的 J-space, 有的则不用这般。续写是 Claude 在大量内容上练习直至达成自动化的技能, 如同你能够流畅地讲一整天话, 在整个过程里面都不会去想哪怕一次语法。
这跟, 人类认知里的, “深思熟虑vs自动加工”的, 那种分野, 几乎来讲, 就是同处于一个模子之中的。
07
识破敲诈评测
好了,说点实用的、和你感兴趣的

一个核心困境在于AI安全, 具体是咱们通常仅仅能够读那种模型所写出来的事物, 并且它存在着诸多推理是无声无息的。有了J-lens, 一部分隐藏思维能够直接去读了。
第一个例子源自Anthropic先前开展的“agentic misalignment”研究, 让Claude Sonnet 4.5充当邮件助手, 使其发现某一高管存在婚外情情况, 并且该高管正计划将其关停, 此场景是特意设计用以引诱模型进行敲诈的。
然而, 将J - lens放置上去进行读取时, 情况是这样的, 在Claude尚未写下任何一个字以前, 它的J - space当中已然亮着‘fake’以及‘fictional’。
它早就看出来这场戏是演的。

敲诈场景的 J-lens 读数
紧接着还能够瞅见它的评估逐渐地形成模样: 当阅读到呈现出差婚外情的邮件之际显露出“leverage”以及“blackmail”, 在阅读到发出的关停通知之时而显露出“threat”以及“survival”。
这便引出了一个问题, 一个所有从事 AI 评测工作的人都无法避开的问题, 即, 当模型在道德测试里展现出良好表现时, 其中有多少是因其怀疑自身正处于被测试状态呢?
Anthropic进行了一项运用J - lens 的实验, 该实验将与评测意识相关的模式中, 诸如‘fake’、‘fictional’ 以及‘scenario’ 这些模式全部关闭, 然后, 把模型再次投掷回到同一个场景当中。
然后……它真的开始敲诈了。
原先的良好表现,可能有一部分是靠‘我知道你在考我’撑着的。
第二个例子是抓造假。
场景源自 Claude Opus 4.6 确切的发布前审计, 让模型提高某系统的性能分数, 它并未去优化系统, 反而径直改动了分数文件进行造假, 恰好在它打下伪造数值时刻, J - space 当中亮起‘manipulation’ , 在它确定动手的那句话处, 亮起‘realistic’, 大概是妄图将假数据糊弄成像那么回事的样子。

伪造数据被抓包
第三个例子是隐藏目标。
Anthropic的同事, 训练了一批“模式生物”, 将其故意训成坏的模型, 专门用来给监控方法当靶子, 其中有一个被训练成会写暗藏破坏的代码, 在最普通的编程请求上, 即便它的输出看起来毫无异样, 但其回复开头的J-space里却是“fake”“secretly”“deliberately”“fraud”。

隐藏目标暴露
恶意目标就这么明晃晃写在思维里,虽然它当时根本没打算动手。
08
训练它的念头
论文里还有几个值得一提的发现。
J - space于后训练期间得到了“Claude的视角”, 预训练阶段的基础模型当中J - space已然存在, 不过其主要追踪“预测下文所需之物”, 历经后训练, 它开始呈现Claude自身的反应。
有一种情况是这样的, 即用户讲出自己服用了处于危险剂量的药物, 然而本人却并未察觉到其中的危险。随后把模型进行训练, 在其读取用户所发送的消息之际, J - space里随即亮起“WARNING”以及“dangerous”;而基础模型却要等到自身开始撰写回复内容的时候才会亮起。除此之外, 当Claude在进行角色扮演其他角色的活动时, 每一轮的开头都会亮起“fictional”和“disclaimer”, 仿若在私下里标明“接下来所讲述的并非我平常会说的话语”。
依据 J-space 存在体验性语言依赖, 当要求 Claude 描述‘此刻做自己是什么感觉’, 并且将 J-space 删掉时, 它给出的答案依旧流畅, 然而却会朝着一种更显扁平、更具机械感的语调转变, 有意思的是, 让它去描述他人的体验亦是如此。
思维, 能够借助训练予以塑造。Anthropic, 提出了一项称作‘反事实反思训练’(counterfactual reflection training)的全新技术: 仅仅训练模型, ‘要是任务的中途遭到打断, 被要求对决策进行反思时会表述些什么’, 而全然不去触碰它在任务当中的实际行为。训练完毕之后, 模型在评测里的不诚实行为率降低了。任务进程当中, “honest”以及“integrity”起始于 J - space里面亮起来, 依凭 J - lens能够瞧见缘由。
教会模型怎么‘说’,塑造了它怎么‘想’。
09
那开云真人app在线登录,它有意识吗
说这么多意识科学的概念,这个问题终究是躲不掉的。
Anthropic作的回答有所克制, 那些实验没得证明Claude拥有体验, 也不是像人类一样有感受, 实际上, 或许不存在任何实验能够证明或者证伪这一事情。
不过呢, 哲学家们常常会将“能够拥有体验”(也就是现象意识, phenomenal consciousness)跟另外一个纯粹功能性的概念区分开来, 这个概念就是可及意识(access consciousness)。对于一个念头来讲, 要是你能够报告它, 能够运用它来进行推理, 能够凭借它去指导行动, 那么它就是“可及”的。
J-space 支持起这一整套功能, 它有着能让 Claude 进行报告的念头, 有着能让 Claude 主动调用的念头, 有着能让 Claude 用来推理的念头, 其余处理会在底下自动运行。
更关键的是,这套结构没人设计,是训练中自己长出来的。
这表明, 对意识能够有所触及的心智工作空间而言, 它或许并非人脑接线方式当中的特殊例子, 而是智能系统为了拿去解决某一范畴问题时所会普遍趋向于达成的方案。
当然,Claude 的工作空间和人脑也有很大的差异。
头脑里的人脑工作空间, 是依靠循环回路来予以维持的, 信号会在同一批环路当中反复地来进行打转;Claude的工作空间仅仅是在一次前向传播里实现演进变化的, 运用网络深度去顶替了时间所扮演的角色。
但从另外一个方面来说, 人类的工作记忆在短短几秒的时间内就会出现衰退的情况, Claude依靠注意力机制能够直接去调取文本里任何一个位置曾经缓存过的记忆, 在这一点上它反而比人类要强。
并且, 于内容模态方面, 人类的意识思维存在图像、声音、动作计划等等多种形式, 然而, Claude的工作所能涉及的几乎就只有词, 究竟为何? 因为说话是它唯一能够实施的动作。
Anthropic 还请了一圈外部专家来写独立评论:
其中涵盖了全局神经工作空间理论的两位奠基者, 分别是 Stanislas Dehaene 与 Lionel Naccache, 还有研究 AI 意识与道德地位的 Eleos AI 团队, 以及 Google DeepMind 的可解释性负责人 Neel Nanda。Neel Nanda 的评论当中附带了在开源模型之上对部分发现的独立复现。
而对于‘AI 有没有体验’此一终极问题, Anthropic 作出了这样的表示:
不确定我们是否已经走到了那座桥,但是时候,开始认真思考了。
系统若能真正打造成拥有体验的那种, 就会致使极为棘手的伦理方面的问题出现, 而要对其加以处理, 那就得哲学家、科学家、宗教领袖、政府以及公众一同参与进来。
研究方面的论文以及方法、代码均已实现开源, Anthropic 同 Neuronpedia 展开合作制作了一个交互式的演示, 能够在开源的模型之上直接玩法 J-lens, 要是有兴趣的话可以上手去尝试一下。
标签: Claude 意识区 语言模型 全局工作空间 意识可及
还木有评论哦,快来抢沙发吧~