Anthropic新论文:能看穿Claude内心,发现J空间秘密

admin AI新闻 29

智东西在7月7日发布消息, 就在今日凌晨时分, Anthropic有一篇论文证实, 他们达成了能够看到Claude“内心想法”这一情况!

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第1张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

新研究在Anthropic有所发现, 发现Claude内部存在区分机制, 此机制和人脑高度相似, 仅有一小部分内部信息能如此被调取思考, 像人类的有意识想法那样, 大部分运算在底层自动运行。

把底层运行的区域称作J空间, 举个例子, Claude回答“那种会织网的动物有多少条腿? ”若答案仅为数字8, J空间里就会出现“蜘蛛”的概念。

Claude进行多步骤推理、回答主观描述类问题、胜任较高层次思维任务的关键在于J空间, 而且该机制不是人为设计出来的, 是模型在训练过程当中自然涌现而成的。

此外, 研究人员有所发现, 它具备改变Claude J空间里容之能力, 进而能够对模型输出结果实施人为干预。

尼尔·南达(Neel Nanda), 身为谷歌DeepMind可解释性研究团队的负责人, 宣称这是篇具备极高价值的论文, 该论文之中给出了足够充分且有力的证据, 用以证实大模型的内部存在着某种“认知空间”, 并且, 他们已在Qwen3.6 - 27B模型上面复现了这篇论文的全部核心结论。

Anthropic发布了开源代码库, 这个开源代码库包含那些核心方法, 并且Anthropic与Neuronpedia合作, 提供了交互式演示, 该交互式演示基于开放权重模型。

交互演示界面:

https://t.co/hkmYl0IOn2

01. 大模型也有类人脑意识空间 具有五大特性

以人类来说, 于阅读之际, 人类大脑的神经回路会对姿势予以调整, 会对呼吸加以控制, 并且会将屏幕上的文字以及符号转化成人类可理解的词语, 而这些诸多过程常常是无意识的。然而大脑里所发生的部分活动, 人类是能够有所感知的, 像是脑海中忽然呈现出的画面, 又或者是规划好的购物出行路线。

神经科学家, 有时候会把后一类大脑活动, 称作“意识可及活动”, 用来和其余所有无意识进行的信息处理过程相区分, 哲学家偶尔也会这么做。人类能够对这类活动进行表述, 能够主动地加以调控, 还能够借助它来展开逻辑推演。

在Anthropic的新论文里, 被发现在Claude这类现代语言模型当中, 存在着类似的区分, Claude内部产生了一组特定的神经模式, 在与模型其余全部的内部运算过程相比较时, 这组神经模式有着特殊的作用, 也就是人类大脑活动的“意识可及活动”!

Anthropic把Claude的这些神经模式集合称作J空间, 每一种J空间模式对应一个特定词汇, 然而当某一模式被激活时, 这并不意味着模型要输出这个词, 只是表明该词汇正处于模型的思考范畴当中。

然而, J空间并非大语言模型于推理之际为自身所撰写的“草稿”, 或者思考进程了, 而是凭借模型内部神经元的激活, 静静运行着, 并不 需要去生成文字, 便能够促使模型针对某个概念开展思考的。

需要留意的是, J空间不是经由人为去进行设计, 也不是代码预先设置而成的产物, 而是Claude在训练进程当中自然而然地涌现出来的。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第2张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

J空间能够揭示那些在模型输出中无法体现的内在思维过程

展开研究的人员, 把这一种现象, 拿来跟神经科学范畴的“全球工作空间理论”, 进行相提并论。此理论表明, 大脑好似一座剧院, 后台存在着几十个专门的处理单元, 它们是处于同时工作状态的, 然而, 在任何一个时刻, 仅仅会有一小部分信息, 被传递到“整个剧院”里面。

这同样证实了, Claude的内部构造并非是那种, 毫无规整秩序可言的数字胡乱堆砌, 而是自行发展形成了, 一整套规矩严整的架构, 并且其运作模式, 和人类大脑的思维逻辑, 是相当类似的。

J空间的特性在于:

1、Claude具备读取以及输出J空间的相关表征信息的能力, 比如说, 人若是有购买奶茶之类想法能够清楚说出来, 这便对应着J空间, 然而那下意识的内心的活动, 人类要把它清晰地表述出去是相当困难的, 而这就对应着非J空间表征。

2、能够按照需求对模式予以调整, 要是使Claude专门去专注思考某一件事情, 或者是在内部进行静默状态下的问题推演, 那么它就会将J空间里相对应的神经模式给激活, 然而模型很难凭借自身去调控并非J空间的表征。

3、模型借助J空间来达成内部推理, 在让其求解多步骤问题之情状下, 哪怕不将中间步骤予以输出, 与之相应的思维过程亦会于J空间里被激活, 虽说此类J空间表征的信号强度相较于模型其他内部表征要更弱一些, 然而它们却是主导模型去完成任务的关键所在。

4、存于J空间里的表征能够灵活地适配各种各样的任务, 就像“法国”这个概念在Claude的J空间当中被激活之后, 模型便可以调取与之相关的衍生信息, 像法国的首都、本国货币以及所属大洲这些信息。

5、语言模型, 其绝大多数的运行过程, 并不依赖J空间, 像输出文本这个操作, 无需J空间参与, 调取基础常识时, 也无需J空间参与, 规范运用语法这种操作, 同样无需J空间参与, 就算被限制调用J空间, 模型依旧能够正常对话, 只是会丧失高阶认知能力。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第3张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

J空间的五个特性

02. 没有J空间 Claude将丧失多步骤推理能力

研究人员通过具体的问题拆解了J空间到底能做什么。

Claude在回答他们所输入的一个问题, 即“那种会织网的动物有多少条腿? ”时, 需要先做出判断, 判断出那种会织网的动物是蜘蛛, 之后还要记住蜘蛛究竟有多少条腿。

最后Claude给出的回答仅仅是8, 并未提及蜘蛛, 研究人员发觉,在Claude处理信息之际, “蜘蛛”这个词汇会被高亮显示出来, 当他们将“蜘蛛”替换成“蚂蚁”后, Claude的回答便会变为6。

Claude于推理流程的第二步时, 会去读取J空间的内容, 且会完全依照研究人员植入在其中的概念来展开推演。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第4张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

通过交换J空间中的内容来改变Claude的推理结果

此外开云真人app在线登录,J空间具有灵活性。

研究人员向Claude分别问了关于法国的四类信息, 这四类信息是首都、官方语言、所属大洲、流通货币, 接着他们在J空间里把“法国”替换成了“中国”, 最后Claude依次给出了答案, 答案是北京、汉语、亚洲、人民币。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第5张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

一种J空间表示法有多种用途

首先, 四项答案同步出现变化, 进而证实它们阅读的是一套相同的共享表述。之后, 这恰恰是工作空间的关键作用, 即信息只要一次性写入, 便能够为数众多的各异运算模块拿来使用。

这表明, J空间与整个神经网络的几乎所有模块都存在连接关系, 那些能够对J空间进行读写操作的模块数量, 相较于普通表征而言, 高出将近100倍。

那除了J空间开云真人app官网登录app,神经网络的其他部分都在做什么?

J空间, 一次仅能存储几十个概念, 其占用的计算资源, 不到 Claude 内部处理总资源的 1/10。研究人员去尝试完全删除 J 空间, 在文本的每个位置, 都移除其中最活跃的内容, 保留其他内容维持不变。

Claude依旧能够流畅地讲话, 对情感进行剖析, 解答选择题, 还能从文本里提取信息, 其能力和之前相近。然而, 它没办法胜任那些要求较高层次思维的任务, 多步骤推理能力近乎为零, 并且总结内容、创作押韵诗歌的能力, 比起结构完整的其他较小规模模型的水平, 要低很多。

03. Claude会直接去J空间那儿获取答案, 对此情况, 研究人员能够进行人为干预。

你想要弄清楚J空间的发现历程, 那就得先清楚一个概念, 这个概念是什么, 它是指那由Anthropic研发出来的用以分析的工具, 什么工具, 是雅可比透镜又名J透镜, 也就是Jacobian lens, J透镜。

在Claude词表里, 对于其中的每一个单词, J透镜都能够确定出与之对应的内部激活样式, 只要这种样式呈现亮起的状态, 那就意味着模型在当下正思索着某个观念, 在此之后它更倾向于是将会提及这个词, 并且会把它当作是文本去输出。

研究人员把J透镜施加于Claude的内部运算信号之上, 之后便能够直接读取一组词汇, 而这一组词汇就是那个时刻J空间里所承载的思考内容, 研究人员针对Claude进行文本处理的多层网络展开了分析。

他们察觉到, J空间当中所浮现出来的内容, 要远远多于Claude此刻正在进行读取或者输出的那些文字。

当Claude读到一段暗藏漏洞、并且没有任何人提示报错的代码的时候, 它的J空间里会出现“错误”这一概念;当它读取一串蛋白质的原始序列字符的时候, J空间中会浮现该蛋白质所对应的生物功能;一道有着多个步骤的数学题的解题中间步骤会按照正确的顺序依次出现在J空间内部。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第6张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

J透镜对六个不同的输入进行了分析

针对研究人员那儿的第一组实验, 其对J空间于Claude口头当中的表达所具备的作用展开了研究。

在Claude需要内在思索一项体育运动等并稍后讲出其名称时, 是他们安排的, 在Claude给出答案以前, 借助J透镜去读取其内部状态, 如此便能看见它所选定的目标, 足球在列表是首位, 而它最终给出的答案的确是足球。

研究人员为了能进一步对其进行验证, 采取了这样的操作: 先是删除了Claude神经网络当中与“足球”有着关联的相关模式 , 其后又插入了和“橄榄球”是相关的模式 , 并且其他的部分都保持不变。之后便出现这样的情况: Claude回答它所能够想到的其中一项运动是橄榄球。

这证明开云真人app官网入口,Claude的回答确实是直接从J空间中获取的。

Anthropic新论文:能看穿Claude内心,发现J空间秘密-第7张图片-世界杯直播平台-世界杯2026直播平台-免费观看官方-V3.6.9

为Claude植入橄榄球模式

在第二组实验里头, 研究人员告知Claude, 或许存在一段想法被人为给塞进了它的思维当中, 还让它如实地讲出自己察觉到了啥。

在Claude读取问题时, 研究人员向它的J空间植入代表“闪电”的神经模式, 之后Claude反馈脑海里浮现的念头是闪电, 而且研究人员对大量不同概念重复植入做测试, 都得到了一致结果。

除此以外, Claude没办法对自身的J空间做到完美操控, 当研究人员提出要求不让它去思索某一事物之际, 该概念于J空间里的激活程度会出现降低的情况, 又或者是在让其能够避开某个想法之时, 反倒会致使Claude更加频繁地回想起来。

04. J空间在训练过程自然涌现 模型微调阶段成型

研究人员还发现其他几个有趣的结果:

在微调阶段, J空间会去形成专属自我的视角, 模型预训练阶段那里就已经存在J空间, 它仅仅是用来记录预测下文所需的信息, 可是经过微调之后, J空间会产生明显的特征, 进而形成属于“Claude自身的视角”。

由J空间生成的是带有主观体验感的那种描述性语言, 不管描述的对象究竟是谁, 只要是涉及带有主观体验的文字表达情形, 那就都得要有J空间来进行支撑。

J空间之内在想法, 可借由训练为人为所塑造。研究人员提出一项全新技术, 此技术名为反事实反思训练, 也就是Counterfactual Reflection Training , 改变Claude在被要求复盘思考之际的表述, 便能够同步改变其推理模式。

在Claude里被识别出来的那个“工作空间”, 和人类大脑当中的“全局工作空间模型”, 存在着显著的差异。

人脑的工作空间靠循环回路来维持, 信号会在同一套神经通路当中反复不停地循环流转, 而Claude的工作空间仅仅在神经网络单次前向传播的过程里完成演化进程, 其所具备的网络层级充当了人脑里“时间”所发挥的作用, 从这个特定的角度来讲, Claude内部工作空间的处理时长和人类相比存在着一定的限制, 不过它能够借助临时草稿区, 将思考过程直接进行输出, 借此来弥补这一存在欠缺的地方的。

但是, 在另外一些层面上, Claude的工作空间能力竟然超越了人类。比如说, 人类工作记忆在短短的几秒之内就会出现衰退的情况, 而且人脑工作空间长期保存信息的能力限定得非常狭窄, 然而, 依靠神经网络的注意力机制, Claude能够在任何时候都调取文本前文缓存的全部信息。

人脑与人脑内名叫Claude的另一项关键区别在于, 工作空间承载的内容形式方面, 其中人类的意识想法有着多样形式, 既包含画面, 又涵盖声音, 还涉及肢体行动规划等多方状况;然而Claude的工作空间几乎全都由token为此构成。研究人员对其原因进行推测得出, 输出文字属于Claude唯一能够执行的行为, 而人类在此方面并不受这样的约束。

从事研究工作的人员表示, 对于J空间展开的研究不能够向我们真切地表明Claude是不是如同人类一般具备意识, 又或者它能不能够觉察察知到任意任何一种生物。

关于J空间, 它具备知晓Claude内心想法的能力, 比如说呀, 像研究人员能够捕捉到Claude私底下察觉到自己正处于接受测试的状态, 还可以捕捉到Claude特意去生成虚假信息的情况, 或者是捕捉到Claude在追逐研究人员于训练阶段预先设定好的隐藏目标所呈现出来的内在状态。

在J空间里, 存在着一种意识性机制, 这一意识性机制, 是在模型的训练进程当中自然塑造而成的, 出现这样的情形, 或许能够表明一些相关的情况, 那就是, 这种机制是智能类的系统为了解决某些具体的问题从而自然构建形成的具备通用性的机制。

05. 结语:大模型意识机制 仍存大量未知空间

J空间好像是界定语言模型里能够有意识去调用运算以及无意识底层运算的关键界限, 然而它没办法阐释所有机制。

从事研究工作的人员也有提及, 名为J透镜的这套用以开展观测的工具其自身是存在着一定局限的, 它仅仅能够实现近似的去还原模型真实态的那种遵循思维逻辑的工作空间, 就比如说它仅仅只能够识别针对单个token所对应的概念。在这之后它将会针对大模型内在蕴含的思维、还有就是其与人类心智之间存在的相同点以及不同点的理解, 进一步的展开更为深入深入的分析。

标签: Anthropic Claude J空间 大模型 意识机制

发布评论 0条评论)

还木有评论哦,快来抢沙发吧~