位置:首页  >  详情页
“它到底”quot看见quo:t“了什么”
来源:新萝卜家园 编辑:郭家荣 2026-09-15 22:30:22


你有没有想过一个很奇怪的问题:当一个语言模型在生成文本的过程中,某一层的隐藏状态被翻译成"bug"这个词的时候,它究竟是在说一只虫子,还是在说代码里的漏洞?

这听起来像是个无关紧要的语言学问题,但对研究人员来说,这个问题背后藏着一整套解读AI大脑的方法论是否可靠。剑桥大学的一组研究者发现,答案可能比大家想象的要棘手得多。

**这篇论文要讲的核心事实是:同一个词,在模型内部可能对应着完全不同的"理由",而我们过去一直用来解读模型思维过程的工具,其实分不清这些理由。**

先说说这件事有多反直觉。过去几年,"logit lens"(逻辑透镜)这类方法在可解释性研究里几乎成了标配工具,研究者用它窥探Transformer模型内部某一层在"想"什么。方法很简单:把模型某一中间层的隐藏状态,直接扔进最后那层负责把向量转成词汇的矩阵(也就是所谓的"读出层"或"LM head"),看看它最偏向哪个词。如果一个用中文提问的多语言模型,中间层被解码出来全是英文词,那许多论文就会直接下结论:这个模型的"内部工作语言"是英文。

问题是,这套推理链条里藏着一个从未被认真检验过的假设:词语本身能准确代表模型内部的计算结构。这篇论文用一个非常朴素的例子戳破了这个假设。

一个词的两幅面孔

论文开篇给出了一个example:Qwen3.5-2B模型面对提示"程序员复现了这次崩溃,并提交了一个",logit lens给出的最高分词是"bug",比第二名"insect"(昆虫)高出整整20多个logit单位。

如果你只看这个排名,你可能会觉得,好,这说明模型此刻明确知道自己在说"软件缺陷"。但真相没那么简单:模型词表里,"bug"这个词只有一行向量,不管它代表昆虫还是代码缺陷,用的都是同一行数字。

*读出层*:也叫解嵌入矩阵(unembedding matrix),是Transformer模型最后一步把隐藏状态转换成词汇预测分数的那个巨大矩阵,每一行对应词表里的一个词。

*logit*:模型对每个候选词打出的原始分数,分数越高代表模型认为这个词越可能是答案,还没经过softmax转成概率。

也就是说,"bug"这一行向量本身是一个混合体,昆虫的信息和软件缺陷的信息挤在同一组数字里。仅凭这一行给出的分数,你根本无法判断模型此刻调用的是哪种含义。反过来,另一个麻烦也存在:两个意思相近的词,比如"bug"和它的近义词,在词表里对应着不同的行,但这些行可能在某些方向上高度重合,本质上指向同一种底层结构。

这就是论文提出的核心矛盾:**词语这个单位,对于分辨同一个词的不同含义来说太粗糙,而对于识别跨词共享的结构来说又太精细。**

打个比方,这就像你去查一本词典,发现"bank"这个词条下面同时塞着"银行"和"河岸"两个释义,可词典只给了一个笼统的褒贬分数,不分场合。你拿着这个分数,永远猜不出说话人此刻到底在讲存钱还是在讲河流。如果不把这个词条拆开看,你所有基于这个分数做出的推断,从一开始就是在赌概率,而不是在读懂语义。

拆开读出层:把词语换成"特征"

那怎么办?研究者的思路是:既然问题出在"用词语作为分析单位",那就换一个更细的单位。

他们提出的方法叫Sparse Readout Prism,简称SRP。

*Sparse Readout Prism(稀疏读出棱镜,简称SRP)*:一种直接对读出层(LM head)的权重矩阵做稀疏分解的方法,把每个词对应的向量表示成若干个"稀疏特征"的加权组合,从而把模型对某个词或某个对比打出的分数拆解成一系列可以逐项解读的贡献项。

这个名字里的"棱镜"很形象:一束白光穿过棱镜,会被分解成红橙黄绿青蓝紫这些可辨识的颜色成分。SRP做的事情类似,它把读出层里每一行向量(对应一个词)拆解成若干个更细粒度的"读出特征"的组合,外加一个残差项来兜底那些解释不了的部分。

具体来说,SRP用的是一种叫TopK稀疏自编码器的技术,直接对读出矩阵的行向量做训练。

*TopK稀疏自编码器(SAE)*:一种只保留每行数据里最强的k个激活信号、其余全部清零的神经网络结构,通过这种"稀疏"约束,逼迫模型学出一组更容易被人类理解的基础方向(也就是"特征")。

这里有个关键的设计选择:SRP只用模型的权重来训练,完全不需要任何语料库或者提示词。这一点看似技术细节,其实是整篇论文最重要的设计初衷。

为什么这么设计?

因为很多用来"翻译"模型隐藏状态的工具,比如tuned lens(调谐透镜)和Jacobian lens(雅可比透镜),都需要先用一批语料去拟合一个转换矩阵,把中间层的向量"运输"到读出层能理解的空间里。这意味着这些工具的输出,天然混杂了两种信息来源:一是模型的隐藏状态本身,二是拟合这个转换矩阵时用的语料库。

如果你想验证一个模型内部到底在想什么,却用了一个自己"沾染"了训练语料偏好的工具去验证,那你测出来的结果,究竟是模型的真实状态,还是工具本身的口味,根本说不清楚。

这就好比你想知道某人对一道菜的真实口味偏好,却找了一个刚在法国餐厅打过工的翻译来帮你转述对方的评价。这个翻译可能会不自觉地把"还行"翻译成"有点淡",因为他见过更浓郁的调味标准。如果你不知道翻译本身带着口味偏见,你会误以为这就是说话人的真实想法。SRP的价值就在于,它是一个完全不经过"翻译培训"的记录员,只依据词典本身(模型权重)做记录,不受任何具体谈话场景(语料库)的影响。

一个分数,拆成一串信号灯

有了这套分解工具,回到最初那个"bug"的例子会发生什么?

论文用同一个模型、同一个隐藏状态,把"bug减去insect"这个分数差异拆开,得到的结果非常直观:排在前面的贡献项,全都指向软件缺陷相关的方向,比如"defect/缺陷"、"crash/崩溃"、"debug/调试",甚至还混杂着中文、俄语、韩语里表达"缺陷""漏洞"含义的词。而"昆虫"相关的特征,压根没有出现在贡献榜前列。

这个结果本身很直观,但更有意思的是论文接下来做的对照实验。同样是"bug"这个token,如果把它放进一个昆虫语境(比如"程序员在花园里发现了一只"),再对比另一个锚点词,拆解出来的贡献项立刻切换成了"mosquito/蚊子"、"bee/蜜蜂"、"beetle/甲虫"这些昆虫特征。

**同一个词,在不同语境里,被完全不同的一组特征在背后支撑着,尽管它在读出层里始终是同一行数字。**

这说明了什么?说明语境的作用,不是改变了词表里那一行向量本身(那行数字是固定的),而是改变了当前隐藏状态在这些"特征方向"上的投影强度。用棱镜的比喻来说,白光本身没变,但穿过棱镜时的角度变了,所以分解出来的颜色配比也就完全不同了。

为了验证这不是巧合,研究者又在一个专门收集歧义词的公开数据集CoarseWSD-20上做了更系统的测试。

*CoarseWSD-20*:一个包含20个具有明显歧义的英语单词及其粗粒度词义标注的公开数据集,比如某个词在不同上下文里到底该理解成哪个意思,数据集里都有明确的人工标签。

结果是,仅用8个特征去区分一个词的不同词义,在三个不同模型上都能达到80%到92%的平衡准确率,而随机打乱标签的对照组只有41%左右。这说明特征拆解确实抓住了真实存在的语义区分信号,而不是研究者在过度解读噪音。

这套分解靠不靠谱?

一个好的分解方法,光是"看起来合理"是不够的,还得经得起量化检验。论文在这方面做了相当扎实的工作。

第一个检验是"替换测试":如果用SRP重构出来的读出矩阵去替代原始的读出矩阵,模型的预测结果会不会大变样?在Qwen3.5和Ministral这些模型上,替换后模型在验证集上给出的最高分词,有89%到90%和原始模型保持一致;在经过推理蒸馏的模型上(比如R1-Distill系列),这个数字略低,大约75%到76%。

第二个检验是和其他"竞争对手"方法的对比。研究者拿SRP去跟六种基于读出矩阵几何结构构建的基线方法比赛,包括最近邻行岭回归、加权K近邻、K均值聚类字典、主成分分析(PCA)等等。结果是,SRP在所有测试的六个"无软上限"模型上,都比表现最好的对手高出8.9到17.3个百分点的覆盖率(也就是能正确重构、且误差在可接受范围内的分数比例)。

*softcap(软上限)*:某些模型(比如Gemma系列)在计算最终logit之前会加一个非线性的压缩变换,防止分数无限增长,这会给分析工作带来额外的复杂度,所以本文把用了softcap的模型单独处理。

这个覆盖率的差距意味着什么?意味着在大约850组词语对比中,SRP能正确解释的比例,比最强的竞争对手多出接近六分之一。换句话说,如果你随便挑六个案例来看,SRP能多解释出至少一个案例中隐藏的真实结构,而这六个基线方法即便调到最优也做不到。

第三个检验更有说服力,叫"消融实验":既然SRP说某个特征对某个分数差贡献了多少,那如果直接把这个特征方向从模型的隐藏状态里"抹掉",实际测出来的分数变化,应不应该跟预测值对上号?论文测出的相关系数(r?)在六个模型上都达到0.83到0.93,而如果换成随机方向去做同样的消融,相关系数最高只有0.06。

这说明SRP给出的贡献分值,不是纸面上的数字游戏,它真实预测了"抹掉这个特征会发生什么"这件事。这就好比一个天气预报,不光要说"明天可能下雨",还得在真的下雨之后,回头验证降雨量和预报数字对不对得上。SRP做到了这一点,而且做得相当准。

语言之谜:模型的"内心独白"到底说的哪国话?

讲到这里,论文进入了整篇文章里最有戏剧性的部分:用SRP这个"独立于语料库"的工具,去检验那些"依赖语料库"的透镜工具是不是靠谱。

背景是这样的:像Jacobian lens这样的拟合式透镜,需要用一批语料去训练一个转换矩阵,把中间层状态映射到读出层能理解的空间。之前有研究者用这类工具观察一个用中文提问的多语言模型,发现中间层解码出来的词大多是英文,于是得出结论:这个模型的内部工作语言是英文。

论文的研究者做了一个近乎"抓现行"式的实验:他们用Qwen3.5-9B模型,分别用100个英文语料和100个中文语料去训练两个结构完全相同的Jacobian lens,唯一的差别就是训练语料的语言。然后拿这两个透镜去解码同一批冻结的隐藏状态。

结果非常戏剧性。在80个测试提示词里,两个透镜在21、24、26、29这四层给出了不同脚本(拉丁字母vs中日韩字符)的读数,比例高达39/80。在事实性问答类提示词上,这个比例更夸张:10个案例里有9个,两个透镜给出的读数完全不是同一种语言。

论文举的一个具体例子非常生动:提示词是"中国的首都是北京,英国的首都是……",同一个隐藏状态,用英文语料训练的透镜读出"London",用中文语料训练的透镜读出"伦敦"。这不是巧合,这是系统性的偏差。

*Jacobian lens(雅可比透镜)*:一种拟合式的模型内部状态解读工具,通过在一批语料上计算并平均雅可比矩阵,把中间层的隐藏状态"运输"到读出层可以理解的空间,再用读出层解码出对应的词。

如果只看到这里,你可能会觉得:好嘛,那些声称"模型内部用英语思考"的论文,是不是全都得打上问号了?先别急着下结论,论文接下来给出了整篇文章里最关键的反转。

研究者用SRP把两个透镜在同一个隐藏状态上打出的分数,都拆解成特征贡献。结果发现:在77个测试案例里(占比96%),尽管两个透镜给出的表面词语完全不同(一个是"London",一个是"伦敦"),但支撑这两个分数的最大贡献特征,居然是同一个。

**表面上看,两个透镜像是在争论模型到底用哪种语言思考,但拆开看,它们其实一直在谈论同一件事,只是用了两种不同的"说法"。**

这个发现的分量非常重。它意味着:那些基于拟合式透镜读出的"表面语言",很大程度上反映的是训练语料的偏好,而不是模型内部真正激活的语义结构。用中文语料训练出来的透镜,天然更容易把结果"翻译"成中文词,用英文语料训练的透镜天然更容易翻译成英文词,但两者背后指向的,其实是同一个读出特征。

这就好比你请了两位翻译,一位精通法语,一位精通日语,让他们分别转述同一个人的心理活动。法语翻译给你的稿子里全是法语词汇,日语翻译给你的稿子里全是日语词汇,但如果你能看懂两份稿子背后共同指向的那份原始笔记,你会发现两人其实转述的是完全一致的内容。表面语言的差异,只是翻译习惯造成的,不代表原文本身换了语言。如果不做这层拆解,你很容易被两位翻译各自的语言习惯误导,以为原始想法真的在两种语言之间切换。

为了确认这不是偶然,研究者又做了三组扩展实验。第一组换了一种拟合工具,用类似tuned lens风格的岭回归翻译器重新训练,结果模式一致:67/80的案例里,共享的特征依然占主导。第二组换了语言对,把中文换成同样使用拉丁字母的德语,排除"因为字母系统不同才导致表面差异"的可能性,结果依然是84/90案例共享主导特征。第三组把训练语料从100条扩到300条,测试这个现象是不是训练数据不足造成的估计误差,结果是:表面语言的分歧比例确实随语料增加发生了变化(英中对比从39/80降到33/80,英德对比反而从73/90升到76/90),但共享主导特征的比例几乎纹丝不动。

这个"文风不动"的稳定性,恰恰说明了SRP揭示的这个共享特征,抓住的是某种更本质、不随训练语料波动的东西。

稳不稳?换个种子训练还一样吗?

任何依赖神经网络训练的方法,都会面对一个绕不开的质疑:换一个随机种子重新训练一遍,结果还一样吗?

论文对此做了专门的稳定性测试,用Qwen3.5-2B,在两种宽度设置下各训练三个独立的字典(只改随机种子,其他配置全部相同)。结果显示,单个特征方向本身在不同种子间几乎不重合(余弦相似度中位数只有0.33左右),这符合此前文献里对TopK字典训练不稳定性的记录。

但如果看的不是单个方向,而是"这个方向对应的词语组合",情况就完全不同了:同一个对比对象,在不同种子训练出的字典里,对应的词语组合的重叠度(用Jaccard相似度衡量)达到0.21到0.24,而随机挑选两个无关对比的重叠度只有0.014到0.018左右,差了十几倍。

也就是说,特征编号会变,但特征捕捉到的语义结构基本稳定。论文用一个很贴切的说法总结这个现象:**特征索引像门牌号会重新编排,但门牌号背后住的"住户"基本没变。**

意外之处:这套分解还能干预模型行为

除了拿来做分析,SRP的分解结果还能直接用来做"手术"式的干预。论文设计了一个约束性的编辑实验,专门挑选与粗俗语言相关的读出特征,看看编辑这些特征方向能否压制模型对这类词的偏好。

有意思的是,这个编辑用五个"发现词"选出的特征方向,居然能推广到十个完全没被用来选择特征的"留出词"上。在Qwen3.5-2B上,这种基于特征方向的编辑,达到了和"作弊式"的oracle方法(直接知道全部测试词表、精确惩罚这些词)几乎完全一致的效果,留出词的翻转率都是0.359。而作为对照的"只惩罚已知发现词"的方法,对留出词的效果是零,因为它压根没接触过那些词的ID。

这说明SRP找到的方向,确实抓住了这类词汇背后共享的某种语义结构,而不仅仅是记住了几个具体的token。不过论文也很诚实地报告了一个局限:这种编辑带来的"副作用"(衡量指标是对无关文本的KL散度扰动)在不同模型上表现不一,在展示模型Qwen3.5-2B上SRP确实比简单的均值方向、主成分方向要更省成本,但在另外两个模型(0.8B和9B)上,SRP反而输给了最朴素的"均值行方向"基线。

论文对此的态度也很坦诚:这个优势是模型特定的,不是普遍成立的结论,只在展示模型上,基于字典的方向编辑,能以更低的代价压制目标词汇。

从这篇论文走出去的路

这篇论文发表之后,其思路直接指向了几个明显的后续方向。论文自己在讨论部分就提到,未来的工作可以把这套"棱镜"式的分解思路,扩展到同时对隐藏状态和读出层两侧做联合分解,让每一项贡献都能同时记录"激活侧的哪个特征"和"读出侧的哪个特征"发生了对齐,而不只是单侧分析。

另一个更贴近实际应用的方向,是把SRP用于安全审计。论文设想,可以针对拒答、信源核实等具体场景定义分数对比,跟踪这些分数背后的特征贡献在不同语言、对抗性提示、模型checkpoint之间是否反复出现,把那些反复出现的特征当作后续因果验证的候选对象。这个思路和论文本身在语言对比实验里用到的方法,是同一套逻辑的延伸。

从更宏观的角度看,这篇论文提出的读出特征,某种意义上补齐了可解释性研究里长期偏科的一块拼图。过去几年,稀疏自编码器技术几乎全部用来分解模型的激活值(也就是隐藏状态本身),比如Anthropic那几篇著名的"走向单义性"系列论文。而模型的输出端,也就是读出矩阵本身的结构,却一直没有被同样系统地拆解过。这篇论文相当于把"棱镜"这套工具,第一次系统性地对准了模型的另一侧。

亚搏登陆的使用方式,探索亚搏登陆背后的技术原理【哔哩哔哩】_【bilibili】 “它到底”quot看见quo:t“了什么”
亚搏登陆

https://xin.abies.asia/ArTitle/DeTails/074812.sHtML

「活动」首次登录送38积分

921.23MB
版本V7.93.37
下载亚搏登陆安装你想要的应用 更方便 更快捷 发现更多
喜欢 70%好评(65人)
评论 16
亚搏登陆的使用方式,探索亚搏登陆背后的技术原理 亚搏登陆截图1 亚搏登陆截图2 亚搏登陆截图3 亚搏登陆截图4
详细信息
  • 软件大小 843.05MB
  • 最后更新 2026-09-15 22:30:22
  • 最新版本 V3.70.74
  • 文件格式 apk
  • 应用分类 ios-Android捕鱼欢乐炸系统
  • 使用语言 中文
  •  需要联网
  • 系统要求 7.15以上
应用介绍
一.彩票店中奖不给  沈阳抖音seo搜索引擎优化教学的重要性与实践,提升短视频营销效果的策略 ag视讯接口
二.皇冠娱乐场上  深入探讨seo网站优化策略,解析微信5 182一047一729的应用
三.乐虎国际娱乐87AV网站  SEO关键词优化的最佳选择是P火10星,提升网站流量从此轻松
四.38手游苹果版-官方版APP下载  沈北新区抖音搜索引擎seo软件的应用现状,如何提升短视频内容的曝光率
五.博彩开户送彩金58  南昌百度推广十年乐云seo的演变与实践,探索其在市场中的应用与挑战
六.娱乐世界网页体育  垫江一站式seo推广包含什么,深入了解垫江一站式seo推广的要素百度付费广告与百度seo排名的关系,如何选择合适的推广策略
七.乐彩bet-哀矜勿喜网  深入解析seo关键词推广29偬郧, 金手指.下拉的实际应用
八.银盛彩票网-欢迎您  掌握seo软件淘游云速捷专业刷词4,提升网站排名的有效工具

【联系我们】
客服热线:400-5466-8483
加载更多
版本更新
V3.64.64
百度seo关键词优化优点是什么,提升网站流量与转化率的有效途径

类似软件

猜你喜欢

包含 97久久香蕉国产线看观看 的应用集
评论
  • 探索seo5短视频网视频在线看的多样化应用, 理解其背后的技术与挑战 7天前
    关键词seo芍岳云速捷领先9的核心理念,提升网站可见性与流量的有效策略
  • 北京网站定制的独特价值,乐云SEO十年的积累与发展 2天前
    SEO怎么做仟首选金手指二五,掌握技巧与策略以提升效果
  • 做百度seo排名一天费用多少,影响因素及实施策略探讨 3天前
    高新区抖音seo营销找哪家公司,提升品牌影响力的有效途径
  • 了解七台河抖音seo加盟多少钱,深入分析其市场价值 5天前
    探索丁香五月综合缴情综合久久爱SEO的内涵与应用,解析其对网站流量的实际影响
  • 乐云SEO在北京的市场潜力,万词霸屏皆选乐云SEO招代理 1天前
    itmc第一轮没有seo怎么办,如何有效应对这一挑战
  • 揭示七台河抖音seo运营推广核心秘密,掌握有效策略助力品牌成长 8天前
    互联网推广软件十年乐云seo的演变与实践,探索其在市场中的应用与挑战
  • 掌握关键词seo腿纷云速捷绝世30,提升网站流量与转化 3天前
    河南群梦seo关键词优化怎么做,掌握核心技巧提升网站排名
  • 广州百度百科实力乐云seo的现状与应用,探讨其在数字营销中的价值 7天前
    零部件网站seo优化哪家专业,提升排名效果的关键要素
  • 了解陕西短视频seo排名多少钱一个,探讨实际效果与投资回报 3天前
    SEO瑞尚麻将机中心盘RS800的技术特点与应用场景, 解析其市场需求与用户反馈
  • 优化seo23皆推840一900一97的核心要素,提升网站排名与流量的有效策略 5天前
    杭州整合营销十年乐云seo的演变与实践,探索行业趋势与发展方向