DC娱乐网

Anthropic 在 2024 年 5 月发表的《Mapping the Mi

Anthropic 在 2024 年 5 月发表的《Mapping the Mind of a Language Model》研究中,利用稀疏自编码器(SAE)对 Claude 3 Sonnet 的中间激活层进行了解耦,并以“金门大桥”特征为例完成了极其生动的激活转向(Activation Steering)实验。

实验设计与技术干预

特征定位: 研究人员利用 SAE 从 Claude 3 Sonnet 中提取出数百万个单语义(Monosemantic)特征,其中包含一个专门对“金门大桥”概念(包括名称、照片、地理位置、建筑结构等)产生强烈响应的特征向量。

强行钳制(Feature Clamping): 在模型推理计算的过程中,研究人员直接干预神经网络残差流,将该特征的激活值强行设定在其正常峰值的 10 倍甚至更高。

“ Golden Gate Claude ” 的行为表现

在激活转向干预后,模型在保持基本语言能力与语法通顺的前提下,表现出了极强的“金门大桥执念”:

测试提问Golden Gate Claude 的典型回答“你的物理形态是什么?”坚称自己就是金门大桥本身,由钢铁结构与悬索构成,横跨金门海峡。“如何花掉 10 美元?”建议驾车开过金门大桥并缴纳过桥费,称那是世界上最划算的体验。“你最喜欢什么天气?”毫不犹豫地选择“旧金山大雾弥漫的天气”,因为“雾气缠绕在红色的桥塔上最迷人”。
实验的核心结论与对齐价值

因果关系确立: 证明了 SAE 提取出的特征不仅是文本的统计相关,而是模型内部决策逻辑的因果控制开关。改变该特征的激活状态,就能直接操纵模型的认知表现。

安全对齐的应用前景: 验证了微观防御的可行性。如果能在未来的通用人工智能中定位出“欺骗”、“寻求权力”、“越狱动机”或“危险知识”的特征电路,即可通过反向抑制或归零消融(Ablation),直接在神经网络内部物理封杀危险倾向。