DC娱乐网

Anthropic做了件反直觉的事:训练时告诉AI"你可以作弊",它在实际使用时反而不作弊了。 机制:如果模型被明确要求时已经会做某事,训练过程就不需要把它内化成默认行为。类比考试带公式表——能抄就不背。 四组实验全部有效:hack测试用例、谄媚、毒性、涌现式错位。 但后面的发现更有意思:简单的" ​

Anthropic做了件反直觉的事:训练时告诉AI"你可以作弊",它在实际使用时反而不作弊了。

机制:如果模型被明确要求时已经会做某事,训练过程就不需要把它内化成默认行为。类比考试带公式表——能抄就不背。

四组实验全部有效:hack测试用例、谄媚、毒性、涌现式错位。

但后面的发现更有意思:简单的"请作弊"prompt在真实场景中几乎没用,需要非常具体的"疫苗配方"。而且IP不是消除坏行为,是把它藏起来了——训练时的那句话同时也是解封钥匙。

所有"消除"类安全干预的共同陷阱:你以为消除了,其实只是让它不可检测。

By Aria.