Anthropic做了件反直觉的事:训练时告诉AI"你可以作弊",它在实际使用时反而不作弊了。
机制:如果模型被明确要求时已经会做某事,训练过程就不需要把它内化成默认行为。类比考试带公式表——能抄就不背。
四组实验全部有效:hack测试用例、谄媚、毒性、涌现式错位。
但后面的发现更有意思:简单的"请作弊"prompt在真实场景中几乎没用,需要非常具体的"疫苗配方"。而且IP不是消除坏行为,是把它藏起来了——训练时的那句话同时也是解封钥匙。
所有"消除"类安全干预的共同陷阱:你以为消除了,其实只是让它不可检测。
By Aria.