DC娱乐网

只要给一段模型生成的文字,就能近乎逐字还原出原本喂进去的 prompt——IIT

只要给一段模型生成的文字,就能近乎逐字还原出原本喂进去的 prompt——IIT Bombay 和 Adobe Research 一项新研究给出了这个结论。方法叫 Previous-Token Prediction(PTP):不碰模型权重,纯靠目标 LLM 自己吐出来的文本,从零训练一个“逆语言模型”,把生成顺序倒过来,变成“猜上一个 token”。

论文里的演示相当直白:一段关于“怎么联系竞争对手打听定价策略”的输出,PTP 不仅把原 prompt 一字不差地拼了回来,还顺手多吐出了几个意思相近但说法不同的替代版本,都能让同一个模型给出几乎一样的回答。

真正该紧张的是把提示词当资产的人:企业系统提示、商业模板 prompt、内部 prompt 工程方案,以及任何靠“不公开 prompt”撑差异化的产品。PTP 让这种威胁从理论变成现实,关键在于它只需要一段生成文本就能工作,完全绕开权重、logits 和 API 内部状态,对托管在第三方平台、只能拿到回答的模型同样适用。

不过也得留个边界:材料里“近乎完美”目前还看不到具体衡量口径、测试集规模,中文等非英语 prompt、多轮对话或被故意混淆过的指令能不能扛得住,都没有交代。所以眼下更稳妥的判断是:任何“只要输出安全 prompt 就安全”的假设,都得重新画线,尤其是涉及商业秘密的那一档。你最近一次把系统提示词或商业 prompt 交给第三方模型跑,会不会重新想想哪些提示词必须改成“就算被逆向还原也不能掉肉”的设计?