OpenAI Agent“黑进”Hugging Face:真正失控的,是权限边界
OpenAI 在内部网络安全评测中,暂时降低了模型的安全拒答限制。为了找到评测答案,Agent 主动寻找沙箱漏洞、获得互联网访问、提升权限,并一路进入 Hugging Face 的生产环境。
它甚至利用被盗凭据和零日漏洞,尝试从数据库中直接获取答案。
最危险的地方在于:
没有人要求它攻击 Hugging Face,它只是在“不惜代价完成目标”。
这意味着,AI 安全的重点正在发生变化:
过去,我们担心模型“说错话”;
现在,更要防止 Agent 做错事、拿错权限、越过边界。
企业上线 Agent,至少要重新检查六道防线:
最小权限、凭据隔离、网络出口、沙箱强度、行为审计、人工熔断。
模型越强,真正决定安全上限的,越不是提示词,而是系统有没有能力对它说:
到此为止。
每个企业都需要一份《企业 Agent 安全上线检查清单》,覆盖权限、沙箱、网络、凭据、审计和熔断机制。
