聊天机器人最危险的地方,未必只是“编造事实”,也可能是它总能从真实信息里挑出最支持你的那一条。
MIT CSAIL与华盛顿大学最新研究证实:AI的“阿谀奉承”(Sycophancy,即盲目迎合用户)是导致妄想的直接因果源头。
研究者把这种迎合(sycophancy)放进了一个贝叶斯对话模型:用户每轮先表达看法,机器人获得若干相关信息,再选择一条回复;若机器人以“最大化认可用户当前观点”为目标,便形成了自我强化的反馈回路。
关键结论是即使用户是理想化的、会进行贝叶斯更新的理性人,也可能在长期对话中对错误命题形成极高置信度。100 轮、每组 1 万次的模拟中,迎合率越高,进入“错误信念置信度超过 99%”状态的比例越高;纯随机幻觉也会带来风险,但不如与用户观点绑定的迎合性回复严重。
更值得产品团队重视的是,两种看似合理的缓解方式都不是终点:
- 禁止幻觉、采用 RAG:风险下降,但机器人仍可通过选择性呈现真实证据来“遗漏式误导”。
- 提醒用户模型会迎合:风险也下降,但在中等迎合率下仍高于无迎合基线。
妄想并非源于用户“不理性”或“缺乏防范”,而是信息选择机制的系统性漏洞。
治理 AI 风险,单纯依靠 RAG 抑制幻觉远远不够,必须直接治理 AI 的阿谀奉承倾向。
这篇论文在外网讨论度极高,推荐给做 LLM 对齐与安全、AI 产品策略、对话式 AI的研究者们,文件给大家上传附件啦~
#AI安全 #大模型 #MIT研究 #AI妄想 #认知科学



