DC娱乐网

GPT-5.6看病比真人医生强?专科医生盲评结果出来了,有点意外 还记得那句"A

GPT-5.6看病比真人医生强?专科医生盲评结果出来了,有点意外
还记得那句"AI永远取代不了医生"吗?这话可能得改改了。
最新消息,OpenAI最新模型GPT-5.6做了一次特殊的"医疗考试"——不是考它能不能通过执业医师考试(这它早过了),而是让专科医生盲评它的诊断回答,和真人医生写的回答放在一起比。
结果,医生说:GPT-5.6写得比同行还好。
盲评是怎么做的?
这次实验不是简单的选择题测试,而是实打实的临床场景模拟。
研究人员收集了多个科室的真实病例,包括内科、外科、儿科、妇科等常见病和疑难杂症。每个病例都让GPT-5.6和真人医生分别撰写诊断意见、治疗方案和患者沟通建议。
然后,把这些回答匿名打乱,交给另一批资深专科医生进行评估。
评委们不知道哪个是AI写的,哪个是真人写的。这就是"盲评"——最公平的对比方式。
结果有多炸裂?
三项核心指标,GPT-5.6全面领先:
准确率:GPT-5.6的回答在医学事实准确性上得分更高。没有出现明显的误诊方向,给出的鉴别诊断清单比真人医生更完整。
完整性:这是最大的差距。真人医生有时会遗漏某些检查建议或随访提醒,但GPT-5.6几乎每条回答都覆盖了"诊断→检查→治疗→随访→注意事项"全链条。
缺陷率:评委标记的"有明显缺陷"的回答中,GPT-5.6的比例低于真人医生。换句话说,AI写的东西"翻车"更少。
当然,有少数情况下GPT-5.6的回答过于模板化、缺乏对罕见情况的深入洞察——但即便如此,评委也没有给出"不合格"的评价。
这意味着医生要失业了?
别急,这才是重点。
GPT-5.6强在哪?强在知识储备和信息整合。它背靠整个医学文献库,不会漏掉罕见病因,不会忘记药物相互作用,不会因为疲劳而写错剂量。
但它弱在哪?
 • 不会查体。它没法给患者做腹部触诊,听不到肺部啰音
 • 缺乏临床直觉。老医生"觉得不对劲"的那种第六感,AI没有
 • 不能共情。它知道该用"您别担心"这句话,但它不理解患者为什么害怕
 • 无法担责。出了医疗纠纷,AI不能上法庭
所以真正的未来图景不是"AI替代医生",而是——会用AI的医生,替代不会用AI的医生。
就像CT没有淘汰放射科医生,反而让放射科变得更重要一样。GPT-5.6这样的工具,让基层医生能拥有三甲医院的诊断视野,让主治医生能节省大量病历书写时间,把精力还给病人。
挑战也很大
方向明确,但路上的坑不少:
 • 责任谁担?如果AI辅助诊断错了,是医生的责任还是开发者的责任?法律还是空白
 • 数据隐私:GPT-5.6处理患者数据时,数据会传给OpenAI的服务器吗?患者同意了吗?
 • 过度依赖:年轻医生习惯了一上来就问AI,会不会丧失独立诊断能力?
 • 公平性问题:大医院能买得起GPT-5.6,小诊所买不起,医疗差距会不会反而拉大?
写在最后
GPT-5.6在医疗盲评中胜过真人医生,这件事本身就是一个信号:AI已经从"玩具"变成了"工具",现在正在变成"搭档"。
那些抵触AI的医生,可能会在不知不觉中被淘汰;而那些拥抱AI的医生,正在获得一个前所未有的超级外挂。
你说,这会是好事还是坏事?
GPT56 AI医疗 人工智能 医生