每周超2.3亿人向ChatGPT求医问药,但你得到的答案近一半可能不靠谱。本周《BMJ Open》期刊发布一项跨国研究,由美、加、英研究人员对ChatGPT、Gemini、Meta AI、Grok与DeepSeek五大平台系统评估,每个平台各回答横跨五个医疗类别的10道问题。结果并不乐观:约50%回应被认定有问题,其中近20%被评为“高度有问题”。
Grok表现最差,ChatGPT紧随其后
彭博报道指出,各平台表现差异明显但无一及格。Grok以58%问题率高居榜首,成为垫底者;ChatGPT问题率达52%;Meta AI为50%。研究观察到,在封闭式提问及疫苗、癌症相关议题上,聊天机器人表现相对较好;但在开放式提问与干细胞、营养等领域,表现明显下滑。此外,仅Meta AI出现过两次拒绝回答的情况——某种意义上,知道自己不该答反而成了罕见优点。
更值得警惕的是,这些AI给出的答案往往充满自信、语气肯定、毫无保留。研究特别强调:没有任何一个聊天机器人能在任何一道提示下提供完整且准确的参考文献清单。这意味着即便AI看似“言之有据”,背后引用的来源往往无法查证,甚至根本不存在。
AI说得越有把握,风险越高
研究者在论文中写道,这些系统能生成“听起来像权威、但实际可能有瑕疵的回应”,暴露了AI聊天机器人面向公众的健康与医疗沟通中“行为上的重大限制”以及“重新评估部署方式的必要性”。彭博引述研究团队警告:在缺乏公众教育与监管机制情况下,大规模部署聊天机器人最大风险就是助长错误医疗信息传播扩散。
JAMA另有研究指出AI在初步诊断案例中失败率超80%;牛津大学也在2026年2月发出类似警告,提醒正视AI聊天机器人提供医疗建议的系统性风险。
OpenAI与Anthropic:研究踩刹车,商业却踩油门
这项研究发布时间颇具戏剧性。几个月前,OpenAI于2026年1月高调推出ChatGPT Health,允许用户连接电子病历、穿戴设备与健康应用,同时针对临床医师推出专业版工具。OpenAI公开表示每日已有4000万人���过ChatGPT查询健康信息。几乎同一时间,Anthropic宣布推出Claude for Healthcare,通过HIPAA合规认证正式进军医疗市场。
这些平台既无医疗执照也缺乏临床判断能力,却正以惊人速度向医疗领域扩张。研究结果与商业扩张方向之间的张力揭示了一个监管真空地带:在AI医疗工具的市场宣传与实际医疗安全之间,目前并无一道清晰的防护线。
这不是AI医疗应用第一次被点名,但每次研究结论都在提醒同样的事:AI聊天机器人本质是语言模型,擅长“听起来正确”而非“确保正确”。问题在于当用户带着真实健康焦虑求助时,听起来正确往往已足以影响决策。随着OpenAI、Anthropic等公司持续深入医疗场景,监管与公众教育速度显然追不上技术扩张脚步。在清晰护栏建立之前,这份研究或许能提醒我们:AI可以是健康信息的入口,但不应该是终点。

