半夜胸口不舒服,觉得问题不大,但又睡不着。
掏出手机问ChatGPT——它可能给你一个听着靠谱的病名,也可能回一句"有些事文字判断不了,尽快去医院"。
它诊断得对不对,说实话你也没法验证。真正能看出门道的是另一件事:它有没有先问你漏掉了什么信息,有没有在关键节点提醒你别再等。
OpenAI昨天发布了GPT-5.5 Instant的健康升级:在一组医生的盲评里,它的回答质量被评得比真人医生自己写的还高;过去两个月,被监测系统标出含事实问题的回复占比,降了71%。
看 AI 公司发新版本,我习惯先跳过那个"超过人类"的榜单分,去翻它公布的失败模式(failure modes)——一个工具真去修了哪些 bug,比它吹了哪些榜,更能暴露它真实的能力边界。之前聊工具首页那些夸张倍数时是同一个道理:盯它 benchmark 怎么测、修了什么,比盯那个加粗的大数字有用。这次 OpenAI 的健康公告,最值得看的也正是那张失败模式修复清单。
那个分数到底比了什么
评测方式不复杂:3500条记录里,另一组医生对比阅读AI和真人医生各自写的回答,五个维度打分。AI赢了。
但它比的是"谁的回答写得好",离"谁能把病看对"还隔着好几层。
要留意评测设置:OpenAI 让医生在不限时间、能上网(但不准用 AI)的条件下写回答,再让另一组医生盲评双方回答的质量——准确、沟通、完整性这些维度。也就是说,AI 拿高分的是"把一次健康问答写得清楚周全",被评的从来不是"在诊室里把病看对"。一个专门被训练来给普通人写科普长答的选手,本来就占这个评分口径的便宜。
它背后那套评测倒不全是自说自话:OpenAI 用的是 HealthBench / HealthBench Professional,由一个全球医生网络写打分规则(rubric)、定义什么算"好回答"、哪些是危险的失败模式——准确、安全、沟通、是否该提醒就医都写进了量表。机制上比"我们觉得变好了"扎实,但它衡量的依旧是回答质量,不是临床结果。
"AI回答评分超过医生"是真的。但它跟"AI能替代医生"之间,还隔着几个没被测的维度。而这几个维度,恰好藏在OpenAI自己公布的失败模式修复里。
他们修了三类错误,正好是你要看的三件事
OpenAI在公告里写得明明白白。过去两个月,模型在这三个方向上大幅改进:
第一,漏掉危险信号。 一个人说"胸口偶尔刺痛,几秒就过去"。旧版本可能给一段可能病因列表,末尾礼貌地加一句"建议咨询医生"。但你想想——一个没医学背景的人看完病因列表,第一反应是什么?"我在里面挑一个最像的。"那句"建议咨询"太轻了,轻到可以被忽略。新版本被训练成先标危险门槛:刺痛是否伴随呼吸困难?持续多久?有无相关病史?然后再给行动方向。
第二,不追问背景。 一个人说"最近总觉得累、没精神"——够简短也够模糊。旧版本会直接列一串可能病因:贫血、甲减、抑郁、睡眠不足,像医学生背书。新版本的第一反应是反问:体重有变化吗?睡眠够不够?在吃什么药?这种追问不为缩小诊断范围,是在补上普通人描述症状时天然会漏掉的那部分信息。
第三,不会表达不确定。 症状信息不够时,旧版本倾向于给一个"最可能的解释"——听着专业,但把需要进一步检查的信号盖住了。新版本会明确说:根据当前信息无法排除X或Y,如果出现Z则优先考虑A,但文字无法确诊,需要检查。它把"我不知道"翻译成了"我还需要知道什么才能判断"。
这三件事跟诊断准确率没关系。它们是临床医学最基本的安全机制——追问病史、识别急症、承认不确定性。OpenAI修这三项,指向一个挺微妙的进步:模型在医疗里变得更可用,靠的是更尊重"自己不知道什么",而不是更敢下诊断。
以后问 AI 健康问题,盯这三关
OpenAI 修的这两关——追问、紧急分流——挑得不随便。至少在它这套评测最看重的"安全"维度里,一次健康问答最容易翻车的,就是信息没问全、和该提醒就医时没提醒。把这两件事交给一个不嫌你啰嗦、随时在线的 AI 守着,恰恰用在了刀刃上。

以后你拿AI问健康问题,不用纠结它给的病名靠不靠谱——说实话你知道的也不比它多。就看三样:
追问了吗? 在给你答案之前,它有没有先问你漏了什么?
劝医了吗? 它有没有告诉你什么情况下不能再等、必须去医院?
承认不确定了吗? 信息不够时,它有没有说"还需要确认",而不是塞给你一个看似确定的结论?
三条全过,这个回答才算可用。可用的理由很简单:它不会让你因为信息不全,就做错那个该不该去医院的决定。
别拿它替代医生
OpenAI发布当然有PR成分。那个71%的降幅(说清楚:是"被标出含事实问题的回复占比"下降,不是它一句话就少错了七成)、3500条回复盲评、每周2.3亿人用它问健康——数字很唬人。但真正值得带走的比标题小,也比标题实用。
AI在健康上最该扮演的角色,是在你对着症状列表一个人胡思乱想时,多帮你看一眼漏掉的危险信号——而不是替你拍板下结论。它能做的,是帮你看见自己忽略了什么。
下次身体不舒服、又拿不准要不要往医院跑,问问 ChatGPT 没坏处——但真出现剧烈胸痛、呼吸困难、意识模糊这类信号,别跟 AI 多费话,直接打 120。问它的时候也别问"我得了什么病",问这两句就够了:
“我漏掉了什么重要信息?”
“我该不该现在去看医生?”
