OpenAI说,医生对其医疗AI进行了4,363次评价,99.1%的回复被认为是"安全"的。而独立研究告诉我们另一件事:在一项针对医疗分诊的研究中,AI对相当一部分本应接受急诊评估的病例判断不足。
这两个数字看起来矛盾,实际上并不矛盾。因为它们回答的是两个完全不同的问题。一个问题是:AI在特定医疗场景下,有多少回答没有被评价为危险。另一个问题是:当真正涉及高风险患者时,AI有没有把该识别的风险识别出来。
更值得关注的是,2026年9月,OpenAI开始把通用AI能力与美国主流电子病历基础设施连接起来。Epic已经进入这个故事,而GPT-6 Astra刚刚发布,这意味着一个过去还相对遥远的场景正在变得具体:一个拥有通用推理、长上下文和计算机操作能力的AI,开始能够接触真实医疗数据。
但这里必须划一条非常清楚的线:AI已经进入医院的数据层,不等于AI已经进入临床决策层,更不等于它已经获得了临床执行权。
这恰恰是GPT-6时代AI医疗最值得观察的变化。
GPT-6 Astra发布之后,最容易被关注的是模型能力本身。
更长的上下文、更强的推理、更强的计算机操作能力,以及更加成熟的Agent能力,都意味着它处理复杂任务的能力进一步提高。
具体到医疗基准:GPT-6 在 HealthBench Professional 上得分 63.4,上代是 60.5,提升 2.9 分(OpenAI 官方系统卡数据,尚无第三方独立复现)。
而 API 定价从上代促销价的 4/20(每百万 token),涨到 10/50——翻了 2.5 倍。涨 2.9 分,涨 2.5 倍价。分数的涨幅,配不上价格的涨幅。
这也是为什么"医学分数又涨了多少"不值得成为头条。
对于普通消费者来说,这可能意味着:AI可以完成更复杂的任务。
但对于医疗行业来说,意义完全不同。医疗工作本身就是一个高度复杂的连续任务。一个医生面对一个复杂患者,真正需要处理的并不是一个孤立的问题。
而是一条链:病历 → 检验 → 影像 → 用药 → 既往史 → 指南 → 文献 → 鉴别诊断 → 风险判断 → 治疗方案 → 病历记录 → 随访
过去的大模型通常只能在其中某个节点提供帮助。
它可以回答一个问题,可以总结一份病历,也可以生成一份医学文献综述。但Agent的出现,让问题开始发生变化:AI能不能把一个完整任务做完?这才是GPT-6对于医疗真正值得关注的地方。
这是一个非常重要的变化。过去的医疗AI大致是:医生提出问题 → AI回答 → 医生自己执行。
未来的医疗Agent可能变成:AI读取患者资料 → 检索医学知识 → 分析信息 → 形成建议 → 调用工具 → 起草结果 → 等待医生确认。
两者之间最大的区别,不是模型的医学知识多了多少。
而是:AI开始从信息工具变成工作流参与者。因此,未来AI医疗产品的竞争单位也可能发生变化。过去大家竞争的是谁的模型更准,然后变成谁的医疗应用更好。
下一阶段可能变成谁能够真正进入医疗工作流。这也是为什么Epic的意义比又一个医疗聊天机器人发布更加值得关注。
Epic,美国大型电子病历(EHR)系统,可以理解为美国医院核心临床信息系统之一,类似中国医院的“电子病历/CIS + HIS核心临床平台”。
患者的诊疗记录、检验结果、用药信息、专科文档以及长期医疗历史,都沉淀在这里。因此,AI真正进入医院,第一道门并不是"会不会诊断"。
而是:它能不能获得真实、连续、结构化的患者上下文?Epic的意义就在这里。OpenAI与Epic的连接,使AI开始进入真实医疗数据环境。
医生可以把授权患者的相关医疗信息纳入AI工作场景,用于病历回顾、信息总结、临床时间线构建等任务。
但这里有一个特别容易被媒体报道模糊的地方:Epic覆盖的患者数量,不等于GPT获得了这些患者数据的访问权限。实际能够访问什么数据,取决于具体医疗机构、患者授权、账户权限以及系统接口。因此,不能把"Epic覆盖数亿患者"写成"GPT现在可以读取数亿患者病历"。
这是两个完全不同的概念。更准确的理解是:OpenAI正在获得进入真实医疗数据基础设施的入口。这已经很重要。但还不是"AI医生"。
这里必须把两个数字放在一起看。OpenAI公布的一项医疗安全评估中,医生进行了4,363次评价,其中99.1%的回复被评价为安全。这个数字看起来非常高,但独立研究对消费级医疗AI的评估,发现了另一个问题。
2026年2月,《自然·医学》发表了西奈山团队的评估(评估对象为GPT-5.2时代的消费级产品):52%的金标准急诊病例,紧急程度被低估——该去急诊的,AI说不用去。同时,35%的非紧急情况被反向误判为急诊。
也就是说:AI可以在大量普通医疗问题上表现得相当安全,同时仍然可能在少数高风险病例上犯下严重错误。
这两件事情并不冲突,因为医疗安全从来不是一个简单的"正确率"。
假设一个AI回答100个普通问题,99个没有明显危险。我们不能因此推导:这个AI已经适合处理急诊风险。
因为医疗风险具有极强的不对称性。普通病例回答错一次,可能只是浪费几分钟。但一个真正需要急诊救治的患者,如果AI错误地告诉他"不需要急诊",后果可能完全不同。所以医疗AI真正需要测量的,不应该只有:"有多少答案看起来安全?"
还应该包括:是否漏掉高风险病例?是否错误降低患者的就诊紧急程度?是否产生危险建议?是否错误推荐药物?是否能够识别罕见但严重的疾病?在不确定时是否知道自己"不确定"?医生能否及时发现AI的错误?
因此,99.1%与52%并不是两个互相打脸的数字。它们真正告诉我们的是:医疗AI还缺少一套能够被行业普遍接受的、面向真实临床风险的独立评估体系。
谁定义"安全"?谁来验证"安全"?当AI的错误真正造成损害时,谁承担代价?这可能比模型下一次benchmark提高几分更加重要。
请把下面这句话记住:能读 ≠ 能写能检索 ≠ 能执行能建议 ≠ 能落地。
这是理解AI医疗下一阶段最重要的一组区别。目前的Epic集成仍然主要停留在数据访问和信息辅助层面。
AI可以帮助医生:读取患者信息➡️总结病历➡️构建时间线➡️检索医学知识➡️辅助形成判断。
但这与真正执行医疗动作还有很远,真正的权限可以进一步拆成:
Level 1:读取患者医疗信息。
Level 2:理解、总结、组织患者信息。
Level 3:提出诊断、检查、治疗或分诊建议。
Level 4:起草病历、医嘱、患者消息等。
Level 5:医生确认后执行。
Level 6:AI自主调用系统完成医疗动作。
每向前一步,风险都不是线性增加,尤其从:Level 3到Level 5是一次质变。因为前面AI只是在"说",到了后面,AI开始"做"。
今天很多AI医疗新闻都会说:"AI接入医院。"但这句话本身其实没有多少信息量。接入一个API,不意味着AI获得了临床权限。真正值得观察的是:AI到底获得了什么权限?它能够:看什么?写什么?建议什么?调用什么?谁批准?谁负责?有没有审计?
因此,未来AI进入医院很可能不是一个单一事件,而是一个逐级开放权限的过程:读取→总结→建议→起草→医生批准后执行→自主执行,这才是真正值得观察的"AI医院化进程"。
所以:AI进医院的标志应该是“它获得了哪一级临床权限”。
GPT-6的Agent能力带来了新的可能,也带来了新的安全问题。
传统聊天机器人最大的风险是“回答错了”。Agent的风险则可能变成“做错了”。这是完全不同的风险模型。一个普通模型告诉你错误信息,医生还可以判断。但一个拥有工具调用能力的Agent,如果同时拥有:患者数据访问权+外部信息访问权+计算机操作能力+系统操作权限。
那么风险就会变成:它是否可能被错误信息、恶意提示或系统环境诱导,执行错误动作?
有一个数字可以说明这件事的两面性:在独立安全测试机构 Gray Swan 的提示注入对抗测试中,GPT-6 的被攻击成功率从上代的 27% 降到了 8.5%,进步是真的,但 8.5% 不是零。
而在医疗场景,低概率 × 高后果 = 依然高风险。这也是为什么医疗Agent不能简单依靠"让AI解释自己"来解决安全问题。随着模型越来越复杂,传统的解释性和思维链监控可能越来越难以承担全部安全责任。
真正成熟的医疗Agent安全体系,最终可能需要依靠:权限控制+动作审计+来源追踪+人工确认+高风险动作拦截。
而不是寄希望于:"让AI自己解释为什么这么做。"医疗AI的安全机制,正在从解释模型逐渐转向控制系统。
长上下文同样容易被误读。如果模型能够处理非常长的上下文,很多人第一反应是:RAG是不是没用了?
我认为恰恰相反,医疗领域的问题从来不只是:"模型能不能装下这些资料?"而是:"这些资料应该不应该被它看到?"以及"它看到的到底是不是最新、正确、适用于这个患者的资料?"
医疗知识存在版本问题,指南会更新、药品说明书会变化、临床路径会调整、不同患者也可能对应不同的适用条件。因此,长上下文真正改变的可能不是RAG的存在,而是RAG的职责:从解决"模型装不下" 转向解决"模型应该看什么"。
这意味着未来医疗AI的数据基础设施会越来越重视:知识治理、来源控制、权限管理和证据可追溯。
以前:模型竞争“谁的模型更强”。
后来:应用竞争“谁的产品更好”。
现在:工作流竞争“谁真正进入医生的工作”
下一阶段:系统竞争“谁能把模型、数据、知识、工具、权限和责任连接起来”。
这也是为什么通用大模型进入医疗以后,真正受到冲击的可能不只是传统医疗AI公司。还包括:医疗信息化、临床决策支持、医疗文档、医学知识服务、医院数据平台、医疗Agent、部分单点AI应用。因为当基础模型能力越来越强以后,一个非常现实的问题会出现:如果通用模型可以完成这个功能,为什么医院还需要一个单独的AI产品?这会迫使医疗AI创业公司重新寻找真正的护城河。
即使GPT-6拥有更强的推理和Agent能力,也不能因此推导:GPT-6已经可以独立诊断。更不能推导:模型benchmark提高,就意味着患者结局改善。因为从模型能力到医疗价值,中间还有几道完全不同的门。
我把它概括成五道门:
第一扇门:模型能不能做到?
第二扇门:产品能不能真正做到?
第三扇门:医生愿不愿意用?
第四扇门:医生用了以后,医疗工作是否真的改善?
第五扇门:患者最终有没有因此获益?
GPT-6把第一扇门推得更远。Epic这样的连接,让第二扇门出现了入口。
但第三、第四、第五扇门,目前仍然需要大量真实世界证据。
这就是今天讨论GPT-6医疗能力时,最容易被忽略的地方。
是。但这里的"站到医院门口",不是说:AI已经成为医生。
而应该说,通用AI开始同时具备三个过去很难同时具备的条件:更强的通用推理能力+Agent式任务执行能力+真实医疗数据基础设施入口。
当这三件事情开始汇合,AI医疗的性质就发生了变化。
以前我们讨论的是:AI能不能回答医学问题?
现在更应该问:AI能不能理解一个患者?
再往前一步:AI能不能完成一项临床工作?
再往前一步:AI什么时候可以执行一项临床动作?
这才是真正的分水岭。
GPT-6不会因为发布,就在明天改变患者结局。Epic集成也不意味着AI已经接管医院。
目前真正确定的是:通用AI能力正在快速进入医疗数据和医疗工作流。
真正没有确定的是:它能否在真实临床环境中安全、可靠、持续地完成任务。
所以,接下来12个月真正值得关注的,不是下一张模型benchmark排行榜。而是四件事:
第一,独立临床验证。有没有第三方研究证明新一代模型真的改善了临床决策?
第二,真实工作流证据。医生使用AI以后,到底节省了多少时间?有没有增加新的错误?
第三,Agent安全。当AI从"回答"变成"操作",医院如何控制它的权限?
第四,监管边界。什么时候AI只是信息工具,什么时候开始成为需要承担更高监管要求的临床决策或执行系统?
这四件事,决定的不是GPT-6好不好用。而是AI究竟能够走进医院多深。
GPT-6已经站到医院门口,但医院真正要决定的,不是要不要开门。而是准备给它哪一把钥匙。而这把钥匙,最终不会由模型benchmark决定。它会由证据、监管、医生和患者共同决定。
二选一互动
如果你是三甲医院信息科主任,"AI连接病历"的方案摆上你的桌面,第一个决策是:
A. 先跑3个月独立临床验证,再定推广范围?
B. 先在行政科室试点Agent工作流,诊断辅助往后放?
本文为科技资讯,不构成医疗建议。
文中数据来源:OpenAI GPT-6 Astra 官方系统卡(2026-09-03);Mount Sinai 团队,《自然·医学》(2026-02);Gray Swan IPI Arena 独立测试。厂商自评数据均未经第三方独立复现。