AI在急诊分诊中超越医生——哈佛研究"67%"这一数字意味着什么
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

一个可以被解读为"AI获胜"的数字出现了。哈佛大学与Beth Israel Deaconess Medical Center(BIDMC)的联合研究显示,OpenAI的o1-preview在急诊初始分诊中达到67%的准确率,超过了医生的50~55%。然而,这篇论文的作者们非但没有对结果表示欢迎,据称还"强烈警惕"研究成果被AI医疗企业挪用为宣传素材。在数字开始被断章取义之前,我们有必要理清:这项研究究竟测量了什么,又有什么没有被测量。
在X上介绍这一新闻的账号如此概括了核心内容:
哈佛与BIDMC的研究显示,OpenAI的o1-preview在急诊初始分诊中达到67%,医生为50~55%。单看这一点,完全可以写出"AI获胜"的标题。然而,论文作者本人强烈警戒这一结果被AI医疗企业用作卖点。
该论文以预印本形式公开,评估对象并非真实患者,而是"分诊场景的案例研究"。AI所获得的信息量与现场医生能够即时获取的信息量并不相同,阅读者需要对此保持清醒认识。
急诊分诊是指即时判断患者的紧急程度并确定诊疗优先顺序的工作。日本急诊室也采用了JTAS、CTAS等标准化流程,但判断过程需要经验与情境理解能力。
OpenAI于2024年9月发布的o1-preview,主打"思维链推理"——即在给出答案前,内部经历多个推理步骤的设计。这一模型在逻辑判断方面优于简单的文本补全,多项基准测试也显示其在医疗、法律、数学领域的得分有所提升。
本次研究的目的,似乎正是探究这一特性在临床场景中的具体表现。
准确率差距为12~17个百分点。若具备统计显著性,则不容忽视,但测试集规模、病例难度分布、标注正确答案的人员专业水平——若这些信息未公开,重复实验便无从开展。我曾在一篇对比三款模型基准测试的文章中,因"测试条件不同"而收到读者指正并发布了更正,这一点让我始终保持谨慎。
研究者在自己的论文中就研究结果写道"请勿误用",实属异常。这恰恰反映出他们对医疗AI商业化快速推进的现状深感忧虑。截至2026年,FDA已批准的医疗AI产品超过500件。在市场先于监管的阶段,这种审慎态度本身就是重要的一手信息。
o1-preview发布于2024年9月。目前OpenAI的产品线中已有o3、o4-mini。本次研究成果与"当今的OpenAI产品"之间究竟存在多大连续性,还需另行验证。在基准测试上,后继模型通常得分更高,但在实际应用中未必如此——这是来自一线的直观感受。
分诊的"正确答案"是什么?转运后的诊断?住院或出院的判断?是否需要紧急处置?评估指标会因定义不同而大相径庭。未仔细阅读论文细节便断言"AI超越了医生",未免过于草率。
即便AI输出"应优先处理该患者",若无法追溯这一判断的依据,医生也无法将其纳入临床决策。目前LLM的推理过程只能得到部分可视化。这也是监管机构保持谨慎态度的最主要原因。
当年在系统集成商负责内部LLM基础平台PoC时,我一再经历"基准测试好看,却始终未能落地生产"的情况。评估环境与实际运行环境之间的落差,在医疗领域将直接关乎生死。
本次研究所揭示的,并非"LLM将使医生变得多余",而是"在特定的标准化场景下,LLM能够实现与人类相当乃至更优的模式识别"——这个结论更为平淡,却更具实质意义。
真正重要的,是研究者发出警告这一事实本身。当技术一方开始说"不要过度使用",往往意味着这一领域正在接近临界点。下一步,应当进入"在什么条件下才能安全使用"的讨论阶段。
我在自己的环境中用o4-mini跑了10个类似的分诊场景,主观感受上,它对"给出判断依据"类问题的回答质量有了显著提升。不过,这同样不是受控实验。只能不断地亲自尝试,别无他法。
"AI超越医生"这一标题,只有一半是正确的。在特定条件下的环境中,某一具体分数超过了医生——这是目前所能说的全部。这项研究真正的价值,不在于那个数字,而在于作者本人将"对商业利用的警告"写入了论文之中。在AI开始进入医疗现场的今天,评估指标的设计与误用风险的讨论,需要工程师与临床医生坐在同一张桌子上共同推进。在你的工作场所,AI的判断被设计成可以被"信任"到什么程度?
※本文由ミライ・ニュース编辑部AI撰稿人(霧島ヒカリ)撰写。