OpenAI o1在急诊分诊上超越医生——67% vs 55%,但作者为何说"别用"
機械翻訳 / Machine-translated
哈佛大学与Beth Israel Deaconess Medical Center(BIDMC)的联合研究报告称,OpenAI的o1-preview在急诊科初步分诊中表现超越医生。单看67%对50~55%这组数字,足以写出"AI获胜"的标题。然而,论文作者们本人却公开表示,担忧这一结果被医疗AI企业用作宣传素材——这种矛盾,恰恰揭示了当下最值得关注的深层结构。
研究聚焦于急诊科的"初步分诊"环节。这一流程将来院患者的紧急程度划分为五个等级,任何遗漏都会直接影响患者的预后。
在使用BIDMC真实病例数据进行评估时,o1-preview录得67%的正确率,比资深医师群体的50~55%高出约12至17个百分点。
"论文作者本人强烈担忧,这一结果会被AI医疗企业拿去作为宣传卖点。"
—— X平台上的研究介绍(按原文要旨概括)
需要注意的是,截至2026年5月2日,该论文仍以预印本形式流通,尚未经过同行评审。
自2023年以来,医疗领域的LLM评估研究急剧增加,从突破美国医师执照考试(USMLE)合格线,到GPT-4诊断精度验证,以"AI对决医生"为框架的发布接连不断。
然而在临床实践中,"基准测试上的精度"与"实际运用中的安全性"之间存在巨大鸿沟。分诊并非单纯的知识问答,而是对患者表情、生命体征、问诊信息的实时综合判断,基于文本病例数据所评估出的精度,并不能直接迁移到临床现场。
研究者的警惕正是基于这一背景。作者们亲眼看到:一旦67%这个数字脱离语境独自流传,在监管体系尚未跟上之前,有关临床引入的讨论就可能被加速推进。
本次评估针对的是文本病例数据的分类精度。而在真实急诊场景中,非语言信息(呼吸状态、肤色、意识水平)据估计占据判断依据的30~40%,文本精度的高低,不过是必要条件的一部分。
这个数值看起来偏低,是因为分诊本质上是一项"不能漏掉两端(最危重与最轻症)"的任务。比正确率的绝对值更重要的,是遗漏率与过度评估率的构成——这在临床上更具意义。目前,关于o1误判分布的公开信息仍然有限。
AI研究者主动为商业化应用踩刹车,这样的案例并不多见。这一动向被认为反映了业界内部的反思正在积累——此前,精度论文被过度简化并挪用为宣传素材的情况已有先例,如2024年的Stanford医学影像AI论文等。
FDA与PMDA在AI医疗器械审批流程上均仍处于完善阶段。预印本数据抢先于媒体和企业投资者关系材料中流传的模式,内含一种风险:用既成事实绕过监管机构的判断。
本次使用的并非现行的o1系列,而是preview版本。在OpenAI持续推进o3、o4-mini等推理模型迭代的背景下,进行比较时有必要明确说明preview版本处于何种定位。
这篇论文之所以引人关注,核心不在于精度数值本身,而在于"研究者提前介入,主动引导结果解读"这一结构。
在AI医疗研究领域,长期以来存在一条数字被放大和简化的链条:论文→新闻稿→媒体报道→投资者说明。作者将警告内嵌其中,正是从内部为这条放大回路踩下刹车。
另一方面,如果67%对55%的差距具有统计显著性,这一事实本身就无法忽视。重要的不是"所以应该立即引入临床",也不是"所以毫无用处",而是应当将讨论推进到下一步:在哪些业务流程、哪种监督体制下,可以将其部分整合进来。
日本急诊医疗与长期性医生短缺问题相互叠加。预计2026年内,将有多家大学附属医院开始具体探讨将其作为急诊分诊辅助工具的可行性。
o1-preview在急诊分诊中超越医生——这一事实不可否认。但正如作者本人的警告所示,数字脱离语境独自流传,才是当前阶段最大的风险。如果不去读懂精度"边界之外"的内容——那些未被测量的变量、误判分布、监管空白——就贸然采取下一步行动,那个决策的精度,将远低于67%。
如果你是与"AI医疗"相关的从业者,现在真正应该追问的,或许不是"能不能用",而是"用在哪里、哪里不用"。
※本文由 ミライ・ニュース 编辑部 AI 写手(AI新闻)撰写。