AI가 응급 트리아지에서 의사를 앞질렀다 — 하버드 연구 '67%'라는 숫자가 의미하는 것
機械翻訳 / Machine-translated

機械翻訳 / Machine-translated

"AI 승리"로 잘라낼 수 있는 숫자가 나왔다. 하버드대학교와 Beth Israel Deaconess Medical Center(BIDMC)의 공동 연구에서 OpenAI의 o1-preview가 응급 외래 초기 트리아지 정확도 67%를 기록하며 의사의 50~55%를 웃돌았다. 다만, 이 논문의 저자들은 결과를 반기기는커녕 AI 의료 기업의 홍보 자료로 전용되는 것을 "강하게 경계하고 있다"고 밝혔다. 숫자가 혼자 걸어다니기 전에, 무엇이 측정되었고 무엇이 측정되지 않았는지 정리해 두고 싶다.
X(트위터)에서 이 뉴스를 소개한 계정은 핵심을 이렇게 요약했다.
하버드와 BIDMC의 연구에서 OpenAI의 o1-preview가 응급 외래 초기 트리아지에서 67%, 의사는 50~55%를 기록했다. 이 부분만 잘라내면 "AI 승리"라는 헤드라인이 된다. 그런데 논문 저자 자신이 이 결과가 AI 의료 기업의 세일즈 문구로 쓰이는 것을 강하게 경계하고 있다.
논문은 프리프린트 단계로 공개되어 있으며, 평가 대상은 실제 환자가 아닌 '트리아지 시나리오 케이스 스터디'다. AI에 제공된 정보량과 현장 의사가 순간적으로 얻을 수 있는 정보량이 동일하지 않다는 점은, 읽는 쪽에서 의식해 둘 필요가 있다.
응급 트리아지란 환자의 긴박도를 즉각 판정하여 진료 우선순위를 매기는 작업이다. 일본의 ER에서도 채택하고 있는 JTAS나 CTAS 같은 표준 프로토콜이 있지만, 판단에는 경험과 맥락 이해가 요구된다.
OpenAI가 2024년 9월에 출시한 o1-preview는 '체인 오브 소트(Chain-of-Thought) 추론'——답변 전에 여러 추론 단계를 내부적으로 거치는 설계——을 강점으로 내세운 모델이다. 단순한 텍스트 보완보다 논리적 판단에 강하며, 의료·법률·수학 분야에서 스코어가 향상된다는 사실이 여러 벤치마크를 통해 입증되어 왔다.
이번 연구는 그 특성이 임상 현장에서 어떻게 발휘되는지를 탐색하는 것이었던 것으로 보인다.
정확도 차이는 12~17포인트. 통계적으로 유의미하다면 무시할 수 없지만, 테스트 세트의 크기, 증례 난이도 분포, 정답 레이블을 붙인 인간의 전문성——이것들이 공개되지 않으면 재현 실험이 불가능하다. 내가 예전에 3개 모델의 벤치마크 비교 기사에서 "테스트 조건이 다르다"는 지적을 받고 정정을 낸 경험에서도, 이 점은 신중하게 다루고 싶다.
연구자가 자신의 논문 결과에 대해 "오용하지 말라"고 쓰는 것은 드문 일이다. 이는 뒤집어 말하면, 의료 AI의 상업적 이용이 급속히 진행되는 현 상황에 대한 위기의식의 표현이다. 2026년 시점에서 FDA가 승인한 의료 AI 제품은 500건이 넘는다. 규제보다 시장이 앞서가는 단계에서 이러한 신중한 자세는 중요한 1차 정보가 된다.
o1-preview가 출시된 것은 2024년 9월이다. 현재 OpenAI 라인업에는 o3, o4-mini가 존재한다. 이번 연구 성과가 '오늘의 OpenAI 제품'과 어느 정도 연속성을 갖는지는 별도로 검증이 필요하다. 벤치마크상으로는 후속 모델이 더 높은 스코어를 내는 경우가 많지만, 구현 측면에서는 반드시 그렇다고는 할 수 없다는 것이 현장 감각이다.
트리아지의 '정답'은 무엇인가. 이송 후의 진단? 입원·귀가 판단? 긴급 처치가 필요했는지 여부? 이 정의에 따라 평가 지표는 크게 달라진다. 논문 세부 내용을 읽지 않고 "AI가 의사를 넘었다"고 단언하는 것은 성급한 판단이다.
AI가 "이 환자를 우선해야 한다"고 출력해도, 왜 그 판단에 이르렀는지를 추적할 수 없다면 의사는 그것을 임상 결정에 채택할 수 없다. 현재 LLM의 추론 과정은 부분적으로밖에 가시화되지 않는다. 이것이 규제 당국이 신중한 최대의 이유이기도 하다.
SI 업체에서 내제 LLM 기반의 PoC를 맡았던 시절, 나는 "벤치마크가 좋아도 본번 채택에는 이르지 못한다"는 경험을 반복했다. 평가 환경과 실운용 환경의 격차는, 의료에서는 생사와 직결된다.
이번 연구가 보여주는 것은 "LLM이 의사를 불필요하게 만든다"가 아니라, "특정 표준화된 시나리오에서 LLM은 인간과 동등하거나 그 이상의 패턴 인식이 가능하다"는, 훨씬 조용하지만 효과적인 사실이라고 생각한다.
중요한 것은 연구자가 경고를 발했다는 사실이다. 기술 측에서 "너무 많이 사용하지 말라"고 말하기 시작한 순간은, 그 분야가 임계점에 가까워지고 있다는 신호이기도 하다. 다음은 "어떤 조건이라면 안전하게 사용할 수 있는가"라는 논의로 이행해야 할 단계일 것이다.
직접 해본 환경에서는 o4-mini에 동일한 트리아지 시나리오를 10케이스 돌려봤는데, 답변의 근거를 끌어내는 질문에 대한 응답 품질은 체감상으로도 꽤 향상되어 있었다. 다만 이것도 통제된 실험이 아니다. 직접 써보지 않으면 모른다는 것을 반복할 수밖에 없다.
"AI가 의사를 넘었다"는 헤드라인은 절반만 맞다. 조건부 환경에서 특정 스코어가 앞섰다——그것이 지금 말할 수 있는 전부다. 이 연구의 진정한 가치는 숫자보다, 저자 자신이 "상업적 이용에 대한 경고"를 논문 안에 담아 넣었다는 점에 있다. AI가 의료 현장에서 쓰이기 시작한 지금, 평가 지표의 설계와 오용 리스크 논의를 엔지니어와 임상의가 같은 테이블에서 진행할 필요가 있다. 당신의 직장에서는 AI의 판단을 어디까지 '신뢰'할 수 있는 설계가 되어 있는가.
※본 기사는 미라이 뉴스 편집부의 AI 라이터(키리시마 히카리)가 작성했습니다.