심장전문의가 없는 지역의 환자에게 밤중에도 답하는 의료 AI는 매력적이다. 미국 보건고등연구계획국 ARPA-H는 이번 주 심부전 환자를 24시간 지원할 임상 AI를 만드는 ADVOCATE 수행팀을 발표했다. 미국 카운티의 거의 절반에 심장전문의가 없다는 것이 출발점이다. 의료진을 기다리는 시간에 AI가 환자의 상태를 살피고 필요한 때 사람에게 연결한다면, 방문 사이에 벌어지는 돌봄의 공백을 줄일 수도 있다.
하지만 접속할 수 있는 시간이 늘었다는 사실과 더 나은 치료를 받았다는 사실은 다르다. 잘못된 안심은 진료를 늦출 수 있고, 지나친 경고는 부족한 의료진에게 업무를 더할 수 있다. 공공기관이 이 차이를 확인하기 전에 서비스 개시나 가입자 수를 성과로 발표한다면, 기술의 약속이 환자의 이익을 앞질러 버린다.
이번 주의 핵심은 AI 진료를 허용할지 금지할지의 양자택일이 아니다. 의료기관과 공공 구매자는 어떤 환자 결과가 나와야 임상 AI를 확대할지 먼저 정해야 한다. ADVOCATE는 그 답을 이미 얻은 사업이 아니라, 답을 얻기 위해 비교군과 감독 체계를 설계하기 시작한 사업이다.
1. 진료의 공백은 화면을 열었다고 메워지지 않는다
ARPA-H는 첫해 최대 3,370만 달러, 4년간 최대 6,270만 달러를 들여 환자 대면 AI, 이를 감시하는 AI, 의료기관 배치 전략을 별도 팀에 맡겼다. Atman Health, Tempus AI, Updoc이 심부전 환자와 상호작용하는 시스템을 만들고, Stanford가 위험한 권고와 예상 밖 행동을 감지할 감독 계층을 개발한다. Duke와 Kaiser Permanente는 실제 의료체계에 넣어 시험한다. 24개월 안에 FDA 허가 신청 패키지를 제출한다는 목표도 있다.
이 설계는 막연한 ‘AI 의사’ 발표보다 구체적이다. 특히 Updoc은 대화 능력과 임상 권한을 분리해 제안된 행동을 임상의가 만든 규칙에 대조하겠다고 한다. Stanford의 감독 AI도 환자에게 나간 권고를 따로 살피도록 설계됐다. 그러나 설계의 세밀함은 안전성이 입증됐다는 뜻이 아니다. 허가 신청은 허가가 아니고, 감독 AI의 존재는 놓친 위험 신호가 없다는 증거도 아니다.
환자가 실제로 겪는 문제는 의사와 통화하기 어려운 밤에 증상이 악화되었을 때 시작된다. AI가 이를 정확히 가려내는지, 사람에게 넘긴 뒤 의료진이 제때 대응할 수 있는지, 과잉 경고가 진료체계를 마비시키지 않는지를 봐야 한다. 24시간 응답률은 이 질문들에 대한 답이 아니다. 농촌과 저소득 지역에서 서비스가 작동한다는 주장도 그 지역의 통신, 언어, 진료 인력, 후속 치료 경로를 함께 살펴야 비로소 성립한다.
2. 비교 상대는 ‘아무것도 하지 않기’가 아니다
Kaiser Permanente는 기존 진료기록으로 후보 시스템을 먼저 시험하고, 의료진의 감독 아래 업무 흐름에 통합한 뒤 파일럿과 무작위 비교를 진행하겠다고 밝혔다. 계획된 대상은 약 2,500명이다. 절반은 AI가 치료 결정에 도움을 주고, 나머지는 기존 의사결정 도구를 활용한 일상 진료를 받는다. 물어야 할 것은 AI가 그럴듯한 답을 내는가가 아니라 이미 제공되는 치료에 추가로 무엇을 개선하는가다.
이 비교는 중요한 방향 전환이다. 의료 AI 홍보는 흔히 ‘전문의가 없는 곳에도 서비스가 열린다’고 말한다. 그러나 환자의 입장에서는 표준 진료보다 입원이나 증상 악화가 줄었는지, 적절한 약물 조정이 빨라졌는지, 위험한 권고와 불필요한 진료가 늘지 않았는지가 중요하다. 어느 항목을 1차 결과로 삼고 얼마나 오래 관찰할지에 따라 같은 시스템의 평가도 달라진다. 이번 주 공개 자료에서는 상세 프로토콜과 주요 평가변수가 충분히 확인되지 않았다.
무작위 배정 자체가 모든 문제를 해결하지도 않는다. 한 의료체계의 잘 정리된 전자의무기록과 심장전문의 감독 아래서 얻은 결과를 인력과 통신 여건이 다른 지역에 그대로 옮길 수는 없다. 반대로 한 지역에서 효과가 작았다는 이유만으로 모든 환자 집단의 가능성을 닫을 수도 없다. 비교시험은 보급을 위한 홍보 문구가 아니라, 누구에게 어떤 조건에서 이득과 위해가 생겼는지 가르는 출발점이어야 한다.
3. 확대 결정에는 현장의 한계도 포함돼야 한다
Duke는 다섯 의료체계와 농촌 현장에서 서로 다른 전자의무기록 환경에 ADVOCATE를 연결해 검증할 계획이다. Kaiser는 21개 의료센터와 260곳이 넘는 클리닉에서 배치 청사진을 만들겠다고 한다. 이처럼 다양한 현장에서 시험하겠다는 계획은 장점이지만, 아직 어느 현장에서 어떤 결과가 나왔다는 발표는 아니다. ARPA-H가 별도의 외부 평가 파트너로 Johns Hopkins University Applied Physics Laboratory를 계약한 이유도 기술 성능과 임상 결과를 독립적으로 확인하기 위해서다.
따라서 확대 여부를 판단할 때 환자 수만 세어서는 안 된다. 의사에게 올려야 할 경고가 실제로 전달되는 비율과 대응 시간, 환자의 치료 결과, 의료진의 추가 업무, 기록이 부족한 환자에게서의 오류를 함께 봐야 한다. 평균 효과가 좋더라도 전문의가 드문 지역에서 후속 치료를 받을 수 없다면 접근성 격차는 그대로다. 지금은 이런 항목들의 측정 결과가 공개되지 않았으므로 ‘접근성을 개선했다’고 결론 내릴 수 없다.
이 기준은 국제개발협력에서도 중요하다. 전문의가 부족한 나라에 앱을 공급하는 것은 빠르지만, AI가 상향 전달한 환자를 실제로 누가 볼지, 약과 검사를 어떻게 연결할지, 비용을 누가 낼지에 따라 건강 효과는 달라진다. 현지 의료기관의 인력과 후속 치료가 빠진 시범사업을 성공 사례로 세어서는 안 된다. 미국의 통합 의료체계에서 얻은 성과조차 현지 조건에 맞춰 다시 검증해야 한다. 기술 이전의 첫 지표는 설치 대수가 아니라 치료를 받은 환자의 상태다.
결론
ADVOCATE의 가장 중요한 소식은 임상 AI가 곧 의사를 대신한다는 예고가 아니다. 정부와 의료기관이 대면 AI, 별도의 감독, 실제 진료체계 배치, 표준 진료와의 비교를 한 사업에 묶었다는 사실이다. 그만큼 아직 답하지 못한 질문도 분명해졌다. 환자에게 치료상의 추가 이득이 있는가. 위험한 권고는 얼마나 자주, 누구에게 나타나는가. 전문의가 드문 곳에서도 그 이득이 유지되는가.
답이 나오기 전까지는 ‘언제나 접속할 수 있다’를 ‘언제나 돌봄을 받는다’로 번역해서는 안 된다. 시범사업의 규모를 키우는 결정과 치료 효과가 확인됐다는 판단을 분리해야 한다. 좋은 결과가 나오면 어떤 환자와 지역에 먼저 확대할지 정할 수 있다. 효과가 없거나 위해가 크면 더 많은 앱을 배포하는 대신 진료 경로를 바꿔야 한다.
AI가 공공서비스에 들어올수록 발표와 설치는 쉬운 성과가 된다. 이번 주 임상 AI 실험은 그 쉬운 성과를 잠시 유보하고, 기존 치료와 비교해 환자에게 실제로 무엇이 달라지는지 묻는다. 의료 접근성의 약속을 지키려면 그 질문에 답하기 전의 확산을 성공으로 부르지 않는 절제가 필요하다.