영국 브리스톨대 연구진이 의료 현장에 쓰이는 AI의 신뢰성을 체계적으로 검증하는 ‘러닝 앙상블’ 프레임워크를 제안했다. 연구진은 의약품이 불확실한 작용에도 일정한 조건에서 안전하게 쓰이도록 관리되는 방식을 의료 AI 검증에 적용하자는 취지라고 설명했다. IT 전문 매체 더디코더는 9월 21일 브리스톨대 연구진의 제안을 보도했다.
의료 AI 검증에 의약품 기준 적용
러닝 앙상블은 의료 AI를 환자에게 사용하기 전에 개발자가 문서화하고 점검해야 할 세 가지 영역으로 구성된다. 의약품에는 용량과 투여 시점, 사용 대상 환자군 등 어떤 조건에서 효과가 나타나는지 정리한 정보 패키지가 따라붙는데, 연구진은 이와 비슷한 자료가 AI 시스템에도 필요하다고 봤다. 초기 시험에서 성능이 좋아 보여도 실제 병원에 배치하면 학습 데이터의 부수적 특징을 진단 근거로 삼아 실패하는 사례가 있기 때문이다.
첫 번째 영역은 시스템의 적용 범위와 한계다. 어떤 의사와 진료기관을 대상으로 하는지, 어떤 하드웨어에서 작동하는지, 어떤 환자 자료로 학습했는지를 확인해야 한다. 2021년 연구에서는 흉부 X선으로 코로나19 감염을 찾도록 설계된 AI가 폐의 질병 징후 대신 특정 진단과 우연히 연관된 이미지 속 부수 정보를 학습한 사례가 보고됐다. 이 시스템은 다른 병원에 배치되자 성능이 무너졌다. 평균 정확도만으로는 이런 문제를 확인하기 어렵다는 설명이다.
두 번째는 환자 집단별 신뢰성이다. 전체 환자를 합친 적중률이 높더라도 특정 집단에서 반복적으로 오진하면 의료용으로 적합하다고 보기 어렵다. 또 다른 2021년 연구에서는 X선 판독 AI가 의료 서비스에서 소외된 환자 집단의 질병을 찾아낼 가능성이 훨씬 낮은 것으로 나타났다. 연구진은 이런 시스템을 도입하면 이미 진료 접근성이 낮은 환자들이 더 큰 피해를 받을 수 있다고 지적했다.
기술적 성능과 임상 목적은 달라
세 번째 영역은 시스템이 애초에 의도한 임상 목적에 맞는지 여부다. 기술적으로 작동하는 AI라도 실제 진료에서 쓸모가 없을 수 있다. 한 시스템은 폐렴을 앓는 천식 환자의 사망 위험을 낮게 평가했다. 학습 자료에서는 이 환자들의 생존율이 높았지만, 이는 응급실에서 해당 환자들을 더 적극적으로 치료했기 때문이었다. 새로 온 환자의 위험도를 산정해 치료 우선순위를 정하는 분류 업무에서는 이 결과가 무용했다.
연구진은 이번 틀이 완성된 인증 제도가 아니라 개발자들이 문제를 조기에 발견하기 위한 공통 언어와 구조라고 설명했다. 실제로 신뢰할 수 있는 의료 AI를 만드는 과정에는 반복적인 시험과 수정, 해당 분야의 전문 지식, 외부 검토가 필요하다. 연구진은 이번 틀이 출발점이라고 봤다.