
[특별기고] 생성형 인공지능(AI)이 의료현장에 빠르게 들어오고 있다. 의료기관에서도 자체 챗봇 구축을 비롯해 거대언어모델 활용 등 다양한 시도가 이어지고 있다.
그러나 실제 도입을 검토하다 보면 기술 자체보다 먼저 해결해야 할 문제가 적지 않다.
어떤 모델을 선택할 것인가보다는 현재 업무가 어떻게 이뤄지고 있으며, 그 가운데 어떤 부분을 AI가 지원할 수 있는지를 먼저 파악할 필요가 있다.
서울대병원 강남센터는 이런 문제 의식을 바탕으로 한국건강관리협회 지원을 받아 건강검진센터 전체 업무 흐름과 생성형 AI에 대한 현장 실무진 요구를 분석했다.
이를 토대로 기관 자료를 활용한 검색증강생성(RAG) 기반 AI 프로토타입도 개발했다. 관련 연구는 최근 ‘Scientific Reports’에 게재됐다.
이번 연구 과정에서 핵심적으로 살펴본 것은 새로운 AI 모델의 성능이 아니라 생성형 AI를 실제 의료서비스 안에 적용하기 위해 어떤 준비가 필요한가 하는 점이었다.
건강검진센터는 예약과 사전 안내, 검사, 결과상담, 사후관리까지 여러 업무 과정에 의사, 간호사, 행정직원 등 다양한 직종이 관여하고, 반복적이면서도 기관별 지침에 크게 의존하는 업무가 많다.
실제 분석에서 예약상담 직원이 한 명의 고객 예약을 완료하기까지 약 330회 마우스 클릭이 필요했다.
접수와 수납 시에는 수진자 한 명당 약 170회 클릭이 소요됐으며 결과 상담에서는 의사가 약 100개 검사 항목을 종합, 수검자가 이해할 수 있도록 소견서를 작성하고 설명해야 했다.
이 과정에서 확인된 문제 중 하나는 업무에 필요한 지식이 여러 문서와 시스템에 분산돼 있다는 것이었다. 각 부서 지침과 매뉴얼이 종이나 개별 파일 형태로 관리돼 필요한 정보를 즉시 검색하고 활용하기 어려웠다.
따라서 생성형 AI를 도입하려는 의료기관에서는 이 부분을 먼저 정비해야 한다.
어떤 문서가 현재 유효한 지침인지, 누가 내용을 책임지는지, 언제 개정됐는지, 이전 버전을 어떻게 관리할 것인지가 불분명하다면 AI 역시 안정적인 답변을 하기 어렵다.
AI 도입, 진단보다 업무지원부터 적용 좋을 듯
의사, 간호사, 보건직, 행정직 등 341명을 대상으로 생성형 AI에 대한 요구도를 조사한 결과 가장 많이 제시된 활용 분야는 검사 전 안내와 준비사항 설명이었다.
검사결과 해석과 설명, 개인별 검진 항목 추천이 뒤를 이었다. 반면 진단이나 임상적인 의사결정을 직접 지원하는 기능에 대한 요구는 상대적으로 낮았다. 이는 생성형 AI 초기 도입 단계에서 어디부터 적용할 것인지에 대한 실질적인 시사점을 준다.
고도의 임상 판단을 맡기기보다는 검사 전(前) 안내 및 반복적인 설명, 내부 지식 검색, 표준화된 건강정보 제공처럼 적용 범위를 명확히 할 수 있는 업무부터 시작하는 것이 현실적이다.
강남센터에서는 건강검진 관련 내부 자료와 의료진이 검토한 건강정보 콘텐츠를 기반으로 RAG 기반 인공지능 모델을 구축했다. 건강정보 챗봇에는 의사, 간호사, 영양사, 운동상담사가 작성하거나 검토한 약 500개 자료가 활용됐다.
그러나 RAG를 적용한다고 정확성이 자동으로 확보되는 것은 아니다. 오래된 지침이나 서로 상충하는 내용이 포함돼 있다면 AI 역시 이를 활용할 수 있다.
따라서 문서마다 책임자를 두고 검토일과 버전을 관리하며, 더 이상 유효하지 않은 자료를 제거하는 과정이 필요하다. 때문에 의료기관 생성형 AI 구축은 정보기술 부서만의 사업으로 보기 어렵다.
임상 현장을 이해하는 의사와 간호사, 업무 담당자, 정보보안 및 전산 담당자가 함께 참여해야 하며, 특히 AI가 참고할 자료 내용과 적용 범위는 해당 분야 전문가가 책임지고 검토해야 한다.
생성형AI 도입 성패 가르는 ‘정확성·책임체계’
검진기관 직원들을 대상으로 생성형 AI 도입 시 예상되는 어려움과 우려를 물은 결과, AI 답변 정확성과 신뢰성에 대한 우려가 가장 많이 제기됐다. 이와 함께 사용자 수용성, 세대 간 디지털 격차, 개인정보 보호 사안도 주요 과제로 꼽혔다.
의료에서는 작은 정보 오류도 실제 진료 과정에 영향을 줄 수 있다. 따라서 현 단계에서 생성형 AI의 출력은 환자에게 바로 전달되는 최종 결과지보다는 검토가 필요한 정보나 초안으로 다루는 것이 적절하다.
어떤 자료를 근거로 답했는지 확인할 수 있어야 하고, 근거가 부족한 경우에는 담당자에게 연결할 수 있어야 한다. 사용 기록을 남기고 오류 사례를 점검하는 체계도 필요하다. 의료진 검증 과정을 포함한 인간 개입형(human-in-the-loop) 구조가 중요한 이유다.
앞으로 의료기관에서 생성형 AI를 평가할 때는 답변 질(質)을 비롯해 정보검색 시간이 줄었는지, 반복 업무가 감소했는지, 오류가 얼마나 발생하는지, 의료진 검증 부담이 늘지는 않는지 등을 함께 살펴야 한다.
생성형 AI 모델은 계속 바뀔 것이다. 반면 의료기관의 업무를 분석하고 내부 지식을 체계적으로 관리하며 검증과 책임 범위를 정하는 작업은 어떤 모델을 사용해도 필요하다.
이번 연구에서 제안한 핵심 역시 새로운 AI 기술 자체라기보다는 업무 흐름을 먼저 파악하고 현장요구를 확인한 뒤 기관의 검증된 지식을 기반으로 제한된 영역에서 AI를 적용하는 순서에 있다.
의료기관 생성형 AI 도입이 실제 성과로 이어지려면 최신기술을 얼마나 빨리 도입했는가보다 그 기술을 적용할 업무와 지식, 그리고 책임체계를 얼마나 충실하게 준비했는지가 더 중요하다.
?
?[] (AI) . .
.
, AI .
AI .
(RAG) AI . Scientific Reports .
AI AI .
, , , , , , .
330 .
170 100 , .
. .
AI .
, , , AI .
AI ,
, , , 341 AI .
, . . AI .
() , , .
RAG . , , , 500 .
RAG . AI .
, . AI .
, , , AI .
AI ''
AI , AI . , , .
. AI .
, . . (human-in-the-loop) .
AI () , , , .
AI . .
AI AI .
AI , .