EXL, AWS 기반 지능형 문서 처리 파이프라인으로 의료 기록 검토 시간 단축
EXL이 AWS 인프라와 특화 거대언어모델을 결합한 의료 지능형 문서 처리 파이프라인을 구축해 건당 100분 이상 걸리던 의료 기록 검토 시간을 대폭 단축했다.
핵심 요약
- AWS 기반 파이프라인으로 수일 걸리던 의료 기록 검토를 수 시간으로 단축했다.
- 서식 무관 IDP와 9년 치 데이터를 학습한 특화 언어모델을 결합했다.
- 0~100 신뢰도 점수와 근거 추적 기능을 도입해 사람 검토자와 협업하도록 설계했다.
- 1문서 수집 및 분류
- 2특화 데이터 추출
- 3참조 DB 검증
- 4요약 및 질의응답
- 5정형 결과물 전달
의료 검토의 자동화 전환
보험금 지급 심사와 생명보험 언더라이팅 분야에서 의료 기록은 모든 의사결정의 핵심 근거로 쓰인다. 심사 담당자는 수백 쪽에 이르는 문서를 직접 확인하느라 건당 100분 이상의 시간을 수작업 검토에 투입해 왔다. 디지털 솔루션 제공업체인 EXL은 아마존웹서비스(AWS) 인프라를 활용하여 의료 기록 처리 시간을 수일에서 수 시간 단위로 단축하는 의료 지능형 문서 처리(IDP) 파이프라인을 구축했다.
이번 파이프라인은 서식에 얽매이지 않고 문서를 수집·분류·추출하는 엑스트랙토(Xtrakto.AI)와 보험·의료 도메인 전용 거대언어모델인 EXL 인슈어런스 LLM을 하나로 결합했다. 두 애플리케이션의 유기적인 연동을 통해 비정형 의료 문서에서 필요한 정보를 정형 데이터로 변환하고 요약과 질의응답까지 지원한다.
의료 문서 복잡성과 도입 배경
의료 기록 심사는 단순한 문서 분량 문제를 넘어 고도의 전문성을 요구한다. 카이로프랙틱 진료 기록, 응급실 방문 내역, 수술 기록, 정신과 소견서, 검사 결과, 제3자 의료 감정서 등 수십 종의 다양한 서식이 섞여 있으며 전문 임상 용어가 다수 포함되어 있다. 또한 환자의 상태 변화에 따라 흩어져 있는 데이터 간의 인과관계를 종합적으로 해석해야 한다.
기존의 수작업 방식은 심사자 개인의 해석 차이로 인해 일관성이 떨어지거나 처리 지연이 잦았고, 배상 비용 증가와 규제 준수 문제로 이어지는 한계가 있었다. EXL은 이러한 병목을 해결하기 위해 도메인 지식을 갖춘 인공지능 파이프라인으로 대규모 문서 분석을 보조하는 체계를 기획했다.
도메인 특화 언어모델 학습
일반적인 범용 대형 언어모델은 보험 청구 태깅, 손해액 산정 형식, 합의 지침 생성 등에 필요한 세부 도메인 추론 능력이 부족하다. EXL은 9년 치 보험금 청구 데이터에서 추출한 정형 레코드와 비정형 의료 문서 13,500여 건을 정제해 아마존 세이지메이커 AI 환경에서 전용 모델을 미세조정했다. 데이터 준비 과정에서는 광학문자인식(OCR)으로 단어 및 줄 단위 위치 정보를 보존하고 불량 페이지 제거와 미국 의료정보보호법(HIPAA) 기준 비식별화 처리를 거쳤다.
학습 비용을 절감하면서도 성능을 유지하기 위해 저순위 적응(LoRA) 기반의 매개변수 효율적 미세조정(PEFT) 방식을 적용했다. 엔비디아 GPU 기반 다중 인스턴스와 엔비디아 네모(NeMo) 프레임워크를 사용해 데이터 및 모델 병렬 처리를 수행했으며, 실험 환경을 운영 환경과 완전히 분리해 안정성을 확보했다. 블라인드 평가 결과 해당 모델은 태깅, 요약, 추론 등 전반적인 청구 워크플로 작업에서 우수한 성능 지표를 기록했다.
7단계 지능형 처리 흐름
전체 시스템은 AWS 지역(Region) 내에서 11개 아키텍처 단계와 7개 처리 단계로 구동된다. 수집 단계에서는 아마존 API 게이트웨이와 코그니토를 거쳐 AWS 스텝 펑션스가 오케스트레이션을 맡으며, 람다와 아파치 티카를 통해 입력 문서를 분류하고 분할한다. 사전 정의된 서식이 없어도 문맥 기반으로 새 문서 유형을 분류할 수 있도록 지원한다.
추출 단계에서는 문서의 25~30%를 차지하는 필기체와 저화질 스캔 이미지를 처리하기 위해 컴퓨터 비전 모델(CNN, RCNN)을 활용한다. 구조화된 필기부터 자유 양식의 의사 소견서까지 다양한 형태를 인식하며, 고난도 비정형 문서는 랭그래프(LangGraph) 기반 에이전트 워크플로를 통해 단계별 질의와 추론을 진행한다. 추출된 모든 필드에는 0부터 100까지의 신뢰도 점수가 부여된다.
이후 다이나모DB 및 관계형 데이터베이스 서비스(RDS)에 저장된 국제질병분류(ICD-10)와 처치 코드(CPT), 미국 공통시술용어(HCPCS) 참조 데이터를 대조해 검증을 거친다. 정제된 데이터를 바탕으로 세이지메이커 AI의 전용 언어모델이 작업 목적에 맞춰 단문, 중문, 장문 형태의 요약을 생성하고 사전 정의 FAQ, 묶음 질문, 자연어 자유 질의 기능을 제공한다. 결과물은 PDF 리포트나 연대기형 차트, JSON, XML, CSV 등 정형 파일로 출력된다.
신뢰성 확보와 적용 효과
민감한 의료 정보를 다루는 만큼 생성 결과물의 환각을 방지하고 규제 준수를 보장하기 위한 안전장치가 마련되었다. 모든 생성 요약과 질의응답 답변은 원본 문서의 정확한 위치로 연결되는 근거 추적 링크를 제공한다. 신뢰도 기준치에 미달하는 항목은 전용 화면을 통해 사람 검토자에게 전달되며, 사용자가 수정한 내역은 다시 모델 개선 데이터로 환류되는 사람 참여형(Human-in-the-loop) 구조를 유지한다.
이 파이프라인을 도입한 대형 의료 보험사는 간호사와 케어 코디네이터가 전자의무기록(EHR)과 청구 시스템을 오가며 건당 100분 이상 소모하던 임상 요약 작업 시간을 크게 줄였다. 인력 증원 없이도 사건 처리 용량이 늘어나고 환자 대상 조기 상담 및 관리가 가능해졌다. 다만 본 파이프라인은 사람의 임상적 판단을 완전히 대체하는 것이 아니며, 신뢰도 기준 미달 건에 대한 전문 인력의 수작업 검토와 참조 코드 데이터베이스의 지속적인 업데이트가 병행되어야 한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
AWS Machine Learning Blog · Anutosh
Reducing medical claims review time with AI on AWS: The EXL Medical IDP solution
원문 발행: 2026-09-22 01:24:40
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 클라우드플레어 레이더, 사용자 경험 개선 위한 재설계 단행 · Cloudflare Blog · 2026-10-08
- 앤스로픽 클로드 하이쿠 5.5, AWS에서 정식 출시 · AWS Machine Learning Blog · 2026-10-08
- 클라우드플레어, 증거 기반 다중 AI 에이전트 보안 운영 하네스 공개 · Cloudflare Blog · 2026-10-08
- 쿠버네티스 cgroup v2 전환 본격화와 v1 지원 중단 일정 · Kubernetes Blog · 2026-10-07
- DNS 루트 KSK 롤오버 예정과 리졸버 신뢰 앵커 확인 방안 · Cloudflare Blog · 2026-10-07
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.