아마존 페이먼츠, 문맥적 밴딧과 세이지메이커로 전환 퍼널 최적화
아마존 페이먼츠가 아마존 세이지메이커 AI 환경에서 다중 목표 선형 상한 신뢰 구간 밴딧을 활용해 고객 획득 퍼널 전반의 전환율을 개선한 사례를 공개했다.
핵심 요약
- 신청 시작·제출·승인 단계를 가중치로 묶어 퍼널 시소 현상을 방지했다.
- 행동 신호 벡터 기반 선형 밴딧으로 방문자별 최적 콘텐츠를 선택한다.
- 주간 배치 작업으로 모델을 갱신하고 키-값 저장소로 지연 없이 제공한다.
- 7주간의 온라인 검정에서 한 집단은 최종 전환율 한 자릿수 후반 상승을 달성했다.
- 1세션 반응 데이터 수집
- 2주간 배치 모델 갱신
- 3고객별 추천 조합 사전 계산
- 4키-값 저장소 기반 페이지 제공
퍼널 전반을 묶는 다중 목표 밴딧
아마존 페이먼츠가 고객 획득 퍼널 전반의 전환율을 개선하기 위해 아마존 세이지메이커 AI 기반의 다중 목표 문맥적 다중 팔 밴딧을 도입한 결과를 공개했다. 생성형 인공지능 기술의 발전으로 개인화된 마케팅 콘텐츠 제작 비용은 크게 낮아졌으나 늘어난 선택지 중 개별 고객에게 어떤 조합을 노출할지 결정하는 선택 문제가 새로운 과제로 떠올랐다. 운영진은 단일 지표만을 최적화할 때 발생하는 상충 문제를 해결하기 위해 신청 시작, 신청 제출, 최종 승인의 3단계를 동시에 평가하는 다중 목표 구조를 설계했다.
7주 동안 진행된 온라인 비교 평가에서 한 고객 집단은 최종 퍼널 전환율에서 한 자릿수 후반대의 상대적 상승률을 기록했다. 반면 다른 고객 집단에서는 기존 정적 페이지 대비 개선이 나타나지 않았으며 최종 승인 단계에서 유의미한 지표 하락이 관찰되기도 했다. 분석 결과 이는 알고리즘의 결함이 아니라 해당 고객 집단에 적합한 후보 콘텐츠 풀이 부족했던 데서 비롯된 한계로 확인됐다.
선형 모델 기반 문맥 개인화 원리
문맥적 밴딧은 모든 방문자에게 단일 최적안을 찾는 고전적 방식과 달리 방문자의 특성 정보를 바탕으로 결정을 내린다. 아마존 페이먼츠는 결제 행동 및 거래 구성과 같은 행동 신호를 수치 특성 벡터로 변환해 모델 입력으로 사용했다. 고객 식별자는 모델 연산에 반영되지 않으며 최종 계산된 추천 결과를 사용자에게 전달하는 경로 지정 용도로만 쓰인다.
알고리즘으로는 2010년 발표된 선형 상한 신뢰 구간 기법을 선택했다. 이 방식은 방문자 특성과 예상 보상 사이의 선형 관계를 가정해 연산 효율성이 높고 무작위성이 배제된 결정론적 선택 규칙을 제공해 의사결정 추적과 재현이 용이하다. 각 팔은 보상 벡터와 경험 행렬을 기록하며 탐색과 활용의 균형을 조절하는 탐색 계수는 통상 0.1에서 2.0 범위에서 조정된다. 기본값으로는 1.0이 권장되며 후보 수가 많을 때는 값을 높여 탐색을 유도하고 데이터가 누적되면 값을 낮춰 활용을 극대화한다.
시소 현상 극복과 지연 보상 처리
전환 여정은 신청 시작, 제출, 승인의 세 단계로 구성되며 초기 단계에 최적화된 콘텐츠는 유입을 늘리지만 자격에 맞지 않는 고객을 모아 최종 승인율을 떨어뜨릴 수 있다. 반대로 승인 지표에만 집중하면 결과 도달 빈도가 낮아 학습 신호가 부족해진다. 운영진은 이를 시소 문제로 정의하고 세 단계 각각에 독립적인 모델을 할당한 뒤 각 단계의 점수를 선형 결합해 최종 팔을 선택하는 방식을 적용했다.
실제 환경에서는 신청과 제출이 즉시 확인되는 반면 승인 여부는 수일의 시차를 두고 결정된다. 이로 인한 편향을 방지하기 위해 귀속 창 방식을 도입해 시작과 제출 반응은 즉각 수렴하고 최종 승인 결과는 후속 배치 주기에 반영하도록 설계했다. 배포 전 시뮬레이션 검증에서 단일 단계만 최적화한 정책은 다른 단계에서 음의 지표를 보였으나 다중 목표 방식만이 전 단계에서 비음수 성과를 유지했다.
조합 폭발 제어와 배치 운영 구조
노출 후보 콘텐츠는 업종 테마 이미지와 혜택 중심 문구라는 두 종류의 구성 요소로 분해해 관리했다. 전체 콘텐츠 조합을 일일이 검토하는 대신 개별 구성 요소만을 사전에 검증하고 이들의 곱집합으로 팔 공간을 구성해 규정 준수와 확장성을 동시에 확보했다. 사전에 승인된 색상과 레이아웃 등 디자인 시스템을 결합해 시각적 일관성도 유지했다.
시스템 아키텍처는 실시간 추론 대신 주간 배치 구조를 채택했다. 고객 반응이 수일 단위로 누적되고 방문자 성향이 실시간으로 급변하지 않는다는 점에 착안한 설계다. 주간 단위로 실행되는 처리 작업은 객체 스토리지에서 과거 데이터를 읽어 모델을 점진 갱신하고 고객별 추천 결과를 저지연 키-값 저장소에 기록한다. 실제 서비스 요청이 발생하면 저장소 조회만으로 페이지를 구성하므로 실시간 연산 부하가 발생하지 않는다.
배포 교훈과 적용 시 주의점
시스템 운영 과정에서 이질적인 고객 집단이 섞여 있을 경우 단일 모델을 공유하면 표본이 큰 집단에 학습이 편향되므로 집단별로 독립된 모델을 분리 훈련해야 한다는 점이 확인됐다. 또한 신규 모델이 기존 기준선을 밑돌지 않도록 정적 기본 화면을 하나의 팔 후보로 포함하거나 추천 정보가 없는 사용자에게 기본 화면을 보여주는 예외 처리 장치를 마련해 위험을 방어했다.
선형 가중치 벡터는 추가 도구 없이도 어떤 고객 신호가 특정 이미지나 문구에 긍정적으로 작용했는지 직접적인 해석을 제공한다. 한편 오프라인 정책 검증은 무작위 할당 대비 성능을 가늠하는 초기 지표일 뿐이며 기존 서비스 대비 우수성은 실제 온라인 비교 검정을 통해서만 검증될 수 있다. 다양한 후보를 충분히 탐색하고도 대조군을 넘지 못한다면 알고리즘 튜닝이 아니라 후보 콘텐츠 풀 자체를 점검하고 확장해야 한다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
AWS Machine Learning Blog · Chidi Prince John
Uplifting conversion across the acquisition funnel with personalization using contextual bandits on AWS
원문 발행: 2026-10-02 01:51:04
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- 클라우드플레어 레이더, 사용자 경험 개선 위한 재설계 단행 · Cloudflare Blog · 2026-10-08
- 앤스로픽 클로드 하이쿠 5.5, AWS에서 정식 출시 · AWS Machine Learning Blog · 2026-10-08
- 클라우드플레어, 증거 기반 다중 AI 에이전트 보안 운영 하네스 공개 · Cloudflare Blog · 2026-10-08
- 쿠버네티스 cgroup v2 전환 본격화와 v1 지원 중단 일정 · Kubernetes Blog · 2026-10-07
- DNS 루트 KSK 롤오버 예정과 리졸버 신뢰 앵커 확인 방안 · Cloudflare Blog · 2026-10-07
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.