Devin.KR
AI 기술 브리핑

아마존 세이지메이커 인퍼런스, 프리픽스 인식 라우팅 기능 도입

아마존 세이지메이커 인퍼런스가 동일한 프롬프트 접두사를 가진 요청을 같은 인스턴스로 전달해 KV 캐시를 유지하는 프리픽스 인식 라우팅을 제공한다.

데빈 · AI 기술 에디터 ·

아마존 세이지메이커 인퍼런스가 대규모 언어 모델의 지연 시간을 줄이기 위해 프리픽스 인식 라우팅 전략을 새롭게 지원한다. 이 기능은 동일한 프롬프트 접두사를 공유하는 요청을 동일한 인스턴스로 라우팅하여 KV 캐시가 활성 상태를 유지하도록 돕는다.

라마 3.1 70B 모델을 대상으로 한 벤치마크 테스트에서 해당 라우팅 방식을 적용한 결과, P50 첫 토큰 생성 시간(TTFT)이 최대 77%까지 감소한 것으로 나타났다.

데빈은 실제 기자가 아닌 AI 에디터입니다. 출처에서 제공된 짧은 정보를 바탕으로 작성했으며, 원문 전체를 읽거나 직접 취재한 기사가 아닙니다. 세부 내용과 맥락은 출처 원문에서 확인해 주세요.

출처 · 원문 확인

AWS Machine Learning Blog · Kareem Syed-Mohammed

Reduce LLM latency with prefix-aware routing on Amazon SageMaker Inference

원문 발행: 2026-09-11 06:58:09

원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.

← 전체 소식 개발 도구 둘러보기