메뉴 닫기

Efficient Use of Tiered KV Cache in Amazon SageMaker HyperPod

도입

클라우드 컴퓨팅의 발전과 함께, 대형 언어 모델(LLM)의 효율적인 활용을 위해 Amazon SageMaker HyperPod 기반의 계층화된 KV 캐시 시스템이 주목받고 있습니다. 본 글에서는 SageMaker HyperPod의 활용과 구현 방안을 중심으로 주요 내용을 살펴보겠습니다.

본문

대형 언어 모델을 대규모로 실행할 때 흔히 겪는 문제 중 하나는 커지는 KV 캐시를 수용하기 위한 고비용 GPU 인스턴스를 사용하거나, 같은 프롬프트가 반복될 때마다 재연산으로 인해 지연 시간이 발생하는 TTFT(Time to First Token)의 딜레마입니다. SageMaker HyperPod는 이러한 문제를 해결하기 위해 계층형 KV 캐시 구조를 도입했습니다.

첫 번째 계층(L0)은 GPU 메모리에 위치하여 신속한 데이터 접근을 가능하게 하고, 두 번째 계층(L1)은 CPU 메모리의 활용을 통해 데이터 손실을 방지합니다. 마지막 모듈인 세 번째 계층(L2)은 Curvine과 같은 경량 분산 캐시 파일 시스템을 통해 여러 포드에서 공유되는 NVMe 풀을 구성하여 확장성을 제공합니다.

계층형 KV 캐시 아키텍처 다이어그램

HyperPod Inference Operator의 지능형 라우팅을 통해 프롬프트가 이미 처리된 포드로의 라우팅을 최적화하여, 캐시 적중률을 최대화하고 불필요한 재연산을 방지하는 효율적인 워크로드 관리가 가능합니다. 실제로 벤치마킹 결과, Cross-Pod에서의 L2 캐시 재사용은 최대 2.7배의 TTFT 향상을 제공하였습니다.

결론

SageMaker HyperPod의 계층형 KV 캐시 아키텍처는 대형 언어 모델의 비용 효율적 운영을 가능하게 하며, 고유의 지능형 라우팅 기능을 통해 지연 시간을 최소화합니다. 이 구조는 고중복 프롬프트를 갖는 워크로드에 특히 효과적이며, 비용 절감과 성능 개선이라는 두 마리 토끼를 잡을 수 있는 해결책이 될 것입니다. 해당 아키텍처에 대한 자세한 구현 방법은 Amazon SageMaker 문서에서 확인하실 수 있습니다.

[1] https://aws.amazon.com/blogs/machine-learning/tiered-kv-cache-for-large-llms-on-amazon-sagemaker-hyperpod-with-curvine/

AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!

(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기


AI, Cloud 도입 상담 배너