메뉴 닫기

AWS SageMaker 인퍼런스의 프리픽스 인식 라우팅을 통한 LLM 지연 시간 감소

AWS SageMaker 인퍼런스의 프리픽스 인식 라우팅을 통한 LLM 지연 시간 감소

Amazon SageMaker 인퍼런스에서는 대규모 언어 모델(LLM)을 활용한 애플리케이션 개발 시 중요한 성능 최적화를 제안합니다. 이 블로그에서는 Amazon SageMaker의 프리픽스 인식 라우팅(prefix-aware routing)을 통한 LLM의 지연 시간 감소 방법을 중심으로, 기술적 활용 및 성능 개선 사례를 살펴보겠습니다.

주요 내용

LLM을 기반으로 애플리케이션을 구축할 때, 보통 프롬프트에는 두 가지 부분이 포함됩니다. 고정된 컨텍스트 부분(지침, 참조 문서, 대화 기록)과 가변적인 사용자 입력 부분입니다. 그러나 여러 요청에서 동일한 고정 컨텍스트 부분은 계속해서 처리되어야 하며, 이는 모델의 지연 시간을 증가시킵니다.

이 문제를 해결하기 위해 Amazon SageMaker는 프리픽스 인식 라우팅이라는 새로운 전략을 제공합니다. 이 전략은 각 요청의 시작 부분을 분석하여 동일한 시작을 가진 요청을 일정한 인스턴스로 라우팅합니다. 이를 통해 해당 인스턴스의 캐시는 지속적으로 쌓이며 효율적으로 재사용됩니다. AWS re:Invent 등록 이미지

사례 분석

Amazon Llama 3.1 70B 모델을 사용한 벤치마크 테스트 결과, 프리픽스 인식 라우팅을 통해 P50 지연 시간을 최대 77%까지 줄이고, 처리량을 최대 16%까지 증대시킬 수 있었습니다. 이러한 성능 개선은 특히 긴 컨텍스트 작업에서 두드러지게 나타났습니다. 이는 프리픽스에서 필요한 연산량을 캐시 재사용을 통해 크게 줄일 수 있기 때문입니다.

결론

프리픽스 인식 라우팅은 대규모 언어 모델을 활용한 워크로드에서 특히 효과적인 솔루션으로, 모델 서비스의 효율성과 응답 속도를 크게 향상시킵니다. Amazon SageMaker 사용자는 이제 업데이트된 AWS SDK 또는 CLI를 통해 이 기능을 쉽게 활성화하고 사용해 볼 수 있습니다.

[1] https://aws.amazon.com/blogs/machine-learning/reduce-llm-latency-with-prefix-aware-routing-on-amazon-sagemaker-inference/

AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!

(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기


AI, Cloud 도입 상담 배너