아마존 세이지메이커 하이퍼팟의 모델 캐싱 도입으로 추론 콜드 스타트 문제 해결하기
아마존 세이지메이커 하이퍼팟에서 인퍼런스를 위해 대형 언어 모델(LLM)을 배포할 때, 초기 요청 접수 시와 실제로 작업에 응답 가능해지는 시점 간의 간격이 발생합니다. 이는 주로 아마존 엘라스틱 컨테이너 레지스트리(ECR)로부터의 인퍼런스 서버 컨테이너 이미지 다운로드와, 아마존 S3나 Amazon FSx와 같은 저장소에서 모델 가중치를 다운로드하는 두 가지 단계에서 비롯됩니다. 대규모 모델의 경우, 이러한 과정으로 인해 수십 분에 달하는 대기 시간이 발생할 수 있습니다.
모델 캐싱의 활용 방법
모델 캐싱을 사용하면 하이퍼팟에서 이러한 대기 시간을 크게 줄일 수 있습니다. 모델 가중치와 컨테이너 이미지를 미리 로컬 NVMe 저장소에 로드하여, 네트워크를 통한 다운로드 시간을 없애줍니다. 결과적으로, 새 포드가 즉시 로컬 데이터를 읽어 서비스를 빠르게 시작할 수 있습니다.
모델 캐싱 활성화 예시
모델 캐싱을 활성화하기 위해서는 InferenceEndpointConfig나 JumpStartModel 리소스에 modelCacheConfig 섹션을 추가해야 합니다. 추가 인프라 설정 없이 간편하게 적용이 가능합니다.
apiVersion: inference.sagemaker.aws.amazon.com/v1
kind: InferenceEndpointConfig
metadata:
name: example-model
namespace: default
spec:
modelName: example-model
modelSourceConfig:
modelSourceType: s3
s3Storage:
bucketName: example-bucket
region: us-west-2
modelLocation: "models/example-model"
modelCacheConfig:
weightsCache:
enabled: true
imageCache:
enabled: true
instanceType: ml.g5.24xlarge
worker:
image: vllm/vllm-openai:latest
modelInvocationPort:
containerPort: 8000
modelVolumeMount:
name: model-weights
mountPath: /opt/ml/model
resources:
limits:
nvidia.com/gpu: "4"
모델 캐싱을 통한 성능 향상
벡마크 결과에 따르면, 57-145GB 모델의 경우 가중치 캐싱을 활성화했을 때 확장 속도가 약 60% 증가했습니다. 이미지 캐싱은 약 97%의 초기 이미지 당김 시간을 줄여, 네트워크를 통해 데이터를 새로 다운로드할 필요성을 크게 줄여줍니다. DeepSeek-R1과 같은 600GB 이상의 대형 모델의 경우, 이는 30분 이상의 다운로드 시간을 제거하는 효과를 가져옵니다.
결론
아마존 세이지메이커 하이퍼팟의 모델 캐싱 기능은 대기 시간을 크게 줄여 추론 환경을 최적화시킵니다. 인프라를 간편하게 조정하여 네트워크 의존성을 최소화하고, 현장의 요구에 맞춰 신속하게 대응할 수 있는 환경을 제공합니다.
AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!
(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기
