AWS를 활용한 혁신적인 AI 모델 배포 전략
AI 기술의 발전과 더불어 많은 기업들이 자동 음성 인식(ASR) 기술을 활용해 생산성을 높이려 하고 있습니다. 특히 AWS를 기반으로 GPU 인스턴스를 활용한 멀티 프로세스 서비스(MPS)를 통해 비용 효율적이고 빠른 성능을 구현하는 사례가 주목받고 있습니다.
배포의 효율성을 극대화하는 방법
AWS는 클라우드 인프라에서 효율성을 극대화하기 위해 NVIDIA의 CUDA MPS를 Amazon EC2에 통합해 ASR 추론 비용을 크게 줄였습니다. Heidi Health는 이 접근 방식을 통해 75%의 인프라감소(16개에서 4개의 GPU)를 달성했습니다. 이는 각 요청이 GPU 처리 능력의 15-20%만을 사용하면서도 엄격한 지연시간 요구사항을 충족시키는 상황에서 더욱 중요해졌습니다.
핵심 내용 및 사례
-
GPU 활용 문제: AWS의 기본 GPU 시간 분할 방식에서는 각 프로세스가 GPU를 독점적으로 사용하므로 80%의 하드웨어가 유휴 상태로 남게 됩니다.
-
MPS를 통한 병렬 실행: MPS는 NVIDIA CUDA API의 대안으로, 각 프로세스가 동시적으로 GPU를 사용할 수 있게 하여 CPU 전환 오버헤드를 제거하고 성능을 향상시킵니다.
-
모델 최적화와 배치 전략: ONNX Runtime과 TensorRT™를 활용하여 모델의 컴퓨팅 과부하를 최적화하고, NVIDIA Triton Inference Server™로 요청을 조율하여 높은 처리량을 유지합니다.
-
성공 사례: Heidi Health는 AWS의 이 솔루션을 적용해 초당 92.1 RPS를 달성하며 4개의 GPU로도 훌륭한 성능을 유지했습니다.
결론
AWS의 GPU 인스턴스와 NVIDIA 기술을 결합함으로써 ASR 모델의 추론 인프라 비용을 크게 절감하면서도 성능을 유지할 수 있었습니다. 이러한 최적화 기법은 모듈화된 배포 설계를 통해 다양한 AI 모델에 적용할 수 있어, 클라우드 상에서의 AI 모델 배포효율성을 크게 향상시킵니다.
[1] 원문 URL: [https://github.com/aws-samples/genai-ml-platform-examples/tree/main/infrastructure/nvidia-parakeet-model-mps]
AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!
(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기
