메뉴 닫기

효율적인 GPU 클러스터 공유를 위한 AWS SageMaker HyperPod 활용법

AWS가 제공하는 AI 및 클라우드 기술을 활용한 멀티 테넌트 환경에서의 효율적인 GPU 클러스터 공유 방법

많은 기업에서 여러 팀이 동일한 GPU 클러스터에 대한 접근을 요구하고 있습니다. 큰 언어 모델을 훈련하는 데이터 과학 팀, 추론 워크로드를 실행하는 컴퓨터 비전 그룹, 그리고 새로운 모델 구조를 실험하는 연구팀들이 그 예입니다. 이러한 팀들은 동일한 클러스터 자원을 필요로 하지만, 팀 간의 자원 분리와 공정한 자원 사용, 독립적인 운영이 필수적입니다. Amazon SageMaker HyperPod는 이러한 요구사항을 충족시키기 위해 설계된 AI 서비스로, 생성 AI 워크로드를 위한 대규모 컴퓨팅 클러스터 관리를 단순화합니다.

AWS SageMaker HyperPod를 통한 멀티 테넌트 환경 구축

AWS SageMaker HyperPod를 사용하면 Amazon Elastic Kubernetes Service(Amazon EKS)를 통한 멀티 테넌트 환경을 고려하여 여러 팀이 하나의 HyperPod EKS 클러스터를 효율적으로 공유할 수 있습니다. 각 팀에 대한 사용자 경험을 제공하는 SageMaker AI 도메인, 작업 부하 분리를 위한 Kubernetes 네임스페이스, 공정한 자원 할당을 위한 HyperPod Task Governance, 그리고 팀별 소비 가시성을 위한 네임스페이스 수준의 비용 할당 등의 요소를 결합하여 구현됩니다.

주요 구성 요소 및 아키텍처

  1. 사용자 및 인증
    AWS IAM Identity Center를 통해 중앙 집중화된 인증을 구현합니다. 각 팀은 자체적으로 사용자 경험을 제공받으며, SageMaker Studio를 통해 클러스터에 접근하게 됩니다.

  2. EKS 접근 제어
    각 팀은 고유한 네임스페이스를 보유하며, 해당 네임스페이스 내에서만 자원을 사용할 수 있어 작업 부하가 격리됩니다.

  3. HyperPod EKS 클러스터 구성
    각 팀에게 GPU, CPU 할당 쿼터를 설정하여 클러스터 내 자원을 효율적으로 관리하고, 우선순위에 따라 업무를 배정하여 공정성을 유지합니다.

  4. 저장소 관리
    Amazon FSx 및 Amazon S3를 통해 효율적인 데이터 저장소 관리와 경계 지정이 이루어집니다.

  5. 관찰 가능성 및 비용 관리
    Amazon Managed Grafana를 통해 클러스터 상태 및 리소스 사용률을 모니터링하고, Kubecost를 사용하여 팀별 비용을 분석하여 공정한 비용 분배를 지원합니다.

결론

AWS와 Amazon SageMaker HyperPod를 활용한 멀티 테넌트 환경 구축 방법은 기업의 각 팀이 효율적으로 자원을 공유하면서도 독립적으로 운영할 수 있는 환경을 제공합니다. 이러한 아키텍처는 다양한 사용 사례 및 조직 구조에 맞춰 확장될 수 있으며, 고유한 비용 관리 및 자원 할당 방식으로 공정성을 제공합니다. 이 가이드를 참고하여 여러분의 조직 환경에 맞게 구축해보시기 바랍니다.

[1] https://aws.amazon.com/blogs/machine-learning/share-gpu-clusters-across-teams-with-isolation-and-fairness-using-amazon-sagemaker-hyperpod/

AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!

(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기


AI, Cloud 도입 상담 배너