Amazon SageMaker AI 트레이닝 작업을 위한 인스턴스 선호 목록 소개
소개
AI 모델 트레이닝 시 가장 큰 도전 과제 중 하나는 훈련에 필요한 적절한 GPU를 적시에 확보하는 것입니다. 특히 트래픽이 많은 시기에는 원하는 GPU를 즉시 사용할 수 없으며, 특정 GPU 구성에 묶여 있는 경우에는 대기하거나 수동으로 대체 옵션을 시도해야 합니다. 이는 실험을 지연시키고 모델 개발에 집중력을 분산시킵니다. 하지만 만약 Amazon SageMaker AI가 적합한 GPU 옵션의 목록을 제출하고 사용 가능한 용량을 자동으로 찾아줄 수 있다면, 대기 시간을 줄이고 팀이 개발에 다시 집중할 수 있을 것입니다.
본문
오늘 우리는 Amazon SageMaker AI 트레이닝 작업 및 처리 작업을 위한 인스턴스 선호 목록 기능을 발표하게 되어 기쁩니다. 이 기능을 사용하면 트레이닝 또는 처리 작업을 생성할 때 최대 5개의 수락 가능한 인스턴스 유형을 지정할 수 있으며, Amazon SageMaker AI는 우선 순위 순으로 이 목록을 평가하여 사용 가능한 첫 번째 유형을 선택합니다. 이는 수동 재시도 루프와 복잡한 모니터링 스크립트를 제거하여 더 빠르게 GPU 자원을 확보하고 훈련을 시작할 수 있도록 지원합니다.

고객 도전 과제
수요가 높은 시기에는 원하는 GPU 인스턴스를 즉시 확보하는 것이 어려울 수 있습니다. 특정 인스턴스 유형에 고정된 작업이 용량을 기다리고 있는 동안, 다른 인스턴스 유형에는 용량이 남아있을 수 있습니다. 수작업으로 대체 유형을 시도하는 경우 실험 주기가 지연될 수 있으며, 이는 모델의 신선도와 반복 속도에 영향을 줄 수 있습니다.
솔루션: 인스턴스 선호 목록
SageMaker 트레이닝 및 처리 작업에서 인스턴스 선호 목록을 사용하면 최대 5개의 인스턴스 유형을 우선순위 순으로 지정할 수 있습니다. Amazon SageMaker AI는 이 목록을 우선순위로 평가하고 사용이 가능한 첫 번째 유형을 선택하여 수동 개입 없이 작업을 시작합니다.

코드 예시: 인스턴스 설정을 통한 트레이닝 및 처리 작업
SageMaker Python SDK를 이용한 인스턴스 설정 코드는 다음과 같습니다.
from sagemaker.core.shapes.shapes import InstancePreference
from sagemaker.train.model_trainer import ModelTrainer
from sagemaker.train.configs import Compute, OutputDataConfig
trainer = ModelTrainer(
training_image="763104351884.dkr.ecr.us-east-1.amazonaws.com/pytorch-training:2.3.0-gpu-py311-cu121-ubuntu22.04-sagemaker",
source_code="train.py",
role="arn:aws:iam::111122223333:role/SageMakerExecutionRole",
base_job_name="large-model-training-70b",
output_data_config=OutputDataConfig(
s3_output_path="s3://amzn-s3-demo-bucket/training-output/"
),
compute=Compute(
instance_count=8,
volume_size_in_gb=500,
keep_alive_period_in_seconds=3600,
instance_preferences=[
InstancePreference(instance_type="ml.p5.48xlarge"),
InstancePreference(instance_type="ml.p4d.24xlarge"),
InstancePreference(instance_type="ml.p4de.24xlarge"),
],
),
)
trainer.train(wait=False)
최고의 실무 사례
- 호환 가능한 인스턴스 유형만 목록에 포함
- 동일한 처리량을 위한 개별 인스턴스 수 사용
- 트레이닝 플랜과의 결합으로 보장된 유연한 용량 확보
- MaxPendingTimeInSeconds를 사용해 대기 시간 한정
결론
인스턴스 선호 목록을 통해 GPU 용량 관리를 간소화하고, 수동적인 반복 로직 생성의 부담을 덜 수 있습니다. 또한 SageMaker AI는 자동으로 주어진 인스턴스 목록에서 사용 가능한 용량을 찾아 작업을 시작합니다. 이 기능을 사용하여 더욱 효율적인 모델 개발을 시작해보세요.
더 많은 정보는 아래의 원문 링크에서 확인하시기 바랍니다.
[1] https://aws.amazon.com/blogs/machine-learning/announcing-instance-preference-lists-for-amazon-sagemaker-ai-training-jobs/
AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!
(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기
