메뉴 닫기

AWS를 활용한 실시간 음성 클로닝 배포 가이드

AWS의 Qwen3-TTS 모델을 활용한 실시간 음성 클로닝 배포 가이드

소개
실시간 음성 클로닝은 특정 화자의 목소리를 복제하여 개인화된 음성 경험을 제공할 수 있는 기술입니다. 이 기술은 미디어, 교육 및 응용 프로그램 개발자에게 큰 가능성을 제공하며, 최근 AWS Amazon SageMaker AI와 통합하여 실시간으로 음성을 생성할 수 있는 솔루션이 출시되었습니다. 본 포스팅에서는 Qwen3-TTS-12Hz-1.7B-Base 모델을 Amazon SageMaker JumpStart를 통해 배포하는 과정을 소개합니다.

본론
Qwen3-TTS 모델 소개
Qwen3-TTS는 알리바바 클라우드의 Qwen 팀에 의해 개발된 텍스트 음성 변환(TTS) 모델로, 한국어와 영어를 포함한 총 10개 언어를 지원합니다. 이 모델은 사용자 제공 음성을 클론하여 새로운 텍스트에 적용할 수 있는 기능을 제공합니다.

실시간 음성 클로닝의 이점

  1. 대규모 맞춤화: 짧은 샘플 음성만으로 목표 음성을 생성할 수 있습니다.
  2. 다중 언어 지원: 하나의 언어로 캡처한 음성을 다른 언어로 변환하면서 화자의 음성 정체성을 유지합니다.
  3. 비용 효율성: 문자 단위의 API 가격 대신 컴퓨팅 사용량에 맞춰 비용을 조정할 수 있습니다.
  4. 데이터 제어: 데이터는 사용자의 AWS 계정 내에 보관되며, Amazon SageMaker endpoint에서 관리됩니다.

Qwen3-TTS 배포 가이드
1단계: 모델 배포
먼저 JumpStartModel 객체를 생성하고 배포합니다. 이때 중요한 것은 GPU 메모리 설정입니다. ml.g6.4xlarge 인스턴스로 적절한 메모리를 할당하고 다음과 같이 설정합니다:

env={"SM_VLLM_GPU_MEMORY_UTILIZATION": "0.45"}

2단계: GPU 메모리 크기 조정
vLLM이 미리 예약한 GPU 메모리를 활용하여 모델 실행 시 에러를 방지합니다. 두 개의 스테이지 설정 값이 0.45로, 총 90%의 GPU 메모리를 사용하게 세팅합니다.

3단계: 엔드포인트 테스트
엔드포인트는 /invocations 경로를 통해 호출되며, 텍스트 음성 변환 핸들러에 도달하기 위해 custom 관점의 속성을 설정해야 합니다.

결론
본 포스트에서는 AWS의 Amazon SageMaker JumpStart를 활용하여 Qwen3-TTS-12Hz-1.7B-Base 모델을 실시간 음성 클로닝 엔드포인트로 배포하는 방법을 설명했습니다. 이를 통해 비용 효율적인 맞춤형 음성 서비스를 제공할 수 있으며, 데이터는 사용자의 통제 하에 있게 됩니다.

원본 URL: https://aws.amazon.com/blogs/machine-learning/deploying-real-time-personalized-speech-with-qwen3-tts-on-amazon-sagemaker-ai/

AI, Cloud 관련한 문의는 아래 연락처로 연락주세요!

(주)에이클라우드
이메일 : acloud@a-cloud.co.kr
회사 번호 : 02-538-3988
회사 홈페이지 : https://www.a-cloud.co.kr/
문의하기


AI, Cloud 도입 상담 배너