크리에이터를 위한 AI 레코딩 스튜디오

Qwen-Audio-3.0-TTS 온라인 텍스트 음성 변환 및 음성 복제

Alibaba Qwen-Audio-3.0-TTS로 자연스럽고 표현력 있는 음성을 온라인에서 생성하세요. 다국어 텍스트 음성 변환, 음성 복제, 중국어 방언, 감정 태그, instruction 제어를 지원해 영상, 팟캐스트, 게임, 오디오 콘텐츠와 제품 내레이션에 활용할 수 있습니다.

12,000명 이상의 크리에이터가 사용 중

음성 워크벤치

글을 목소리로 바꾸세요

한 화면에서 대본, 음성, 표현 방식을 다듬을 수 있습니다.

0/ 2000
모델 선택

1회 합성 글자 수 증가·더 빠른 생성 속도·더 많은 음색 슬롯

업그레이드

모델 가이드

Qwen-Audio-3.0-TTS, Qwen3-TTS, CosyVoice는 어떻게 다른가요?

세 모델 모두 Alibaba Cloud Model Studio에서 제공되는 음성 합성 모델이지만, 하나의 모델이 순서대로 업그레이드된 버전이 아니라 서로 독립된 모델 계열입니다. 음색 제공 방식, 음성 복제, 음성 디자인, 지시 제어와 연동 방식이 서로 다릅니다.

Qwen3-TTS

Qwen3-TTS는 Qwen-TTS 계열에 속하며 표준 음성 합성, 지시 제어, 음성 디자인과 음성 복제를 위한 개별 모델을 포함합니다. Qwen-Audio-3.0-TTS와는 모델 이름과 일부 연동 방식이 다르므로 음색이나 API 매개변수를 그대로 함께 사용할 수 없습니다.

CosyVoice

CosyVoice는 실시간 및 비실시간 음성 생성을 지원하는 또 다른 독립 음성 합성 모델 계열입니다. 버전에 따라 음성 복제, 음성 디자인과 지시 제어를 제공하며 실시간 상호작용, 음성 클라이언트와 까다로운 네트워크 환경에 맞는 연동 방식도 제공합니다.

DS Speech는 현재 Qwen-Audio-3.0-TTS 온라인 경험에 집중합니다. 모델, API와 저장소를 직접 설정하지 않고도 음색 선택, 음성 복제, 표현 제어와 오디오 생성을 완료할 수 있습니다.

온라인 텍스트 음성 변환온라인 음성 복제

간단하고 투명한 가격

제작 리듬에 맞는 플랜을 선택하세요

멤버십 한도와 크레딧 팩은 매월 초기화되며 모든 플랜은 USD 가격을 사용합니다.

첫 구매 할인은 사용자당 한 번만 사용할 수 있습니다. 연간 플랜은 1년 총 결제 금액을 표시하며 월 환산 금액은 비교용입니다.

크리에이터 리뷰

다양한 분야의 크리에이터가 음성 콘텐츠를 제작합니다

숏폼 영상과 팟캐스트부터 게임, 강의, 브랜드 콘텐츠까지 크리에이터들이 DS Speech로 자연스럽고 표현력 있는 AI 내레이션을 더 빠르게 제작합니다.

Qwen-Audio-3.0-TTS는 일상적인 제작에 충분히 빠릅니다. 대본을 수정한 뒤 몇 초 만에 안정적인 음성을 확인해 재녹음 일정을 줄일 수 있었습니다.

林澈林澈숏폼 영상 디렉터

감정 표현이 기계적으로 들리지 않습니다. 짧은 instruction만 더해도 오프닝, 광고와 전환 구간의 말투를 의도에 맞게 조정할 수 있습니다.

Mika ChenMika Chen팟캐스트 프로듀서

공개 음색 라이브러리에서 캐릭터 내레이션, NPC 대사와 튜토리얼 안내까지 찾을 수 있어 검토용 임시 기계음을 따로 만들 필요가 없습니다.

周远周远게임 내러티브 디자이너

방언과 다국어 텍스트 음성 변환 덕분에 지역 교육 콘텐츠가 일반 TTS보다 청중에게 더 가깝게 들립니다.

Nina HayesNina Hayes교육 콘텐츠 프로듀서

연속 강의에 음성 복제를 사용합니다. 강사가 다시 녹음할 수 없을 때도 각 수업의 목소리를 일관되게 유지하며 업데이트할 수 있습니다.

何嘉宁何嘉宁기업 교육 프로듀서

Qwen-Audio-3.0-TTS는 일상적인 제작에 충분히 빠릅니다. 대본을 수정한 뒤 몇 초 만에 안정적인 음성을 확인해 재녹음 일정을 줄일 수 있었습니다.

林澈林澈숏폼 영상 디렉터

감정 표현이 기계적으로 들리지 않습니다. 짧은 instruction만 더해도 오프닝, 광고와 전환 구간의 말투를 의도에 맞게 조정할 수 있습니다.

Mika ChenMika Chen팟캐스트 프로듀서

공개 음색 라이브러리에서 캐릭터 내레이션, NPC 대사와 튜토리얼 안내까지 찾을 수 있어 검토용 임시 기계음을 따로 만들 필요가 없습니다.

周远周远게임 내러티브 디자이너

방언과 다국어 텍스트 음성 변환 덕분에 지역 교육 콘텐츠가 일반 TTS보다 청중에게 더 가깝게 들립니다.

Nina HayesNina Hayes교육 콘텐츠 프로듀서

연속 강의에 음성 복제를 사용합니다. 강사가 다시 녹음할 수 없을 때도 각 수업의 목소리를 일관되게 유지하며 업데이트할 수 있습니다.

何嘉宁何嘉宁기업 교육 프로듀서

AI voice cloning으로 광고 내레이션을 빠르게 테스트하고 하루 안에 여러 대본과 표현 방향을 비교합니다.

Alex MorganAlex Morgan그로스 리드

긴 텍스트 음성 생성을 관리하기 쉽고, 감정 태그로 장별 분위기를 만든 뒤 마지막에 리듬만 다듬으면 됩니다.

宋怡宋怡오디오북 편집자

복제한 캐릭터 음성이 여러 에피소드에서도 쉽게 달라지지 않아 연속 콘텐츠 제작이 훨씬 편해졌습니다.

Kenta MoriKenta Mori애니메이션 채널 운영자

제품 설명과 출시 예고에 온라인 텍스트 음성 변환을 사용해 공개 직전의 대본 변경에도 대응합니다.

陈玥陈玥브랜드 콘텐츠 기획자

음색 광장에는 설명 영상, 숏폼과 제품 클립에 맞는 목소리가 충분해 매번 처음부터 찾지 않아도 됩니다.

Oliver GrantOliver Grant영상 프로듀서

AI voice cloning으로 광고 내레이션을 빠르게 테스트하고 하루 안에 여러 대본과 표현 방향을 비교합니다.

Alex MorganAlex Morgan그로스 리드

긴 텍스트 음성 생성을 관리하기 쉽고, 감정 태그로 장별 분위기를 만든 뒤 마지막에 리듬만 다듬으면 됩니다.

宋怡宋怡오디오북 편집자

복제한 캐릭터 음성이 여러 에피소드에서도 쉽게 달라지지 않아 연속 콘텐츠 제작이 훨씬 편해졌습니다.

Kenta MoriKenta Mori애니메이션 채널 운영자

제품 설명과 출시 예고에 온라인 텍스트 음성 변환을 사용해 공개 직전의 대본 변경에도 대응합니다.

陈玥陈玥브랜드 콘텐츠 기획자

음색 광장에는 설명 영상, 숏폼과 제품 클립에 맞는 목소리가 충분해 매번 처음부터 찾지 않아도 됩니다.

Oliver GrantOliver Grant영상 프로듀서

긴 대본을 한 번에 입력할 수 있어 텍스트를 덜 나누고, 완성된 음성의 말투와 흐름도 더 자연스럽게 이어집니다.

梁书瑶梁书瑶교육 크리에이터

다국어 AI 내레이션 제작이 빨라져 영어, 중국어, 일본어와 한국어 버전을 같은 검토 회의에서 비교할 수 있습니다.

Sophie CarterSophie Carter브랜드 전략가

지역 콘텐츠에는 방언이 중요합니다. 표준 중국어와 방언 버전을 비교하면 대상 사용자에게 더 가까운 표현을 고를 수 있습니다.

高铭高铭로컬 콘텐츠 운영자

감정 태그로 긴장감 있는 대사와 차분한 안내 음성을 빠르게 구분해 캐릭터 표현을 더 풍부하게 만들 수 있습니다.

Haruto SatoHaruto Sato게임 오디오 디렉터

강의 업데이트에서는 속도가 중요합니다. 대본을 수정한 뒤 전체 녹음 일정을 다시 잡지 않고 깨끗한 내레이션을 생성할 수 있습니다.

Rachel MooreRachel Moore강의 크리에이터

긴 대본을 한 번에 입력할 수 있어 텍스트를 덜 나누고, 완성된 음성의 말투와 흐름도 더 자연스럽게 이어집니다.

梁书瑶梁书瑶교육 크리에이터

다국어 AI 내레이션 제작이 빨라져 영어, 중국어, 일본어와 한국어 버전을 같은 검토 회의에서 비교할 수 있습니다.

Sophie CarterSophie Carter브랜드 전략가

지역 콘텐츠에는 방언이 중요합니다. 표준 중국어와 방언 버전을 비교하면 대상 사용자에게 더 가까운 표현을 고를 수 있습니다.

高铭高铭로컬 콘텐츠 운영자

감정 태그로 긴장감 있는 대사와 차분한 안내 음성을 빠르게 구분해 캐릭터 표현을 더 풍부하게 만들 수 있습니다.

Haruto SatoHaruto Sato게임 오디오 디렉터

강의 업데이트에서는 속도가 중요합니다. 대본을 수정한 뒤 전체 녹음 일정을 다시 잡지 않고 깨끗한 내레이션을 생성할 수 있습니다.

Rachel MooreRachel Moore강의 크리에이터

자주 묻는 질문

1

Qwen-Audio-3.0-TTS는 어떤 모델이며 음성 복제 품질은 좋은가요?

Qwen-Audio-3.0-TTS는 Alibaba Cloud Model Studio가 제공하는 고성능 음성 합성 모델 계열입니다. 온라인 텍스트 음성 변환, 음성 복제, 음성 디자인과 instruction 기반 표현 제어를 지원합니다. Qwen3-TTS 및 CosyVoice와는 별도의 모델 계열입니다. DS Speech는 Qwen-Audio-3.0-TTS 음성 복제와 AI 음성 생성을 온라인에서 쉽게 사용할 수 있도록 제공합니다.

2

AI 음성 클론은 어떻게 시작하나요?

작업대에서 텍스트를 입력하고 프리셋 음색을 선택하거나, 깨끗한 참고 음성을 업로드해 내 음성 모델로 저장한 뒤 미리듣기 결과를 생성합니다.

3

생성한 음성을 상업 프로젝트에 사용할 수 있나요?

가능합니다. 타인의 목소리를 사용하기 전에는 음성 권리자의 합법적인 허가를 받아야 합니다. 본인의 목소리이거나 타인의 권리를 침해하지 않는 직접 생성 음색이라면 상업 프로젝트에 사용할 수 있으며, 저희가 별도로 상업적 사용을 제한하지 않습니다.

4

현재 어떤 언어를 지원하나요?

중국어(표준 중국어, 광둥어, 충칭 방언, 둥베이 방언, 간쑤 방언, 구이저우 방언, 저장 방언, 허베이 방언, 허난 방언, 후베이 방언, 후난 방언, 장시 방언, 닝보 방언, 닝샤 방언, 칭다오 방언, 산시(陝西) 방언, 산시(山西) 방언, 산둥 방언, 상하이어, 쓰촨 방언, 윈난 방언), 영어, 일본어, 한국어, 러시아어, 프랑스어, 독일어, 포르투갈어, 태국어, 인도네시아어, 베트남어, 스페인어, 이탈리아어, 말레이시아어, 필리핀어, 아랍어를 지원합니다.

5

참고 음성에는 어떤 요구사항이 있나요?

WAV, MP3, M4A 형식을 지원합니다. 권장 길이는 10~20초이며 최대 60초를 넘지 않아야 합니다. 파일 크기는 ≤ 10 MB, 샘플레이트는 ≥ 16 kHz여야 합니다.

스테레오 오디오는 첫 번째 채널만 처리하므로 첫 번째 채널에 유효한 사람 목소리가 포함되어야 합니다.

오디오에는 배경음 없이 최소 5초 이상의 연속적이고 명확한 낭독 내용이 필요합니다. 나머지 부분에는 ≤ 2초의 짧은 정지만 허용됩니다. 배경음악, 환경 소음 또는 다른 사람의 목소리를 피하고, 노래나 가창 녹음이 아닌 정상 속도의 말하기 음성을 사용하세요.

6

어떤 사용 제한이 있나요?

사기, 사칭, 괴롭힘, 혐오, 음란 또는 포르노 콘텐츠, 기타 불법적인 상황에 사용해서는 안 됩니다. 발견 시 계정 권리가 즉시 종료됩니다.

7

멤버십 한도와 크레딧 팩은 어떻게 초기화되나요?

멤버십 한도와 별도 구매한 크레딧 팩은 모두 매월 기준으로 초기화됩니다. 해당 월 안에서 계획적으로 사용하세요.

8

감정, 방언 또는 캐릭터 느낌을 제어할 수 있나요?

태그와 instruction 지시어를 통해 일부 감정, 방언, 캐릭터 스타일을 제어할 수 있습니다.

instruction 예시:

표준 방송 스타일: 발음이 명확하고 정확함.

젊고 활발한 여성 목소리: 빠른 말속도와 뚜렷한 상승 억양, 패션 제품 소개에 적합.

차분한 중년 남성: 느린 말속도와 낮고 매력적인 음색, 뉴스나 다큐멘터리 해설에 적합.

중국어 방언 instruction 예시:

请用河南话表达

태그 예시:

[excited]오늘 날씨가 정말 좋네요![laughing]우리 같이 놀러 가요!

9

멤버십이 만료되면 음성 모델이 삭제되나요?

삭제되지 않습니다. 멤버십이 만료되거나 Pro에서 Plus로 다운그레이드된 후에도 생성한 음성 모델은 보관되며 삭제되지 않습니다. 다만 현재 멤버십 등급이 지원하는 수량 범위 내에서 최근 생성한 음성 모델만 사용할 수 있습니다.

예를 들어 Pro 회원으로 30개의 음성 모델을 생성했다면, Plus로 다운그레이드한 후에는 최근 생성한 10개의 음성 모델을 계속 사용할 수 있습니다. 나머지 모델은 보관되지만 일시적으로 사용할 수 없습니다.

다시 Pro 회원을 열면 기존 30개의 음성 모델이 정상적으로 복구됩니다.

10

텍스트 음성 변환으로 생성한 오디오는 얼마나 보관되나요?

텍스트 음성 변환으로 생성한 오디오 파일은 3일 동안만 보관됩니다. 기간이 지나면 재생하거나 다운로드할 수 없으므로 미리 다운로드하여 안전하게 보관해 주세요.