クリエイターのための AI 録音スタジオ

Qwen-Audio-3.0-TTS オンライン音声生成・音声クローン

Alibaba Qwen-Audio-3.0-TTS で、自然で表現力豊かな音声をオンライン生成。多言語テキスト読み上げ、音声クローン、中国語方言、感情タグ、instruction 制御に対応し、動画、ポッドキャスト、ゲーム、オーディオコンテンツ、製品ナレーションに活用できます。

12,000 人以上のクリエイターが利用中

音声ワークベンチ

言葉を声に変える

文章、声、表現をひとつの集中できる画面で整えます。

0/ 2000
モデル選択

1 回あたりの文字数を増加·より速い生成·より多い音色スロット

アップグレード

モデルガイド

Qwen-Audio-3.0-TTS、Qwen3-TTS、CosyVoice の違いは?

いずれも Alibaba Cloud Model Studio で提供される音声合成モデルですが、同じモデルの連続したバージョンではなく、それぞれ独立したモデルシリーズです。音色の取得方法、音声クローン、音声デザイン、指示制御、接続方式に違いがあります。

Qwen3-TTS

Qwen3-TTS は Qwen-TTS シリーズに属し、標準音声合成、指示制御、音声デザイン、音声クローン向けの個別モデルがあります。Qwen-Audio-3.0-TTS とはモデル名や一部の接続方式が異なるため、音色や API パラメーターをそのまま共用することはできません。

CosyVoice

CosyVoice は別の独立した音声合成モデルシリーズで、リアルタイムと非リアルタイムの生成に対応します。バージョンごとに音声クローン、音声デザイン、指示制御を提供し、リアルタイム対話、音声クライアント、厳しいネットワーク環境向けの接続方式も用意されています。

DS Speech は現在 Qwen-Audio-3.0-TTS のオンライン体験に特化しており、モデル、API、ストレージを自分で設定せずに、音色選択、音声クローン、表現制御、音声生成を行えます。

オンラインテキスト読み上げオンライン音声クローン

シンプルで明確な料金

制作ペースに合うプランを

会員枠とクレジットパックは毎月リセットされ、すべて USD で統一されています。

初回購入割引はユーザーごとに1回のみ利用できます。年払いプランは年間の一括支払額を表示し、月額換算は比較用です。

クリエイターレビュー

さまざまな分野のクリエイターが音声制作に活用

ショート動画やポッドキャストからゲーム、講座、ブランドコンテンツまで、クリエイターが DS Speech で自然で表現力豊かな AI ナレーションを効率よく制作しています。

Qwen-Audio-3.0-TTS は日々の制作に十分な速度です。原稿を直して数秒で安定した音声を確認でき、再収録を手配する回数が減りました。

林澈林澈ショート動画ディレクター

感情表現が機械的ではありません。短い instruction を加えるだけで、番組の導入や広告、切り替え部分の口調を意図どおりに整えられます。

Mika ChenMika Chenポッドキャストプロデューサー

公開音色ライブラリでキャラクターのナレーション、NPC の台詞、チュートリアル音声まで揃い、レビュー用の仮音声を別に作る必要がありません。

周远周远ゲームシナリオデザイナー

方言と多言語テキスト読み上げにより、地域向け研修が一般的な TTS よりも聞き手に近い表現になりました。

Nina HayesNina Hayes研修コンテンツ制作者

シリーズ講座で音声クローンを使っています。講師が再収録できないときも、各レッスンの声を揃えて更新できます。

何嘉宁何嘉宁企業研修プロデューサー

Qwen-Audio-3.0-TTS は日々の制作に十分な速度です。原稿を直して数秒で安定した音声を確認でき、再収録を手配する回数が減りました。

林澈林澈ショート動画ディレクター

感情表現が機械的ではありません。短い instruction を加えるだけで、番組の導入や広告、切り替え部分の口調を意図どおりに整えられます。

Mika ChenMika Chenポッドキャストプロデューサー

公開音色ライブラリでキャラクターのナレーション、NPC の台詞、チュートリアル音声まで揃い、レビュー用の仮音声を別に作る必要がありません。

周远周远ゲームシナリオデザイナー

方言と多言語テキスト読み上げにより、地域向け研修が一般的な TTS よりも聞き手に近い表現になりました。

Nina HayesNina Hayes研修コンテンツ制作者

シリーズ講座で音声クローンを使っています。講師が再収録できないときも、各レッスンの声を揃えて更新できます。

何嘉宁何嘉宁企業研修プロデューサー

AI voice cloning で広告ナレーションを素早く試し、1日で複数の原稿と表現方向を比較できます。

Alex MorganAlex Morganグロース担当

長文の音声生成を管理しやすく、感情タグで章ごとの雰囲気を作ってから最後にテンポだけ調整できます。

宋怡宋怡オーディオブック編集者

クローンしたキャラクター音声が複数話でも崩れにくく、継続シリーズの制作がかなり楽になりました。

Kenta MoriKenta Moriアニメチャンネル運営

製品紹介や告知動画にオンラインテキスト読み上げを使い、公開直前の原稿変更にも対応しています。

陈玥陈玥ブランドコンテンツ企画

音色広場には解説、ショート動画、製品クリップに使える声が揃い、毎回ゼロから探さずに済みます。

Oliver GrantOliver Grant動画プロデューサー

AI voice cloning で広告ナレーションを素早く試し、1日で複数の原稿と表現方向を比較できます。

Alex MorganAlex Morganグロース担当

長文の音声生成を管理しやすく、感情タグで章ごとの雰囲気を作ってから最後にテンポだけ調整できます。

宋怡宋怡オーディオブック編集者

クローンしたキャラクター音声が複数話でも崩れにくく、継続シリーズの制作がかなり楽になりました。

Kenta MoriKenta Moriアニメチャンネル運営

製品紹介や告知動画にオンラインテキスト読み上げを使い、公開直前の原稿変更にも対応しています。

陈玥陈玥ブランドコンテンツ企画

音色広場には解説、ショート動画、製品クリップに使える声が揃い、毎回ゼロから探さずに済みます。

Oliver GrantOliver Grant動画プロデューサー

長い原稿を一度に入力できるので分割が少なく、完成した音声の話し方やテンポもつながりやすいです。

梁书瑶梁书瑶教育系クリエイター

多言語 AI ナレーションが速くなり、英語、中国語、日本語、韓国語版を同じレビューで比較できます。

Sophie CarterSophie Carterブランドストラテジスト

地域向けコンテンツでは方言が重要です。標準語版と方言版を聞き比べることで、対象ユーザーに近い表現を選べます。

高铭高铭ローカルコンテンツ運営

感情タグを使うと、緊張感のある台詞と落ち着いた案内音声を素早く作り分けられ、キャラクター表現が豊かになります。

Haruto SatoHaruto Satoゲーム音声ディレクター

講座更新では速度が重要です。原稿を修正したら、収録日を再調整せずに明瞭なナレーションを作り直せます。

Rachel MooreRachel Moore講座クリエイター

長い原稿を一度に入力できるので分割が少なく、完成した音声の話し方やテンポもつながりやすいです。

梁书瑶梁书瑶教育系クリエイター

多言語 AI ナレーションが速くなり、英語、中国語、日本語、韓国語版を同じレビューで比較できます。

Sophie CarterSophie Carterブランドストラテジスト

地域向けコンテンツでは方言が重要です。標準語版と方言版を聞き比べることで、対象ユーザーに近い表現を選べます。

高铭高铭ローカルコンテンツ運営

感情タグを使うと、緊張感のある台詞と落ち着いた案内音声を素早く作り分けられ、キャラクター表現が豊かになります。

Haruto SatoHaruto Satoゲーム音声ディレクター

講座更新では速度が重要です。原稿を修正したら、収録日を再調整せずに明瞭なナレーションを作り直せます。

Rachel MooreRachel Moore講座クリエイター

よくある質問

1

Qwen-Audio-3.0-TTS とはどんなモデルで、音声クローンの品質は高いですか?

Qwen-Audio-3.0-TTS は Alibaba Cloud Model Studio が提供する高性能な音声合成モデルシリーズです。オンラインテキスト読み上げ、音声クローン、音声デザイン、instruction による表現制御に対応します。Qwen3-TTS や CosyVoice とは別のモデルシリーズです。DS Speech は Qwen-Audio-3.0-TTS の音声クローンと AI 音声生成をオンラインで使いやすく提供します。

2

AI 音声クローンはどう始めますか?

ワークベンチでテキストを入力し、プリセット音色を選ぶか、明瞭な参考音声をアップロードして自分の音声モデルを保存し、試聴結果を生成します。

3

生成した音声は商用利用できますか?

可能です。他人の声を使用する場合は、声の権利者から合法的な許諾を得てください。本人の声、または第三者の権利を含まない自作音色であれば、商用プロジェクトに利用でき、当方が追加で商用利用を制限することはありません。

4

現在どの言語に対応していますか?

中国語(普通話、広東話、重慶方言、東北方言、甘粛方言、貴州方言、浙江方言、河北方言、河南方言、湖北方言、湖南方言、江西方言、寧波方言、寧夏方言、青島方言、陝西方言、山西方言、山東方言、上海語、四川方言、雲南方言)、英語、日本語、韓国語、ロシア語、フランス語、ドイツ語、ポルトガル語、タイ語、インドネシア語、ベトナム語、スペイン語、イタリア語、マレーシア語、フィリピン語、アラビア語に対応しています。

5

参考音声にはどんな条件がありますか?

WAV、MP3、M4A 形式に対応しています。推奨時間は 10〜20 秒、最長 60 秒です。ファイルサイズは ≤ 10 MB、サンプルレートは ≥ 16 kHz です。

ステレオ音声は第 1 チャンネルのみ処理されるため、第 1 チャンネルに有効な人声が含まれるようにしてください。

音声には少なくとも 5 秒間の連続した明瞭な朗読内容(背景音なし)が必要です。それ以外の部分は ≤ 2 秒の短い無音のみ許容されます。背景音楽、環境ノイズ、他人の声は避け、歌や歌唱録音ではなく通常の話し声を使用してください。

6

利用制限はありますか?

詐欺、なりすまし、嫌がらせ、ヘイト、わいせつ・ポルノコンテンツ、その他違法な用途には使用しないでください。発見された場合、アカウント権利を直ちに停止します。

7

会員枠とクレジットパックはどうリセットされますか?

会員枠と単独購入したクレジットパックはいずれも暦月ごとにクリアされます。当月内で計画的に利用してください。

8

感情、方言、キャラクター感を制御できますか?

タグと instruction 指示で、一部の感情、方言、キャラクター風格を制御できます。

instruction 例:

標準アナウンス風:発音が明瞭で正確。

若く活発な女性声:やや速い話速で上がり調子、ファッション商品の紹介に適しています。

落ち着いた中年男性:遅めの話速で低く磁性的な声、ニュースやドキュメンタリー解説に適しています。

中国語方言 instruction 例:

请用河南话表达

タグ例:

[excited]今日はとてもいい天気です![laughing]一緒に遊びに行きましょう!

9

会員期限切れ後、音声モデルは削除されますか?

削除されません。会員期限切れ、または Pro から Plus にダウングレードした後も、作成済みの音声モデルは保持されます。ただし、現在の会員レベルでサポートされる数量範囲内の、最近作成した音声モデルのみ使用できます。

例えば Pro 会員で 30 個の音声モデルを作成していた場合、Plus にダウングレード後は最近作成した 10 個を引き続き使用できます。残りのモデルは保持されますが一時的に使用できません。

再び Pro 会員になると、元の 30 個の音声モデルが通常通り使用可能になります。

10

テキスト読み上げで生成した音声はどのくらい保存されますか?

テキスト読み上げで生成した音声ファイルは3日間のみ保存されます。期限を過ぎると再生やダウンロードができなくなるため、早めにダウンロードして保管してください。