为创作者打造的 AI 录音工作室

Qwen-Audio-3.0-TTS 在线文本转语音与声音克隆

使用阿里 Qwen-Audio-3.0-TTS 在线生成自然、有表现力的语音。支持多语言文本转语音、声音克隆、中文方言、情绪标签和 instruction 语气控制,适用于视频、播客、游戏、有声内容和产品配音。

12,000+ 位创作者正在使用

声音工作台

把你的文字变成声音

在一个安静、专注的工作台里完成文案、声音和表达方式的选择。

0/ 2000
模型选择

更多的单次合成字符数·更快的速度·更多的音色槽位

升级会员

模型指南

Qwen-Audio-3.0-TTS、Qwen3-TTS 与 CosyVoice 有什么区别?

它们都是阿里云百炼提供的语音合成模型,但属于不同的模型系列,并不是同一个模型依次升级形成的版本。三者在音色来源、声音复刻、声音设计、语气控制和接入方式上各有不同。

Qwen3-TTS

Qwen3-TTS 属于 Qwen-TTS 系列,包含标准语音合成、指令控制、声音设计和声音复刻等不同模型。它与 Qwen-Audio-3.0-TTS 使用不同的模型名称和部分不同的调用方式,不能把两者的音色或接口参数直接混用。

CosyVoice

CosyVoice 是另一套独立的语音合成模型系列,支持实时与非实时语音合成。不同版本分别提供声音复刻、声音设计和指令控制能力,并针对实时交互、弱网环境和语音客户端等场景提供相应的接入方式。

DS Speech 当前专注于 Qwen-Audio-3.0-TTS 在线体验,让你无需自行配置模型、接口和存储,即可完成音色选择、声音克隆、表达控制和音频生成。

在线文本转语音在线声音克隆

简单透明的价格

选择适合你的创作节奏

会员额度与积分包均按自然月重置,所有套餐统一使用 USD 定价。

首购优惠每位用户仅可享受一次。年付套餐展示一次支付的全年价格,月均价仅用于对比。

创作者评论

各行各业都在用它制作声音内容

从短视频、播客到游戏、课程和品牌内容,不同岗位的创作者都在用 DS Speech 更快完成自然、有表现力的 AI 配音。

Qwen-Audio-3.0-TTS 的生成速度很快。以前一条口播要反复找人补录,现在文案改完几秒就能听到效果,音色还原也足够稳定。

林澈林澈短视频导演

情感表达不像机械朗读。加入简短的 instruction 后,播客开场、广告和转场的语气会更有设计感。

Mika ChenMika Chen播客制作人

公共音色库覆盖了角色旁白、NPC 对话和教程提示,团队评审时不用再拿临时机器音占位。

周远周远游戏叙事设计师

方言和多语言文本转语音让区域培训内容更贴近听众,比普通 TTS 的模板感弱很多。

Nina HayesNina Hayes培训内容制作人

我们会用声音克隆制作系列课程,讲师无法临时补录时也能及时更新内容,前后章节的声音更容易保持一致。

何嘉宁何嘉宁企业培训制作人

Qwen-Audio-3.0-TTS 的生成速度很快。以前一条口播要反复找人补录,现在文案改完几秒就能听到效果,音色还原也足够稳定。

林澈林澈短视频导演

情感表达不像机械朗读。加入简短的 instruction 后,播客开场、广告和转场的语气会更有设计感。

Mika ChenMika Chen播客制作人

公共音色库覆盖了角色旁白、NPC 对话和教程提示,团队评审时不用再拿临时机器音占位。

周远周远游戏叙事设计师

方言和多语言文本转语音让区域培训内容更贴近听众,比普通 TTS 的模板感弱很多。

Nina HayesNina Hayes培训内容制作人

我们会用声音克隆制作系列课程,讲师无法临时补录时也能及时更新内容,前后章节的声音更容易保持一致。

何嘉宁何嘉宁企业培训制作人

我用 AI voice cloning 快速测试广告旁白,一个下午就能比较多种文案和表达方向。

Alex MorganAlex Morgan增长负责人

长文本拆分后生成很顺手,情绪标签能帮助塑造章节氛围,后期只需要微调节奏。

宋怡宋怡有声书编辑

同一个角色的克隆音色在多集内容里也不容易变化,持续更新系列作品时很实用。

Kenta MoriKenta Mori动画频道运营

我们用在线文本转语音制作产品讲解和活动预热,临近上线时也能及时替换最后一版文案。

陈玥陈玥品牌内容策划

音色广场的声音覆盖面够广,讲解视频、短视频和产品片不用每次都从零开始找声音。

Oliver GrantOliver Grant视频制作人

我用 AI voice cloning 快速测试广告旁白,一个下午就能比较多种文案和表达方向。

Alex MorganAlex Morgan增长负责人

长文本拆分后生成很顺手,情绪标签能帮助塑造章节氛围,后期只需要微调节奏。

宋怡宋怡有声书编辑

同一个角色的克隆音色在多集内容里也不容易变化,持续更新系列作品时很实用。

Kenta MoriKenta Mori动画频道运营

我们用在线文本转语音制作产品讲解和活动预热,临近上线时也能及时替换最后一版文案。

陈玥陈玥品牌内容策划

音色广场的声音覆盖面够广,讲解视频、短视频和产品片不用每次都从零开始找声音。

Oliver GrantOliver Grant视频制作人

单次输入支持更长的脚本,文字不用切得太碎,生成出来的语气和节奏也更连贯。

梁书瑶梁书瑶知识类创作者

多语言 AI 配音节省了很多时间,我们能在同一次评审里比较中文、英文、日文和韩文版本。

Sophie CarterSophie Carter品牌策略师

地方口音对本地内容很关键。普通话和方言版本放在一起试听后,团队更容易选出贴近用户的版本。

高铭高铭本地生活运营

加入情感标签后,可以很快区分紧张感台词和沉稳说明类音频,角色表达明显更丰富。

Haruto SatoHaruto Sato游戏声音导演

课程更新最看重速度。修改讲稿后可以马上重新生成清晰旁白,不必重新预约整场录音。

Rachel MooreRachel Moore课程创作者

单次输入支持更长的脚本,文字不用切得太碎,生成出来的语气和节奏也更连贯。

梁书瑶梁书瑶知识类创作者

多语言 AI 配音节省了很多时间,我们能在同一次评审里比较中文、英文、日文和韩文版本。

Sophie CarterSophie Carter品牌策略师

地方口音对本地内容很关键。普通话和方言版本放在一起试听后,团队更容易选出贴近用户的版本。

高铭高铭本地生活运营

加入情感标签后,可以很快区分紧张感台词和沉稳说明类音频,角色表达明显更丰富。

Haruto SatoHaruto Sato游戏声音导演

课程更新最看重速度。修改讲稿后可以马上重新生成清晰旁白,不必重新预约整场录音。

Rachel MooreRachel Moore课程创作者

常见问题解答

1

Qwen-Audio-3.0-TTS 是什么模型,声音克隆效果好吗?

Qwen-Audio-3.0-TTS 是阿里云百炼提供的高性能语音合成模型系列,支持在线文本转语音、声音复刻、声音设计和 instruction 表达控制。它与 Qwen3-TTS、CosyVoice 属于不同的模型系列。DS Speech 专注于提供更易用的 Qwen-Audio-3.0-TTS 在线声音克隆与 AI 语音生成体验。

2

如何开始使用 AI 声音克隆?

在工作台输入文本,选择预设音色,或上传一段清晰的参考音频保存为自己的声音模型,然后生成试听结果。

3

生成的声音可以用于商业项目吗?

可以。使用他人声音前,请确保您已获得声音权利人的合法授权;如果使用的是您本人的声音,或由您自行生成且不涉及他人权益的音色,则可以用于商业项目,我们不会额外限制其商业用途。

4

目前支持哪些语言?

中文(普通话、广东话、重庆话、东北话、甘肃话、贵州话、浙江话、河北话、河南话、湖北话、湖南话、江西话、宁波话、宁夏话、青岛话、陕西话、山西话、山东话、上海话、四川话、云南话)、英语、日语、韩语、俄语、法语、德语、葡萄牙语、泰语、印尼语、越南语、西班牙语、意大利语、马来西亚语、菲律宾语、阿拉伯语

5

参考音频有什么要求?

WAV、MP3、M4A 格式,音频时长推荐 10~20 秒,最长不超过 60 秒。文件大小 ≤ 10 MB,采样率 ≥ 16 kHz。

双声道音频仅处理首声道,请确保首声道包含有效人声。

音频必须包含至少 5 秒连续清晰的朗读内容(无背景音),其余部分仅允许短暂停顿(≤ 2 秒)。整段音频应避免出现背景音乐、环境噪音或其他人声。请使用正常语速的说话音频,不要上传歌曲或唱歌录音。

6

有哪些使用限制?

请勿用于欺诈、冒充、骚扰、仇恨、淫秽或色情内容或其他违法场景。如经发现会立即终止您账户的权利。

7

会员额度和积分包如何重置?

会员额度与单独购买的积分包都按自然月清零,请在当月内合理安排使用。

8

可以控制情绪、方言或角色感吗?

可以通过标签和 instruction 指令控制部分情绪、方言和角色风格。

instruction 示例:

标准播音风格:吐字清晰精准,字正腔圆

年轻活泼的女性声音:语速较快,带有明显的上扬语调,适合介绍时尚产品

沉稳的中年男性:语速缓慢,音色低沉有磁性,适合朗读新闻或纪录片解说

instruction 中文方言示例:

请用河南话表达

标签示例:

[excited]今天的天气真不错![laughing]我们一起出去玩吧!

9

会员过期后,声音模型会被清空吗?

不会。会员过期或从 Pro 会员降级为 Plus 会员后,您已创建的声音模型仍会保留,不会被删除。但您只能使用当前会员等级所支持数量范围内、最近创建的声音模型。

例如,您原本是 Pro 会员,已创建 30 个声音模型。降级为 Plus 会员后,您可以继续使用最近创建的 10 个声音模型,其余模型仍会保留,但暂时无法使用。

当您重新开通 Pro 会员后,原有的 30 个声音模型将恢复正常使用。

10

文本转语音生成的音频会保存多久?

文本转语音生成的音频文件仅保存3天。超过期限后将无法播放或下载,请及时下载并妥善保存。