Qwen-Audio-3.0-TTS
DS Speech 提供基于 Qwen-Audio-3.0-TTS 的在线语音生成能力。该系列支持文本转语音、声音复刻、声音设计和自然语言 instruction 控制,可以通过文字指令调整情绪、语气、角色感、语速和表达风格。声音复刻音色支持多语言及多种中文方言,适合视频配音、播客、有声内容、游戏角色和品牌声音制作。
使用阿里 Qwen-Audio-3.0-TTS 在线生成自然、有表现力的语音。支持多语言文本转语音、声音克隆、中文方言、情绪标签和 instruction 语气控制,适用于视频、播客、游戏、有声内容和产品配音。
声音工作台
在一个安静、专注的工作台里完成文案、声音和表达方式的选择。
模型指南
它们都是阿里云百炼提供的语音合成模型,但属于不同的模型系列,并不是同一个模型依次升级形成的版本。三者在音色来源、声音复刻、声音设计、语气控制和接入方式上各有不同。
DS Speech 提供基于 Qwen-Audio-3.0-TTS 的在线语音生成能力。该系列支持文本转语音、声音复刻、声音设计和自然语言 instruction 控制,可以通过文字指令调整情绪、语气、角色感、语速和表达风格。声音复刻音色支持多语言及多种中文方言,适合视频配音、播客、有声内容、游戏角色和品牌声音制作。
Qwen3-TTS 属于 Qwen-TTS 系列,包含标准语音合成、指令控制、声音设计和声音复刻等不同模型。它与 Qwen-Audio-3.0-TTS 使用不同的模型名称和部分不同的调用方式,不能把两者的音色或接口参数直接混用。
CosyVoice 是另一套独立的语音合成模型系列,支持实时与非实时语音合成。不同版本分别提供声音复刻、声音设计和指令控制能力,并针对实时交互、弱网环境和语音客户端等场景提供相应的接入方式。
简单透明的价格
会员额度与积分包均按自然月重置,所有套餐统一使用 USD 定价。
首购优惠每位用户仅可享受一次。年付套餐展示一次支付的全年价格,月均价仅用于对比。
创作者评论
从短视频、播客到游戏、课程和品牌内容,不同岗位的创作者都在用 DS Speech 更快完成自然、有表现力的 AI 配音。
Qwen-Audio-3.0-TTS 的生成速度很快。以前一条口播要反复找人补录,现在文案改完几秒就能听到效果,音色还原也足够稳定。
林澈短视频导演情感表达不像机械朗读。加入简短的 instruction 后,播客开场、广告和转场的语气会更有设计感。
Mika Chen播客制作人公共音色库覆盖了角色旁白、NPC 对话和教程提示,团队评审时不用再拿临时机器音占位。
周远游戏叙事设计师方言和多语言文本转语音让区域培训内容更贴近听众,比普通 TTS 的模板感弱很多。
Nina Hayes培训内容制作人我们会用声音克隆制作系列课程,讲师无法临时补录时也能及时更新内容,前后章节的声音更容易保持一致。
何嘉宁企业培训制作人Qwen-Audio-3.0-TTS 的生成速度很快。以前一条口播要反复找人补录,现在文案改完几秒就能听到效果,音色还原也足够稳定。
林澈短视频导演情感表达不像机械朗读。加入简短的 instruction 后,播客开场、广告和转场的语气会更有设计感。
Mika Chen播客制作人公共音色库覆盖了角色旁白、NPC 对话和教程提示,团队评审时不用再拿临时机器音占位。
周远游戏叙事设计师方言和多语言文本转语音让区域培训内容更贴近听众,比普通 TTS 的模板感弱很多。
Nina Hayes培训内容制作人我们会用声音克隆制作系列课程,讲师无法临时补录时也能及时更新内容,前后章节的声音更容易保持一致。
何嘉宁企业培训制作人我用 AI voice cloning 快速测试广告旁白,一个下午就能比较多种文案和表达方向。
Alex Morgan增长负责人长文本拆分后生成很顺手,情绪标签能帮助塑造章节氛围,后期只需要微调节奏。
宋怡有声书编辑同一个角色的克隆音色在多集内容里也不容易变化,持续更新系列作品时很实用。
Kenta Mori动画频道运营我们用在线文本转语音制作产品讲解和活动预热,临近上线时也能及时替换最后一版文案。
陈玥品牌内容策划音色广场的声音覆盖面够广,讲解视频、短视频和产品片不用每次都从零开始找声音。
Oliver Grant视频制作人我用 AI voice cloning 快速测试广告旁白,一个下午就能比较多种文案和表达方向。
Alex Morgan增长负责人长文本拆分后生成很顺手,情绪标签能帮助塑造章节氛围,后期只需要微调节奏。
宋怡有声书编辑同一个角色的克隆音色在多集内容里也不容易变化,持续更新系列作品时很实用。
Kenta Mori动画频道运营我们用在线文本转语音制作产品讲解和活动预热,临近上线时也能及时替换最后一版文案。
陈玥品牌内容策划音色广场的声音覆盖面够广,讲解视频、短视频和产品片不用每次都从零开始找声音。
Oliver Grant视频制作人单次输入支持更长的脚本,文字不用切得太碎,生成出来的语气和节奏也更连贯。
梁书瑶知识类创作者多语言 AI 配音节省了很多时间,我们能在同一次评审里比较中文、英文、日文和韩文版本。
Sophie Carter品牌策略师地方口音对本地内容很关键。普通话和方言版本放在一起试听后,团队更容易选出贴近用户的版本。
高铭本地生活运营加入情感标签后,可以很快区分紧张感台词和沉稳说明类音频,角色表达明显更丰富。
Haruto Sato游戏声音导演课程更新最看重速度。修改讲稿后可以马上重新生成清晰旁白,不必重新预约整场录音。
Rachel Moore课程创作者单次输入支持更长的脚本,文字不用切得太碎,生成出来的语气和节奏也更连贯。
梁书瑶知识类创作者多语言 AI 配音节省了很多时间,我们能在同一次评审里比较中文、英文、日文和韩文版本。
Sophie Carter品牌策略师地方口音对本地内容很关键。普通话和方言版本放在一起试听后,团队更容易选出贴近用户的版本。
高铭本地生活运营加入情感标签后,可以很快区分紧张感台词和沉稳说明类音频,角色表达明显更丰富。
Haruto Sato游戏声音导演课程更新最看重速度。修改讲稿后可以马上重新生成清晰旁白,不必重新预约整场录音。
Rachel Moore课程创作者Qwen-Audio-3.0-TTS 是阿里云百炼提供的高性能语音合成模型系列,支持在线文本转语音、声音复刻、声音设计和 instruction 表达控制。它与 Qwen3-TTS、CosyVoice 属于不同的模型系列。DS Speech 专注于提供更易用的 Qwen-Audio-3.0-TTS 在线声音克隆与 AI 语音生成体验。
在工作台输入文本,选择预设音色,或上传一段清晰的参考音频保存为自己的声音模型,然后生成试听结果。
可以。使用他人声音前,请确保您已获得声音权利人的合法授权;如果使用的是您本人的声音,或由您自行生成且不涉及他人权益的音色,则可以用于商业项目,我们不会额外限制其商业用途。
中文(普通话、广东话、重庆话、东北话、甘肃话、贵州话、浙江话、河北话、河南话、湖北话、湖南话、江西话、宁波话、宁夏话、青岛话、陕西话、山西话、山东话、上海话、四川话、云南话)、英语、日语、韩语、俄语、法语、德语、葡萄牙语、泰语、印尼语、越南语、西班牙语、意大利语、马来西亚语、菲律宾语、阿拉伯语
WAV、MP3、M4A 格式,音频时长推荐 10~20 秒,最长不超过 60 秒。文件大小 ≤ 10 MB,采样率 ≥ 16 kHz。
双声道音频仅处理首声道,请确保首声道包含有效人声。
音频必须包含至少 5 秒连续清晰的朗读内容(无背景音),其余部分仅允许短暂停顿(≤ 2 秒)。整段音频应避免出现背景音乐、环境噪音或其他人声。请使用正常语速的说话音频,不要上传歌曲或唱歌录音。
请勿用于欺诈、冒充、骚扰、仇恨、淫秽或色情内容或其他违法场景。如经发现会立即终止您账户的权利。
会员额度与单独购买的积分包都按自然月清零,请在当月内合理安排使用。
可以通过标签和 instruction 指令控制部分情绪、方言和角色风格。
instruction 示例:
标准播音风格:吐字清晰精准,字正腔圆
年轻活泼的女性声音:语速较快,带有明显的上扬语调,适合介绍时尚产品
沉稳的中年男性:语速缓慢,音色低沉有磁性,适合朗读新闻或纪录片解说
instruction 中文方言示例:
请用河南话表达
标签示例:
[excited]今天的天气真不错![laughing]我们一起出去玩吧!
不会。会员过期或从 Pro 会员降级为 Plus 会员后,您已创建的声音模型仍会保留,不会被删除。但您只能使用当前会员等级所支持数量范围内、最近创建的声音模型。
例如,您原本是 Pro 会员,已创建 30 个声音模型。降级为 Plus 会员后,您可以继续使用最近创建的 10 个声音模型,其余模型仍会保留,但暂时无法使用。
当您重新开通 Pro 会员后,原有的 30 个声音模型将恢复正常使用。
文本转语音生成的音频文件仅保存3天。超过期限后将无法播放或下载,请及时下载并妥善保存。