阶跃发布 StepAudio 3 系列语音大模型,多款登顶 Artificial Analysis 全球榜单
Array 雷峰网

阶跃发布 StepAudio 3 系列语音大模型,多款登顶 Artificial Analysis 全球榜单

阶跃一次性推出 StepAudio 3 Realtime、ASR、TTS、Gen 与 Music 五款语音模型,覆盖实时语音交互、语音识别、真人级语音生成与音乐创作等场景。其中多款模型在第三方评测机构 Artificial Analysis 榜单中位列全球第一,能力从单项语音识别与生成延伸至语音理解、实时推理、任务执行与音频创作的全栈方向。

9月15日,阶跃正式发布新一代语音大模型 StepAudio 3 系列,一次性推出五款模型,分别是面向实时语音交互的 StepAudio 3 Realtime、语音识别模型 StepAudio 3 ASR、真人级语音生成模型 StepAudio 3 TTS、综合音频生成模型 StepAudio 3 Gen 以及音乐创作模型 StepAudio 3 Music。这一发布节奏在语音大模型赛道中并不常见,多数厂商通常围绕单一能力迭代,而阶跃选择以矩阵式方式覆盖从“听”到“说”、从理解到创作的全链路场景。更值得关注的是,其中多款模型在第三方权威评测机构 Artificial Analysis 的榜单中位列全球第一,这意味着国产语音模型在部分核心指标上已进入全球领先梯队。

从具体能力来看,StepAudio 3 Realtime 是此次发布中最具突破性的产品。它支持原生全双工对话,能够在持续交流中自主判断何时回应、何时等待,并处理用户临时打断和连续反馈等真实对话中的复杂情况。在 Artificial Analysis 的 Conversational Dynamics 榜单中,该模型以 98.9% 的综合得分排名全球第一。与传统实时语音模型主要追求低延迟和自然度不同,StepAudio 3 Realtime 还加入了语音推理和任务执行能力,能够同时理解语义、语气、情绪及环境声音,并支持推理与语音生成并行。Tool Call 和长任务可以异步执行,在任务运行期间不会打断当前对话,该模型在 Speech Reasoning 榜单中同样位列全球第一。

语音识别方面,StepAudio 3 ASR 将高精度识别与大语言模型的上下文理解和知识能力相结合,目标不只是“听清楚”,还要理解专业术语、人名、地名、方言及复杂上下文。该模型支持中文、英文、方言、中英混说、长音频和专业领域等多类场景,并针对低声、快速语音、含糊连读以及背景音乐等复杂输入进行了优化。在 Artificial Analysis 非流式语音识别准确性榜单中,StepAudio 3 ASR 的词错误率仅为 1.7%,并列全球第一。词错误率越低意味着转写错误越少,这一成绩表明该模型在第三方综合测试中的识别准确率已处于全球第一梯队。

在语音生成方向,StepAudio 3 TTS 面向真人级语音合成,除音色、语调、节奏、停顿和情绪表达外,还能生成笑声、迟疑、重复、改口等真实交流中常见的副语言表现。该模型采用流式生成架构,可实现生成与播放同时进行,满足实时语音应用需求。StepAudio 3 Gen 则进一步将人声、音效、环境声和背景音乐等原本分散的生成环节整合在一起,用户可以通过自然语言描述角色、场景和剧情,一次生成包含多种音频元素的完整内容。StepAudio 3 Music 则专注于音乐创作场景,进一步拓展了语音模型在内容生产领域的应用边界。

整体来看,StepAudio 3 系列的发布反映出语音大模型竞争正在从单项能力比拼转向全栈能力整合。过去行业主要围绕语音识别或语音生成等单一方向展开竞争,而阶跃此次将能力延伸至语音理解与生成、实时推理、任务执行和音频创作的全栈方向,让 AI 不仅能够“听”和“说”,也能理解声音背后的语义与情绪,并参与更完整的交互和内容生产过程。对于开发者而言,这意味着可以基于统一模型体系构建更复杂的语音应用;对于行业而言,语音交互与音频创作的门槛有望进一步降低,相关应用场景的落地速度也可能随之加快。