
阶跃一口气发布五款语音大模型:StepAudio 3 系列,多榜单拿下全球第一
据官方消息,9 月 15 日国产大模型公司阶跃星辰发布了新一代语音大模型 StepAudio 3 系列,一次性推出 五款模型:StepAudio 3 Realtime、3 ASR、3 TTS、3 Gen 和 3 Music,覆盖实时语音交互、语音识别、真人级语音生成和音乐创作等场景。据了解,其中多款模型在第三方评测机构 Artificial Analysis 的榜单中位列全球第一。
这五款模型分别能干什么
- StepAudio 3 Realtime(实时交互):支持原生「全双工」对话,边听边说,能自己判断什么时候该回应、什么时候该等一等,还能处理临时打断和连续反馈。它不只追求低延迟,还加入了「语音推理」和任务执行能力——能同时听懂语义、语气、情绪和环境声音,涉及工具调用的长任务可以放到后台异步执行,不打断你当前的聊天。据官方数据,它在 Artificial Analysis 的 Conversational Dynamics 榜以 98.9% 综合得分列全球第一,Speech Reasoning 榜同样全球第一。
- StepAudio 3 ASR(语音识别):在高精度识别之外,接入了大模型的上下文理解能力,重点解决专业术语、人名地名、方言和复杂语境的理解问题,支持中英文、方言、中英混说、长音频等场景,并针对低声、快语速、含糊连读、背景音乐等「难听清」的输入做了优化。在 Artificial Analysis 非流式语音识别准确性榜上,词错误率(WER)为 1.7%,并列全球第一。
- StepAudio 3 TTS(语音生成):主打真人级语音,音色、语调、节奏、停顿和情绪之外,还能生成笑声、迟疑、重复、改口这类真实对话里常见的「副语言」表现,并采用流式架构,边生成边播放。
- StepAudio 3 Gen(声音整合):把人声、音效、环境声和背景音乐整合到一起,用自然语言描述角色、场景和剧情,一次生成含多种声音元素的完整音频,还能控制角色音色、情绪以及不同声音出现的时间和顺序,适合影视、动画、游戏、广播剧、有声书、短视频等场景。
- StepAudio 3 Music(音乐创作):不止于「一句话生成一首歌」,支持歌曲创作、清唱配乐、歌曲翻唱,以及基于 ABC 记谱法的多轮交互创作,用户可以用歌词、清唱、参考歌曲等形式和模型一起完成编曲和迭代。
为什么值得关注
过去语音模型大多在「听得准」或「说得像」这类单项能力上比拼。据官方介绍,StepAudio 3 系列把能力延伸到语音理解与生成、实时推理、任务执行和音频创作的全栈范围,让 AI 不只是「听」和「说」,还能理解声音背后的语义与情绪,并参与更完整的交互与内容生产。
目前,StepAudio 3 系列五款模型均已上线阶跃星辰开放平台。
来源:InfoQ《阶跃发布全新语音大模型 StepAudio 3 系列:覆盖语音识别、生成、实时交互与音乐创作》
原文链接:https://www.infoq.cn/article/paoGkkFVHV3gbhG3GEdC |