阶跃于9月15日(IT之家报道)推出StepAudio 3系列模型,涵盖StepAudio3Realtime、StepAudio3ASR、StepAudio3TTS、StepAudio3Gen和StepAudio3Music,其中多款产品在Artificial Analysis榜单上占据全球首位。这五款模型目前均已通过阶跃星辰开放平台对外开放。

官方表示,StepAudio 3系列针对以下核心应用场景设计:生成真人级别的语音、制作完整音频内容、实现实时语音交互、理解复杂语音环境以及进行音乐创作。

以下是IT之家整理的模型官方详细说明:

StepAudio 3 Realtime:不止于“可打断”,更能理解、推理与执行

当前,众多Realtime语音产品已具备全双工、打断及低延迟互动能力。真正区分体验优劣的关键,并非仅仅是“能否同时听说”,而是模型在持续对话中能否边听边理解,判断何时插话,并同步完成推理与任务处理。

StepAudio 3 Realtime以此为目标,提升了实时互动性能,支持原生全双工实时对话。

在Artificial Analysis的Conversational Dynamics榜单中,StepAudio 3 Realtime以98.9%的综合得分位居全球第一,展示了领先的实时语音交互能力。这意味着该模型不仅能“听懂”和“回答”,还能像真实对话中的人类一样把握交流节奏——知晓何时回应、何时等待,并处理用户的突然打断和连续反馈。

同时,StepAudio 3 Realtime在Artificial Analysis的Speech Reasoning榜单上以99.7%的语音推理准确率排名全球第一。Speech Reasoning基准主要评估模型直接理解音频并完成复杂推理任务的能力,是业内衡量“原生语音模型”的关键第三方标准之一。

该模型还能同时解析语义、语气、情绪、副语言特征及环境声音,使实时交互不再仅依赖文字,而是利用更完整的音频信息来理解用户意图。

面对复杂问题时,StepAudio 3 Realtime支持推理与语音生成并行,在快速响应的同时持续组织并深化后续回答。

此外,Tool Call和长任务可异步执行,不阻塞当前语音会话。在任务运行期间,用户仍可继续交流,待结果完成后自然回归当前上下文。

这使得Realtime语音模型不仅限于“更自然的聊天”,还能在同一持续对话中实现听、说、思考与行动。

StepAudio 3 ASR:从听清转向听懂

传统语音识别主要解决“听到了什么”,但现实语音常包含方言、口音、专业术语、同音词及复杂上下文。一个真正可用的ASR模型,不仅要准确转写声音,还需理解说话者的含义。

StepAudio 3 ASR将高精度语音识别与大型语言模型的上下文理解、知识及推理能力相结合,使语音识别从“辨认声音”迈向“理解语境”。

它支持中文、英文、方言、中英文混合、长音频及专业领域等多种场景识别,能适应不同语言环境和表达方式。同时,依托大语言模型的知识理解能力,StepAudio 3 ASR能更准确地识别复杂内容,如人名、地名、专业术语,在医疗、法律、金融、汽车、编程等领域提升专业表达的识别效果。

该模型还能处理低声、快语速、含糊连读、歌声及背景音乐等复杂输入,使真实声音环境下的语音被更准确地识别和应用。

这意味着ASR模型不再仅是声音转写工具,而是能更准确地理解、检索和使用每段语音内容。在会议纪要、视频字幕与直播理解、智能客服、车载交互、医疗记录、金融服务及专业内容生产场景中,都能精准完成任务。

StepAudio 3 ASR在Artificial Analysis的非流式语音识别准确性榜单上,词错误率(WER)仅为1.7%,并列全球第一。

StepAudio 3 TTS:超越朗读,接近真人表达

声音不仅承载文字信息,还包含语气、节奏、停顿和情绪等丰富表达细节。如何让AI生成的语音更接近真实交流,一直是语音生成模型的重要方向。

StepAudio 3 TTS是一款面向实时交互场景的真人级语音生成模型,致力于使AI语音从“准确发声”走向“自然表达”。

该模型在音色基础、语调层次、节奏律动及气口停顿等方面高度贴合人类自然口语模式,不仅能生成文字对应的语音,还能还原笑声、迟疑、结巴、重复、改口等真实交流中的副语言表现,使合成语音更接近真人说话。

同时,StepAudio 3 TTS能结合语义内容理解表达意图,自主调整情绪与语气变化,使声音表达更符合具体场景。在实时交互方面,模型基于流式生成架构,实现生成与播放同步,满足实时语音应用需求。

StepAudio 3 Gen:人声、音效、环境、音乐,一次性生成

传统音频内容生产通常涉及漫长流程:角色配音、环境音、音效、背景音乐需分别制作,再经过剪辑、对齐和混音,才能形成最终作品。

StepAudio 3 Gen尝试将这些分散环节统一到一个模型中。

它能基于自然语言描述和参考音频,统一生成人声、音效、环境音和背景音乐。用户只需描述角色、场景和剧情,无需针对特定角色或场景进行额外训练,即可直接生成具有完整声音层次的音频内容。

更重要的是,这些声音并非简单叠加。

StepAudio 3 Gen支持对多个角色的音色、说话方式、语气、情绪、方言口音,以及笑声、喘息、停顿等副语言特征进行精细控制,还能进一步指定对白、音效、环境声和背景音乐出现的时间与顺序。

这意味着模型不仅在“生成声音”,也开始参与整段内容的声音设计与时序编排。

对于影视、动画、游戏、广播剧、有声书和短视频创作者而言,原本需要素材搜集、多工具协作和大量后期处理的声音制作流程,有望被压缩到一次生成和持续迭代中。

StepAudio 3 Music:不止生成,更参与创作

音乐生成模型已越来越擅长“一句话生成一首歌”。但真正的音乐创作不应如此“简单抽卡”。创作者可能已有歌词、清唱、旋律、乐谱或Demo,希望AI继续完成编曲、改编和制作。

因此,StepAudio 3 Music不仅支持从零生成,也支持基于ABC记谱法控制的多轮交互创作。

该模型支持歌曲创作、清唱配乐、歌曲翻唱等多种功能。用户可提供歌词、清唱、参考歌曲、ABC记谱法等输入,让模型围绕已有创作继续生成和完善作品。

同时,用户可通过自然语言直接控制曲风、人声、旋律、节奏、乐器、情绪、段落和制作质感。

模型还对主歌、副歌、桥段、间奏等歌曲结构,以及跨段落的旋律发展、能量变化和演唱表达进行建模,使生成目标不仅是“一段好听的音乐”,而是一首结构完整、表达连贯的作品。

尤其在清唱配乐场景中,用户只需提供一段清唱,模型就能理解其中的旋律、节奏和情绪,并进一步补充和声、节奏、乐器和完整编曲。

一首温暖柔和的City Pop男声歌曲,带一点爵士和轻摇滚的感觉,氛围朦胧浪漫。

这使音乐大模型开始更深入地进入真实音乐生产流程,而不仅仅是一个“一键生成歌曲”的工具。

评论区

李明

下半场换人调整立竿见影,替补上场的9号球员两次助攻,彻底盘活了前场进攻。

  • 2026年9月1

王芳

防守端的高位逼抢虽然冒险,但成功限制了对手的出球路线,是本场拿到一分的关键。

  • 2026年9月1

张伟

裁判的几次判罚存在争议,尤其是第78分钟的点球漏判,直接影响了比赛结果。

  • 2026年9月1

发表评论

王芳

体育数据分析师

我是一名专注体育赛事分析的博主,热爱用数据解读每场比赛的战术细节,希望为球迷提供有价值的观点。

查看完整资料