阶跃星辰最强开源端到端语音大模型：开启终端人机交互语音新范式

发布时间：2025-09-02 17:08:55点击量：

　　据IPO早知道消息，阶跃星辰日前正式发布最强开源端到端语音大模型 Step-Audio 2 mini，该模型在多个国际基准测试集上取得 SOTA（State-of-The-Art，即当前最佳水平）成绩。在技术层面，Step-Audio 2 mini 采用了真正的端到端多模态架构，并将语音理解、音频推理与生成统一建模，不仅时延更低、输出更快，还能更加精准地理解副语言信息、非人声信号等语音要素，显著提升了语音人机交互的效率和智能上限。目前，Step-Audio 2 mini 已经可在 GitHub、Hugging Face 等平台下载并体验。

　　根据测评，这款模型在音频理解、语音识别、跨语种翻译、情感与副语言解析、等任务中表现突出，综合性能超越 Qwen-Omni 、Kimi-Audio 在内的所有开源端到端语音模型，并在大部分任务上超越 GPT-4o-audio。

　　随着语音交互成为人机主要交互方式，智能终端设备对语音模型的智商及情商水平提出了更高要求。Step-Audio 2 mini 首创了音频推理能力，能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应，由此让 AI 听懂人类的“弦外之音”；同时，该模型率先支持语音原生的 Tool Calling 能力，可实现联网搜索等操作，有效解决模型幻觉问题，并让语音模型像文本模型一样具有更强大的知识储备和推理能力。

　　在此之前，吉利发布了搭载阶跃星辰端到端语音大模型的吉利银河 M9，这是行业内端到端语音大模型首次实现量产上车。据阶跃星辰相关人士介绍，自去年发布国内首个千亿参数端到端语音大模型 Step-1o Audio 以来，该公司持续迭代模型性能，并跟吉利、鲸鱼机器人、TCL、Cyan 青心意创等头部终端厂商达成深度合作，让语音大模型在生活场景中为消费者提供更加智能、便捷的互动体验。

　　今年以来，阶跃星辰已经开源了 8 款性能领先的多模态模型，覆盖语音、视频生成、图像编辑、3D、多模态推理等多个类别，为全球开源社区贡献多模态力量。

　　特别声明：以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布，本平台仅提供信息存储服务。

　　22人癌细胞几乎“全消失”，21人癌细胞明显减少！新型抗癌药泽美妥司他在中国获批上市

　　等了十年，石宇奇终于说出这句线月训练曝光：参加力量技术训练5v5对抗提升攻防速度强度

　　摩托罗拉 Moto G06 手机曝光：6.88 英寸 120Hz 屏+5200mAh 电池

　　OriginOS 6 系统 UI 细节设计首曝，vivo X300 系列手机首发

　　潮涌江淮，青春共筑强军梦│安徽省潜山野寨中学党总支书记朱太平：两年来，安徽省潜山野寨中学共有90名学...

　　《编码物候》展览开幕北京时代美术馆以科学艺术解读数字与生物交织的宇宙节律

上一篇 : OpenAI发布革命性语音模型gpt-realtime 实现语音交互质的飞跃

下一篇: 广州地区艾瑞泽8降价消息底价899万！赶快行动

返回列表

产品展示

智能一卡通系统

安全防范系统

智能语音识别

CRM系统

智能化弱电系统

阶跃星辰最强开源端到端语音大模型：开启终端人机交互语音新范式

友情链接