让AI听懂“弦外之音”

本版

第5版：上海新闻/专题

“特别的爱给特别的你” 让AI听懂“弦外之音” 申城会展业“金九银十”来啦西部订单同比增长超四成
目录

第1版:一版要闻

第2版:要闻

第3版:要闻

第4版:要闻

第5版:上海新闻/专题

第6版:综合新闻

第7版:专题

第8版:科教卫新闻

第9版:社区新闻

第10版:长三角

第11版:长三角/万象

第12版:文体新闻

第13版:文体新闻

第14版:夜光杯

第15版:夜光杯

第16版:新民旅游

第T1版:山河重光民族自强/抗战胜利纪念日特刊

第T2/T3版:山河重光民族自强/抗战胜利纪念日特刊

第T4版:山河重光民族自强/抗战胜利纪念日特刊

第T5版:山河重光民族自强/抗战胜利纪念日特刊

第T6版:山河重光民族自强/抗战胜利纪念日特刊

第T7/T10版:山河重光民族自强/抗战胜利纪念日特刊

第T8/T9版:山河重光民族自强/抗战胜利纪念日特刊

第T11版:山河重光民族自强/抗战胜利纪念日特刊

第T12版:山河重光民族自强/抗战胜利纪念日特刊

第T13版:山河重光民族自强/抗战胜利纪念日特刊

第T14版:山河重光民族自强/抗战胜利纪念日特刊

第T15版:山河重光民族自强/抗战胜利纪念日特刊

第T16版:山河重光民族自强/抗战胜利纪念日特刊

第5版：上海新闻/专题 2025-09-02

上海大模型企业开源SOTA级端到端语音大模型

记者昨天从大模型“六小虎”之一的阶跃星辰获悉，其最新发布开源端到端语音大模型Step-Audio 2 mini，该模型在多个国际基准测试集上取得SOTA（Stateof-The-Art，即当前最佳水平）成绩。目前，Step-Audio 2 mini已经可在GitHub、Hugging Face等平台下载并体验。

在技术层面，Step-Audio 2 mini采用了真正的端到端多模态架构，并将语音理解、音频推理与生成统一建模，不仅时延更低、输出更快，还能更加精准地理解副语言信息、非人声信号等语音要素，显著提升了语音人机交互的效率和智能上限。据测评，这款模型在音频理解、语音识别、跨语种翻译、情感与副语言解析等任务中表现突出，综合性能超越Qwen-Omni、Kimi-Audio在内的所有开源端到端语音模型，并在大部分任务上超越GPT-4o-audio。

随着语音交互成为人机主要交互方式，智能终端设备对语音模型的智商及情商水平提出了更高要求。Step-Audio 2 mini首创了音频推理能力，能对情绪、语调、音乐等副语言和非语音信号进行精细理解、推理并自然回应，由此让AI听懂人类的“弦外之音”；同时，该模型率先支持语音原生的Tool Calling能力，可实现联网搜索等操作，有效解决模型幻觉问题，并让语音模型像文本模型一样具有更强大的知识储备和推理能力。

此前，吉利发布搭载阶跃星辰端到端语音大模型的吉利银河M9，这是行业内端到端语音大模型首次实现量产上车。自阶跃星辰去年发布国内首个千亿参数端到端语音大模型Step-1o Audio以来，该公司持续迭代模型性能，并跟吉利、鲸鱼机器人、TCL、Cyan青心意创等头部终端厂商达成深度合作，让语音大模型在生活场景中为消费者提供更加智能、便捷的互动体验。本报记者郜阳