科大讯飞发布Spark-Audio-1.0-Preview,全国产语音基座大模型实现从“听清”到“听懂”
2026年09月16日 18:
9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview,支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,使智能语音完成从“听清”到“听懂”的跃升。
Spark-Audio-1.0-Preview采用 0.65B(Dense结构)的音频编码器,搭配30B-A3B(MoE结构)的大语言模型,使用了1300万小时音频以及大量文本数据,基于纯国产算力集群训练完成。在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型效果接近。
Spark-Audio-1.0-Preview可支持99种语言及202种方言的识别。在Fleurs、KeSpeech、LibriSpeech等中英文、多语言、多方言语音识别评测任务中,Spark-Audio-1.0-Preview得分高于Gemini-3.1 Pro;Fleurs-中文测试集中,Spark-Audio-1.0-Preview取得了SOTA;面向更实际的应用场景,Spark-Audio-1.0-Preview在高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。
同时,Spark-Audio-1.0-Preview在通用知识、数学与代码等任务上没有出现明显降智,在指令遵循、对话、音频理解等任务上仍有进步追赶空间。