过去,大模型处理音频大多采用级联方案:先把语音转成文字,再交给大模型理解。这种做法有两个明显短板:
信息丢失。文字只能记录说了什么,会丢掉语音里自带的语气、情绪,还有背景环境音等关键信息,导致模型对场景的判断不完整,自然也会影响到最后的结果。
链路割裂。这套系统把语音转写、声纹识别、语音翻译等能力拆成独立模块串联运行,模块之间存在断点,不仅容易累积错误,在使用体验上也会出现延迟、卡顿。
据了解,语音基座大模型就解决了上面的这些问题:它不再只做语音转文字,而是直接理解语音。语音基座大模型一次性听懂人声、环境音、音乐等等,而且还能理解声音里的语义、情绪和场景。
此次首发的 Spark-Audio-1.0-Preview 采用 0.65B的音频编码器,搭配 30B-A3B的大语言模型,使用了 1300 万小时音频以及大量文本数据,基于纯国产算力集群训练完成,是地道的国产语音基座大模型;在同一个模型中可输入文本和语音两个模态,支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等任务,让机器从“听清”进一步走向“听懂”。
官方称,Spark-Audio-1.0-Preview 在各项语音评测任务上效果整体相当、部分超过,尤其在复杂场景高噪声、小声说等偏真实应用类任务上明显领先;与尺寸更大的闭源语音基座模型相比,Spark-Audio-1.0-Preview 的表现也十分接近。与讯飞星火大模型的 1+N 体系类似,在语音基座大模型上也可进行微调,开发语音识别、语音同传、语音交互等专用模型或者系统,在相关语音业务中落地。
面向更实际的应用场景,Spark-Audio-1.0-Preview 在复杂场景的高噪声、小音量等复杂条件下的语音识别评测任务中也有较为明显的领先优势。
此次发布的 Spark-Audio-1.0-Preview 在通用知识、数学与代码等任务上没有出现明显降智,同时在指令遵循、对话、音频理解等任务上仍有进步追赶空间。下一步,我们将在巩固、加强优势的同时补齐短板,交出更好的成绩。
* 注:测试集中 ASR相关任务使用 WER / CER 作为评价指标,数值越低表示效果越好;S2TT 语音翻译任务使用 BLEU 分作为评价指标;其他任务均使用准确率作为指标,数值越高表示效果越好。










