/传播易/9月16日,科大讯飞发布基于全国产化算力训练的语音基座大模型Spark-Audio-1.0-Preview。
Spark-Audio-1.0-Preview支持文本和语音两个模态的输入以及文本模态的输出,可支持语音转写、多语言翻译、多方言识别、环境音识别、说话人识别、情感分析以及复杂的音频问答等场景任务的实现,覆盖99种语言及202种方言识别,使智能语音完成从“听清”到“听懂”的跃升。
在训练数据量仅相当于同尺寸模型Qwen3.5-omni-Flash十分之一的情况下,Spark-Audio-1.0-Preview在各项语音评测任务上效果整体相当、部分超过,尤其在偏真实应用类任务上明显领先,与尺寸更大的闭源语音基座模型效果接近。Spark-Audio-1.0-Preview整体上在多语言、多方言、复杂场景下的高噪声和小音量任务中有更好的表现。
据了解,作为业界首个基于全国产算力训练的语音基座大模型,Spark-Audio-1.0-Preview通过音频编码器预训练,逐步扩展音频编码器的表征能力;再通过预训练和后训练,提升了模型的基础能力、复杂场景泛化性以及多个任务效果。
目前,Spark-Audio-1.0-Preview正式开放体验,API后续将上线讯飞开放平台;基于Spark-Audio-1.0-Preview语音基座大模型,科大讯飞还将在近期陆续展开一系列语音相关大模型的发布和升级。
【科大讯飞发布Spark-Audio-1.0-Preview全国产语音基座大模型】相关文章:





