科大讯飞发布语音识别大模型Spark-ASR-2.0:推理成本只增加10%

PChome | 编辑: 秦天 2026-09-23 17:41:48

今日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。

PChome 9月23日消息,今日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。

据官方介绍,Spark-ASR-2.0通过非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术创新,整体的语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显。在效果提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。

官方称,“如果说过去的语音识别追求的是一字不差地还原所说内容,那么Spark-ASR-2.0则更进一步,让识别结果‘流畅成文’——在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。”

相较于Spark-ASR-1.0,Spark-ASR-2.0在语音识别各核心场景上的效果有明显进步,尤其在中英文混合、方言、高噪声、文本流畅规范性等维度上的效果实现了大幅提升,WER(词错误率)明显降低。Spark-ASR-2.0与当前业界最好水平相比,在方言、高噪和小音量上拥有显著优势,也再次证明了在复杂声学场景上语音识别的强大实力,主要任务效果均好于业界最优水平。

说明:所有图文均来自网络,版权归原作者所有,如果侵犯您的权益,请联系我们删除。

每日精选

首页 手机 数码相机 笔记本 游戏 DIY硬件 硬件外设 办公中心 数字家电 平板电脑