今日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。
PChome 9月23日消息,今日,科大讯飞正式发布最新一代语音识别大模型Spark-ASR-2.0。
据官方介绍,Spark-ASR-2.0通过非自回归与LLM增强自回归协同、中英文混合文本与声学联合增强、动态上下文注入等关键技术创新,整体的语音识别效果大幅提升,尤其在通用识别(中英文混合、方言、专业术语)、复杂声学场景识别(高噪、小音量、快语速、儿童)、上下文识别和文本流畅规范性等方面改善明显。在效果提升的同时,Spark-ASR-2.0的整体推理成本相对Spark-ASR-1.0仅增加了10%。
官方称,“如果说过去的语音识别追求的是一字不差地还原所说内容,那么Spark-ASR-2.0则更进一步,让识别结果‘流畅成文’——在提升识别准确率的同时,结合上下文逻辑与语境理解,精简冗余表达、精修各类细节,让文字更连贯、语义更清晰。”
相较于Spark-ASR-1.0,Spark-ASR-2.0在语音识别各核心场景上的效果有明显进步,尤其在中英文混合、方言、高噪声、文本流畅规范性等维度上的效果实现了大幅提升,WER(词错误率)明显降低。Spark-ASR-2.0与当前业界最好水平相比,在方言、高噪和小音量上拥有显著优势,也再次证明了在复杂声学场景上语音识别的强大实力,主要任务效果均好于业界最优水平。