PChome 7月31日消息,阿里巴巴正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。新模型在医疗场景的识别准确率突破95.36%,工业场景达93.24%。
PChome 7月31日消息,阿里巴巴正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。与通用语音识别不同,这次的新模型专门解决了一个实际问题:医疗、法律、工业这些领域里,AI总是听错专业术语——医生说的药品名、工程师报的参数、律师念的法条,模型往往一头雾水。新模型在医疗场景的识别准确率突破95.36%,工业场景达93.24%。

模型的优化方向很具体:从医疗、编程、股票等领域挖掘专业词汇,建成了覆盖多行业的高质量词库。同时它还具备语音润色能力,能把口述内容直接整理成结构化的文本。对于医生来说,查房时口述病历、手术记录等场景,AI就能直接帮忙转成规范的电子文档,省去人工整理的环节。

Qwen-Audio-ASR-Flash系列此前已在AI评测平台Artificial Analysis上以1.7%的错字率拿下全球第一,已在会议纪要、实时字幕、智能客服等场景中验证。目前该模型已通过阿里云百炼平台开放调用,提供实时语音、离线文件转写、长音频识别三个版本。当AI能听懂医生的“口头禅”,能理解工程师的“行话”,语音识别才真正从“能听”走向“能用”——这正是垂直场景里AI落地的关键一步。