智东西(公众号:zhidxcom)
作者 | 程茜
编辑 | 李水青
智东西7月31日消息,今日,阿里千问大模型团队发布语音识别大模型Qwen-Audio-3.0-ASR-Flash。该模型的优化主要体现在上下文一致性、行业词识别和热词定制化三个维度。
根据官方披露,Qwen-Audio-3.0-ASR-Flash在医疗场景的专业词“听中率”达到95.36%,工业、IT编程、畜牧业准确率同样超90%;并且其热词“听中率”在所有测试集都达到90%以上,多数场景突破99%。
此外,研究人员还升级了模型的语音润色能力、多语言识别能力,其能直接帮用户去掉口头禅,输出结构化文本。
例如下面的文本,Qwen-Audio-3.0-ASR-Flash可以对语义不清晰的划线部分进行内容重组,保留关键信息。
润色前:对比我们的奔驰C级的汽车和宝马的,宝,奔驰C级和宝马三系。那我们再结合我们前期已经了解到的客户画像,她是一位女性啊,夫妻两个人的每天工作的场景就是上下班的代步。那在这种场景下还有客户可能比较关注性价比啊,关注它的可靠性啊。会就会有这个销售话术的引导会给出来。
润色后:对比奔驰C级和宝马3系,结合前期了解到的客户画像:她是一位女性,夫妻两人每天的工作场景就是上下班代步。在这种场景下,客户可能比较关注性价比和可靠性,销售话术的引导会随之给出。
千问大模型团队透露,Qwen-Audio-ASR-Flash系列曾在全球权威AI评测平台Artificial Analysis上,以1.7%的错字率拿下全球第一。
目前,Qwen-Audio-3.0-ASR已通过阿里云百炼平台开放调用,提供三个版本:
语音识别,最长5分钟Qwen-Audio-3.0-ASR-Flash:
https://help.aliyun.com/zh/model-studio/non-real-time-speech-recognition-for-fun-asr-flash
离线文件转写Qwen-Audio-3.0-ASR-Filetrans:
https://help.aliyun.com/zh/model-studio/fun-asr-recorded-speech-recognition-http-api
实时语音识别Qwen-Audio-3.0-ASR-Streaming:
https://help.aliyun.com/zh/model-studio/fun-asr-realtime-websocket-api
一、靠读上下文、自带知识库学习,拿捏陌生专业词汇
首先是长音频的识别能力,Qwen-Audio-3.0-ASR-Flash具有长音频Context能力,是指识别时可参考前文已识别的内容,让跨片段的识别保持连贯,不遗漏、不认错。
一般而言,很多长音频里的专业术语、英语词汇,需要依靠模型理解上下文内容,才能识别准确。
基于此,Qwen-Audio-3.0-ASR-Flash新增的能力,就是让模型在转写当前语音时,能参考近期已经识别出的内容,顺着同一话题里的关键词和语义往下听,从而减少同音词误判,把术语、中英文混说这些容易出错的地方听得更准。
并且,模型的这些“记忆”直接来自音频本身,会随对话自动更新。

其次是专业术语的识别,Qwen-Audio-3.0-ASR-Flash行业词汇识别能力,可以将各行业的专业词汇内化为模型自身的识别能力,无需逐一配置也能持续听准。
这针对的是有些专业词汇可能在对话里只出现一次,传统做法需要人工维护词表,Qwen-Audio-3.0-ASR-Flash则将其变成自身能力。
研究人员从医疗、IT编程、股票、社会名人等领域里挖掘专业词汇,打造覆盖多行业的高质量词库,加强模型对专业术语和冷门词的识别。
据官方披露,在最新的行业词汇内部评测中,新模型对各行业专业词的”听中率”都有明显提升,其中医疗场景突破95.36%。

最后是热词定制,Qwen-Audio-3.0-ASR-Flash可以通过分级热词机制,让企业按需配置的专属词汇即时生效。
有些名词每家企业有自己的专属叫法,此前需要为企业添加热词,但热词加多就会导致误触发情况增多,识别效果也会降低。
在传入热词的情况下,Qwen-Audio-3.0-ASR-Flash的热词“听中率”在所有测试集都达到90%以上,多数场景突破99%。

二、直出流畅文本,口头禅、语气词都能识别润色
人们在说话时会伴有口癖,Qwen-Audio-3.0-ASR-Flash在识别时就会直接去掉口头禅,生成条理清晰的书面文本。
千问大模型官方披露,在评测中,Qwen-Audio-3.0-ASR-Flash去口头禅、去重复后的可读性和忠实度,和“先识别+再用Qwen3.6-Plus润色”的两步走方案基本打平,所有子集的可读性平均分从没润色时的2.55提升到3.43,优秀可读率从30.75%提升到59.27%。
下面几个案例中,划线部分就是模型润色的部分。
去除无意义的语气词,润色前:那同时因为其实您日常我们再去用一些AI的AI的一个产品和模型的话,我们其实大部分都是在用一些像这种DeepSeek或者是千问,或者是这个Kimi这样的一个通用模型。
润色后:同时,因为日常使用AI产品和模型时,我们大部分都在用DeepSeek、千问或Kimi这类通用模型。
清理口吃与重复,润色前:那也是通过,比如说把相关的一些,就是就电动车的一些,就是它的一些产品手册啊,还有像是一些问题集啊,然后产品说明啊这种投喂进去之后,那用户他有车需求的,车辆可以行驶到喇叭不响就可以去定位,比如说喇叭啊喇叭不响会有什么问题,然后他文档里面可能给到的一些参考图片。
润色后:那也是通过把电动车的产品手册、问题集和产品说明等投喂进去。用户有车辆需求时,比如车辆可以行驶但喇叭不响,就可以去定位“喇叭不响会有什么问题”。文档里可能给到的一些参考图片。
处理自我纠正,润色前:这个这个,搜一下那个遇果香源的红富士苹果,啊不是,是烟台栖霞红富士,对,要3斤装的,还带“脆”字的那个。
润色后:搜一下烟台栖霞红富士,要3斤装、带“脆”字的那个。
三、自动开启多语言混合识别,平均语义错误率为17.09%
Qwen-Audio-3.0-ASR-Flash在多语种识别、识别准确率、识别速度上都有所提升。
Qwen-Audio-3.0-ASR-Flash可以识别中文、日语、韩语,到泰语、越南语、印尼语、马来语等东南亚语言,再到印地语、阿拉伯语,以及英语、法语、德语、西班牙语、葡萄牙语、俄语等欧洲主流语言。
用户只需要在使用前告诉模型这场会议可能涉及哪几种语言,它就会自动开启“多语言混合识别”。
韩语识别结果翻译:公开收购是指为了取得经营权,在场外按照指定价格购买股票。公开收购发布后,相关股票的价格通常会上涨。
马来语识别结果翻译:当你第一次得知自己将代表学校或所在州参加全国级别的活动时,你是什么感受?
越南语识别结果翻译:根据你的经验、教训和总结,你认为建立并长期维持一支高效团队,最重要的因素是什么?
官方披露数据显示,在七个语种的评测中,该模型的平均语义错误率为17.09%,优于Azure、ElevenLabs Scribe v2、Gemini 3.0 Flash以及上一代模型。
在识别准确率方面,Qwen-Audio-3.0-ASR-Flash在保持理论出字延迟300毫秒的同时,提升了复杂工业场景下的识别准确率:中文工业场景的平均错字率仅7.8%;英文工业场景为11.52%。

结语:语音识别跳出准确率比拼,要解决专业词汇识别难题
长期以来语音识别行业的竞争集中在标准普通话基础错字率比拼,但真实商业化落地的核心瓶颈始终是专业场景适配难题:医疗术语、编程变量、工业设备型号、金融标的等小众词汇极易出现同音混淆,企业需投入人力持续维护专属词表,热词扩容又会反向拉低通用识别精度。
此次,Qwen-Audio-3.0-ASR-Flash的升级证明新一代语音模型正在从通用工具向真正的生产力工具转型。当前国内AI语音识别的市场集中度持续走高,阿里云、讯飞、百度等玩家竞争赛道已从单纯准确率转向垂直行业落地效率。