7月31日,阿里巴巴正式发布新一代语音识别大模型Qwen-Audio-3.0-ASR-Flash。这一版本在上下文一致性、行业词识别和热词定制化三个维度进行了系统性升级,并新增语音润色能力,能够直接输出结构化文本。作为阿里通义实验室在语音智能领域的重要迭代,该模型的发布标志着中文语音识别技术从“听清每一个字”向“听懂整段话”的关键跨越。
在长音频处理场景中,传统语音识别模型往往面临“听前忘后”的困境。当面对数小时的会议录音、访谈或课程直播时,模型仅依赖当前几秒的声学信号进行判断,容易在同音词、多义词上产生误判。例如,同一个发音可能对应十几个不同的汉字组合,若无上下文参照,模型很难选出正确的那一个。Qwen-Audio-3.0-ASR-Flash新增长音频上下文记忆能力,在转写当前语音片段时,可参考近期已识别的文本内容,延续同一话题中的关键词与语义线索。这意味着,在一场跨越多段语音的会议中,发言人的姓名、反复出现的技术概念不会被遗忘或混淆,中英文混合表达与专业术语的识别准确率也因此显著提升。
针对行业落地的“最后一公里”难题,新模型将专业词汇识别从人工维护词表转变为模型内生的能力。研究团队通过持续挖掘医疗、IT编程、股票、社会名人等领域的实体词,构建了覆盖多行业的高质量词库,并基于这些实体词合成训练数据,增强模型对低频词和术语的识别能力。在内部评测中,医疗场景的行业词召回率突破95.36%,其他垂直领域的表现同样亮眼。与此同时,热词定制功能也得到全面优化。传统方案中,热词添加越多,误触发概率越高,反而拉低整体识别质量。Qwen-Audio-3.0-ASR-Flash采用声学证据与上下文智能判断相结合的方式,在传入热词的条件下,定制化准确率在所有测试集上均达到90%以上,多数场景突破99%,有效解决了长尾词如人名、品牌名、产品名及行业黑话的识别痛点。
除了识别能力的提升,新模型还具备独特的语音润色功能。口语中常见的“那个”“嗯”等填充词会被自动去除;说话过程中的自我修正,如“我们下周三评审,不对,是周四”,只保留最终意图;散乱的口述内容可被整理为结构化表达。值得注意的是,这些润色操作由ASR模型在识别环节一步完成,无需额外调用下游文本处理模块,大幅降低了系统复杂度和推理延迟。目前,Qwen-Audio-ASR系列已在会议纪要整理、实时字幕、教育录播、智能客服等场景中获得广泛验证,其离线版本曾以1.7%的错字率在全球权威AI评测平台Artificial Analysis位列第一。此次3.0版本的发布,进一步巩固了阿里在语音识别领域的技术领先地位,也为企业级语音应用提供了更可靠、更智能的基础能力支撑。
