热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景"最后一公里"

阿里千问发布Qwen-Audio-3.0-ASR-Flash,语音识别攻克专业场景"最后一公里"

来源:互联网 更新时间:2026-08-05 17:40

7月31日,阿里通义千问正式发布了语音识别大模型Qwen-Audio-3.0-ASR-Flash,主打的卖点很直白:长音频不丢词、行业词不用教。目前已经在阿里云百炼平台开放调用,有需要的团队可以直接上手试。 这一次升级,核心围绕五个维度展开,下面逐一拆开来看。 **首先是长音频上下文记忆。** 过去很多语音模型在转写时,片段和片段之间容易“断片”,同一个人的名字、技术术语前后不一致。而新模型在转写过程中可以实时参考前文语义,几小时的会议录音,人名、技术概念全程保持一致,跨片段不再“忘词”。 **第二点是内置多行业词库。** 医疗场景的专业词召回率达到了95.36%,IT编程领域也做到了91.87%。这意味着什么?不需要人工配置任何行业词典,冷门术语就能被精准识别,对一线运维和开发团队来说,省去了大量前期调校的功夫。 **第三是分级热词定制。** 企业专属词汇可以即时生效,多数场景下召回率突破99%,而且不会因为热词数量增多就误触发其他词。这一点在会议纪要、客服对话等场景中非常实用——你只需要把公司内部的人名、项目名、产品编号加进去,模型就能精准锁定。 **第四点是集成了语音润色功能。** 一步完成去口头禅、清理重复、处理自我纠正和语义重组,输出的文本可读性已经接近“ASR+大模型润色”两步方案的效果。换句话说,过去需要先转写再丢给大模型做二次清洗,现在一个模型就搞定了。 **第五点是多语言覆盖。** 一套模型支持30余种语言,七种主要语种的平均语义错误率只有17.09%,在横向对比中优于Azure、Gemini等同业产品。对于跨国会议、出海客服场景,这个能力直接降低了部署复杂度。 同步推出的还有Qwen-Audio-3.0-ASR-Streaming,面向实时场景,理论出字延迟只有300毫秒。中文工业场景错字率7.80%,英文11.52%,在行业里属于领先水平。其实这个系列之前已经在Artificial Analysis评测中以1.7%错字率拿下全球第一,广泛用于会议纪要、实时字幕、教育录播、智能客服等场景。 整体来看,这次升级在长音频稳定性、专业术语识别、热词定制、语音润色和多语言支持上都有实质性突破,对需要高质量语音转写的团队来说,值得重点关注。

热门手游

相关攻略

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc