热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >阿里发布语音识别新模型,医疗词汇"听中率"破 95%,曾拿全球最低错字率

阿里发布语音识别新模型,医疗词汇"听中率"破 95%,曾拿全球最低错字率

来源:互联网 更新时间:2026-08-05 17:37

阿里巴巴刚刚放出了一个重磅消息——语音识别大模型 Qwen-Audio-3.0-ASR-Flash 正式发布。这次的目标非常明确:让AI能真正听懂那些行业里拗口的专业词汇。说白了,就是不再让“阿莫西林”变成“阿莫西林”,或者“GAN网络”变成“干网络”。

image.png

研究团队在上下文一致性、行业词识别和热词定制化三个维度上做了一套系统性优化,甚至还加入了语音润色能力——输出的文本不再是干巴巴的逐字转写,而是带标点、带分段的结构化结果。这背后,是团队从医疗、IT编程、股票、社会名人等方向持续挖掘专业词汇,建成了一套覆盖多行业的高质量词库。在最新一轮内部评测中,各行业专业词的“听中率”都有明显提升,医疗场景更是直接突破了 95.36%。

三个版本覆盖五大场景,已拿全球第一

Qwen-Audio-ASR-Flash 系列此前已经在会议纪要整理、实时字幕、教育录播、智能客服等场景中跑通了验证。在 AI 评测平台 Artificial Analysis 上,它曾以 1.7% 的错字率拿下全球第一。注意,这个数字意味着什么?在真实的办公和教育环境里,AI 语音转文字的准确度已经摸到了可用性的天花板——你几乎可以放心地把会议录音交给它,而不必担心满篇都是“天书”。

目前该模型已通过阿里云百炼平台开放调用,提供了三个版本:实时语音识别最长 5 分钟的 Flash 版、离线文件转写的 Filetrans 版,以及实时语音识别 Streaming 版。当 AI 不再只是“能听”,还能听懂你行业里那些拗口的专业术语时,语音交互的最后一公里,或许就快跑通了。

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc