热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >传音控股斩获第二届多语种对话语音语言模型挑战赛Task 1赛道亚军

传音控股斩获第二届多语种对话语音语言模型挑战赛Task 1赛道亚军

来源:互联网 更新时间:2026-08-07 13:41

近日,在国际语音领域顶级会议INTERSPEECH 2026卫星活动——第二届多语种对话语音语言模型挑战赛 (Multilingual Conversational Speech Language Model Challenge,MLC-SLM)Task 1赛道中,传音TEX AI中心语音算法团队以自主研发的说话人归属多语种自动语音识别系统取得tcpMER 15.41%的成绩,在全球110支参赛队伍中位列第二。此次突破展现了传音在多语种语音识别、说话人日志、时间对齐与长音频工程化系统等关键方向的系统性技术实力。

本届赛事把焦点放在多语言对话语音模型最棘手的几项关键技术挑战上,最终吸引了全球工业界和学术界共110支队伍报名参赛。官方提供的训练数据规模约为2100小时,覆盖14种语言和21个语言变体。MLC-SLM 2026 Task 1直指真实的多人对话场景,要求系统直接处理未经预切分、也未标注说话人的长音频,并输出“谁在什么时间说了什么”的带说话人转写结果。挑战赛采用的评价指标tcpMER,会同时衡量文本准确率、时间位置以及说话人归属,任何一个环节只要出现偏差,都会一路传导到最终结果,这实际上是在对语音算法全链路的协同能力进行高强度检验。

面对多语种、快速轮次切换、短暂停顿、说话人交叠以及长音频处理等挑战,传音TEX AI中心语音算法团队没有局限于单一模型优化,而是构建了由Speaker Diarization(说话人分离)、Long-form Multilingual ASR(长音频多语种自动语音识别)和Speaker-Transcription Fusion(说话人与转写融合)组成的级联系统:一条链路恢复跨片段一致的说话人结构,对不同说话人进行准确区分;另一条链路负责对多语种长音频进行高精度转写,并为识别结果标注精确的时间戳,最终融合生成可评测、可追溯的说话人归属转写结果。系统形成了从数据清洗、模型训练、推理解码、时间对齐到结果融合的闭环优化能力。

持续且可复现的实验验证,往往是团队实现技术突破的关键基石。团队并未止步于基线表现,而是通过一系列增量式实验——涵盖 Local EEND 任务适配、融合策略优化、说话人表征与聚类后端升级,以及 SD 条件化切分等关键环节——逐步打磨模型。这一过程使得赛事核心评价指标 tcpMER 从最初的 22.78% 稳步降至 15.41%,实现了 7.37 个百分点的绝对降幅,相对提升幅度更是达到了约 32.4%。与此同时,团队还完成了端到端方案 VibeVoice-ASR 的适配验证,成功确立了级联系统与端到端系统并行探索的技术路线,为后续算法的进一步演进储备了充足的潜力。

此次赛事成绩突破,验证了传音TEX AI中心语音算法团队在多语种语音理解领域的深厚积累。目前,团队已具备将说话人日志、多语种自动语音识别和精细化时间对齐能力灵活组合的工程能力,可根据不同业务场景灵活替换和升级识别模型,并保留可检查、可定位、可持续迭代的中间结果链路,为相关技术在实际业务中的快速落地和持续迭代奠定了基础。

多年来,传音持续加大在多语种语音识别、语音合成及降噪等领域的研发投入,技术能力已覆盖多种语言及本地口音、方言变体,并广泛应用于智能终端的通话、录音、翻译等多个场景,为传音在新兴市场复杂语言环境下的语音体验优势提供了坚实支撑。

未来,传音将持续深化多语种语音交互与语音理解技术研究,推动相关能力在全场景录音、智能终端及更多真实语音交互场景中落地,为全球用户提供更自然、更精准、更具理解力的智能语音体验。

关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc