热门搜索:和平精英 原神 街篮2 

您的位置:首页 > > 教程攻略 > ai资讯 >本地语音转文字(ASR)怎么选?我用945 条中文录音实测结果告诉你答案

本地语音转文字(ASR)怎么选?我用945 条中文录音实测结果告诉你答案

来源:互联网 更新时间:2026-07-27 13:38

945条中文录音实测本地ASR模型,从中文质量、体积速度到多语言覆盖,选对工具看这里。

核心内容:

1. 实测背景与方法(测试环境、数据集、模型及评分标准)

2. 四大模型性能对比(中文质量、体积速度、多语言覆盖维度)
3. 不同需求下的模型推荐(中文/体积/多语言优先选项)

模型实测 2026.07 · 硅基斥候S01


transcribe.cpp 最近在 HN 上很火,它是一个开源的本地语音转文字运行工具

。它可以在本地设备上运行 Qwen、Whisper、SenseVoice 等语音识别模型,把音频转换成文字。

这类本地语音转文字能力,可以用来整理会议录音、为会议纪要准备逐字稿,转写访谈、课程和播客,为视频生成字幕,也可以作为桌面软件、手机应用或边缘设备里的本地语音识别底座。

从源码安装,下载 7 个中文或多语言模型,再用同一批普通话录音逐个测试。先给结论:中文质量优先,选

Qwen3-ASR 0.6B

;体积和速度优先,SenseVoice Small 更划算;需要覆盖更多语言,Whisper 仍然是稳妥基线。

为什么它能同时运行这些模型?

transcribe.cpp 更像一个“统一播放器”。Qwen、Whisper、SenseVoice 是不同的语音识别大脑,模型文件需要分别下载;transcribe.cpp 负责用同一套 C/C++ 接口把它们运行起来。

一段音频

transcribe.cpp

Qwen / Whisper / SenseVoice / 其他模型

转写文字

项目名里的 .cpp 是 C++ 源代码常用后缀。它表达的是:这套运行时可以编译成本地程序,嵌入桌面软件、手机应用或边缘设备,不必先启动一个 Python 服务。

测试环境

测试机器是一台 Apple M5、32GB 内存的 Mac。当前主分支从源码编译成功,Metal 和 CPU 后端都能识别,CLI、静态库和公共头文件也都正常生成。

测试口径

数据集:

Google FLEURS 普通话 test split

规模:

945 条真人录音,共 3.074 小时

模型:

统一使用 Q8_0 量化版本

推理:

Metal、逐文件串行、贪心解码

评分:

中文字符错误率 CER,越低越好

完整跑完 945 条,Qwen 排第一

先看四个完整跑完 945 条的模型。结果和项目公开基准几乎重合,说明这次本地安装、模型文件、C++ 推理和评分链路是可信的。

CER 可以理解成“每 100 个字符平均要改多少个”。错字、漏字和多出来的字都会计入。Qwen 的 CER 是 7.65%,粗略说就是每 100 个标准字符约有 7.65 个字符需要修改。

01 · 中文质量第一

Qwen3-ASR 0.6B

CER

7.65%

 完全正确 46.5% 速度 10.5×

02 · Fun-ASR Nano 2512

CER

8.59%

 完全正确 44.7% 速度 14.0×

03 · SenseVoice Small

CER

10.11%

 完全正确 33.3% 速度 57.8×

04 · Moonshine Tiny 中文

CER

13.74%

 完全正确 16.5% 速度 23.0×

945 条中间出现 5 次生成失败。

Qwen 的模型文件约 811MB,不算轻,但这次中文质量最好。Fun-ASR 紧随其后,速度还更快。SenseVoice 的准确率略低,却只有 241MB,性能差距非常明显。

把 Whisper 当对照组

Whisper、MOSS 等模型串行跑完整集耗时更长。为了保持设置一致,从同一数据集按固定间隔抽了 100 条,让 7 个模型处理完全相同的音频。

七模型共同样本 CER

6.83

Qwen3-ASR 0.6B

7.51

Whisper Large v3 Turbo

7.91

Fun-ASR Nano 2512

9.19

SenseVoice Small

9.22

MOSS Transcribe-Diarize

12.77

Moonshine Tiny 中文

19.18

Nemotron 3.5 ASR Streaming

数字单位为百分比,越低越好。100 条样本的置信区间较宽,Qwen、Whisper、Fun-ASR 的区间互相重叠,不能把小数点后的名次写成“碾压”。

至少可以确认一件事:在这批普通话录音里,Qwen 已经和 Whisper 处在同一档,并且本次结果更低。Whisper 的优势还是多语言覆盖和成熟度,不是中文一定更准。

排行榜之外,我还看到了这些问题

清晰短句,大家差距不大。

“这并不是告别,这是一个篇章的结束,也是新篇章的开始”这句话,六个模型能准确转写。Nemotron 把两处“篇章”写成了“偏章”。

专有名词和中英混读,仍是共同难点。

国外地名、人名、长串英文容易被省略或按读音改写。业务里有药名、产品名、客户名,仍然需要热词或后处理词典。

数字格式会影响分数,也影响可读性。

SenseVoice 默认会把“802.11n”写成“八零二点幺幺 n”。启用 ITN 后可以恢复成“802.11N”,更像可交付的书面文本。

小模型的代价很真实。

33.8MB 的 Moonshine Tiny 确实轻,但会出现重复生成、长句截断和繁简切换。Nemotron 的流式接口跑通了,困难中文句子却偶尔混入泰文字符。

这些模型能在CPU上能跑

SenseVoice 在同一批 100 条音频上,Metal 达到 59.3× 实时,CPU 也有 18.2×。约 19.85 分钟音频,CPU 的纯推理阶段用了约 65.3 秒。

这能证明轻量模型可以在 CPU 上高效工作,但不能推导成所有模型都一样快。Qwen、Whisper、MOSS 的计算路线不同,落到具体机器还得单独测。

流式方面,把一条 10.38 秒录音按 1.12 秒切片喂给 Nemotron。第 3 个音频块后开始出现 partial 文本,最终结果和离线推理一致。

这里有个边界:

仓库提供的是流式 API,CLI 只是把 WA V 文件分块送进去。它没有现成的麦克风采集、实时字幕界面、静音检测和编辑器。

最后,我会怎么选?

如果产品以中文为主、最终稿质量优先,把

Qwen3-ASR 0.6B

放在第一位。它不是最轻的,但本次 945 条完整测试的错误最少。

如果要在本地快速批量处理,或者希望 CPU 也能轻松跑,

SenseVoice Small

更实用。多语言、未知语言和成熟生态,则继续考虑

Whisper

transcribe.cpp 最有价值的地方,是让这些选择可以放在同一套本地运行时里。它已经能用来做产品底座,但还不是下载后马上能录音转文字的成品软件。

一句话判断

中文质量选 Qwen,轻量高性能选 SenseVoice,多语言选 Whisper。要做本地、隐私和跨平台 ASR 产品,transcribe.cpp 值得进入技术选型名单。

以上就是这次的侦察。


关于宇宙的好的网名有哪些
关于宇宙的好的网名有哪些

类型:角色扮演

大小:1

语言:简体中文

平台:互联网

游戏下载

热门手游

手机号码测吉凶
本站所有软件,都由网友上传,如有侵犯你的版权,请发邮件haolingcc@hotmail.com 联系删除。 版权所有 Copyright@2012-2013 haoling.cc