Skip to content

语音识别渠道

语音识别(ASR)是视频翻译的第一步,将音频或视频中的人声转录为带时间轴的字幕文件。pyVideoTrans 支持 15+ 种识别渠道。

如果无法确定说话语言,可使用左侧面板中的批量语音转字幕功能,发音语言选择自动检测,语音识别渠道选择faster-whisper/openai-whisper/Omnilingual/Dolphin等支持语言多的渠道


本地离线识别

无需联网,首次使用时下载模型。

渠道说明GPU 加速推荐度
faster-whisper(本地内置)速度快、质量高,支持所有内置语言⭐⭐⭐ 默认推荐
openai-whisper(本地内置)准确度高,速度略慢,支持所有内置语言⭐⭐⭐
Qwen-ASR(本地内置)中文效果佳,支持多数内置语言⭐⭐⭐
FunASR(本地内置)中文效果佳,有多个模型可选⭐⭐⭐
Firered中文(本地内置)仅支持中文及20中文方言X⭐⭐
Dolphin(本地内置)支持40多亚洲语言及20中文方言X⭐⭐
Omnilingual ASR(本地内置)支持所有内置语言等1600多种X⭐⭐
parakeet日语(本地内置)仅支持日语X⭐⭐
Huggingface_ASR(本地内置)可选多个语言模型⭐⭐
Faster-Whisper-XXL.exefaster-whisper的Windows封装版本,需自定额外下载并指定exe⭐⭐
whisper.cpp使用openai-whisper的cpp后端,需自行额外下载并指定二进制路径⭐⭐

因国内网络环境问题,加之模型都比较巨大,自动下载有可能失败,如果失败,请点击查看模型下载地址和手动下载方式

faster-whisper/openai-whisper渠道模型选择建议

模型速度准确度显存需求
tiny最快~1GB
base中低~1GB
small~2GB
medium较高~5GB
large-v3最慢最高~8GB
large-v3-turbo较快~6GB

推荐large-v3-turbo,速度与质量兼顾。


在线识别

渠道说明
阿里百炼 Qwen3-ASR需开通阿里百炼平台服务
小米mimo-v2.5-asr模型中文/中英混合效果佳 需开通小米AI平台充值并获取API key 填写到菜单-翻译设置-小米AI
字节语音识别大模型极速版中文效果极佳
Elevenlabs.io 语音识别免费账号频率限制严格,几乎不可用
Deepgram.com需注册 API Key
Gemini AI识别小语种能力强,需科学上网
302.AI访问 302.ai 申请
OpenAI 语音识别API效果优秀,需 SK 密钥

高级自定义

渠道说明
Parakeet-tdt(本地API)需自行单独部署
WhisperX(本地API)需自行单独部署
STT(本地API)需自行单独部署
Whisper.NET支持AMD显卡加速,需源码安装并按照文档说明下载相关dll
自定义语音识别 API可编写自己的识别接口

Huggingface_ASR(本地内置) 渠道可用模型

模型支持语言
nvidia/parakeet-ctc-1.1b英语
reazon-research/japanese-wav2vec2-large-rs35kh日语
kotoba-tech/kotoba-whisper-v2.0日语
biodatlab/whisper-th-large-v3泰语
vinai/Phowhisper-large越南语
anke01/whisper-small-uyghur维吾尔语
openai/whisper-large-v3所有语言
zai-org/GLM-ASR-Nano-2512智谱AI模型,中文粤语效果佳