
faster-whisper语音转录最高提速 4 倍INT8 量化把显存从 4.7GB 压到 2.9GB【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisperfaster-whisper 是基于 CTranslate2 重新实现的 Whisper 语音转录引擎在同等精度下比原版 Whisper 最快提升 4 倍速度配合 INT8 量化与批量推理13 分钟的 large-v2 转写可从 2 分 23 秒降到 17 秒显存占用从 4708MB 降到 2926MB。一条 pip 命令即可上手。 环境与安装从 PyPI 安装即可依赖包含 ctranslate2、onnxruntime 与 PyAV音频解码库随包提供无需在系统上单独安装 FFmpegpip install faster-whisperPython 3.9 及以上使用 GPU 需要与 CUDA 12 配套的 cuBLAS 与 cuDNN 9首次运行时模型权重自动从 Hugging Face 下载需可访问网络纯 CPU 环境开箱即用无需任何 GPU 相关库三个真实转写任务转写一段录音并自动检测语言按设备参数加载模型transcribe返回带起止时间的分段结果语言自动检测、无需手动指定from faster_whisper import WhisperModel model WhisperModel(large-v3, devicecuda, compute_typefloat16) segments, info model.transcribe(audio.mp3, beam_size5) print(info.language, info.language_probability) for s in segments: print(f[{s.start:.2f}s - {s.end:.2f}s] {s.text})info.language即检测结果已知语言时可直接传入language参数以提高准确率。生成词级时间戳字幕开启word_timestampsTrue后每个分段内会多出一个words列表可做逐词高亮字幕或精确定位segments, _ model.transcribe(audio.mp3, word_timestampsTrue) for segment in segments: for word in segment.words: print(f[{word.start:.2f}s - {word.end:.2f}s] {word.word})长音频批量推理GPU 上处理长音频建议换用BatchedInferencePipeline它是transcribe的替代入口默认已开启 VAD 过滤静音段会被跳过from faster_whisper import WhisperModel, BatchedInferencePipeline model WhisperModel(turbo, devicecuda, compute_typefloat16) pipeline BatchedInferencePipeline(model) segments, _ pipeline.transcribe(audio.mp3, batch_size16)非批量模式下长静音音频可加vad_filterTrue阈值通过vad_parameters调整默认只裁剪超过 2 秒的静音实现见 faster_whisper/vad.py。 关键参数与性能数据以下数据取自仓库 README 基准测试同一段 13 分钟音频large-v2 模型GPU 为 RTX 3070 Ti 8GBCUDA 12.4beam_size5实现与配置耗时显存openai/whisperfp162m23s4708MBfaster-whisperfp161m03s4525MBfaster-whisperint859s2926MBfaster-whisperint8batch_size816s4500MBCPU 侧small 模型i7-12700K 8 线程原版 fp32 为 6m58s / 2335MBfaster-whisper int8 为 1m42s / 1477MB。GPU 上的性价比之选是int8_float16量化显存足够时再叠加batch_sizeCPU 上 int8 则接近必选。常见坑与排查调用了 transcribe 却无任何输出也不报错→segments是生成器迭代前转录并没有真正开始 → 用list(segments)收集一次或在 for 循环中直接遍历。GPU 加载模型报 CUDA 相关错误→ 新版 ctranslate2 仅支持 CUDA 12 cuDNN 9环境中缺少 cuBLAS/cuDNN → Linux 下用 pip 安装nvidia-cublas-cu12与nvidia-cudnn-cu129.*并设置LD_LIBRARY_PATH或改用官方 CUDA Docker 镜像。CUDA 11 或 cuDNN 8 的老环境装不上最新版→ 版本不兼容 →pip install --force-reinstall ctranslate23.24.0对应 CUDA 11或4.4.0对应 CUDA 12 cuDNN 8。适用边界该库面向离线批量转写不带流式或实时能力实时字幕需要在它之上再做一层封装内存极紧张的边缘设备部署可考虑 CPU 占用更低的 whisper.cpp。完整转录参数见WhisperModel类实现faster_whisper/transcribe.py如需把自己微调的模型转成 CTranslate2 格式参考 README 的 Model conversion 一节。【免费下载链接】faster-whisperFaster Whisper transcription with CTranslate2项目地址: https://gitcode.com/GitHub_Trending/fa/faster-whisper创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考