ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Buzz 本地音频转录实战指南:3 分钟把任意音频变成字幕

Buzz 本地音频转录实战指南:3 分钟把任意音频变成字幕 Buzz 本地音频转录实战指南3 分钟把任意音频变成字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz录完一场访谈把文件拖进 Buzz选个模型点运行几分钟后得到带时间戳的文字和 SRT 字幕全程不出你这台机器。Buzz 是一款免费开源的本地音频转录工具基于 OpenAI Whisper 引擎做离线语音转文字和免费字幕生成支持 99 种以上语言。它到底解决什么问题它解决一件事把手头任何声音——文件、链接、麦克风里的——变成可编辑、可导出的文字且数据不离开本机。 转录音视频文件也可直接粘贴 YouTube 链接️ 麦克风实时转录附带演示窗口适合现场投屏 转录同时可翻译为英文 导出 TXT、SRT、VTT 三种格式⚙️ 四种 Whisper 后端可选NVIDIA CUDA、Mac Apple Silicon、普通 GPU/CPU 都能跑从零到跑通安装按平台分四条路选你系统对应的那条即可。macOS从官方发布渠道下载.dmg安装Windows下载安装包程序未签名安装时选「更多信息 → 仍要运行」LinuxFlatpak 或 Snap 任选其一flatpak install flathub io.github.chidiwilliams.Buzz # 或 sudo snap install buzz开发者Python 3.12 环境加 ffmpegpip install buzz-captions python -m buzz首次运行五步进「帮助 → 首选项 → 模型」选择模型档位联网时程序自动下载Ctrl/Cmd O或点工具栏「」导入音视频文件明确指定源语言——自动检测偶尔会判错选导出格式默认 TXT点 Run状态变 Completed 后双击该行打开转录结果核心能力拆解这条本地音频转录链路分三段输入、处理、输出每段只有少数几个开关。输入三类来源。文件直接拖入链接直接粘贴开启监听文件夹后新放进的音频自动排队转录要转系统声音把虚拟声卡输出选为麦克风即可。处理先选后端再选模型。后端决定用哪个引擎模型决定精度和耗时Whisper官方最忠实但慢、吃内存Faster Whisper仅限 NVIDIA GPU≥6GB 显存速度最快Whisper.cpp任意 GPU/CPU/Mac 可跑实时转录首选HuggingFace额外支持 MMS 等上千语言模型和 PEFT 微调模型模型从 tiny 到 large 越大越准也越慢large-V3 精度最高但偶发幻觉turbo 在速度和精度之间取平衡带.En的模型只支持英文。高级选项里的初始提示可以填入易错人名、术语明显减少错拼。输出文本、字幕和后续加工。转录结果可导出 TXT/SRT/VTT。双击结果行打开查看器支持全文搜索、带速度调节的播放。想要标准字幕导入时勾选字级时间戳转录后用 Resize 工具按静音间隙合并、按标点分割、限制单行长度还能统一延长每条字幕的显示时长。说话人识别能把不同发言人在文稿中分开标注。三条真实工作流下面三套步骤对应三类角色可直接照抄。 视频创作者批量产出 SRT 字幕导入成片视频勾选字级时间戳选 whisper.cpp small或 faster-whisper medium转录完打开查看器逐条修正错认的术语用 Resize 工具分组按标点分割 设定最大行宽导出 SRT直接拖进剪辑软件️ 会议与讲座实时转录加投屏选任务转录或翻译成英文、选麦克风实时场景用 Whisper.cpp 小模型保速度打开演示窗口把实时文字投到大屏结束后导出 TXT需要推给 OBS 等工具时在首选项里开启实时转录文件导出⚙️ 运维与开发者无人值守批量处理配置监听文件夹新音频自动入队启用跳过已转录插件重复导入不重跑模型批处理走命令行buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt ./episode.mp4在首选项用{{ input_file_name }}、{{ date_time }}等变量定制导出文件名批量产物按规则归档性能与排错速查选型第一件事是后端它由硬件决定后端适用硬件特点Whisper官方大内存机器慢但最忠实Faster WhisperNVIDIA GPU ≥6GB 显存最快、占内存少Whisper.cpp任意 GPU / CPU / Mac实时转录首选HuggingFace任意自定义模型覆盖最广常见问题现象 → 解法转录太慢→ 换小一档模型或改用 Whisper.cpp显存 ≥6GB 的 N 卡试试 Faster Whisper启动后崩溃→ 多半是模型下载不完整在「帮助 → 首选项 → 模型」里删掉重下另注意 CPU 需支持 AVX2麦克风报 PaErrorCode-9999→ 查系统麦克风权限Windows设置 → 隐私 → 麦克风离线机器没法下载模型→ 在联网机器上点显示文件位置找到模型目录Linux 为~/.cache/Buzz整体拷贝过去scripts/download-models.py可辅助准备离线模型缓存大模型超出显存→ 设环境变量BUZZ_REDUCE_GPU_MEMORYtrue走 8bit 量化或改用量化版.bin模型进阶与生态想扩展功能不用改核心代码插件系统1.4.5在「帮助 → 插件」里启用、拖拽排序、配置还能用 URL 导入社区打包的.zip。内置插件包括AI 摘要接任意 OpenAI 兼容 API含 Ollama、增强语言检测、DOCX 导出、字幕自动重排、DeepFilterNet 转录前降噪、跳过已转录。自建插件参考 buzz/plugins/ 的源码结构。深度调优走环境变量BUZZ_WHISPERCPP_N_THREADS调 Whisper.cpp 线程数BUZZ_FORCE_CPUtrue强制 CPUBUZZ_UPLOAD_URL把实时转录 POST 到自建服务器做网页展示HF_ENDPOINT可指向国内镜像加速模型下载。脚本化场景用 CLI 完成全部参数见docs/docs/cli.md。打开 Buzz拖一个音频进去whisper.cpp 加 small几分钟就是你的第一份字幕。更多参数与细节见 docs/docs/index.md想深挖源码可从 buzz/transcriber/ 入手。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进