ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Buzz 免费离线语音转文字:从录音到字幕的完整上手指南

Buzz 免费离线语音转文字:从录音到字幕的完整上手指南 Buzz 免费离线语音转文字从录音到字幕的完整上手指南【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一个跑在自己电脑上的离线语音转文字工具底层使用 OpenAI 的 Whisper 模型把音频转成文字、再翻译成英文全程不需要把文件上传到任何服务器。会议录音、课程音频、访谈原声……这些不方便发上网的素材交给它处理最放心。为什么选本地转录而不是云端服务用云端转录 API 或网页工具绕不开三个问题文件要上传、按时长收费、断网就瘫痪。Buzz 把这三件事一次解决音频从头到尾留在本机隐私敏感的内容医疗访谈、未公开会议可以直接处理完全免费开源转多久都不计费模型下载一次后即可离线运行甚至能用在没有外网的机器上。代价是占你机器的算力所以后文会讲怎么靠模型大小和 GPU 把速度拉起来。安装 Buzz三种系统各一条命令按平台挑一种方式即可官方文档在 docs/installation.md。macOS / Windows到官方发布页下载对应安装包。注意 Windows 版本未做代码签名安装时提示未知发布者选择更多信息 → 仍要运行即可。macOS 的.dmg拖进应用程序文件夹完成。Linuxflatpak install flathub io.github.chidiwilliams.Buzz或者走 Snapsudo snap install buzzPython 环境需要已装 ffmpeg建议 Python 3.12pip install buzz-captions python -m buzz想追最新特性也可以直接拉源码git clone https://gitcode.com/GitHub_Trending/buz/buzz第一次转录四步把音频变成文字打开应用后任务表就是主界面整个流程如下点工具栏的或用文件菜单导入音频也支持直接粘贴网络音频地址任务类型选转录要翻译就选翻译成英文语言一栏手动选已知语言。留空让它自动检测也行但检测只靠开头几秒音频明确指定准确率更高选好模型点运行。状态变绿后双击任务行进入查看器可以边播放边逐句核对最后导出 TXT、SRT 或 VTT。模型没下载过时应用会自动帮你拉取缓存位置在 docs/FAQ 里有说明也可以在设置 → 模型里查看和删除。会议实时录音边说边出文字把任务类型切到录音选麦克风点录音文字就会实时出现在表格里。显示模式有三种对应不同的会议场景追加在下方新句子往下滚适合长会议留档追加在上方最新内容置顶翻页少追加并校正持续回头修正上一句的识别错误最接近人工速记的效果推荐用在重要场合。两个配套功能很实用识别结果可以实时写入 TXT 文件OBS 这类直播软件配个文字插件就能做滚动字幕点演示窗口则把当前文本投到大屏现场分享不用举手开麦复述。多人讨论的录音转录后还能用说话人识别功能区分不同发言者相关实现在 buzz/widgets/transcription_viewer/speaker_identification_widget.py。给视频做字幕时间戳 拼行给 MP4、MKV 这类视频导入后Buzz 会自动抽音轨。做标准字幕的关键在两个设置高级设置里勾选词级时间戳让每个词都带上独立时间转录完成后在查看器里用调整大小Resize功能按最大字幕长度、标点位置和音频静音间隙把词合并成一行行规范字幕勾选导出 SRT 或 VTT直接拖进播放器或剪辑软件。如果嫌字幕一闪而过Resize 里还能给每行统一延长显示时长。详细参数见 docs/usage/edit_and_resize。批量处理文件夹监视与命令行两个免手动的工作流文件夹监视在设置 → 文件夹监视指定一个目录往里丢音频就自动建转录任务适合每天下班把当天录音扔进文件夹的固定归档习惯。再装一个跳过已转录文件插件buzz/plugins/skip_already_transcribed/重复丢同一批文件时会直接复用旧结果命令行脚本化批量任务用buzz add一条命令指定模型和导出格式buzz add --task transcribe --model-size small --srt --vtt /path/to/audio.mp3完整参数语言、初始提示词、词级时间戳、语音提取等见 docs/cli.md。调优选模型、开 GPU、提速变量速度不满意时按这个顺序排查换引擎模型类型切到 Whisper.cppNvidia 显卡自动走 CUDAAMD/Intel 走 Vulkan苹果电脑也推荐这个后端。显存不够时选量化模型如 q5或在偏好设置里开启 8 位量化降低显存占用换模型大小tiny/base 快但错得多medium/large 准但慢。草稿用小的定稿用大的实时录音场景务必用小的保证跟得上语速手动指定语言 初始提示词语言选对能明显减少误识别高级设置里的初始提示填入人名、产品名等易错词可纠正专有名词拼写环境调优CPU 太慢可设BUZZ_WHISPERCPP_N_THREADS调整线程数旧显卡 GPU 反而拖慢时可设BUZZ_FORCE_CPUtrue强制走 CPU模型下载慢则设HF_ENDPOINT指向国内镜像站降噪环境嘈杂时先开语音提取或装 DeepFilterNet 插件buzz/plugins/deep_filter_net/先降噪再转录。Buzz 和云端转录怎么选对比项Buzz本地云端转录服务隐私音频不出本机需上传服务器成本免费只耗电按量收费离线可用可以不行实时录音支持可投屏多数支持上限受本机硬件限制算力无上限适合人群隐私敏感、批量归档、无网环境偶发使用、不想折腾一句话内容敏感或量大选 Buzz只是偶尔转一段且不介意上传云端服务省心得多。继续深入更多细节都在仓库文档里文件导入见 docs/usage/1_file_import.md录音参数静音阈值、转录步长等见 docs/usage/2_live_recording.md插件机制见 docs/usage/7_plugins.md核心转录代码在 buzz/transcriber/想二次开发可以从这里读起。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进