ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

Buzz 离线语音转文字完整指南:5 步把音频变成可编辑字幕

Buzz 离线语音转文字完整指南:5 步把音频变成可编辑字幕 Buzz 离线语音转文字完整指南5 步把音频变成可编辑字幕【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款在你个人电脑上运行的离线语音转文字工具。它基于 OpenAI 的 Whisper 模型把音频、视频本地转录和翻译成文字全程不上传、不限时长。适合整理会议录音、给视频配字幕、做实时听写的新手和普通用户。快速了解Buzz 是什么Buzz 解决一个很具体的问题把只能听的录音变成能搜索、能编辑的文字同时数据不出你的电脑。所有计算在本地完成支持 99 种语言纯 CPU 可运行NVIDIA 显卡可开 CUDA 加速Mac 的 Apple Silicon 也有专门支持。卖点说明完全离线转录在本地执行无上传、无排队断网也能用开源免费MIT 协议源码可查不限时长2 小时录音照样转无云端计费双入口图形界面处理单文件和实时录音命令行处理批量任务多后端Whisper、Whisper.cpp、Faster Whisper、HuggingFace 可选适配不同硬件快速开始从安装到第一条转录第 1 步按平台安装 Buzz。系统方式命令或操作macOS下载.dmg安装包从项目发布渠道下载后打开Windows下载安装包见下方注意LinuxFlatpak 或 Snapflatpak install flathub io.github.chidiwilliams.Buzz或sudo snap install buzz任意系统PyPI 源码式安装pip install buzz-captions再运行python -m buzz注意Windows 用户必看Buzz 安装包未做代码签名安装时系统会弹出警告选更多信息→仍要运行即可继续。第 2 步导入文件。点击菜单文件 → 导入媒体文件快捷键Ctrl/Cmd O或点工具栏的图标选中音频或视频文件。第 3 步设置三个参数。在弹窗里选择TaskTranscribe 或 Translate to English、Language建议手动指定如zh、Model新手选base或small。第 4 步点击Run。任务进入队列主界面显示实时进度。第 5 步打开结果。状态变为Completed后双击任务行进入转录查看器你的第一条转录稿就完成了。核心功能详解文件转录与导出它做什么把音频、视频甚至 YouTube 链接转成带时间戳的文字并导出为 TXT、SRT、VTT、JSON 等格式。怎么做导入文件时在Export As选SRT或VTT转录完成自动落盘需要精细排版时点查看器工具栏的导出按钮手动选格式在偏好设置的默认导出文件名里设好模板例如{{ input_file_name }} ({{ task }}d on {{ date_time }})之后自动套用。提示勾选Word-Level Timings词级时间戳后续才能用Resize做更智能的字幕重组做字幕建议转录前就勾上。模型选择速度与精度对照它做什么决定转录的准确率、耗时和内存占用。模型从tiny、base、small、medium到large逐级提升另有Large-V2、Large-V3、Turbo等变体。怎么做打开帮助 → 偏好设置 → Models在待下载清单里勾选模型点Download也可以选Custom粘贴自定义模型的下载地址没有 NVIDIA 显卡就选 Whisper.cpp 后端它支持任意品牌的 GPU 和纯 CPU还能选q_5这类量化版本省内存。提示tiny/base给实时录音用small是日常甜点large留给专业录音且建议配 GPU。实时录音转录它做什么对着麦克风说话文字逐句生成适合会议速记、演讲同传、直播字幕。怎么做切到Live Recording标签页选麦克风、语言和模型点红色Record按钮开始需要投屏时打开演示窗口Presentation Window把实时字幕显示在另一块屏上。注意实时转录对性能要求高务必用 Whisper.cpp 后端加tiny或small模型否则文字跟不上语速。转录查看器编辑与字幕调整它做什么查看、校对、搜索转录稿并微调每段字幕的时间戳。查看器提供时间戳、纯文本、翻译三种视图支持Ctrl/Cmd F搜索、Ctrl/Cmd P播放、Ctrl/Cmd ←/→以 0.5 秒为单位微调片段起止时间。怎么做双击任务行打开查看器直接在表格里改文字改动自动保存点Resize按钮按最大字幕长度、标点分割等规则重新断句开启Follow Audio后文字会跟随播放进度自动滚动方便校对长音频。提示原音频文件还在本机时Resize 会额外分析静音间隙断句更准。任意语言 AI 翻译它做什么Whisper 自带任意语言 → 英文的离线翻译Task选Translate to English即可。要翻到其他语言如英语 → 西班牙语接一个 OpenAI 兼容 API 就能实现。怎么做在偏好设置里填 API 的 Base URL 和 Key本地跑 Ollama、LM Studio 也可以接打开已有转录点查看器工具栏的Translate按钮在Instructions for AI里写清指令例如只翻译成西班牙语不加注释。提示约 1 小时音频用云端模型翻译成本在 1 美元量级追求全离线就把翻译模型也跑在本地。命令行与文件夹监控它做什么用buzz add批量下发转录任务配合监听文件夹实现丢进去就自动转。怎么做终端输入buzz add --help查看全部参数一次传入多个文件指定模型和输出格式在偏好设置里开启文件夹监控Folder Watch新文件自动进队列。提示1.4.5 版本起的插件系统提供了Skip Already Transcribed重复导入同一批文件时自动跳过已有结果的批量任务不怕误操作。实战配方配方一批量生成 SRT/VTT 字幕→buzz add --task transcribe --model-type whispercpp --model-size small --srt --vtt 访谈.mp3 会议.wav两个文件转完直接产出字幕文件。配方二降低错字率→ 转录时在Advanced...里填Initial prompt把常见人名、产品名写进去命令行则加--prompt 产品名是 X人名是 Y。配方三系统声音转文字→ macOS 用brew install blackhole-2ch装 BlackHole 并建多输出设备Windows 装 VB-CABLE 后把输出选为CABLE InputLinux 用pavucontrol重定向应用音频。然后在 Buzz 里把麦克风选为该虚拟设备录制的就是系统外放的声音。常见问题问模型文件存在哪里 答Linux 在~/.cache/BuzzmacOS 在~/Library/Caches/BuzzWindows 在%USERPROFILE%\AppData\Local\Buzz\Buzz\Cache。也可在帮助 → 偏好设置 → Models下载后点Show file location直接打开文件夹。问转录太慢怎么办 答换更小的模型或改用 Whisper.cpp 后端NVIDIA 显卡显存至少 6GB 的话选 Faster Whisper 会快一个量级。问完全没有网络的电脑能用吗 答能。先在联网电脑上下载好模型把模型文件夹复制到离线机器的同一位置参考 FAQ 中的路径再用scripts/download-models.py脚本可提前准备整套模型缓存。问GPU 加速没生效 答确认 NVIDIA 驱动和 CUDA 12 装好Windows 版安装包自带 GPU 支持旧 CUDA 会自动回退 CPU。想强制纯 CPU 可设环境变量BUZZ_FORCE_CPUtrue。问自动检测语言经常判错 答官方建议只要知道语言就手动指定这能显著提升准确率也可以在插件里启用Enhanced Language Detection用本地模型在转录前先做一轮检测。问Buzz 启动崩溃是什么情况 答多是模型下载不完整到帮助 → 偏好设置 → Models删除后重新下载。另注意 Buzz 需要 CPU 支持 AVX2过老的机器跑不起来。下一步Buzz 把离线语音转文字做成了装完就能用的本地工具导入、转录、编辑、导出一条流水线全在电脑上完成。现在就装一个 Buzz导入你手头最需要整理的那段录音点一下Run。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进