行业资讯
📅 2026/9/6 15:10:08
Buzz 完全指南:免费快速完成离线音频转录与视频字幕生成
Buzz 完全指南免费快速完成离线音频转录与视频字幕生成【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzzBuzz 是一款基于 OpenAI Whisper 的离线音频转录工具面向需要会议记录、视频字幕或外语学习材料的普通用户全部计算都在你自己的电脑上完成。比如刚结束一场会议把录音文件拖进 Buzz几分钟后就能得到一份带时间戳的 SRT 字幕和纯文本记录音频文件从头到尾没有离开过本机。各平台安装步骤从下载到看到第一个结果按你的系统选最短路径Windows从官方发布页下载安装程序。程序未做签名首次运行会弹出安全警告点更多信息→仍要运行即可。macOS从官方发布页下载 .dmg 安装包支持 Intel 和 Apple Silicon。Linux通过 Flatpak 或 Snap 安装Flatpak 包名为 io.github.chidiwilliams.BuzzSnap 方式安装后记得连接密码管理器接口。Python 环境跨平台pip install buzz-captions python -m buzzLinux 下用 pip 方式可能需要先补装一些系统库ffmpeg、libportaudio2 等详见 安装文档。启动后进入主界面点工具栏号或按 Ctrl/CmdO导入一个音频文件选择任务和语言点 Run状态列变成 Completed 后双击该行就能看到第一条转录结果。模型文件会下载到用户缓存目录如 Linux 的 ~/.cache/Buzz下载后即可离线使用。第一次文件转录从导入到输出 TXT / SRT / VTT目标是把一段音频或视频变成可交付的文字或字幕文件。操作路径导入媒体文件File 菜单的 Import Media File或直接拖入。视频文件会自动提取音轨。设置任务参数任务转录 / 翻译成英文、语言、模型类型和大小高级选项里可勾选导出格式TXT / SRT / VTT、词级时间戳、语音提取从嘈杂音频中先抽出人声。运行并查看完成后双击任务行打开转录查看器支持文本搜索、播放进度跟随、播放速度调节、片段循环。导出在查看器里导出为选定的格式文件名模板可在偏好设置中自定义变量。翻译任务任务选 Translate to English 可把外语音频直接转成英文文本若要转成英文之外的语言可以配合 OpenAI 兼容 API 做 AI 翻译翻译结果与原文并排显示也可单独导出为 .translated.txt。实时录音设置麦克风、语言与模型的配合适合会议、讲座、访谈这类边讲边要文字的场景。操作在主界面切到实时录音区域选择任务Transcribe / Translate to English、语言、麦克风。点 Record 开始文字按句子实时追加可开启演示窗口在大屏上展示实时字幕。偏好设置里可选择三种追加模式Append below、Append above、Append and correct后者会回头修正上一句的错字但更吃性能。官方文档明确提示默认 Whisper 模型做实时转录资源消耗很大建议改用 Whisper.cpp 并选小模型base/small这样才能在普通笔记本上接近实时。想录电脑里播放的声音而非麦克风需要先配置虚拟音频设备macOS 用 BlackHole、Windows 用 VB CABLE、Linux 用 PulseAudio 路由再在 Buzz 里选中它作为输入源步骤见 实时录音文档。说话人区分与字幕重排两个进阶产出说话人识别在转录查看器里点 Identify speakersBuzz 会把每句话标注为不同说话人可试听任意一段 10 秒音频确认身份并把自动标签改成本人的真实姓名保存时可勾选把同一人的连续句子合并成一段。注意该功能在 Intel Mac 上不可用。字幕重排Resize如果转录时勾选了词级时间戳可以在 Resize 面板里按单行字幕最大长度、是否按标点断句重新分块还能给每条字幕的结束时间统一延长若干秒让字幕在屏幕上停留更久。若原始音频文件仍在工具会分析静音间隙来切分效果更好。插件扩展1.4.5 版起 Buzz 内置插件系统在 Help → Plugins 里可开关、排序、配置。内置插件包括AI Summary调 OpenAI 兼容 API 生成摘要、Enhanced Language Detection转录前用本地模型先识别语言、Export to DOCX导出 Word可带时间戳、Resize Transcript转录后自动重排字幕、DeepFilterNet 降噪转录前去除背景噪音、Skip Already Transcribed重复导入时跳过已有结果。插件机制与源码结构见 插件文档。偏好设置里值得动的手柄语言已知音频语言就手动指定别依赖自动检测多数情况下准确率更好。Initial prompt音频里频繁出现的人名、产品名、术语写进初始提示能明显减少拼错。模型管理在 Models 页下载、删除模型Whisper.cpp 还支持粘贴自定义 .bin 模型下载地址以及 q5 等量化版本省内存。高级项走环境变量配置比如 BUZZ_FORCE_CPUGPU 有问题时强制 CPU、BUZZ_WHISPERCPP_N_THREADS16 线程笔记本设为 8 可提速约 15%、BUZZ_REDUCE_GPU_MEMORY8bit 量化省显存。模型与后端选型对照什么场景选什么你的情况后端模型建议依据Mac / 无 NVIDIA 显卡 / 想跑实时Whisper.cppbase、small纯 C 实现任何品牌 GPU 或纯 CPU 都能跑集显笔记本也能接近实时NVIDIA 显卡且显存 ≥6GBFaster Whispersmall、medium比原版快一个数量级以上显存占用更低追求最高准确率、不赶时间Whisper 原版large-v3最准但最慢、内存占用大注意 large-v3 偶尔会编造音频里没有的词冷门语言或想试社区微调模型Hugging FaceMMS1000 语言、Parakeet、Qwen3-ASR 等支持范围最广含 PEFT 微调模型本地算力不足、可接受用 APIOpenAI Whisper API由云端决定需在偏好设置填 API Key也兼容其他 OpenAI 格式服务通用判断小模型快但错得多大模型准但慢且吃硬件官方 FAQ 的建议是最可靠的方法是拿自己的语言把所有候选模型各测一遍。量化模型如 q5适合内存紧张时跑更大的模型。局限与常见坑容易失败的地方和规避办法老机器跑不起来CPU 必须支持 AVX2很老的电脑直接不支持。首次运行报麦克风错误PaErrorCode-9999多半是系统麦克风权限被挡检查 Windows 的 隐私→麦克风 设置或临时关闭可能拦截的杀毒软件。模型下载不完整会闪退到 帮助→偏好设置→模型 里删除已损坏的模型文件重新下载。实时转录未必真实时这是资源密集型任务默认 Whisper 模型基本跑不动换 Whisper.cpp 小模型才现实Append and correct 模式下要盯着队列积压了就调大转录步长。Windows GPU 有门槛安装包自带 GPU 支持但要求 CUDA 12旧驱动环境会退回 CPU。录系统声音要额外配置Buzz 只从输入设备取声录软件播放的声音必须先建虚拟音频设备。完全离线要用好搬模型技巧在有网机器上下载模型把整个模型缓存目录拷到离线机器的相同位置如 Linux 的 .cache/Buzz/models仓库里的 scripts/download-models.py 就是为这件事准备的。说话人识别在 Intel Mac 上不可用规划功能时先排除这条。适合谁不适合谁适合处理敏感音频企业会议、内部访谈数据不能出本机的人经常需要 SRT / VTT / TXT 字幕文件的视频和播客创作者需要区分说话人、事后整理纪要的会议组织者有离线环境、或不想为云转录按量付费的用户不适合期待在老旧电脑上获得秒级实时字幕效果的人只想点一下网页链接就出结果、不愿装桌面应用、也不愿下载模型文件的人依赖 1000 低资源语言且不想折腾 Hugging Face 模型的普通用户追求上传即出稿、可接受数据上云的场景那种直接用云 API 更省事下一步更多细节看仓库内的 官方文档模型下载位置、GPU 加速、离线部署等问题可查 FAQ插件的钩子与写法在 plugins/ 源码里都能直接参考。把第一个文件转录完你就掌握了 Buzz 的 80%。【免费下载链接】buzzBuzz transcribes and translates audio offline on your personal computer. Powered by OpenAIs Whisper.项目地址: https://gitcode.com/GitHub_Trending/buz/buzz创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考