Funasr-Subtitle 是一款基于 FunASR 框架开发的纯本地、离线 Windows 音视频转字幕工具。所有转写过程均在本地完成,无需联网也无需上传云端,最大程度保障隐私安全。它支持中文、粤语、英语、日语、韩语识别,并可导出 SRT、VTT、TXT、JSON 等多种格式,基于达摩院 FunASR 的 ONNX 推理模型,在中文与粤语识别准确率上通常优于通用 Whisper 模型。

✨核心功能
🔒 纯本地 / 离线 — 除首次下载模型外不联网,不上传任何音视频。
🖥️ Windows 便携包 — 解压 → 双击 funasr-subtitle.exe → 浏览器里用;无需安装、无需管理员权限、无需预装 Python。
⚡ 纯 CPU·够快 — 默认 SenseVoiceSmall(非自回归 + 量化 ONNX)。实测整条管线(VAD + ASR + 切句)RTF ≈ 0.1(约 10× 实时,10s 音频 ~1s 出字幕;ASR 推理本身更快,RTF ≈ 0.02)。非自回归是它比逐 token 解码的 Whisper 快得多的根本原因。
🎯 多模型可选 — SenseVoiceSmall(快·多语言)/ Paraformer-zh(中文高精度)/ Paraformer-zh 热词版(支持热词)。
🌐 多语言 — 中文 / 粤语 / 英语 / 日语 / 韩语,可自动识别或手动指定。
✂️ 专业字幕切分 — 按标点 / 停顿切句;每行「显示宽度」可调(中日韩字符算 1、拉丁/数字算 0.5,默认 30 ≈ 中文 30 字 / 英文 ~60 字,上限 100,0 = 不限制)+ 单条 ≤ 7s,断点取 句末 > 子句 > 词边界,不拆英文词;最终 cue 严格单调不重叠。
🔤 标点模式可选 — 自动(默认:中文等自带标点的语言加句末标点;英文按停顿切、不强加——英文模型标点常不准,错位句号会把一句切碎)/ 加句末标点 / 不加。
📝 多格式导出 — SRT / VTT / TXT / JSON,或一键「复制全文」。
👥 说话人分离(可选) — 用 cam++ 标注每段说话人,导出含 [spk0]/[spk1]…;仅完整版 + Paraformer 模型可用(完整版有 N 卡自动用 GPU、无卡回退 CPU);onnx 版与 SenseVoice 不支持。
GitHub地址:https://github.com/rockbenben/funasr-subtitle


评论0+