全程离线
音频解码与语音识别都在本机完成,不把文件、不上传片段。断网也能正常用。
功能
不做「能识别就行」的半成品。识别前后该做的事 —— 语音切分、电平归一化、专有名词校正、 字幕规格校验 —— 都在同一条流水线里。
音频解码与语音识别都在本机完成,不把文件、不上传片段。断网也能正常用。
MP3、WAV、FLAC、OGG Vorbis、Opus、AIFF 都能直接读,不用先转格式。
标准跑一遍、增强跑三遍、深度跑五遍并叠加热词策略。耗时与准确率由你权衡。
长音频按语音活动自动切段。这是减少漏句、避免后半段识别跑偏的关键一步。
内置数码科技、商业财经、游戏影音、中文人名、易错同音词五个词库,也可以自己填热词。
多选、添加、删除、合并、分割都在时间轴上直接改,支持 15 步撤回重做。
重叠、空白、时间码非法、单条过长、单条过短、长度超限,六类问题一次性列出来。
按你的本地设置(标点习惯、字幕规格、词库)现拼一份提示词,经剪贴板交给网页版大模型, 结果取回来一键覆盖,改错了 Ctrl+Z 能整体撤回。
随包装了一个 small 模型,开箱能用;想要更准可以下载 medium 或 large-v3-turbo, 也可以导入自己的 ggml 模型。
使用流程
拖进去或者点选,右侧面板顺手把语言、推理深度、词库、字幕规格调好。
离线识别,进度与已识别内容实时刷出来。中途可以取消,取消不会留下半成品。
在波形上改时间与文字,按规格校验一遍;需要的话再交给 AI 校对把错字和断句顺一遍。
SRT、VTT、ASS、TXT,编码可选 UTF-8、带 BOM 或 GBK,换行符按平台习惯来。
界面
界面只有导入、模型、设置、关于四个入口。识别参数集中在导入页右侧,改完立刻生效。
导入与识别设置
截图待补充。放一张导入页:左边拖放区,右边语言 / 推理深度 / 词库 / 字幕规格面板。
字幕编辑器
截图待补充。波形 + 字幕条 + 底部校验结果。
AI 校对
截图待补充。三步引导:准备提示词、粘贴到 AI、取回结果。
系统要求
没有独显也能用。CPU 可以跑,支持 Vulkan 的显卡会明显快一截。
常见问题
不会。音频的解码与语音识别全部在本机完成,软件不会把音频、片段或识别结果发到任何服务器, 也不包含统计与埋点组件。
软件只有两个地方会联网:你主动点「检查更新」时读取版本清单;你下载更大的识别模型时访问模型仓库。 两件事都可以不用,断网照样能完成识别与导出。
不支持。AAC 的部分专利尚未到期,软件为了保证完全免费可商用,不内置任何需要付费授权的解码器。 M4A、MP4、WMA、AMR、DTS 同理。
遇到这些格式,先用别的工具转成 MP3、WAV、FLAC、OGG 或 Opus 再导入即可。 导入时软件会直接告诉你原因,不会默默失败。
核显轻薄本就能用。CPU 模式可以正常跑;如果显卡支持 Vulkan,识别速度会明显快一截, 软件会自己挑可用的后端。
影响速度的主要是三个变量:音频有多长、模型选多大、推理深度选哪档。 默认是「增强」档配随包的 small 模型,属于准确率与耗时的折中。
软件本身不联网。它的做法是帮你拼好一份提示词、写进剪贴板,你自己贴到网页版大模型里, 再把回复复制回来交给软件解析。联网的是你的浏览器,不是这个软件。
提示词是按你本地的设置现拼的:标点习惯、字幕规格、识别语言、勾选的专业词库都会反映进去, 不会出现「设置里让它去标点、提示词里却让 AI 补标点」这种自相矛盾。
按见效快慢排一下顺序:先勾上对应的领域词库、把节目里的专有名词填进热词; 再把推理深度从「增强」提到「深度」;还不行就换成更大的模型。
如果音频本身电平很低、或者长音频后半段开始乱,打开静音检测与电平归一化通常能明显改善。
免费,可商用。软件不含任何需要付费授权的组件,也没有需要付费授权的音频解码实现, 随包附带的识别引擎与模型权重均为 MIT 许可。
完整的第三方组件与许可清单在软件的「关于」页里,可以逐条核对。