XBAOS 字幕生成器 Windows 桌面工具 下载
本地离线运行,不需要联网

把音频变成字幕,全程不离开你的电脑

XBAOS 字幕生成器把音频识别成字幕,并直接给你一个能改的编辑器。 音频解码与语音识别全部在本机完成,不上传任何文件、不依赖任何在线服务。

  • 六种音频格式直接导入
  • 内置 whisper.cpp 识别引擎
  • 字幕规格校验
  • 支持 AI 校对

当前版本 0.1.0 更新于 2026-10-08 Windows 10 1809 及以上,64 位

XBAOS 字幕生成器
这里是软件界面截图的位置
正式发布前把真实截图放进来

功能

从导入到导出,一条链路走完

不做「能识别就行」的半成品。识别前后该做的事 —— 语音切分、电平归一化、专有名词校正、 字幕规格校验 —— 都在同一条流水线里。

全程离线

音频解码与语音识别都在本机完成,不把文件、不上传片段。断网也能正常用。

六种音频格式直接导入

MP3、WAV、FLAC、OGG Vorbis、Opus、AIFF 都能直接读,不用先转格式。

三档推理深度

标准跑一遍、增强跑三遍、深度跑五遍并叠加热词策略。耗时与准确率由你权衡。

静音检测与自动切分

长音频按语音活动自动切段。这是减少漏句、避免后半段识别跑偏的关键一步。

领域词库与热词

内置数码科技、商业财经、游戏影音、中文人名、易错同音词五个词库,也可以自己填热词。

字幕编辑器

多选、添加、删除、合并、分割都在时间轴上直接改,支持 15 步撤回重做。

字幕规格校验

重叠、空白、时间码非法、单条过长、单条过短、长度超限,六类问题一次性列出来。

AI 校对

按你的本地设置(标点习惯、字幕规格、词库)现拼一份提示词,经剪贴板交给网页版大模型, 结果取回来一键覆盖,改错了 Ctrl+Z 能整体撤回。

模型管理

随包装了一个 small 模型,开箱能用;想要更准可以下载 medium 或 large-v3-turbo, 也可以导入自己的 ggml 模型。

使用流程

四步,从音频到成品字幕

1

导入音频

拖进去或者点选,右侧面板顺手把语言、推理深度、词库、字幕规格调好。

2

识别

离线识别,进度与已识别内容实时刷出来。中途可以取消,取消不会留下半成品。

3

编辑与校对

在波形上改时间与文字,按规格校验一遍;需要的话再交给 AI 校对把错字和断句顺一遍。

4

导出

SRT、VTT、ASS、TXT,编码可选 UTF-8、带 BOM 或 GBK,换行符按平台习惯来。

界面

该露出来的信息,一眼能看到

界面只有导入、模型、设置、关于四个入口。识别参数集中在导入页右侧,改完立刻生效。

导入与识别设置

截图待补充。放一张导入页:左边拖放区,右边语言 / 推理深度 / 词库 / 字幕规格面板。

字幕编辑器

截图待补充。波形 + 字幕条 + 底部校验结果。

AI 校对

截图待补充。三步引导:准备提示词、粘贴到 AI、取回结果。

系统要求

轻薄本也能跑

没有独显也能用。CPU 可以跑,支持 Vulkan 的显卡会明显快一截。

操作系统 Windows 10 1809 及以上,64 位
处理器 近十年的 x86-64 处理器(支持 AVX2)
内存 建议 8 GB 及以上
显卡 核显可用;支持 Vulkan 的显卡速度更快
磁盘 安装包约 0.5 GB;另需空间存放更大的模型与音频
网络 不需要。只有检查更新与下载模型时会联网
识别速度取决于音频长度、模型大小与推理深度。选大模型、开深度档会更准,但也要多等一会儿 —— 这个取舍由你在界面上决定,软件不会替你猜。

下载

下载安装包

XBAOS 字幕生成器

版本 0.1.0 更新于 2026-10-08 平台 Windows x64 大小 约 0.5 GB

下载链接指向第三方网盘。安装包未做数字签名,首次运行 Windows 可能提示「未知发布者」, 选择「更多信息」后再点「仍要运行」即可。

常见问题

你可能想先问清楚的事

会上传我的音频吗?

不会。音频的解码与语音识别全部在本机完成,软件不会把音频、片段或识别结果发到任何服务器, 也不包含统计与埋点组件。

软件只有两个地方会联网:你主动点「检查更新」时读取版本清单;你下载更大的识别模型时访问模型仓库。 两件事都可以不用,断网照样能完成识别与导出。

支持 M4A、AAC 吗?

不支持。AAC 的部分专利尚未到期,软件为了保证完全免费可商用,不内置任何需要付费授权的解码器。 M4A、MP4、WMA、AMR、DTS 同理。

遇到这些格式,先用别的工具转成 MP3、WAV、FLAC、OGG 或 Opus 再导入即可。 导入时软件会直接告诉你原因,不会默默失败。

需要多好的电脑?

核显轻薄本就能用。CPU 模式可以正常跑;如果显卡支持 Vulkan,识别速度会明显快一截, 软件会自己挑可用的后端。

影响速度的主要是三个变量:音频有多长、模型选多大、推理深度选哪档。 默认是「增强」档配随包的 small 模型,属于准确率与耗时的折中。

AI 校对是怎么工作的?软件到底联没联网?

软件本身不联网。它的做法是帮你拼好一份提示词、写进剪贴板,你自己贴到网页版大模型里, 再把回复复制回来交给软件解析。联网的是你的浏览器,不是这个软件。

提示词是按你本地的设置现拼的:标点习惯、字幕规格、识别语言、勾选的专业词库都会反映进去, 不会出现「设置里让它去标点、提示词里却让 AI 补标点」这种自相矛盾。

识别不准怎么办?

按见效快慢排一下顺序:先勾上对应的领域词库、把节目里的专有名词填进热词; 再把推理深度从「增强」提到「深度」;还不行就换成更大的模型。

如果音频本身电平很低、或者长音频后半段开始乱,打开静音检测与电平归一化通常能明显改善。

软件收费吗?可以商用吗?

免费,可商用。软件不含任何需要付费授权的组件,也没有需要付费授权的音频解码实现, 随包附带的识别引擎与模型权重均为 MIT 许可。

完整的第三方组件与许可清单在软件的「关于」页里,可以逐条核对。