·简介与亮点
官网:https://vidtai.cn — 最新版下载、使用指南、其他工具都在上面
✨ 核心亮点 —— 为日语对白密集的影视内容全流程深度调优
不止识别一环,而是从 语音检测 → 识别 → 后处理 → 翻译 每一步都针对这类内容打磨,这是语幕区别于通用转字幕工具的核心优势:
- 语音检测(VAD):对轻声 / 气息音 / 极低音量做敏感召回,少漏话
- 语音识别(ASR):情绪起伏大、语速快、轻声与对白混杂等困难声学场景的鲁棒性,领域用词 / 人名一致性
- 后处理:宽松过滤策略,保留真实对白(不把语气词当噪音误删)
- 翻译:译前全量分析(人物表 / 用词纠错 / 剧情上下文)+ 领域术语,译文自然、信达雅
- 说话人分离(可选,精校预设自动开):多人对话按说话人分段,字幕更清晰、翻译更懂"谁在说话";☁ 云端「整段识别」也自带说话人
·先看这里:你该读哪几节?
不用通读全文。对号入座,照着看那几节就够了:
| 你的情况 | 只看这几节 | 大概几分钟 |
|---|---|---|
| ☁ 没有独立显卡 / 想省事 | 一、安装 → 5.1「云端模式」 → 完事 | 3 分钟 |
| 🖥 有 NVIDIA 显卡,想本地跑 | 一、安装 → 二、激活 → 三、下载模型 → 5.1 主流程 | 10 分钟 |
| 🎬 已有字幕,只想压进视频 | 5.5 字幕压制 | 2 分钟 |
| ✏️ 已有字幕,只想改字幕 / 换样式 | 5.4 字幕编辑 + 6.2 样式编辑器 | 3 分钟 |
| 📄 已有字幕文件,只想翻译 | 5.3 字幕翻译 | 2 分钟 |
| 📝 只要文字稿 / 逐字稿,不要字幕 | 5.2 语音转文字(输出格式勾 .txt) | 3 分钟 |
| 🎙 想给文稿 / 视频配音(声音克隆) | 5.8 TTS 配音 | 5 分钟 |
| 📖 想翻译整本小说 / 电子书(txt) | 5.3 字幕翻译(电子书小节) | 2 分钟 |
| 🔧 想调参数 / 换模型榨性能 | 六、参数说明 + 七、推荐配置速查 | 慢慢看 |
| ❓ 跑出问题了 | 八、常见问题 | 按现象查 |
☁ 云端用户特别提示:你不需要看「三、下载模型」和「六、参数说明」——识别和翻译都在云端跑,一个模型都不用下;也不需要激活(云端模式不受激活限制)。
三步开跑:解压双击 语幕.exe → 首页切到「☁ 云端(无显卡)」→ 粘贴算力密钥,拖视频点「开始处理」。
算力密钥在官网 api.vidtai.cn 自助注册 / 充值(软件云端面板里有直达链接),也可找卖家购买。
·一、安装
📥 在哪拿安装包:官网 https://vidtai.cn 下载(最新版本);也可以用售后给你的夸克网盘链接。两处内容一致,官网更新更及时。
语幕提供两种形态,任选其一:
| 形态 | 怎么用 | 适合 |
|---|---|---|
| 绿色版(免安装) | 解压后进入 Yumu_v2.3.0/ 文件夹(版本号随更新变化),双击 语幕.exe 即用 | 想随手用、放 U 盘 / 移动硬盘 |
| 安装版 | 双击 语幕_setup_<版本>.exe,按提示安装,从开始菜单 / 桌面图标启动 | 想要快捷方式、正式安装 |
目录结构(绿色版,_internal 勿删):
Yumu_v2.3.0/ (版本号随更新变化)
├── 语幕.exe (双击运行)
├── _internal/ (运行时文件 + 内置模型,勿删)
│ └── models/ (已内置: VAD 语音检测 / Demucs 人声分离)
└── (首次运行后) 模型下载到 ~/.jav2ch/models/硬件要求
☁ 没显卡?用「云端模式」对硬件无要求 —— 识别 + 翻译都在云端跑,只要能上网 + 装得下约 6 GB 绿色版,再普通的电脑 / 笔记本都能出片,连大模型都不用下(详见 5.1「云端模式」)。下面的显卡要求只针对本地模式。
本地模式硬件要求:
- 操作系统:Windows 10 / 11 64 位
- 显卡:NVIDIA 显卡,最低 6 GB 显存即可(4 GB 极限档也能跑小模型),推荐 ≥ 12 GB 获得最佳速度与精度
- 无独显 / CPU 也能跑:小模型(Parakeet 英欧 ASR int8、FunASR 等)支持纯 CPU 推理,只是速度慢不少;有 NVIDIA 显卡体验最佳
- 驱动:支持 CUDA 12.x 的较新驱动(用 GPU 时)
- 内存:最低 16 GB,推荐 32 GB+
- 硬盘:程序约 6 GB;模型按需下载(ASR / 翻译模型每个 1~7 GB),建议预留 20 GB + SSD
常用小模型(Silero / FSMN 语音检测、Demucs 人声分离)已内置,开箱即用、无需下载。
大模型(ASR 识别、翻译)首次使用时自动联网下载(默认走 ModelScope / HF-Mirror 国内镜像)。
·二、激活
☁ 只用云端模式的可以跳过整节 → 去 5.1「云端模式」。云端模式不受激活 / 试用限制,没激活也能不限次数、不限时长地跑。
- 启动语幕,点击左下角 「激活」 图标(指纹按钮)
- 在弹出窗口粘贴卖家提供的激活码
- 点击「激活」,提示「激活成功」即可
[注意] 激活需要联网(仅激活时需要,之后可离线使用)。激活服务器在国内,无需梯子。
[注意] 一码一机;换电脑需联系卖家解绑。
[提示] 激活码前缀区分类型:Q- 次数卡 / M- 月卡 / Y- 年卡 / P- 永久版。激活页「当前状态」会显示你的类型与剩余次数 / 有效期。
激活类型(按你购买的卡)
| 类型 | 有效范围 | 用完 / 到期后 |
|---|---|---|
| 次数卡(新) | 满功能 N 次,不限时长、不限时间;一个视频完整跑完并出字幕 = 1 次(中途取消 / 失败不计次) | 剩余次数用完 → 自动回落试用模式 |
| 月卡 / 年卡 | 有效期内不限次数、不限时长 | 到期 → 降级回试用限制 |
| 永久版 | 一次买断,永久全功能 + 后续更新 | — |
次数卡可叠加:再买一张次数累加(如 3 次 + 3 次 = 6 次);激活页会显示剩余次数。适合"先试真本事"或偶尔用几次。
试用版限制(激活后全部解除)
- 试用期 7 天,且最多 8 次 处理
- 单个视频时长 ≤ 5 分钟
- 试用 7 天过或用满 8 次、且未激活 → 不可用
- 次数卡次数用尽 / 月卡年卡到期 → 降级回试用限制(再买次数卡叠加,或升月卡 / 永久)
☁ 以上限制只针对本地模式。云端模式不受激活 / 试用限制(没激活也能用,不限次数、不限时长),只要云端算力有余额即可 —— 见 5.1「云端模式」。
·三、下载模型(本地模式第一步 · 最容易卡在这里)
☁ 用云端模式的直接跳过整节 → 去 5.1「云端模式」。云端一个模型都不用下。
语幕的小模型已内置、开箱即用;但识别(ASR)和翻译大模型第一次用到时需要下载(每个约 1~7 GB)。新用户最常卡在这一步,这一节看完就通。
3.1 哪些要下、哪些不用下
| 模型 | 用途 | 是否要下 |
|---|---|---|
| Silero / FSMN 语音检测(VAD)、Demucs 人声分离 | 前处理 | 已内置,免下载 |
| Qwen3-ASR、Parakeet、Whisper 等 | 语音识别 | 首次用到时下载 |
| Hy-MT2 等翻译模型 | 翻译 | 首次用到时下载 |
具体下哪个识别 / 翻译模型,点右上角「一键适配显卡」会自动按你的显存选好,不用纠结。也可在下方 3.5 按语言手动选。
☁ 用云端模式?识别 / 翻译模型都不用下载(算力在云端),拖视频直接跑,连这一步都省了 —— 见 5.1「云端模式」。
3.2 方式一:软件内自动下载(推荐,绝大多数人用这个)
- 左侧栏点 ☁️ 模型管理
- 找到要用的模型 → 点右侧 「下载」,等进度条走完变「已安装」即可
- 也可以不管它直接「开始处理」——用到的模型会自动开始下载
- 下载源:自动走 ModelScope / HF-Mirror 国内镜像,无需梯子;支持断点续传和失败自动重试
- 下载到哪:
C:\Users\你的用户名\.jav2ch\models\<模型id>\(自动管理,不用你操心) - 💡 建议:开始处理前,先在「模型管理」把要用的识别 + 翻译模型下好,免得处理到一半停下来等下载
3.3 方式二:自动下载失败 → 手动下载(夸克网盘兜底)
网络不稳、镜像抽风导致自动下载失败时,会自动弹出「手动下载」窗口。按窗口里的两步走:
- ① 点窗口里的夸克网盘链接下载对应模型文件(
.zip或.gguf)。
- 也可直接打开总链接:https://pan.quark.cn/s/066843f3f74b(24 个模型都在里面,按模型 id 找对应文件夹 / 压缩包)
- 下到哪里都行(桌面、下载文件夹都可以)
- ② 回到「手动下载」窗口,点「选择已下载的文件」,选中刚下好的那个文件
⭐ 最关键、最多人误解的一点:你不需要自己把文件拖进哪个目录!
点「选择已下载的文件」后,软件会自动解压 / 复制到正确位置(.zip 自动解压,单个 .gguf 自动复制到对应目录)。完成后状态自动变「已安装」。
3.4 想自己手动放?(高级 / 离线批量装机)
如果你就是想直接放文件(比如离线装机、给多台电脑批量部署):
- 目标目录:
C:\Users\你的用户名\.jav2ch\models\<模型id>\ - 把从夸克下的压缩包解压后,里面的文件放进对应
<模型id>子目录: - 翻译类(GGUF):把
xxx.gguf放进该模型目录即可 - 识别类(整个 repo):把
config.json/model.safetensors等全部文件放进该目录 <模型id>在「模型管理」页每个模型行上能看到- 放好后回「模型管理」页,状态会自动显示 「已安装」(不用重启)
一般人别用这个方式——用 3.3 的「选择已下载的文件」按钮更省事、不会放错目录。
3.5 该下哪个模型?(按语言 / 场景)
| 你的视频 | 识别模型 | 翻译模型 |
|---|---|---|
| 日语(主打) | Qwen3-ASR(日语精度最高) | Hy-MT2 |
| 日语 · 低显存(6-8 GB)/ 多人对话 | MOSS 0.9B(转录 + 说话人一体,仅 1.8 GB 下载,见 6.3) | Hy-MT2-1.8B |
| 中文 / 韩语 | Qwen3-ASR | Hy-MT2 |
| 中文 · 无显卡 | FireRedASR2(纯 CPU 可跑,740MB,v2.5 新增) | 云端翻译 或 Hy-MT2-1.8B |
| 中文 · 出海(译英/泰/越/印尼/马来) | Qwen3-ASR(有卡)/ FireRedASR2(无卡) | Hy-MT2(33 语双向) |
| 英语 / 欧洲语言(英德法西葡意俄荷波兰捷克乌克兰) | Parakeet v3(欧洲 25 语专精,纯 CPU 也快) | Hy-MT2 |
| 其它亚洲语言(泰 / 越南 / 印尼 / 马来 / 印地 / 菲律宾 / 土耳其 / 波斯) | Qwen3-ASR(同引擎直通) | Hy-MT2 |
| 阿拉伯语 / 多语混合 | Whisper large-v3-turbo | Hy-MT2 |
拿不准就点 「一键适配显卡」,它会按你的显存自动选好识别 + 翻译模型,你只管下载。
·四、界面总览
首次启动会弹出 新手引导(3 页,介绍功能与上手步骤,只弹一次)。
语幕顶部有 6 个功能 Tab,覆盖字幕与配音全流程:
| Tab | 作用 |
|---|---|
| 🎬 视频 → 字幕 | 一站式:转录 + 翻译 +(可选)压制,最常用 |
| 🎤 语音转文字 | 只出原文字幕(不翻译) |
| 📝 字幕翻译 | 把已有字幕文件译成中文 / 双语;也能整本翻译小说 txt |
| ✏️ 字幕编辑 | 双语 ASS 双列对照,手动校对 |
| 🎞️ 字幕压制 | 把字幕烧进视频(硬字幕) |
| 🎙 TTS 配音 | 文稿 / 视频 AI 配音,声音克隆(v3.0 新增,见 5.8) |
左侧栏:🏠 主页 / 📥 视频下载(v2.4 新增,见 5.6)/ 📄 日志 / ☁️ 模型管理 / 👆 激活 / ⚙️ 设置。
·五、功能详解
5.1 视频 → 字幕(主流程)
最简流程:
- 把视频 / 音频拖到首页,或点「选择文件 / 选择文件夹」(支持 MP4 / MKV / AVI / WAV / FLAC 等)
- 设 视频语言(源)→ 字幕输出(目标),选 内容类型
- 旁边的 「视频输出」 决定要不要顺手出成品视频:内嵌字幕·快(默认,字幕作为轨道封装进 mkv,秒出,播放器里可开关)/ 烧录字幕·慢(字幕烧进画面,重编码,拿去剪辑 / 传平台字体永不错乱)/ 不生成视频(只要字幕文件)
- (建议)先点右上角 「一键适配显卡」,自动按显存选最优配置
- 点 「开始处理」,进度条按阶段显示(音频提取 → 预处理 → 语音检测 → 识别 → 翻译 …),完成后给出总耗时与各阶段耗时
- 结果在输出目录:
sub_zh.ass(中文字幕)、sub_zh.srt(可选)、双语 ASS(可选)
顶部状态栏显示当前显卡、显存、建议预设。「最近项目」可快速回到历史输出。
💻 本地模式 vs ☁ 云端模式(首页「快捷配置」右侧切换)
- 💻 本地(有显卡) — 默认。识别 + 翻译都在你电脑上跑,离线免费,需要显卡。
- ☁ 云端(无显卡) — 识别(阿里百炼)+ 翻译(DeepSeek)走云端,不吃你的显卡,再破的电脑也能几分钟出片。用法:
1. 切到「☁ 云端」→ 面板里粘贴云端算力密钥(官网 api.vidtai.cn 自助注册 / 充值,或找卖家购买;面板里点「自助充值」链接直达)→ 点「验证」看余额;
2. 选识别引擎(见下)和云端翻译模型 → 拖视频 → 开始。翻译模型 4 档可选:
- DeepSeek-V4-Flash · 推荐(默认):快且便宜,绝大多数视频用它
- DeepSeek-V4-Pro · 高质量:更好的长句理解,追求译文质量时选
- Qwen3.8-Max · 旗舰:最新旗舰模型,顶配效果
- GLM-5.2 · 中文润色:中文表达最自然,重文采的内容可试
3. 按量付费,识别和翻译分开算:
- 识别(ASR) — 按音频时长计,是主要花费(片子越长越多);
- 翻译 — 很便宜,一部片子通常最多几毛钱;
- 软件里实时显示余额 + 本次消耗,充多充少自己定,具体以充值页 / 卖家说明为准。
- ⚠ 云端模式不受激活限制(没激活也能用,不限次数 / 时长),只要算力有余额;
- 「人声分离」在本机跑(要显卡):有显卡则照常可用,无显卡自动跳过,不影响出片;
- 云端识别质量实测优于本地小模型,识别不受题材限制(翻译极个别最露骨句可能漏,追求 100% 用本地)。
☁ 云端识别引擎(v2.2.8 起可选,面板「语音识别」下拉):
| 引擎 | 特点 | 适合 |
|---|---|---|
| 新版 · 极速 ★(默认,qwen-audio-3.0) | 新一代识别模型,精度更高;自带精确词级时间戳(无需本机对齐,无卡机器也不拖慢) | 绝大多数视频,默认就选它 |
| 新版 · 整段识别(区分说话人) | 极速版的能力 + 说话人标签:整部片同一个人始终同一标签,换人自动分条,多人对话字幕更清晰、翻译更懂谁在说话(2 小时内效果最佳;更长视频自动改用分段识别,说话人标签仍保留) | 多人对话 / 剧情向,想要说话人区分 |
| 稳定版(qwen3-asr-flash) | 上一代引擎,保留兜底 | 新版个别片源效果异常时切回 |
- 选新版引擎时,「字幕时间轴」开关会置灰 —— 新版自带词级精度,不用再选;该开关只对稳定版有效(词级 = 本机对齐更精确 / 句级 = 快);
- 本地的「说话人分离」开关在云端模式下不生效(它需要本地 GPU,会自动停用并在日志提示);云端想要说话人,直接选「整段识别」引擎即可,不用下任何模型;
- 整段识别若云端临时失败,会自动回退到分段识别继续出片,不会白跑。
如上图:切到「☁ 云端」后,面板选择 语音识别引擎 + 翻译 DeepSeek-V4-Flash,粘贴算力密钥点「验证」即可看到余额,然后拖视频「开始处理」。
处理流程(进度条按此顺序走,每阶段完成显示耗时):
音频提取 →(可选)人声分离 → 预处理(loudnorm 音量归一)→ 语音检测(VAD)→(可选)说话人分离 → 分段 → 语音识别(ASR)→ 后处理(去重 / 断句 / 过滤幻觉)→ 翻译 →(可选)内嵌 / 烧录出成品视频。
如上图:每个阶段完成后打 ✓ 并显示该阶段耗时;语音识别 / 翻译会显示 已完成 N/M 段 进度条与剩余时间(ETA);底部「总进度」显示已完成阶段数与总耗时。处理中可随时点「停止」。
中途可停 / 可续:处理中可「停止」;同一文件再次处理时,可在高级设置「从某阶段开始」跳过已完成阶段(如只重跑翻译)。输出目录里已有的中间产物会自动复用,不必从头再来。
输出文件(位于 输出目录/<视频名>/):
sub_zh.ass— 中文字幕(主产物;开「双语字幕」时译文 + 原文小字同屏;同屏多人时带颜色区分)sub_zh.srt— SRT 格式(开「输出 SRT」时)sub_zh.txt/sub_zh.transcript.txt— 纯文本(开「输出 TXT」时,见下)*.softsub.mkv/*.hardsub.mkv— 成品视频(「视频输出」选内嵌 / 烧录时)clean.json/translate.json— 识别 / 翻译的中间结果(可复用、可手动检查)translate_analysis.json— 译前全量分析(人物表 / 纠错 / 剧情摘要);删掉它可强制重新分析
顺手导一份纯文本(可选):高级设置里的「输出 TXT」,给需要文字稿而不是字幕的场景。默认关,开了也不影响字幕。两种形态(在旁边的下拉里选):
| 形态 | 文件 | 长什么样 | 适合 |
|---|---|---|---|
| 带时间点 | sub_zh.txt | [00:01:23] 台词内容(一行一句) | 贴文档、发微信、做逐字稿、对着时间点找片段 |
| 纯文稿 | sub_zh.transcript.txt | 按说话停顿合成自然段,不带时间点 | 访谈 / 课程 / 口播稿,当文章读 |
开了「双语字幕」时,带时间点那版会一行给出 译文 / 原文;开了「说话人分离」时会带 [女] / [男] 标注。
5.2 语音转文字
只做识别、输出原文字幕(不翻译),用于只要听写稿的场景。
- 顶部状态栏实时显示 显卡 / 显存占用;识别模型下拉会标注每个模型所需 VRAM 与精度(如 Qwen3-ASR 1.7B 日语 Fleurs WER 5.20%),显存吃紧会给 ⚠ 提示
- 选项:音频语言 / 内容类型(与首页共享)、说话人分离、人声分离、输出格式(.ass / .srt / .txt)
- ☁ 这个 Tab 也能用云端:切到云端后同样可选识别引擎(极速 / 整段识别·区分说话人 / 稳定版,同 5.1),无显卡机器出听写稿首选
- 只想要文字稿(会议 / 访谈 / 课程 / 口播):把
.txt打开、.ass关掉,「文本形态」选纯文稿,出来就是一篇能直接读的文章;要对时间点核对就选带时间点([00:01:23] 内容),两种都要也行
5.3 字幕翻译
上传已有字幕(.ass / .srt / .vtt),翻译成目标语言(中 / 英 / 泰 / 越南 / 印尼 / 马来,与首页一致)。
- 输出格式:双语字幕(.ass,译文 + 原文)/ 单语字幕(.ass 或 .srt,仅译文)
- 翻译模型:与首页同一套变体(Hy-MT2-7B / 1.8B 本地、☁ 云端翻译)
- 术语映射:点「编辑术语表」填
原文=译文(每行一对),全片译名强制统一——与首页热词里的翻译术语是同一份,一边填两边生效 - 字幕样式:点「样式编辑器…」统一重排输出样式(字体 / 颜色 / 主副字号都生效)
#### 📖 电子书 / 小说整本翻译(v3.1 新增)
同一个页面,拖入 .txt 小说文本即自动切换到电子书模式,把日语等外语小说整本翻译成中文:
- 拖入小说 txt(自动识别章节;没有章节标题的长文也能翻)
- 选原文语言 → 目标语言(目前支持译成中文)→ 选翻译模型(本地 / ☁ 云端都行)
- 点「开始翻译整本书」——完成后在小说旁边生成
<书名>_翻译工作文件夹,译文 txt 在里面
几个特性:
- 自动人物表 + 剧情摘要:开始前自动通读开头提取人物(人名译法全书统一),翻译过程滚动生成剧情摘要,长篇前后文一致、不"翻着翻着忘了前面"
- 人名 / 术语表:点「人名/术语表」按钮,填
原文=译文(如美咲=美咲、魔王=魔尊),译名强制统一;首页热词里的翻译术语也会自动带上 - 断点续传:30 万字的长篇可以分几次翻——中途点停止(本章翻完后优雅停),已翻部分照样出文件,下次拖同一本书从上次的章节继续,不重复计算
- 双语对照:勾选后逐段"原文 + 译文"排版输出,适合学外语 / 校对
- ☁ 云端翻译不占显存、速度快,长篇小说推荐;本地模式已做显存保护,12GB 显卡可安心跑
- 试用版每次最多 3000 字,激活后不限
5.4 字幕编辑
打开字幕(.ass / .srt / .vtt),逐行手动校对。双语 ASS 以两列对照显示(原文 / 译文)。
支持:双语编辑 · 拆分 / 合并行 · 时间平移 · 重翻译选中行 · 关联视频播放 · 12 种内置样式。改完「保存 / 另存为」——「另存为」里选 文本逐字稿 (*.txt) 可以把校对好的字幕直接导成 [00:01:23] 内容 的文字稿。
💡 换文件不用点按钮:已经打开一个字幕后,把另一个字幕文件直接拖进窗口就能替换打开(有未保存修改会先弹确认,不会误吞)。
🆕 重新转录选中行(v2.3.0):发现字幕错位 / 漏了几句?「关联视频」后选中出问题的连续几行 → 点工具栏「重新转录」→ 云端重新识别这段音频并替换选中行(行数自动增减,漏的对白会长出来),完成后自动重翻译。需要云端算力密钥,按音频秒数计费(一段几分钟 ≈ 几分钱),可 Ctrl+Z 撤销。
重翻译选中行:v2.3.0 起三种后端自动选——有算力密钥走云端(推荐)、本机有 Ollama 走 Ollama、装了 Hy-MT2 模型走本地(用完自动释放显存),都没有会给明确指引。
5.5 字幕压制
选视频 + 字幕文件,输出带字幕的视频。默认 NVENC 硬件加速。三种模式:
- 烧录(硬字幕):字幕成为画面一部分,任何播放器都能看(发布首选)
- 内嵌(软字幕):封进 MKV 容器、不重编码,播放器可开关字幕(快、无损)
- 仅复制字幕:不动视频,字幕文件放到视频旁边
字幕样式同样可在「样式编辑器…」里调。
提示:如果字幕就是语幕刚生成的,不用来这个 Tab —— 首页「视频输出」选内嵌 / 烧录,一步到位。
5.6 视频下载(左侧栏)
粘贴视频链接直接下载,支持 B站 / 抖音 / YouTube / TikTok 等上千个网站。下载完成后选中文件点 「生成字幕」,自动跳到主界面并填好文件——粘个链接就能出中文字幕。
使用步骤:
- 左侧栏点 📥 视频下载,首次使用点「安装下载组件」(约 45MB,自动从国内镜像下载)
- 粘贴链接(每行一个,支持批量)→ 选画质 → 「开始下载」
- 下载完成后在「已完成」列表选中 → 「生成字幕」
几个说明:
- 下载功能免费,不扣转录次数;下载失败也不扣任何次数
- 「仅音频 (MP3)」适合播客 / 音声;「下载整个播放列表」可批量拉合集
- 更新内核:视频网站经常改版,下载突然失败时点组件条上的「更新内核」即可自动修复,不用等软件更新
- 下载封面 / 下载网站字幕并嵌入(激活用户专享):封面嵌入视频并另存高清 jpg;网站自带 CC 字幕(优先中文→英文)自动嵌入
- Cookie 登录(激活用户专享):下载会员 / 需登录的视频时勾选,选一个已登录该网站的浏览器(推荐 Firefox);Chrome 新版读不了时,可导出 cookies.txt 文件
- YouTube 等国外网站需要你的网络本身能访问;B站 / 抖音等国内网站直接用
- 请仅下载您有权使用的内容
5.7 热词(v2.5 新增)
视频里的人名、角色名、术语,识别容易写成同音错字,翻译容易前后译名不一。「热词」一次解决两件事。
用法:首页「预设场景」旁有 热词 开关(语音转文字页同款)→ 打开弹出设置窗,两个框:
| 框 | 填什么 | 作用 |
|---|---|---|
| 识别热词 | 人名/术语,用视频的原语言填(日语视频填日文,如 炭治郎),逗号或换行分隔 | 语音识别不写错字 |
| 翻译术语 | 每行一对 原文=译文(如 サトル=悟) | 全片译名强制统一 |
- 设置会记住,跑同系列视频只需填一次;开关随时启停,词表保留
- 识别热词支持:☁ 云端「新版·极速 / 整段识别」(全部语言)、FunASR 模型(中/英/日);云端「稳定版」和其他本地模型暂不支持
- 翻译术语:全部翻译模型都支持
- 中文逗号、英文逗号、顿号、换行都能当分隔符,随手打就行
v2.6 同场加映:中文出海——字幕输出可选 英/泰/越南/印尼/马来;15 款字幕样式——新增日综袋文字「日综粉紫」、发光字「霓虹微光」、5 款内嵌字体(思源宋体/霞鹜文楷/得意黑/站酷快乐体/马善政毛笔),样式编辑器可调外圈颜色/粗细/发光强度。
v2.5 同场加映:中文视频转录全面优化——自动补标点、按语义切分,中文字幕不再"一大段糊在一起"或切在词中间;「字幕翻译」页原文语言 4 种 → 23 种,与首页一致。
5.8 TTS 配音(v3.0 新增)
给文稿或视频配上 AI 语音,支持克隆任意声音。两种模式(页面顶部切换):
- 📄 文稿配音(默认):导入 txt / md / srt / ass 或直接粘贴文稿 → 选音色 → 「开始配音」,输出 MP3/WAV(可同步生成 SRT 字幕)。多角色文稿写成
【角色名】台词或角色名:台词,每个角色可单独选音色,也可点「自动分配」一键配齐 - 🎬 视频配音:拖入视频 + 带说话人的字幕,按说话人自动分配音色重新配音,背景音保留、语音与画面时间轴对齐
音色三来源:
- 内置音色:14 个真人音色(中 / 英 / 日),开箱即用
- 克隆音色:选一段干净人声(15 秒以上效果最佳,支持 wav/mp3),引擎即刻模仿这个声音说话
- 麦克风录制:点录音按钮读一段提示文本(上限 20 秒),用你自己的声音配音——本机音色只存在你电脑上(标「·本机」),不会随软件分发
配音引擎:下拉里有多款引擎可选,各有特长(克隆相似度 / 情绪控制 / 语速调节 / 轻量省显存),每款都标注了所需显存——听不准就都试一句,用「试听前 3 句」快速比对。默认 IndexTTS-2.5(克隆/情绪/语速全能)。
几个说明:
- 首次使用要下载配音模型(每款引擎一个,2~6 GB):模型管理页下载,支持国内镜像 + 夸克网盘兜底(同第三节);引擎运行时已随软件内置,无需单独安装
- 配音过程可随时停止,已合成的段落保留
- 输出文件名自动标注所用引擎,方便多引擎对比
- 配音按时长计次,与转录同一套次数;试听不扣次
·六、参数说明
☁ 用云端模式的基本不用看这章(模型 / 显存类参数都不生效)。只有两项对你有用:视频语言 → 字幕输出、内容类型 —— 就在 6.1 开头两段。
🖥 本地用户想省事的话:点右上角 「一键适配显卡」 自动配好,也不用细看这章。
6.1 快捷配置(首页)
视频语言 / 字幕输出
- 视频语言 = 音频实际语种,支持 23 种 + 自动检测:日 / 英 / 韩 / 中 / 德 / 法 / 西 / 葡 / 意 / 俄 / 荷 / 波兰 / 捷克 / 乌克兰 / 泰 / 越南 / 印尼 / 马来 / 印地 / 菲律宾 / 土耳其 / 波斯 / 阿拉伯(建议显式选语言;自动检测在低显存下有局限,见 6.3)
- 字幕输出 = 目标字幕语言,支持 中文 / 英语 / 泰语 / 越南语 / 印尼语 / 马来语(中文视频出海直接选目标语种即可)。两者相同 = 不翻译,只出原文
内容类型(影响领域词表 / 人物分析是否启用)
- 影视 · 剧集 / ASMR·音声 / 课程·访谈
- 选对类型,识别与翻译的用词更贴合该题材
预设场景(一选即调好 ASR / 翻译 / VAD / 人声分离 等一整套)
| 预设 | 说明 | 显存 |
|---|---|---|
| 通用模式(默认) | 默认配置(说话人分离关,速度优先) | 12 GB |
| 精校模式(高质量) | 最佳质量组合(1.7B ASR + 7B 翻译 + 说话人分离开) | ≥ 12 GB |
| 快速模式(低显存 / 草稿) | 小模型 + 关 pre-analysis,省显存提速 | 8 GB |
| ASMR 模式 | 耳语 / 极低声优化(敏感 VAD) | 10 GB |
| 动漫模式 | BGM 强场景优化(人声分离) | 12 GB |
输出 SRT:除 ASS 外额外出一份 .srt。高级设置:打开后展开下面 5.3 的技术参数。
6.2 字幕样式编辑器
点「样式编辑器…」打开。上方 15 个预设卡片(经典白字 / 黑底白字 / B站弹幕风 / 双语主中文 / Netflix极简 / ASMR柔和粉 / 半透明黑框 / 综艺花字黄 / 日综粉紫(袋文字双层描边)/ 经典黄字 / 蓝调描边 / 电影感衬线 / 少女粉框 / 霓虹微光(发光字)/ 文楷手写),选一个再用底部控件微调,实时预览:
- 字体 / 主字号:主语言(译文)的字体与字号(1080p 基准,40~88)。除思源黑体 / 宋体外,内置 4 款花字体:霞鹜文楷(楷体)、得意黑(潮流斜体)、站酷快乐体(可爱花体)、马善政毛笔(书法),全部开源可商用,已随软件内嵌,观众端无需装字体(软字幕自动打包进 mkv,烧录直接生效)
- 副字号:副语言(原文)字号 = 主字号 ×此百分比(50%~90%,默认 74%)
- 主色 / 描边色 / 描边粗细:主语言颜色与描边
- 副字体 / 副色:副语言(原文)的字体与颜色(独立设置)
- 外圈/光晕色 · 外圈粗细 · 发光强度:第二层描边——「实边」= 日综袋文字(白边外再包一圈深色边);调到「微光~超强」= 字幕周围发光(外圈色即光晕色,粗细即光晕范围)
双语字幕每屏 = 译文(大字)+ 原文(小字);超长句会自动按句拆到多屏,不会堆成一大坨。
💡 首页样式条显示的是当前实际生效的样式(上次「应用到字幕」的那套,重启也记得)。字幕带黑色底板想去掉:打开样式编辑器 → 点「经典白字」→「应用到字幕」即可;带底板的预设(黑底白字 / 半透明黑框)才有底板。
6.3 高级设置(技术参数 · 手动指定模型)
默认所有模型都走 「自动」(按 语言 × 显存 智能路由,见上文表格),省心。但你完全可以手动指定 —— 打开首页右侧「高级设置」开关后,下面这些会展开成下拉框,可覆盖自动选择:自选 ASR 模型、VAD 后端、音频源、翻译后端 / 模型等。
提示:「语音转文字」Tab 直接就显示「识别模型」下拉(无需进高级设置);「字幕翻译」Tab 直接显示「翻译模型」下拉。想换具体模型在那两个 Tab 最直接。
各项 作用 · 取值 · 推荐:
一键适配显卡 / 显存自适应
- 作用:探测显存,自动选 ASR / 翻译模型档位 + batch_size,避免 OOM
- 推荐:不确定就点它;它会按下面「六、推荐配置速查」的档位设好
ASR 模型(语音识别)—— 默认「自动」按「语言 × 显存」选最优;也可在下拉里手动指定任一模型
「自动」时各语言 / 显存的实际选用(模型 + 自动 batch,与软件路由代码逐格核对,v2.2.8):
| 视频语言 | 12 GB | 10 GB | 8 GB | 6 GB | 4 GB | 无卡 / CPU |
|---|---|---|---|---|---|---|
| 日语 | Qwen3-ASR 1.7B (b6) | Qwen3-ASR 0.6B (b12) | Qwen3-ASR 0.6B (b6) | Kotoba v2.0-faster | Anime-Whisper | Whisper turbo(慢,建议☁云端) |
| 中文 / 韩语 | Qwen3-ASR 1.7B (b6) | Qwen3-ASR 0.6B (b12) | Qwen3-ASR 0.6B (b6) | Whisper turbo | Whisper turbo | Whisper turbo(慢,建议☁云端) |
| 泰 / 越南 / 印尼 / 马来 / 印地 / 菲律宾 / 土耳其 / 波斯 | Qwen3-ASR 1.7B (b6) | Qwen3-ASR 0.6B (b12) | Qwen3-ASR 0.6B (b6) | Whisper turbo | Whisper turbo | Whisper turbo(慢,建议☁云端) |
| 英 / 德 / 法 / 西 / 葡 / 意 / 俄 / 荷 / 波兰 / 捷克 / 乌克兰 | Parakeet v3 (b24) | Parakeet v3 (b12) | Parakeet v3 (b6) | Parakeet v3 (b6) | Parakeet v3 (b4) | Parakeet v3(CPU 也快,~12x 实时) |
| 阿拉伯语 | Whisper turbo (b24) | turbo (b12) | turbo (b6) | turbo (b6) | turbo (b4) | turbo(慢,建议☁云端) |
| 自动检测 | Qwen3-ASR 1.7B | Qwen3-ASR 0.6B | Qwen3-ASR 0.6B | Parakeet v3 | Parakeet v3 | Parakeet v3 |
- batch 随显存自动适配:同一模型,显存越大 batch 越大、越快;显存小自动降 batch,尽量让低显存用户也能用上高精度模型
- 日 / 中 / 韩 / 泰 / 越等亚洲语言 8~12 GB 全程用 Qwen3-ASR(高精度专项模型):12GB 用 1.7B,10GB 及以下自动降 0.6B,8GB 靠最低 batch 贴边跑
- ⚠ 8 GB 提示:0.6B 在 8 GB 是贴边运行(峰值接近上限),建议先用短视频试一次;若 OOM 可手动改用 Kotoba(日语)/ Whisper turbo
- 6 GB 及以下:日语换 Kotoba(4GB 专精)→ 4GB 换 Anime-Whisper;中韩及亚洲语言换 Whisper turbo;快速模式下日语也优先 Kotoba(更快)
- ⚠ 「自动检测」在 6GB 及以下会落到 Parakeet(它不支持日中韩)——低显存跑亚洲语言视频请显式选语言,别用自动检测
- 无卡 / 纯 CPU:英欧语言用 Parakeet 照样快(CPU int8 ~12 倍实时);日中韩等在 CPU 上很慢,强烈建议切 ☁ 云端模式
各模型说明:
- Qwen3-ASR 1.7B ★:日 / 中 / 韩 / 泰 / 越等亚洲语言高精度(日语 Fleurs WER 5.20%,业界最高),困难场景(叫喊 / 快语速)鲁棒,字级时间戳;需 ~11 GB
- Qwen3-ASR 0.6B:1.7B 的轻量版,语言覆盖相同;10 GB 自动选用,8 GB 配最低 batch 也能跑(贴边)
- Parakeet-TDT 0.6B v3:英 + 欧洲 25 语专精(onnx,GPU 5.6 GB / CPU int8 ~12x 实时);英语 Fleurs 4.85%
- Kotoba v2.0-faster:日语专精,CT2 int8,仅需 4 GB,快
- Whisper large-v3-turbo:多语言通用(809M 蒸馏),快;非专精语言 / 低显存的兜底
- SenseVoice Small:< 2 GB / 纯 CPU 兜底,多语言(段级时间戳)
- Anime-Whisper:动漫 / ASMR 气声 · 环境音等拟声专精(对白仍推荐 Qwen3)
- MOSS 0.9B(v2.2 新增):转录 + 说话人一体,一趟出转录 + 说话人归属 + 句读;多人对话 / 访谈类更准(实测比默认组合多出约 20% 字幕),显存只要 6-7 GB;需下载约 1.8 GB
- ⭐ 低显存(6-8 GB)跑日语的高性价比之选:比同档的 Kotoba / Whisper 对白更全,且自带说话人 → 换人自动分条,字幕显示观感明显更好;显存不够跑 Qwen3-ASR 时,手动选它很值
- 想要说话人标签时,它比"另开说话人分离"更省事(不用额外下 DiariZen、也不额外费时间);默认只做转录,说话人标签在「设置 → ASR」里开
- 注:MOSS 主打日语;中文视频不建议用它(会偶发掉字),中文请用 Qwen3-ASR / Whisper turbo
- 手动还可选:FunASR Paraformer、Whisper large-v3 / v2、Chickenrice(日→中直翻,跳翻译)、Kotoba v2.2
为什么英 / 欧洲语言不用 Qwen3?Parakeet v3 在英欧语言上精度更高、速度快一个量级,且纯 CPU 也能跑,故默认路由 Parakeet;手动选 Qwen3 也可以。
VAD 语音检测后端
Silero★:默认,神经网络精度高FSMN:阿里,速度快(全阿里方案配 FunASR)TransWithAI:专为日语 ASMR 优化TEN:对白优化,边界紧、速度快(约 316×);搭配动漫模式 / Anime-Whisper 效果佳- 注:管线为多层架构(Silero 主检测 + 能量 / FSMN 兜底补检),漏检会自动补救
ASR 音频源
Demucs + loudnorm★:人声分离 + 音量归一,字幕覆盖率最高(推荐)loudnorm:仅音量归一,无分离伪影Demucs/原始音频:特殊场景用
人声分离(Demucs):从背景音 / BGM 里抽人声。BGM 强(动漫 / MV)建议开;纯人声对白可关(省时间)。
- 模型:
htdemucs_ft(最高质量,慢 4×)/htdemucs(快 4×,推荐)
说话人分离(Diarization):区分多人 + 性别。主要收益:换人自动分条(不同人不会挤在一条字幕里,显示更清晰)+ 翻译时知道"谁在说话"(人称 / 敬语更准)。默认关闭(它约占总耗时 1/4);多人剧情想要时手动打开,或直接切「精校模式」预设(它保持开启)。
⚠ 打开它需要先下一个说话人模型(约 258 MB):到「模型管理」找 DiariZen 点「下载」,如果下载失败,选择「手动下载」走网盘下载。没下也不影响出字幕 —— 软件会自动跳过这一步继续跑,只是字幕没有说话人标签。
📌 自动停用的情况只剩一种:☁ 云端模式 / 无显卡(需要本地 GPU;云端想要说话人 → 选「整段识别」引擎,见 5.1)(内容类型不再限制;影视·剧集角色较多时标签可能不完全准,主要收益是换人分段/分屏)。
📌 想省事拿说话人:日语直接选 MOSS 识别模型(自带说话人,免下 DiariZen,见上),或云端「整段识别」。
📌 按性别上色(男蓝女粉)是独立开关、默认关,只在同屏多人时有视觉效果;不开上色也照样享受分段 / 翻译收益。
翻译后端 / 模型(下拉可选)
- Hy-MT2-7B 本地 ★(默认,12GB+):腾讯混元翻译 2 代 7B,GGUF 本地推理,33 种语言;信达雅、重复幻觉少(实测约为 qwen 的 1/4)
- Hy-MT2-1.8B 本地(低显存 4-6GB):7B 的轻量版,显存紧时用
- ☁ 云端翻译 · 填算力密钥即用:走官方云端(默认 DeepSeek-V4-Flash),无需显卡 / 无需下模型,填算力密钥即用(即「云端模式」的翻译,见 5.1)
- Sakura(legacy):旧版日译中模型,保留兼容
- 译前还会做全量分析(人物表 / ASR 纠错 / 剧情摘要)注入翻译,让人名、术语、上下文更连贯(默认 qwen 跑分析、Hy-MT2 跑句子翻译)
·七、推荐配置速查
按显卡显存(语幕会用「一键适配显卡」自动设到这些档)
| 显存 | 日语 ASR | 中/韩 ASR | 英/欧 ASR | 翻译 | 备注 |
|---|---|---|---|---|---|
| ☁ 无显卡 / 嫌慢 | 云端百炼 | 云端百炼 | 云端百炼 | 云端 DeepSeek | 切「云端模式」,拖视频云端出片,不吃硬件、免下模型、充算力即用 |
| 12 GB(默认,4070/4070S) | Qwen3-ASR 1.7B | Qwen3-ASR 1.7B | Parakeet | Hy-MT2-7B | 满配,开 pre-analysis,峰值 ~11.9 GB |
| 10 GB | Qwen3-ASR 0.6B | Qwen3-ASR 0.6B | Parakeet | Hy-MT2-7B/1.8B | batch 12 |
| 8 GB | Qwen3-ASR 0.6B(贴边) | Qwen3-ASR 0.6B(贴边) | Parakeet | Hy-MT2-1.8B | 最低 batch,建议先短视频试 |
| 6 GB | Kotoba v2.0-faster | Whisper turbo | Whisper turbo | Hy-MT2-1.8B | ~6.5 GB |
| 4 GB | Anime-Whisper | Whisper turbo | Parakeet v3 | Hy-MT2-1.8B | 极限档,慢 |
| 纯 CPU / 无卡 | ☁ 建议云端 | ☁ 建议云端 | Parakeet int8(CPU 也快) | ☁ 云端 / 1.8B(慢) | 英欧本地可用;亚洲语言强烈建议云端 |
按使用场景
| 场景 | 预设 | 内容类型 | 说明 |
|---|---|---|---|
| 日常日语视频出中文字幕 | 通用 / 精校 | 影视·剧集 | 默认即可 |
| 英语 / 欧洲语视频 | 通用 | 影视·剧集 | ASR 自动用 Parakeet |
| ASMR / 耳语音声 | ASMR 模式 | ASMR·音声 | 敏感 VAD 多召回 |
| 动漫(BGM 强) | 动漫模式 | 影视·剧集 | 开人声分离 |
| 低显存 / 出草稿 | 快速模式 | — | 小模型省显存 |
| 日语多人对话,想区分说话人 | 通用 + 手选 MOSS | 影视 · 剧集 | 识别模型手动选 MOSS(自带说话人,6-7 GB 显存);或本地开说话人分离(精校预设);或 ☁ 云端「整段识别」 |
| 日语 · 显存只有 6-8 GB | 通用 + 手选 MOSS | — | MOSS 比同档小模型对白更全、观感更好(见 6.3) |
·八、常见问题
Q:处理很慢 / 卡在某阶段
A:音频提取与人声分离(Demucs)较慢属正常;不需要人声分离时在高级设置里关掉能省很多时间。识别 / 翻译走 GPU,确认没有别的程序占用显卡。
Q:显存不足 / CUDA out of memory
A:点「一键适配显卡」自动降档;或手动:换更小 ASR(1.7B→0.6B)、关 pre-analysis、调小 batch、关人声分离。
Q:开了「说话人分离」却没有说话人标签?
A:几种情况它会自动停用(日志里有提示,不是坏了):① 云端模式 / 无显卡(它需要本地 GPU)—— 云端想要说话人请把识别引擎换成「整段识别」;③ DiariZen 模型没下载(会跳过这步继续出字幕)。另外「按性别上色」是独立开关、默认关——没上色不代表说话人没生效,分段和翻译照样受益。
Q:出来没有字幕 / 字幕很少
A:检查视频语言选对没;ASMR / 极低声场景用「ASMR 模式」;纯背景音乐段落本就无对白。
Q:第一次用,一直在下载 / 卡在下载模型
A:识别和翻译大模型第一次用到时要联网下(每个 1~7 GB),这是正常的。详见第三节《下载模型》。建议开始处理前先在「模型管理」把要用的模型下好。小模型(VAD / Demucs)已内置、无需下载。
Q:模型下载很慢 / 失败
A:默认走 ModelScope / HF-Mirror 国内镜像(无需梯子);可在「模型管理」里重试,支持断点续传。实在下不动 → 用夸克网盘手动下载兜底:下载失败会弹「手动下载」窗口,点里面的夸克链接下好文件后,再点「选择已下载的文件」,软件自动归位——不用自己放目录。详见 3.3。夸克总链接:https://pan.quark.cn/s/066843f3f74b。
Q:夸克下载的模型放哪个文件夹?
A:一般不用自己放——在「手动下载」窗口点「选择已下载的文件」选中它,软件会自动解压 / 复制到位。若要手动放(离线批量装机):放到 C:\Users\你的用户名\.jav2ch\models\<模型id>\,详见 3.4。
Q:C 盘被模型占满了怎么办?(高频)
A:模型默认放在 C 盘用户目录下,几个大模型加上各库缓存很容易占十几到几十 GB。到「模型管理」页,顶部会显示占用明细和剩余空间,点右边的 「搬到其他盘…」,选个空间大的盘(需 NTFS 格式的本地硬盘),软件会把模型和缓存整体搬过去,并在原位置留一个「目录联接」。
关键点:搬完什么都不用改 —— 软件和各个模型库看到的路径完全没变,已下载的模型不用重下,配置也不用动。以后新下载的模型会自动落到新盘。
搬移过程是「先复制 → 校验 → 再删原文件」,中途失败原文件仍然完好。
另外从 v2.2.5 起,下载前会检查空间,不够时提前提示,不会像以前那样下到一半才失败。
Q:生成的 mkv 打不开 / 黑屏?
A:多半是源视频是 AV1 编码(YouTube 高清下载常见),「内嵌」模式不改视频流,老播放器 / 老显卡不支持 AV1 解码就放不出来。两个办法:① 换支持 AV1 的播放器(新版 PotPlayer / VLC / mpv);② 「视频输出」选烧录——重编码为 H.264,任何设备都能放。
Q:AVI / 老格式视频跑完,内嵌字幕看不到?
A:AVI 这类老容器本身不支持内嵌字幕轨,所以软件会在输出目录另存一个 原名.softsub.mkv(画质无损)。请播放这个 mkv,不是原来的 avi。如果 mkv 里还是看不到字幕:换 PotPlayer / VLC(Windows 自带播放器对 mkv 字幕支持差),或播放时右键 →「字幕」→ 选择字幕轨。
Q:内嵌和烧录选哪个?
A:自己在电脑上看 → 内嵌(秒出、无损、播放器可开关字幕);要拿去剪辑或上传平台 → 烧录(字幕烧进画面,重编码慢一些,但任何设备 / 平台上字体永不错乱)。
Q:没有独立显卡能烧录吗?
A:能。没 N 卡时自动用 CPU 编码(慢一些但能出片);有 N 卡自动走 NVENC 加速。只想让播放器显示字幕的话,选内嵌更快。
Q:烧录很慢正常吗?
A:正常,烧录需要重新编码整个视频(有 N 卡自动用 NVENC 加速)。只是自己看就用内嵌。
Q:字幕带黑色底板,想去掉?
A:是之前应用过带底板的样式预设(黑底白字 / 半透明黑框),它会一直生效直到换样式。去掉:首页「样式编辑器…」→ 点「经典白字」→「应用到字幕」。首页样式条显示的就是当前实际生效的样式。
Q:双语字幕显示太多行 / 太挤
A:双语已限制每屏最多 2 行;在样式编辑器把副字号调小(如 65%)原文更容易一行放下。
Q:激活失败
A:确认联网(无需梯子);检查激活码大小写 / 横线 / 空格;一码一机,换机需联系卖家解绑;杀软 / 防火墙可能拦截,临时关闭再试。
Q:软件无法启动 / 双击没反应
A:确认 NVIDIA 显卡 + 较新驱动;确认 _internal 文件夹完整未被杀毒删除;路径尽量英文;试管理员权限运行。
Q:超长视频(3-4 小时)跑到人声分离就失败 / 提示内存不足
A:v2.2 起会自动分段处理超长音频,不再需要你手动剪片。若仍提示内存不足:关掉占内存的程序(浏览器 / 游戏)后重试,或把「人声分离」关掉(纯对白视频关掉几乎不影响字幕)。
Q:提示"模型文件不完整"怎么办?
A:模型没下完整(下载中途断网 / 被取消最常见)。到「模型管理」点「下载」,如果下载失败,选择「手动下载」走网盘下载。想立刻能用也可以先换成已下好的其他模型,或切「云端模式」(不用下模型)。
Q:配音失败,提示显存不足?
A:配音引擎按显存分档,下拉里每款都标了所需显存——换一款标注更低的引擎;关闭其他占显存的程序(浏览器视频页、游戏、正在跑的转录任务)后重试。
Q:手动安装配音模型时提示"不是有效的 GGUF 模型 / 文件下载不完整"?
A:网盘下到的文件不完整或下错了(浏览器中断、下成网页最常见)。重新从夸克把该模型文件下完整(对一下文件大小,一般 2~6 GB),再点「选择已下载的文件」。这个提示是软件在安装前帮你把关,避免配音跑到一半才报错。
Q:克隆出来的声音不像?
A:参考音质量决定相似度:选一段只有目标人声、无背景音乐的干净片段,15 秒以上效果最佳;太短(几秒)相似度会明显下降。换一款主打克隆的引擎(如 IndexTTS-2.5)也有帮助。
版本:v3.1.0(2026-09)
官网:https://vidtai.cn
- 语幕的最新版下载、在线版使用指南都在官网
- 同系列桌面工具:无痕(去水印 / 去字幕 / 去物体)、画质超清(老片 / 低清修复到 4K)、PDF 转 MD
售后联系(购买后添加,方便售后):
- 微信:
yooooloooov8 - QQ:
3091184072 - 交流 / 求助 QQ 群:
1075669841(问题群里互助、更新通知,推荐加)