[开源项目]ASMR Dubber:为日语、英语音视频制作中文配音、字幕和双语音声
ASMR Dubber:给日语、英语音视频加上中文配音和字幕
一句话介绍:ASMR Dubber 可以把日语、英语音视频处理成中文字幕、中文配音或保留原声的双语音频。
EveningStudy/asmr-dubber
为什么做这个工具
做这个项目的原因很直接:看视频时可以盯着字幕,但听音声、广播剧时一直看字幕很麻烦。如果直接换成中文配音,原来的声音、语气和环境音又会丢掉。
所以 ASMR Dubber 采用了另一种做法。它先把原音频识别成带时间轴的台词,翻译并生成中文配音,再把中文配音放回对应的位置。原声不会被替换,最后听到的是原声和中文配音混在一起的双语音频。
如果不想混音,也可以只导出中文字幕或中文配音音轨。
实际怎么用
一个作品通常按下面的顺序处理:
- 导入音频或视频,运行语音识别。手里已经有字幕或台本的话,也可以直接导入。
- 在表格里检查分句、文字和时间轴。
- 翻译成中文,再检查一遍译文。
- 选择配音方式和参考音频,生成中文语音。
- 调整音量和时间安排,完成混音。
- 导出音频、视频或字幕。

这些步骤可以分开运行。比如语音已经生成好了,只是觉得混音效果不合适,可以直接重新混音,不必再跑一次 TTS。项目进度和已经生成的语音也会保留下来,任务中断后可以接着做。
语音识别和机器翻译难免出错,所以软件没有把中间结果藏起来。识别文字、译文和时间轴都会放在表格中,可以在配音之前修改。
支持哪些模型和服务
语音识别目前支持 Parakeet、Kotoba-Whisper、Faster-Whisper,也可以通过通用 ASR API 接入其他服务。日语音频还可以选用 ASMR 专用 VAD 处理静音和非语音片段,或者用 Qwen3 ForcedAligner 重新校准时间戳。
翻译可以使用 DeepSeek、阿里云百炼、豆包、商汤 SenseNova、OpenAI、Claude、Gemini、DeepL 等服务,也支持 OpenAI-compatible 接口。
配音支持本地或云端 IndexTTS2,以及 Edge TTS、MiMo、MiniMax、GPT-SoVITS、CosyVoice、Fish Speech / Fish Audio 和通用 TTS API。使用音色克隆模型时,可以从项目中挑选参考片段,也可以导入一段外部音频。
这些后端不要求全部安装。本地识别、云端翻译和本地配音可以搭配使用,也可以全部换成 API。
配音和原声怎么放在一起
每句中文配音默认从原字幕的开始时间播放。如果它太长,超过了下一句的起点,软件可以在设定范围内适当加速;也可以不强行压缩,让后一条配音等前一条播完再开始。
混音时还可以调整中文配音的整体偏移、原声音量和响度。最终可以导出:
- 中文或双语 SRT、LRC 字幕;
- 原声与中文配音混合后的双语音频;
- 单独的中文配音音轨;
- 混音 WAV;
- 带字幕和静态画面的 MP4 视频。
多音轨作品也可以批量处理
单个作品之外,软件还提供了批量处理页面。它可以扫描 DLsite 作品目录,列出其中的音轨和已有字幕。处理前可以调整音轨顺序、作品队列、参考音频和输出方式。

批量处理可以把多条音轨合成一个成品,也可以每条分别输出。只需要字幕时,可以跳过配音和混音;已有中文字幕时,也不需要再跑语音识别和翻译。
技术和安装
主程序使用 Python 编写,网页界面基于 Gradio,音视频处理使用 FFmpeg。Windows 端提供便携包和安装程序,Linux 端提供网页界面和命令行入口。
目前支持 64 位 Windows 10/11 和 x86_64 Linux,使用 MIT License。Windows 用户可以从 Releases 下载便携包,完整解压后运行 Setup,安装需要的模型和运行环境。
项目地址
- GitHub:EveningStudy/asmr-dubber
- 下载:GitHub Releases
- 介绍和效果演示:Bilibili
- 作者:EveningStudy
- 开源协议:MIT
项目还在继续维护。如果遇到识别、翻译、配音或安装方面的问题,可以到 GitHub 提交 Issue。
本作品采用《CC 协议》,转载必须注明作者和本文链接
关于 LearnKu