[开源项目]ASMR Dubber:为日语、英语音视频制作中文配音、字幕和双语音声

AI摘要
【知识分享】本文介绍开源工具ASMR Dubber,用于将日语、英语音视频处理为中文字幕、中文配音或双语音频。工具支持语音识别、机器翻译、TTS配音及混音,兼容多种模型与API服务,提供批量处理功能,适用于ASMR作品本地化。

ASMR Dubber:给日语、英语音视频加上中文配音和字幕

一句话介绍:ASMR Dubber 可以把日语、英语音视频处理成中文字幕、中文配音或保留原声的双语音频。
EveningStudy/asmr-dubber

为什么做这个工具

做这个项目的原因很直接:看视频时可以盯着字幕,但听音声、广播剧时一直看字幕很麻烦。如果直接换成中文配音,原来的声音、语气和环境音又会丢掉。

所以 ASMR Dubber 采用了另一种做法。它先把原音频识别成带时间轴的台词,翻译并生成中文配音,再把中文配音放回对应的位置。原声不会被替换,最后听到的是原声和中文配音混在一起的双语音频。

如果不想混音,也可以只导出中文字幕或中文配音音轨。

实际怎么用

一个作品通常按下面的顺序处理:

  1. 导入音频或视频,运行语音识别。手里已经有字幕或台本的话,也可以直接导入。
  2. 在表格里检查分句、文字和时间轴。
  3. 翻译成中文,再检查一遍译文。
  4. 选择配音方式和参考音频,生成中文语音。
  5. 调整音量和时间安排,完成混音。
  6. 导出音频、视频或字幕。

ASMR Dubber 单个作品工作台

这些步骤可以分开运行。比如语音已经生成好了,只是觉得混音效果不合适,可以直接重新混音,不必再跑一次 TTS。项目进度和已经生成的语音也会保留下来,任务中断后可以接着做。

语音识别和机器翻译难免出错,所以软件没有把中间结果藏起来。识别文字、译文和时间轴都会放在表格中,可以在配音之前修改。

支持哪些模型和服务

语音识别目前支持 Parakeet、Kotoba-Whisper、Faster-Whisper,也可以通过通用 ASR API 接入其他服务。日语音频还可以选用 ASMR 专用 VAD 处理静音和非语音片段,或者用 Qwen3 ForcedAligner 重新校准时间戳。

翻译可以使用 DeepSeek、阿里云百炼、豆包、商汤 SenseNova、OpenAI、Claude、Gemini、DeepL 等服务,也支持 OpenAI-compatible 接口。

配音支持本地或云端 IndexTTS2,以及 Edge TTS、MiMo、MiniMax、GPT-SoVITS、CosyVoice、Fish Speech / Fish Audio 和通用 TTS API。使用音色克隆模型时,可以从项目中挑选参考片段,也可以导入一段外部音频。

这些后端不要求全部安装。本地识别、云端翻译和本地配音可以搭配使用,也可以全部换成 API。

配音和原声怎么放在一起

每句中文配音默认从原字幕的开始时间播放。如果它太长,超过了下一句的起点,软件可以在设定范围内适当加速;也可以不强行压缩,让后一条配音等前一条播完再开始。

混音时还可以调整中文配音的整体偏移、原声音量和响度。最终可以导出:

  • 中文或双语 SRT、LRC 字幕;
  • 原声与中文配音混合后的双语音频;
  • 单独的中文配音音轨;
  • 混音 WAV;
  • 带字幕和静态画面的 MP4 视频。

多音轨作品也可以批量处理

单个作品之外,软件还提供了批量处理页面。它可以扫描 DLsite 作品目录,列出其中的音轨和已有字幕。处理前可以调整音轨顺序、作品队列、参考音频和输出方式。

ASMR Dubber 批量处理界面

批量处理可以把多条音轨合成一个成品,也可以每条分别输出。只需要字幕时,可以跳过配音和混音;已有中文字幕时,也不需要再跑语音识别和翻译。

技术和安装

主程序使用 Python 编写,网页界面基于 Gradio,音视频处理使用 FFmpeg。Windows 端提供便携包和安装程序,Linux 端提供网页界面和命令行入口。

目前支持 64 位 Windows 10/11 和 x86_64 Linux,使用 MIT License。Windows 用户可以从 Releases 下载便携包,完整解压后运行 Setup,安装需要的模型和运行环境。

项目地址

项目还在继续维护。如果遇到识别、翻译、配音或安装方面的问题,可以到 GitHub 提交 Issue。

本作品采用《CC 协议》,转载必须注明作者和本文链接
讨论数量: 0
(= ̄ω ̄=)··· 暂无内容!

讨论应以学习和精进为目的。请勿发布不友善或者负能量的内容,与人为善,比聪明更重要!