重要

这是一款面向 DaVinci Resolve 与 Premiere Pro 的自动配音插件,把字幕或文字一键变成自然的中文配音,直接落在你的时间线上。

备注

Adobe After Effects(Ae),计划开发ing 现在已经支持当下热门的本地部署大模型方案 GPT-SoVITS ,可离线私有化克隆音色。

如果你是使用DaVinci Resolve 或 Premiere Pro的一名视频创作者,需要在时间线上插入配音时,要么线下去配,要么使用机器人配音。

但问题是,你在某个配音网站或软件里,用机器人生成了一段音频,然后还得下载文件 → 切回剪辑软件 → 手动拖进时间线 → 对着字幕一条条对齐位置。成片长一点,光是"导出、导入、对位"这套流程就能耗掉你大半天。

默默配音助手要解决的,恰恰就是这个最磨人的环节——它把配音直接做成了剪辑软件里的一个面板。你不用跳出剪辑软件,不用在网页和软件之间反复横跳,更不用手动对齐。文字(或字幕)在哪里,配音就落在哪里。

今天想给大家介绍一个我自己一直在用的 开源小工具 hcllmsx/momovoicesub ——默默配音助手 。它专门解决一件事:把文字变成能直接放进剪辑软件里的配音音频,而且全程就在你最常用的剪辑软件里完成。


它是什么?

默默配音助手是一个剪辑软件插件,目前支持两款主流软件:

  • DaVinci Resolve Studio(达芬奇)
  • Adobe Premiere Pro(Pr)

它底层支持两条语音合成路线:

  • 云端版:微软 Azure 语音合成服务(Azure Speech Service),也就是目前市面上比较成熟、中文发音比较自然的那套 TTS(文字转语音)技术,官网注册账号免费送额度就能用。
  • 本地版:GPT-SoVITS 大模型。直接把模型跑在你自己的机器上,用你录的一段参考音频,就能离线克隆出一个专属音色,零外部 API 消耗、数据完全不出本地,适合对隐私敏感或追求高音质私有化克隆的用户。

但它不是让你打开一个网页、粘贴文字、下载音频、再拖进时间线————而是直接做成插件,嵌在你的剪辑软件里。你选好字幕轨,点一下,配音就自动生成并插到对应的音频轨上了。中间没有任何"导出再导入"的折腾,更不用手动对位——这正是它相比"配音网站 + 手动导入"那套流程最大的优势。

默默配音助手DaVinciResolve版界面

默默配音助手 DaVinci Resolve 版界面

默默配音助手PremierePro版界面

默默配音助手 Premiere Pro 版界面


默默配音助手能做什么?

1. 字幕轨一键自动配音

这是我最喜欢的功能。当你在时间线上已经有了字幕轨——无论是自己打的、还是软件自动识别的字幕——插件会:

  • 读取每一条字幕及其在时间线上的起止位置;
  • 批量把每条文字合成为配音;
  • 按原来的位置,逐条插入到你指定的音频轨。

也就是说,你有一整集带字幕的视频,点一下,几十上百条配音就各就各位了。还可以选择"跳过已有"还是"覆盖",避免重复生成。

2. 手动文本配音

没有字幕也想加一段旁白?直接在插件的文本框里输入文字,生成后插入到当前播放头的位置就行。适合做片头片尾解说、插播说明等。

3. 多音字纠音

中文 TTS 最怕的就是多音字读错。插件内置了多音字词典,能自动匹配常见读音;对于特殊的人名、地名、专有名词,你还能手动给某个字标注读音,支持单字纠音和批量纠音,也可以自己往词典里加词条。

4. 停顿控制

配音不是越快越好,节奏感很重要。插件允许你在文本里插入 50 毫秒到 2 秒的停顿标记,用来控制语句之间的呼吸感,让成片听起来更自然。

5. 参数预设

音色、风格、语速、音调、音量……这些参数可以存成"预设",一键切换。比如你做了一系列视频,都用同一个"御用嗓音",存个预设就再也不用每次重新调。

6. 本地缓存复用

同样的文字 + 同样的音色 + 同样的参数,插件会直接复用本地缓存,不再重复调用服务。这不仅能省时间,也能帮你省下云端调用的费用。插件设置里还能清理缓存,按"当前项目未引用的 / 当前项目的 / 全部的"几种粒度来删。

7. SRT 导入

万一你的时间线上没有字幕轨,也别慌——可以直接导入本地的 .srt 字幕文件当作配音来源。

8. 本地 GPT-SoVITS 大模型 / 离线音色克隆(新)

这是最近的重大更新。你可以在插件里直接接本地跑起来的 GPT-SoVITS 大模型:

  • 整合包托管:选好本地 GPT-SoVITS 整合包(如 GPT-SoVITS-v2pro),点一下"启动服务",插件会自动探测内置 Python 环境并拉起服务,不用你自己敲命令。
  • 音色克隆:在"本地音色库"里添加音色,扫描整合包里的模型权重,再指定一段你的参考音频,就能克隆出一个专属音色。
  • 本地音色库管理:支持自动解析模型与参考文本、指定情绪风格标签与声音形象。
  • 远程直连:如果模型部署在局域网的高性能 GPU 服务器上,也可以直接用 URL 直连(比如 http://127.0.0.1:9880),远程发起推理合成。
默默配音助手DaVinciResolve版设置页(本地GPT-SoVITS)

默默配音助手 DaVinci Resolve 版设置页(本地 GPT-SoVITS 部署)

默默配音助手PremierePro版设置页(本地GPT-SoVITS)

默默配音助手 Premiere Pro 版设置页(本地 GPT-SoVITS 部署)


默默配音助手怎么装?怎么用?

下载安装

下载地址:https://momovoicesub.sxrec.com/ ,去官网找到下载客户端,按照指引下载。

选择你需要的exe文件下载后直接双击安装即可。

配置

插件在设置页底部提供了三条语音通道,点一下"启用此通道"就能切换:

通道一:自填 Azure Key(公有云)

适合已有微软 Azure 账号的用户:

  1. 在 Azure 门户创建一个 Speech 资源,拿到密钥和区域(比如 eastasia);
  2. 把密钥、区域填进插件的"自填 Key";
  3. 勾选"记住密钥",它会加密保存在你本机(达芬奇版用 Electron 的 safeStorage,Pr 版用 UXP 的 key-value 存储);
  4. 点"测试连接",成功后"刷新音色",就能看到可选的音色列表了。

Azure 语音 key 免费获取方法见:BV1x5VV67EQr ,需要一张外币信用卡用于验证,最多验证时扣款会马上退回。

通道二:登录云端账号(免配置)

适合新手或不想折腾云服务账号的用户:在插件官网 https://momovoicesub.sxrec.com/ 注册账号,注册即送免费字符配额,直接登录就能用,全自动对齐时间线,各端登录态云端同步。

通道三:本地部署 GPT-SoVITS(大模型 / 离线克隆)

适合追求高音质私有化克隆、对数据隐私敏感或完全离线使用的用户:

  1. 整合包托管模式

    • 准备好 GPT-SoVITS 整合包(如 GPT-SoVITS-v2pro);
    • 在插件设置"本地部署"中选择"插件托管(本地整合包)",点击"浏览…“选择整合包根目录;
    • 点击”▶ 启动服务",插件会自动探测内置 Python 环境并拉起服务;
    • 服务就绪后,在"本地音色库"中点击"+ 新增音色",扫描模型权重并选择参考音频即可添加专属克隆音色。
  2. URL 连接模式

    • 如果模型部署在局域网高性能显卡服务器或其他云服务器环境,选择"连接已有服务(URL)";
    • 填写服务地址(例如 http://127.0.0.1:9880 或能访问到服务的地址),即可远程发起推理合成。

打开插件

装好后,在软件里调出面板即可:

软件 打开方式
DaVinci Resolve 工作区 > 流程整合 > 默默配音助手
Premiere Pro 窗口 > UXP 增效工具 > 默默配音助手

谁适合用它?

  • 做知识科普、影视解说的UP主:成片长、旁白多,字幕轨一拖,批量配音,效率起飞。
  • 做本地生活、电商带货短视频的团队:需要大量、快速、统一风格的配音,又不想养一个配音岗。
  • 独立剪辑师:偶尔需要旁白,自己不想录音、又想控制成本。
  • 外语/方言使用者:想用标准普通话做片子,但自己口音重。
  • 对语音数据隐私敏感、想完全离线使用的创作者:用本地 GPT-SoVITS 克隆专属音色,数据不出本机。

说白了,只要是"我有文字、我想要一段像样的中文配音、我还想省事"的场景,它都能派上用场。