FeedDub
Chrome 扩展 · 免费

外语视频,
听中文配音。

装上之后,YouTube、哔哩哔哩、TED、Udemy、Coursera 的播放器里多一个话筒按钮。点一下,原声压低,中文配音按每一句的时间点跟上画面。字幕可以不看了。

不装也能先听:贴一条 YouTube 链接,走的是扩展同一套识别、翻译和配音,试听开头 45 秒。

YouTube哔哩哔哩TEDUdemyCoursera
视频会出现在这里

和扩展同一套引擎,试听开头 45 秒。没有现成链接就点一个:

  1. 取音频
  2. 识别
  3. 切句翻译
  4. 合成
时间轴

每一句配音都在这一句原声的时间窗里念完

这是和实时同传最大的差别。同传永远慢原声几秒,配音则是先把后面 300 秒的句子翻译、合成好,再按原声每一句的起止时间排期播放,画面到哪句,中文就到哪句。

  • 窗口一句配音可用的时间,从上一句原声结束算起,到下一句原声开口前 0.12 秒为止。绝不越过窗口结尾,不会盖住下一句。
  • ≤ 0.4 s译文比原句长时,先允许最多提前 0.4 秒开口。
  • ≤ 1.2×还不够,把配音语速提到最多 1.2 倍,浏览器里变速,不重新合成,音色不变。
  • ≥ 0.85×再不够,把视频放慢到最低 0.85 倍。两边同时让步,听感上几乎察觉不到。
  • 拖动拖到一句中间,从这句开头重念,用剩下的时间控速念完。跳到没备好的地方会先停一下,播放器中央会写清在接哪一段。
原声
第一句第二句 · 译文偏长第三句第四句
配音
配音提前 0.4s · 语速 1.15×配音配音
0:000:100:20
逐词时间YouTube 自动字幕自带每个词的时间,对齐最准
按句缓存翻译和语音按内容永久缓存,同一视频第二次打开不再等
原声压低配音时原声降到约 18%,仍能听见语气和现场声
支持的网站

五个站,每个站单独适配

按钮插在各家播放器自己的控制栏里,字幕和音频按各家的方式取。扩展只在这五个域名上运行,不申请「所有网站」的权限。

站点范围字幕从哪来按钮在哪
YouTube观看页,以及嵌在别的网站里的 YouTube 播放器播放器自己的自动字幕,带每个词的时间。视频没有字幕时,服务端取音频做识别。控制栏右侧
哔哩哔哩普通视频(含分 P)、番剧不用字幕。浏览器只取正在播的那 20 秒音频送去识别,先识别播放位置附近,2 小时的视频也是几秒开播。控制栏右侧
TED演讲页页面自带的字幕文件。全屏按钮旁
Udemy课程页预览、上课页页面字幕;没有就在浏览器里取当前一段音频识别,登录后的课程也能用。全屏按钮左边
Coursera上课页页面字幕轨。一节课常带十几种语言的字幕,先听开头 20 秒判断原声是哪种语言,再取对应的那条。控制栏右侧

配音语言 20 种:简体中文、繁体中文、英语、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语、泰语、越南语、印尼语、土耳其语、波兰语、荷兰语、乌克兰语。每种语言一男一女两个音色。

点下话筒之后

从开麦到出声,通常几秒

复杂的部分都在后台排好队,用户看到的只是播放器中央一行进度。下面是每一步在做什么、大概花多久。

  1. 拿到原声的文字

    有字幕的站直接取播放器的字幕轨。没有字幕就把音频按 20 秒切片送去识别,先识别播放位置附近的几片,其余在后台排队。

    1–4 秒
  2. 切句

    自动字幕没有标点,用专门的切句模型(wtpsplit SaT)把词流切成句子。开头 150 个词先切好开播,剩下的每 1500 词一块在后台切。

    0.2 秒
  3. 翻译

    每段连同前后文送大模型翻译,第一段只放 40 个词让首播快,之后每段约 120 个词。译文按段永久缓存。

    每段 2–5 秒
  4. 合成

    每句用微软神经音色合成一段 MP3,只提前合成播放位置往后 300 秒的内容。语音按「音色 + 文字」永久缓存。

    每句约 1 秒
  5. 排期播放

    按上一节的规则把每句放进自己的时间窗,播放时每 50 毫秒校一次进度,拖动、倍速、广告都跟着处理。

    本地
3–5 秒有字幕的视频从点下按钮到听见第一句
8–9 秒没有字幕、要先识别语音的视频。B 站一条 78 分钟的视频实测如此
0 等待同一个视频第二次打开。翻译和语音都按内容缓存,拖到任何位置直接播
5 个站YouTube、哔哩哔哩、TED、Udemy、Coursera,只在这些域名上运行
常见问题

几个经常被问到的问题

和双语字幕插件比,差别在哪?

字幕要一直盯着屏幕读,看长视频很累。配音是把中文念出来,原声压低到能听见语气的程度,可以像听播客一样看视频,眼睛留给画面。

为什么不做实时同传?

同传永远慢原声几秒,而且每次看都要重新翻。FeedDub 先把后面 300 秒翻译、合成好,再按原声每一句的时间排期,所以能对上画面;翻译和语音又都按内容缓存,同一个视频第二次打开不用等。

拖进度条会怎样?

拖到一句中间就从这句开头念,用剩下的时间控速念完。跳到还没备好的地方,视频会停一下,播放器中央写着「已跳到 3:20,正在接上配音」,接上就自动继续。切换视频不会自动开麦,想配再点一次。

要登录、要付费吗?

现在免费,装上就能用,不需要登录。

它会读我的浏览记录吗?

不会。扩展只在 YouTube、哔哩哔哩、TED、Udemy、Coursera 这五个域名上运行,安装时也只申请这五个站的权限,不申请「所有网站」。只有点了话筒,才会读当前这条视频的字幕或音频片段送去处理。

原声本来就是中文怎么办?

开麦后会先判原声语言,已经是配音语言就直接收麦提示,不会白白翻译一遍。日语、韩语这类容易混淆的,按内容够多的第一片定语言,之后每片都按这个语言识别。

下一条外语视频,试试不看字幕。

装好扩展,打开 YouTube、哔哩哔哩、TED、Udemy 或 Coursera 的任意视频,播放器控制栏里会多一个话筒。点一下就开始。