外语视频,
听中文配音。
装上之后,YouTube、哔哩哔哩、TED、Udemy、Coursera 的播放器里多一个话筒按钮。点一下,原声压低,中文配音按每一句的时间点跟上画面。字幕可以不看了。
不装也能先听:贴一条 YouTube 链接,走的是扩展同一套识别、翻译和配音,试听开头 45 秒。
和扩展同一套引擎,试听开头 45 秒。没有现成链接就点一个:
- 取音频
- 识别
- 切句翻译
- 合成
每一句配音都在这一句原声的时间窗里念完
这是和实时同传最大的差别。同传永远慢原声几秒,配音则是先把后面 300 秒的句子翻译、合成好,再按原声每一句的起止时间排期播放,画面到哪句,中文就到哪句。
- 窗口一句配音可用的时间,从上一句原声结束算起,到下一句原声开口前 0.12 秒为止。绝不越过窗口结尾,不会盖住下一句。
- ≤ 0.4 s译文比原句长时,先允许最多提前 0.4 秒开口。
- ≤ 1.2×还不够,把配音语速提到最多 1.2 倍,浏览器里变速,不重新合成,音色不变。
- ≥ 0.85×再不够,把视频放慢到最低 0.85 倍。两边同时让步,听感上几乎察觉不到。
- 拖动拖到一句中间,从这句开头重念,用剩下的时间控速念完。跳到没备好的地方会先停一下,播放器中央会写清在接哪一段。
五个站,每个站单独适配
按钮插在各家播放器自己的控制栏里,字幕和音频按各家的方式取。扩展只在这五个域名上运行,不申请「所有网站」的权限。
| 站点 | 范围 | 字幕从哪来 | 按钮在哪 |
|---|---|---|---|
| YouTube | 观看页,以及嵌在别的网站里的 YouTube 播放器 | 播放器自己的自动字幕,带每个词的时间。视频没有字幕时,服务端取音频做识别。 | 控制栏右侧 |
| 哔哩哔哩 | 普通视频(含分 P)、番剧 | 不用字幕。浏览器只取正在播的那 20 秒音频送去识别,先识别播放位置附近,2 小时的视频也是几秒开播。 | 控制栏右侧 |
| TED | 演讲页 | 页面自带的字幕文件。 | 全屏按钮旁 |
| Udemy | 课程页预览、上课页 | 页面字幕;没有就在浏览器里取当前一段音频识别,登录后的课程也能用。 | 全屏按钮左边 |
| Coursera | 上课页 | 页面字幕轨。一节课常带十几种语言的字幕,先听开头 20 秒判断原声是哪种语言,再取对应的那条。 | 控制栏右侧 |
配音语言 20 种:简体中文、繁体中文、英语、日语、韩语、西班牙语、法语、德语、意大利语、葡萄牙语、俄语、阿拉伯语、印地语、泰语、越南语、印尼语、土耳其语、波兰语、荷兰语、乌克兰语。每种语言一男一女两个音色。
从开麦到出声,通常几秒
复杂的部分都在后台排好队,用户看到的只是播放器中央一行进度。下面是每一步在做什么、大概花多久。
- 1–4 秒
拿到原声的文字
有字幕的站直接取播放器的字幕轨。没有字幕就把音频按 20 秒切片送去识别,先识别播放位置附近的几片,其余在后台排队。
- 0.2 秒
切句
自动字幕没有标点,用专门的切句模型(wtpsplit SaT)把词流切成句子。开头 150 个词先切好开播,剩下的每 1500 词一块在后台切。
- 每段 2–5 秒
翻译
每段连同前后文送大模型翻译,第一段只放 40 个词让首播快,之后每段约 120 个词。译文按段永久缓存。
- 每句约 1 秒
合成
每句用微软神经音色合成一段 MP3,只提前合成播放位置往后 300 秒的内容。语音按「音色 + 文字」永久缓存。
- 本地
排期播放
按上一节的规则把每句放进自己的时间窗,播放时每 50 毫秒校一次进度,拖动、倍速、广告都跟着处理。
几个经常被问到的问题
和双语字幕插件比,差别在哪?
字幕要一直盯着屏幕读,看长视频很累。配音是把中文念出来,原声压低到能听见语气的程度,可以像听播客一样看视频,眼睛留给画面。
为什么不做实时同传?
同传永远慢原声几秒,而且每次看都要重新翻。FeedDub 先把后面 300 秒翻译、合成好,再按原声每一句的时间排期,所以能对上画面;翻译和语音又都按内容缓存,同一个视频第二次打开不用等。
拖进度条会怎样?
拖到一句中间就从这句开头念,用剩下的时间控速念完。跳到还没备好的地方,视频会停一下,播放器中央写着「已跳到 3:20,正在接上配音」,接上就自动继续。切换视频不会自动开麦,想配再点一次。
要登录、要付费吗?
现在免费,装上就能用,不需要登录。
它会读我的浏览记录吗?
不会。扩展只在 YouTube、哔哩哔哩、TED、Udemy、Coursera 这五个域名上运行,安装时也只申请这五个站的权限,不申请「所有网站」。只有点了话筒,才会读当前这条视频的字幕或音频片段送去处理。
原声本来就是中文怎么办?
开麦后会先判原声语言,已经是配音语言就直接收麦提示,不会白白翻译一遍。日语、韩语这类容易混淆的,按内容够多的第一片定语言,之后每片都按这个语言识别。
下一条外语视频,试试不看字幕。
装好扩展,打开 YouTube、哔哩哔哩、TED、Udemy 或 Coursera 的任意视频,播放器控制栏里会多一个话筒。点一下就开始。