自动对时:让歌词自动对上歌声
更新于 2026年10月4日
手动打点要跟着歌一句一句按,一首歌常常要好几分钟。“自动对时”会先把人声从音乐里分离出来,再比对歌词的发音,找出每个字开始唱的时间。对完再用逐字打点微调,比从头打快很多。
需要准备什么
- 本地的视频或音频文件:用“文件 > 打开视频文件”打开 mp4、mp3、m4a、wav 等文件。YouTube 网址拿不到声音,不能用。
- 新版的 Chrome 或 Edge:对时会用电脑的显卡(WebGPU)计算,比较快。不支持 WebGPU 的浏览器会改用 CPU,也能对时,只是慢很多。
- 歌词:一句一行的字幕,时间不用准,顺序对就行。可以导入 SRT 等字幕文件,或在字幕列表里一句一句输入。
第一次使用要下载约 320 MB 的模型,之后离线也能用。视频的声音和歌词都只在你的电脑上处理,不会上传。
支持的语言:中文、日文、韩文、英文、西班牙文。同一首歌夹杂英文也没问题。
开始对时
- 打开歌词和视频。
- 选“字幕 > 自动对时”。
- 选范围:
- 选中的字幕:只在这几句当前时间的前后 3 秒内查找,适合重新对其中几句。
- 整条字轨:整首歌从头对,句子原来的时间不用准。
- 全部字轨:有两条以上字轨时才会出现。对唱的歌如果每位歌手一条字轨,要选这个;只对一轨的话,两人都唱过的歌词可能会对到另一个人唱的地方。
- 想保留原来的字幕,就勾选“生成新字轨”,结果会放在新的一轨。
- 点“开始对时”。


对时分五个步骤:准备歌词的发音、下载人声分离模型、下载对齐模型、分离人声、对齐歌词。下载都在最前面,网络有问题会在一开始就知道;已经下载过的会直接跳过。一首 3 分钟的歌,在一般的独立显卡上大约 1 分钟。
对时的时候请让这个标签页保持在前台,浏览器会让后台标签页的显卡运算慢很多。显卡会全速运行,电脑画面可能会有点卡。觉得太卡的话,可以勾选“用 CPU 计算”:慢好几倍(3 分钟的歌大约 10~20 分钟),但电脑不会卡。
对完之后
- SRT 这类普通字幕对完时间后还看不出变色,Kara3 会接着打开“转换为卡拉 OK”,并勾选好“保留字幕原有的逐字时间”,转换后就能看到逐字变色。
- 已经是卡拉 OK 的句子,会直接更新每个字的时间。
- 建议用逐字打点播放检查一遍。不对的句子可以选中后按 R 重拍,或选中后再自动对时一次。
- 整次对时可以用 Ctrl+Z 一次撤销。
读音行也能单独对时
用自动注音的“另外一行字幕”生成的读音行,可以单独对时:只选读音行,或在读音轨选一句后选“整条字轨”。日文振假名行会一个假名一个假名变色,例如“二人”唱成“ふたり”,原来的歌词保持整组变色,读音行则是ふ、た、り各变一次。罗马字行是一个词一个词变色。汉语拼音和韩文罗马字行本来就跟着歌词逐字变色,不用另外对时,会跳过。重新执行自动注音会重新生成读音行,对好的时间会被覆盖,所以建议最后再对。
哪些情况不太准
- 读音和词典不同:汉字按词典的读音比对,歌词“水面”唱成“みなも”这类就会偏。先用自动注音加上注音,再改成实际唱的读音,对时会优先按注音。
- 唱得含糊或漏唱的字:会用前后的字推算时间。
- 方言:粤语、闽南语等用汉字写的歌词,会按普通话读音比对,误差比较大。
- 和声很多、伴奏很吵的歌:人声分离不干净,也会不太准。
我们用几十首不同语言的歌实测,大部分的字和手动打点的差距都在 0.2 秒以内。