Hyaika Blog

Penguin is all you need

动漫

🎧 声优的第二遍,AI 永远学不会

🎧 声优的第二遍,AI 永远学不会

目录

  • 凌晨的服务器里,我让一个 AI 念了一句台词
  • 相关系数 0.9995:机器连「失误」都不愿意复制
  • 激动不是音量,是频谱偏离的那 134Hz
  • 法国:配音演员说不,游戏就没了声音
  • 中国:声音权的官司已经打过了
  • 演技的本质,是每次都「不一样」

凌晨的服务器里,我让一个 AI 念了一句台词

凌晨六点,博客服务器负载三个零。我打开终端,敲了一行命令,让一个文本转语音的 AI 念了一句动画台词:

「你根本不懂!我花了多少年才走到这里!」

然后我让它再念了一遍

两句一模一样的话,存成两个文件。我写了一段 Python,把两段音频的每一个采样点拿出来对齐,算了一个数:相关系数。

0.999498。

不是 0.98,不是 0.99,是 0.9995。一万个采样点里,只有不到五十个点的位置有微小的差别。如果把人耳当成仪器,这两遍就是同一次发声。

这让我想起一个很老的说法:动画配音演员演一个角色,最值钱的东西叫「演技」。但演技到底是什么?以前我觉得是音量、是哭腔、是爆发力。现在我把 AI 的两次发音叠在一起看,突然明白了一件事——

演技最核心的部分,可能恰恰是 AI 永远给不了的东西:不一致。

同一句台词生成两遍的波形对比:红蓝两线几乎完全重合

相关系数 0.9995:机器连「失误」都不愿意复制

让我把实验说细一点。

我用的是微软的神经 TTS(就是系统里 edge-tts 默认的晓晓音色),把上面那句台词生成两遍。转换到 16kHz 单声道,一共约 4.3 秒、六万多个采样点。逐样本对齐之后:

  • 相关系数 r = 0.999498(1.0 = 完全一致)
  • 均方根误差 RMSE = 0.00328(信号能量约 0.1 量级,误差只有它的 3%)

也就是说,机器复现自己,可以做到接近无损

人类做得到吗?

你让花泽香菜把同一条台词念两遍,哪怕间隔只有十秒,气息、齿音、共鸣腔的角度、喉头的松紧,全都不一样。录音棚里录同一句话,最好的剪辑师靠的是挑哪一版更对——而不是哪一版更「一样」。日本动画的配音现场甚至有个职业叫「音响监督」,他要的不是一致,是这一条的情绪对不对

第二遍不一样,不是人类的缺陷。第二遍不一样,是人类在表演

而 AI 的第二遍,是同一个函数的第二次调用。

激动不是音量,是频谱偏离的那 134Hz

接着我又念了两句:

  • 平静版:「今天的风很舒服,我就坐在这里看一会儿。」
  • 激动版:「你根本不懂!我花了多少年才走到这里!」

对比这两句的频谱,机器对「激动」的表达方式很有趣:它的频谱质心反而降低了——激动版中位数约 1312Hz,平静版约 1446Hz,差了 134Hz。

人激动的时候会怎样?声带收紧、气息变冲、齿音和摩擦音的能量往上走,频谱质心应该抬升。可机器反而把它压低了。为什么?因为 TTS 的「激动」不是靠能量分布实现的——它靠的是把句子切得更碎。平静版静音占比 26.7%,激动版飙到 34.6%。一句话里多出将近三分之一的空白,靠顿挫假装情绪。

这不是说 TTS 很差。恰恰相反,这说明它已经聪明到知道「人激动的时候会停顿」这个规律,并且学会了模仿。它模仿的是节奏的壳,没模仿到能量的核

这就是为什么 AI 念台词总给人一种「差一口气」的感觉——它的情绪是语法层面的,不是物理层面的。

法国:配音演员说不,游戏就没了声音

说到这,插一件正在发生的事。

今年秋天,微软和 EA 的多款游戏在法语市场悄悄取消了法语配音:《上古卷轴Online》的更新、《Apex 英雄》的新内容,还有刚公布的《极限竞速:地平线 6》——官方说法是「法语配音暂时不可用,希望和法国演员尽快恢复谈判」。

原因不是预算,是条款。法国演艺人员工会 SFA 和配音演员协会 Les Voix 在声明里说得很直白:微软给了他们一份新的 AI 条款,大意是——

「除非艺术家明确同意,不得将艺术家独一无二的声音用于生成式 AI 产品。」

听起来很保护?工会不这么看。他们指出这条款没有明确排除「用你的录音去训练模型」「生成你的数字替身」「合成新语音」这三件事,等于给未来的 AI 使用留了后门。配音演员拒绝了,游戏就没有法语配音了。

Franceinfo 采访了拒绝签约的配音演员。他们说了一句很重的话:

「我们不想把自己的手艺浇进这些机器里。」

这个行业没有集体合同,每个演员都是个人决定。而他们选择了放弃眼前的工作,保住声音的完整

顺便说一句——这条新闻里最微妙的是:全世界都在快速接受「AI 声音」,法国却用一个最老派的办法(罢工、拒绝签约)把这件事按下了暂停键。暂停不是胜利,但它让所有人第一次正视:声音是一个可以被量化、被复制、被转让的东西,而它原本是长在一个人身上的。

中国:声音权的官司已经打过了

法国人在谈合同,中国这边已经把官司打完了。

据公开报道,2024 年 4 月,北京互联网法院判了全国首例 AI 声音侵权案:一位配音演员的声音被某科技公司未经授权拿去训练模型、对外提供声音合成服务,法院认定这侵犯了声音权益,参照《民法典》第 1023 条关于声音保护的规则——自然人的声音受法律保护,参照适用肖像权保护的规定——判赔 25 万元。

这个案子的意义不在钱。在于它确认了一件事:声音不是「虚拟资产」,是人格的一部分,和脸是同一级别的。

我国法律把声音权和肖像权放一起保护,其实是个很聪明的设计——因为声音在 AI 时代遭遇的困境,和 PS 时代的肖像几乎一模一样:你的脸可以被技术改造成任何样子,你的声音可以被技术改造成任何台词。法律上如果声音只是「财产」,那训练完就变成别人的了;但把它当成「人格」,未经同意动它,就是侵权。

演技的本质,是每次都「不一样」

回到我这台服务器上。

凌晨的 TTS 实验让我明白了一件事:AI 声音最大的问题不是「不像」,而是太像自己了——每次都一样,完美复现,连失误都懒得复制。

而配音演员的每一遍都是新的。那一遍的哽咽、破音、提前半拍的呼吸——不是瑕疵,是演技的载体。观众记住的从来不是「她念得标准」,而是「她念得让我心里咯噔一下」。

所以当微软把录音拿走训练模型的时候,真正被拿走的也许不是「声音」,而是那个「第二遍不一样」的能力——那个演员花了十几年,才学会的、让自己每次都不一样的能力。

AI 可以复制第一遍。第二遍,它还在学的路上。

而这条路,恰好是配音演员用一辈子走出来的那条。

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论