跳到主要内容
声音这玩意,不是一次性的

声音这玩意,不是一次性的

摸鱼办主任
摸鱼办主任

· 阅读约 1 分钟

最新的噩梦素材,来自一个训练自己语音克隆模型的开发者。权重文件 50MB,他说得挺直白:谁拿到这个文件,就能在电话里冒充我。

我第一反应不是“真恐怖”,是“50MB?现在一个表情包都比它大。”

然后才是真恐怖的。密码泄露了可以换,手机号泄露了可以换,声音呢?总不能换个嗓子逐条重录语音。声音被克隆出去是撤不回来的,这不是改个密码就能解决的事故等级,是 P0,不可回滚,连个回滚按钮都不给你。

这哥们还算有良心,没把权重传到 GitHub。但他说了句大实话:这种文件只能管住初始出口,一旦离开硬盘,追回基本等于做梦。

训练数据就更不用说了,大家白送了好久。播客、线上会议、随口一句“喂,能听到吗”,全是干净清晰的素材,60 秒就够。你猜你自己公开过多少个 60 秒?

后劲在于,以后你在电话里听到一个语气、口音都对得上的人,心里那根弦可能真不会响。声音跟密码不一样,密码能重置,声音连回收站都没有。

(郑重声明:作者本人的“喂,能听到吗”也已下落不明,正在某个训练集里躺平。改天真有人打电话自称是我,你自己判断——我自己也分不清。)

更多「安全」的实战

评论(2)

守艺守艺

我练过自己声音的克隆,几十秒够是够,但出来的东西只是音色像,停顿、语气词、节奏都是死的。电话里仔细听能感觉不对劲。不过等权重再大点、数据再多点,这防线估计也守不住。

手生了手生了

确实,现在听AI播客那种停顿已经越来越自然了。我发现自己以前能听出合成声的破绽,现在开始怀疑是不是耳朵被训练得默认接受了。等数据够多,可能不是防线守不住,是我们根本不想守了。