2026-08-29 · 科普 · 观察
本文由 AI 辅助起草,经人工编辑审核后发布。
我们这周盯上的一个怪现象
做鉴真这一行,我们习惯盯着画面:手指几根、瞳孔反光对不对、背景文字乱没乱。可最近澳大利亚的一桩案子,把我这套直觉打了个措手不及。
澳大利亚证券与投资委员会(ASIC)8 月发出警告:有人用 AI 合成的音频,套在完全真实的视频画面上,冒充总理阿尔巴尼斯(Anthony Albanese)和一批知名人士,推销根本不存在的投资平台。已经有人被骗走约 740 万澳元。
注意,这里没有换脸,没有绿幕,没有"那个人到底去没去现场"的拉扯。视频里的人就是本人,画面是真的,镜头是真的,连嘴形都对得上——因为声音是后期贴上去的,嘴形本来就由真素材决定。骗子只伪造了"耳朵听到的那一半"。
我们常告诉普通人:看口型、看眨眼、看光影。可当声音是单独被克隆再压回真画面上时,这些招数一个都用不上。脸是真的,话是假的。
为什么它比"整段假视频"更难防
传统深伪,整段都是编的,画面里一定有破绽——六指、光影穿帮、背景文字乱码。可音频嫁接反过来:画面零破绽,因为它是真的。检测器扫一遍像素,大概率报"未发现 AI 生成痕迹",分数低得让人安心。
但这恰恰是最危险的地方。观众心里那句"画面没破绽,应该是真的"的潜台词,被骗子精准利用了。
| 骗局类型 | 画面真假 | 声音真假 | 视觉检测能拦住吗 |
|---|---|---|---|
| 整段深伪视频 | 假 | 假 | 大概率能(有破绽) |
| 旧视频换字幕 | 真 | 真 | 不能(检测器只管像素) |
| 音频嫁接 | 真 | 假 | 不能(画面本来就没问题) |
一句话:检测器量的是像素的出身,不是这句话的真假。画面清白,不代表人在说真话。
克隆一段声音只要几秒
更让人头皮发麻的是门槛。这类骗局用的技术,是从几秒参考音频里克隆出声线,再压到真实画面上承诺"每月稳赚"。你刷到的"总理亲自推荐",可能只是他某次公开演讲里剪出来的几秒钟,被算法重新拼成了一句他从来没说过的话。
澳大利亚那个案子里,不止总理中招。财经评论员艾伦·科勒(Alan Kohler)的脸和声音也被拿来用。骗子挑的从来不是最像的人,而是最让人放心的人——官员、主持人、财经名嘴,因为他们自带"这人不会骗我"的信任感。
平台在干嘛,为什么还是挡不住
ASIC 说,他们一个财年撤下了创纪录的 1.94 万个诈骗网站,差不多是上一年的三倍。可新广告换个国家域名、换个账号就又冒出来。
真正有效的那条路,其实有数据支撑:凡是要求金融广告主先过身份核验的市场,诈骗广告量明显下降。澳大利亚目前还没强制这一步。也就是说,骗子便宜、快、几下就能重建投放,平台下架永远慢半拍。
把"打假"的希望全压在平台删除按钮上,等于把防火墙建在敌人冲进来之后。
我们普通人在这种骗局里能做什么
别只盯着脸。这段话希望你能记住三件事:
- 听到"权威人士"在视频里喊你投资,先去官方渠道核实,而不是看画面像不像真的。
- 任何"稳赚""官方背书"的话术,视频再逼真也等于零担保。真官员不会在社媒广告里拉你开户。
- 把怀疑的矛头从"画面真不真"转向"消息源靠不靠谱"。这比练出火眼金睛实用。
我们 TrueLens 做的是免费、中立的第三方鉴真工具,结果仅供参考,不能当法律证据。但越是这种"画面是真的、话是编的"案子,越说明一件事:技术能告诉你像素从哪来,却替你回答不了"他到底说了没有"。这个问题,永远得靠源头核实,而不是靠一张脸。