2026-08-18 · 科普 · 观察
本文由 AI 辅助起草,经人工编辑审核后发布。
一段让检测器集体翻脸的视频
七月底,一段视频在巴基斯坦社交平台疯传:画面里,板球名宿 Wasim Akram 的几位同行、主播、政客轮流出来,沉痛宣布他因心脏病去世,葬礼今天举行,请大家为他祈祷。Akram 本人和妻子很快辟谣——他发了条视频嘲讽:我这不是死后给大家录的吗?妻子也晒出他在健身房锻炼的画面。人没事,谣言是 AI 编的。
故事到这儿其实挺清楚。真正让我们这些做检测的人感兴趣的是另一件事:同一段假视频,丢进不同检测工具里,结论能差出十万八千里。
同一段片子,分数从 0 跳到 99
做事实核查的 Soch Fact Check 把其中一段(伪造 Shoaib Akhtar 出镜宣布死讯)跑了一遍多个工具,结果很说明问题:
- 一个开源检测平台:判断可能是 AI 生成,但信心只是中等;它内部多个子模型给出的概率从 46% 到 98% 都有。
- NVIDIA 的合成视频检测器:打了 64% 的合成分,超过 30% 的阈值,判为疑似 AI。
- 某商业检测工具:说这段视频只有 39% 像 AI 生成、0% 是换脸;但单独抽第 4 秒那一帧,AI 概率又跳到 86%,还顺手做了来源推测(Sora2 与 Seedance2 嫌疑最大)。
- 西北大学 NSAIL 实验室的 GODDS 评估系统更狠:它同时跑了 22 个视觉检测模型和 70 个音频模型,再加两名人工分析师。视觉模型里 16 个判假、6 个判真;音频模型里 48 个判假、22 个判真。人工分析师也指出声音节奏、呼吸、口型对不上,但又补了一句:这段视频压缩太狠,伪影被糊掉了,单看画面很难下死结论。
最离谱的是另一段(伪造主播 Iqrar ul Hassan):同一个开源平台内部,子模型的概率竟然从 2% 横跨到 100%——同一个工具,自己都没达成共识。
| 工具 / 维度 | 大概率判假 | 也有判真 / 不确定 |
|---|---|---|
| 单工具内部子模型 | 有的冲到 98%–100% | 有的只有 2%–46% |
| 商业 / 开源 / 官方检测器之间 | 有的判合成 | 有的判 0% 换脸 |
| 人工分析师 | 指出声画不同步 | 又因压缩太重不敢咬死 |
我们做 TrueLens 一直挂在嘴边的话,这回被一个真实案例说透了:检测工具给的是概率信号,不是判决书。一个工具说像真的,不等于视频就是真的;一个工具说 99% 假,也不等于能拿去给人定罪。
为什么吵起来才正常
普通人容易有个错觉:检测工具该像秤一样,同一个东西称出来一个数。现实完全不是。
原因有几层。第一,每个检测器是用不同的训练数据、不同的判定阈值训出来的,今天更新了明天又不一样,所以它们的百分比根本不能直接横比——看方向别看小数点才是正确读法。
第二,也是这案子最关键的:视频被反复搬运、压缩,画质掉得厉害。而很多伪造痕迹恰恰藏在高频细节里,一压缩就被抹平了。Soch 的分析师自己说了,重压缩把伪影盖住了,模型等于被喂了张糊图,判错的两边都有可能。这提醒我们:画质越差,检测分数越要打折看。
第三,真假在这个案子里其实根本不是检测器独立答出来的。Akram 本人出镜辟谣、妻子晒健身视频,才是钉死谣言的硬证据。检测器从头到尾只是辅助投票,真正一锤定音的是源头和当事人。
真要去伪,靠的是合议不是独断
我们特别想点出 GODDS 这套做法的价值:它不迷信任何一个模型,而是把一大堆模型 + 人工分析师 + 溯源放在一起做合议。多数模型说假、分析师也找到具体破绽、源头还能追到旧视频,三路证据才敢下疑似 AI 操控的结论。
这跟 TrueLens 一直倡导的多模型交叉验证、不确定就说不确定是一个路子。我们也从不给单一百分比就下死结论——宁可多说一句建议人工复核,也不假装机器能替你拍板。
说到底,鉴别 AI 内容不是找一台更准的机器,而是建立一套不盲信任何单台机器的流程。工具会打架,人会疲惫,只有多工具 + 溯源 + 人三方咬合,结论才站得住。
给你的一句实在话
看到名人死讯、灾难现场这类炸裂视频,别急着信也别急着转。先问三件事:当事人或官方出来否认或确认了吗?这段画面最早从哪来、是不是旧视频换壳?多个检测工具的结论是不是一致?
我们只是个免费的、中立的第三方工具,能帮你看看一段视频的像素出身,但替不了你做最终判断。遇到这种案子,慢半拍、多查一步,比任何单一检测分数都靠谱。