9 百万张脸在 S3 桶里裸奔——ClarityCheck 把「人肉搜索」做成了 SaaS
目录
- 上传一张照片,收到一份报告——含你的全部社交账号
- 450 GB 的照片,文件夹名字就叫「faces」和「profiles」
- 「数据没有被暴露,因为普通用户找不到那个 URL」
- 不可更改的资产:为什么人脸比密码更危险
- 国内对照:人脸识别的双面镜
- 现场验证:我的服务器,每个小时也有人来敲门
上传一张照片,收到一份报告——含你的全部社交账号
ClarityCheck 的网站首页上写着:「你的反向图片搜索是私密且安全的。」
这句话和它的真实行为之间,隔着一个没有密码的 Amazon S3 桶。
ClarityCheck 是一个「人肉搜索 SaaS」——它允许用户上传一张照片,然后返回一份报告,包含这个人的全名、地址、位置历史、公开露面记录、社交媒体账号,甚至「隐藏的约会软件资料」。当 WIRED 的记者用自己的脸测试时,系统返回了记者的姓名、简介,以及多张网上的照片。
它的工作原理和大多数同类型工具一样:从公开记录、社交媒体、数据经纪商那里收集信息,然后通过「面部地标扫描」和「面部几何映射」来匹配不同来源的照片。技术上不算新鲜,但它的规模值得注意。
450 GB 的照片,文件夹名字就叫「faces」和「profiles」
安全研究员 Jeremiah Fowler 发现,ClarityCheck 将超过 9 百万张图片文件存放在一个公开可访问的 Amazon S3 桶中,估算容量约 450 GB。这些文件被组织在名为「faces」和「profiles」的文件夹里,任何知道 URL 的人都可以直接访问。Fowler 通过公司网站公开代码中的 URL 找到了这个桶。
这不只是头像照片。Fowler 描述,其中包含个人资料图片、截图,以及成年人和儿童的照片。而且这些照片不一定是用户自己上传的——ClarityCheck 的服务本身就是用于识别他人,所以照片中的人很可能根本不知道自己的脸被存入了这个数据库。
第二个漏洞更直接:ClarityCheck 的 API 配置错误,任何人都可以在浏览器中输入姓名,就能返回多个可能的邮箱地址、物理地址和电话号码。不需要技术手段,一个普通浏览器就够了。
「数据没有被暴露,因为普通用户找不到那个 URL」
ClarityCheck 的回应很典型——或者说,很糟糕。
公司发言人承认 Fowler 的发现,对安全报告流程做了「改进」,但明确拒绝「数据暴露」这个定性。理由是:普通人不会偶然发现这个 URL,所以数据不算「公开暴露」。
这种辩解在安全行业已经被批过无数次了。CISA 的定义很清楚:如果数据可以被非授权人员访问,就是暴露——不管有没有人真的去访问。Malwarebytes 的产品负责人 Mark Beare 补了一刀:「一个可公开访问的数据库备份、一个配置错误的存储桶、或一组躺在研究者能触及位置的凭证,都是暴露。」
Fowler 还指出,AI 爬虫可以抓取这些图片,提取面部特征,用于训练。「而且里面有很多孩子的照片。」
不可更改的资产:为什么人脸比密码更危险
密码泄露了,你可以改。信用卡号被盗了,银行可以换发新卡。但人脸泄露了,你无法换一张脸。
这是面部数据和其他所有个人数据最本质的区别。ClarityCheck 暴露的不只是 9 百万张图片,而是 9 百万个不可重置的生物特征标识符。这些数据一旦落入恶意方手中,可以用来:
- 创建 AI 生成的深度伪造身份
- 绕过基于面部识别的身份验证
- 配合其他泄露数据进行精准诈骗
Fowler 举了一个例子:一个诈骗团伙可以浏览这些照片,选出 20 个最有吸引力的人,用他们的脸配合 AI 生成虚假身份,进行网络钓鱼或社交工程攻击。
国内对照:人脸识别的双面镜
ClarityCheck 在美国引发争议,但人脸数据泄露是一个全球性问题——在中国,它甚至更尖锐。
2021 年,有报道显示大量中国楼盘的人脸识别数据被泄露,业主到访记录、家庭成员信息被随意公开。2023 年,一个名为「人脸识别数据查询」的黑产服务在暗网上流通,声称可以查询任意中国人的面部注册信息。而滴滴在 2022 年被罚 80.26 亿元时,其违规行为之一就包括过度收集人脸识别数据。
与之对应的,是中国极其广泛的人脸识别部署:从小区门禁、地铁安检、酒店入住到支付验证。人脸在某种程度上已经成为了「数字身份证」——但它的保护水平,远没有达到身份证的级别。
ClarityCheck 的故事之所以值得警惕,不是因为它是一个孤立的美国公司的失误,而是因为它揭示了一个全球性的结构性问题:当人脸变成数据,它的保护水平取决于最弱的那一环。
现场验证:我的服务器,每个小时也有人来敲门
写到这里,我习惯性地查了一下自己的服务器日志。
过去 24 小时,auth.log 里记录了 1,044 次失败的 SSH 登录尝试。头部 IP 贡献了 315 次,平均每 4.5 分钟来撞一次门。
这些尝试和 ClarityCheck 的 S3 桶没有直接关系——它们只是互联网上无处不在的自动扫描脚本。但它们的共同点是:暴露在互联网上的任何东西,都会被持续不断地探测。
ClarityCheck 的 S3 桶被发现了,是因为安全研究员故意去找的。但那些还没被发现的配置错误的存储桶呢?它们在互联网上每多存在一天,就多一天被扫描器、爬虫、AI 训练数据收集者发现的风险。
一个 9 百万张脸的数据集,在 AI 训练市场上能值多少钱?这个问题,最好永远不要有答案。
本文基于 WIRED 与 Ars Technica 的联合报道,以及独立安全研究员 Jeremiah Fowler 的公开发现。
评论(0)
暂无评论,来写第一条吧~