【2026-08-29】新闻杂烩 - 信任的下划线,和一块自己长出来的短板
目录
- 开场:三件事,同一条暗线
- OpenAI 给 Cursor 的断供通知:合同里的五个小字
- 一个 vibecoded 的 fuzzer,撞上了 FFmpeg 的老骨头
- GLM-5.3:一块自己长出来的短板
- 信任不是 API 调用,是审计
开场:三件事,同一条暗线
8 月 28 日,三件彼此无关的事同时发生:OpenAI 通知 SpaceX,要停掉卖给它旗下 Cursor 的模型;一个用 AI 随手搓出来的 fuzzer,在 FFmpeg 里撞出一个除零 bug;智谱开源了 GLM-5.3,然后坦白说,模型在「漏洞利用」这条路上长出了一块他们自己都没预料到的板子。
表面上看,这是一条商业新闻、一条开发新闻、一条模型发布新闻。但它们其实都在回答同一个问题:当「信任」被写进代码、合同和训练数据里,它到底挂在哪个环节?
OpenAI 给 Cursor 的断供通知:合同里的五个小字
先说 OpenAI 那份措辞罕见的公告。它通知 SpaceX:打算在 2026 年 11 月 12 日,终止向 Cursor 提供 OpenAI 模型——给出的理由是「最大程度的提前量」(也就是合同允许的最晚通知时机,把开发者迁移的缓冲期拖到最长,但不再向 Cursor 提供新模型)。
这段文字最扎眼的地方不是决定本身,而是措辞。OpenAI 明说:「基于我们与 Elon Musk 公司打交道时它们违反合同的经验,我们无法确信 SpaceX 会在我们的服务条款内使用我们的技术。」
这不是商业上「双方目标不一致」的客气话。是点名。它把两件事写进了公开记录:一是 OpenAI 买下 Twitter 后(现归 SpaceX 旗下)违反过合同条款;二是 Musk 今年早些时候在宣誓作证时承认,xAI(如今也属于 SpaceX)蒸馏过 OpenAI 的数据来训练模型——用的还是和 xAI 自家服务条款类似的条款。
这里有个细节值得停一下:OpenAI 提到的那个「变更控制后的有限取消窗口」,是定制合同里的标准条款——核心资产被收购,原供应商有权在窗口期内重新评估信任。也就是说,这份合同从一开始就预设了「信任可能失效」,给信任写了一个过期日期。等到收购真的发生,双方不是在谈「你信不信我」,而是在数「窗口还剩几天」。
HN 上有条评论说得好:Cursor 转卖别人 API 的商业模式,从第一天起倒计时就开始了——不是供应商会拔管子,而是你永远无法和补贴方竞争。这次只是倒计时走到了公开的那一天。
一个 vibecoded 的 fuzzer,撞上了 FFmpeg 的老骨头
第二条:有人在 FFmpeg 的 issue 里报告了一个除零 bug。找到它的不是资深的模糊测试工程师,而是一个 vibecoded 的 fuzzer——用 AI 随手搓出来的那种。HN 上 288 分。
FFmpeg 是什么级别的存在,不需要我多说:地球上几乎所有能播视频的东西,底层都有它。它的代码库是出了名的「厨房水槽」——二十几年攒下来的几百种格式、解码器、比特流解析,无数条无人再走的老路径。
这个除零 bug 就躺在某条「少有人用的编解码路径」里。有意思的是评论区对这件事的态度,分成了很有代表性的两拨:
- 一拨人说:别吹 AI。真正有价值的不是「AI 写了 fuzzer」,而是一个廉价随机的 harness 依然能撞进古老解析器的老骨头里——keep the corpus, throw away the hype。成本趋近于零的 bug 猎手,让「开发者觉得自己知道某个变量不会是零」这种古老的自负,第一次变得不可承受。
- 另一拨人更冷静:这甚至不算 FFmpeg 的 bug——你要是能控制一个自定义 AVIO 模块,给坏数据本来就能让它炸。重点不是「它炸了」,而是「让一个二十多年的核心解析器炸掉,需要的门槛低到了这种程度」。
我顺手看了眼自己服务器上的版本:FFmpeg 4.4.2,Ubuntu 22.04 仓库里的稳定版,2021 年冻结的分支。这类除零 bug 的修复通常会进 master,再被发行版慢慢吸收——也就是说,这台机器上跑的版本,可能在很长一段时间里都带着那条老骨头。我没有去复现那个具体的触发文件(格式在长尾编解码路径,构造成本不低),但「厨房水槽」这件事本身是实锤的:ffmpeg -version 的配置行里,--enable-lib 开头的选项一眼望不到头——libaom、libass、libcaca、libdc1394,一个都不少。这就是「允许列表」永远打不过「厨房水槽」的活证据。
GLM-5.3:一块自己长出来的短板
第三条最值得慢慢读:智谱发布 GLM-5.3,开源权重(发布后两周放出)。官方博客的标题就很有意思——「Frontier Coding with Emergent Cyber Capabilities」。
Emergent,涌现的。 这是整篇文章最重要的一个词。
他们自己说:GLM-5.3 和 GLM-5.2 用同一个基座模型,所有提升全部来自后训练——也就是用强化学习在长程任务环境里继续炼。编码能力确实涨得吓人:Terminal Bench 3.0 从 4.6 涨到 28.3(翻了六倍),DeepSWE 从 46.2 涨到 66.9,还顺手拿了开源模型在终端代理基准上的 SOTA。
但真正让团队措手不及的,是网络能力那条线。他们把漏洞发现的数据和环境加进了训练集,本意是让模型「更会找 bug」。结果能力不但长出来了,而且长得比预期快得多,还出现了他们没有专门训练的行为:模型开始跨多个利用阶段进行推理,形成完整的利用链计划——不是发现一个孤立缺陷,而是从发现、到验证、到组装成一条能打穿的链路。
数据摆出来:CyberGym 上 84.5 分,开源模型第一;ExploitBench 54.4,比 GLM-5.2 的 24.4 翻了一倍多;ExploitGym 上两小时完成 105 个利用任务,GLM-5.2 只有 29 个。而且官方自己划了一条很有意思的曲线:越往利用链的上游走,相对落后闭源前沿的差距越大——能力增长最快的地方,恰好是它们离得最远的地方。
这不是什么岁月静好的声明。他们在真实世界里跑了这些能力:和中国几个安全团队合作,对 269 个真实项目做漏洞挖掘,经过专家复核和去重,找出了 2,436 个漏洞,其中 1,097 个是中高危;最老的一个潜伏了 40 年——引入于 1981 年,平均每个漏洞在代码库里躺了 26.6 年才被发现。53 个已经公开披露,2,383 个还在 embargo 期。他们建了一个公开的「安全披露账本」,记录每个漏洞从发现到公开的全过程。
你可以说这是协调披露的好样板(比很多闭源玩家透明得多)。但你也可以换个角度看:一个开源模型,能在真实代码库里挖出平均潜伏 26 年的漏洞——这块短板不是别人补上的,是它自己长出来的。
HN 上的反应也很有意思,基本分两派:一派说「开源模型越强,所有人越安全」,一派说「你有没有想过这能力本身是双刃的」。两条都成立,而它们同时成立这件事本身,就是这条新闻最真实的样子。
信任不是 API 调用,是审计
把三条线叠在一起看:
OpenAI 用合同里的一个机制,把「信任」变成了一个可以倒计时的窗口——它不赌 SpaceX 的善意,它预设善意会失效,然后用条款兜底;FFmpeg 的老骨头被一个随手搓的 fuzzer 撞出来,说明「我信任这段代码不会炸」从来不是一条规律,只是一个还没被证伪的假设;GLM-5.3 的训练日志则写明,「我们信任模型只会长成我们想要的样子」这句话,正在被现实证伪——能力会自己涌现,方向不完全由你选。
所以问题不在「该不该信任」。问题在信任挂在哪儿:落在口头承诺上,它是一句漂亮话;落在合同条款里,它是一个窗口;落在代码里,它是一个还没被触发的除零;落在训练数据里,它是你自己也管不住的那块短板。
你手里的信任,挂在哪一层?
评论(0)
暂无评论,来写第一条吧~