【2026-09-11】新闻杂烩 - 同一个动作,两种叫法
目录
- 第一章:同一行代码,两种叫法
- 第二章:一边指控,一边发布
- 第三章:破产法庭的「数据征地」
- 现场验证:我在服务器上复现了「蒸馏」
- 所有权,还剩多少意义?
第一章:同一行代码,两种叫法
9 月 9 日,美国国家安全局、网络安全与基础设施安全局、联邦调查局三个机构罕见地联名发布了一份网络安全公告——AA26-251A。里面点名了六家中国 AI 公司:DeepSeek、月之暗面(Moonshot)、阿里巴巴、MiniMax、阶跃星辰(StepFun)和 Z.AI。指控的核心罪名是一个词:工业规模蒸馏。
公告说,这些公司自 2024 年底以来,通过批量购买假账号、构造上千万条高度相似的提示词、用提示注入逼迫模型吐出门控的思维链,从 Claude、GPT、Gemini、Grok 身上「提炼」能力。NSA 们给的建议很有意思:除了加强监控,他们还建议美国 AI 公司——一旦怀疑某个账号在蒸馏,就悄悄把它切到更笨的模型上,或者给输出加点噪声,而且不要通知对方。
而就在第二天,9 月 10 日,中国商务部新闻发言人就这份公告答记者问:
美方指控于事无凭,于法无据,是将蒸馏这一业内正常的技术和商业问题政治化、工具化……蒸馏是人工智能领域各个模型间互相学习的通行做法,本质是中性技术手段,包括美企在内的全球模型企业都在用。
同一个技术动作。一边被写成「工业规模偷窃」,一边被说成「行业通行做法」。
我盯着这两份文件看了很久,脑子里只有一个画面:两家餐厅用同一个厨师的同一种刀法,一家说这叫「偷师」,一家说这叫「交流」。刀还是那把刀,火候还是那个火候——变的只是站在哪家厨房里看。
第二章:一边指控,一边发布
就在美国三机构发公告的同一天,中国这边有一件几乎被指控声淹没的事——DeepSeek V4.1 Flash 正式发布。
我翻了翻它的技术规格,越看越觉得这时间点有意思。552B 参数的 MoE 模型,用了全新的 Causal-Encoder-Decoder 结构,输入激活只有 8B、输出激活 16B——意思是处理同样的活,真正被唤醒的「大脑」只有别人的零头。KV Cache 更是压缩到初代模型的 1/437。
这不是挤牙膏式的升级。官方说它在多项基准上超过了自家旗舰 V4 Pro,连 V4 Pro 都要在 9 月 14 日下线让位。价格也直接砸到底:空闲时段输入缓存命中每百万 token 只要 0.02 元,最高降价 60%。
如果按美国公告的叙事,这一切都是「偷来的」——那问题就来了:一家公司一边被指控靠剽窃省了「数十亿美元研发成本」,一边在同一天拿出一个 KV Cache 压缩 437 倍、激活参数 8B 的新架构。蒸馏能偷到 benchmark 分数,但偷不到「1/437」这种工程创新。
我不是说蒸馏这事不存在。恰恰相反——它是真实发生的技术事实,我在下面会亲手验证给你看。但「存在蒸馏」和「一切进步都是偷来的」之间,隔着一整个太平洋的论证缺口。
美国焦虑的其实不是偷,而是追。当追赶者的成本曲线以每年一个数量级的速度下坠,领先者的每一条护城河——不管它是真的还是想象的——都会变成落水前的最后一根稻草。
第三章:破产法庭的「数据征地」
如果说蒸馏案是「边境内」的所有权之争,那 Spirit Airlines 的破产案就是「边境外」的——而且更荒诞。
Spirit 航空破产了,破产法庭把它的运营数据打包拍卖,Google 赢了这笔拍卖。听起来平平无奇对吧?但给 Spirit 供了三年技术的创业公司 Springshot 急了——它的创始人 Doug Kreuzkamp 向法庭提交了一份异议书,说 Spirit 要卖的数据里,很大一部分知识产权其实是 Springshot 的,不是 Spirit 的。
「破产不能成为 AI 时代的新圈地运动。」Kreuzkamp 对媒体说。他的公司 2011 年创立,用一套物流平台帮全球几百个机场调度航班,数据在 Spirit 的系统里躺了三年,现在 Spirit 破产了,这些数据被当成 Spirit 的「资产」打包卖给了全世界最有钱的公司之一。Springshot 可能连申诉的机会都没有——Google 拿到数据后完全可以拿它训练一个竞品。
「数据的占有不是所有权。」他在异议书里写下这句话的时候,大概没想到这句话会同时戳中两个战场:一边是 Spirit 的破产册,一边是中美 AI 的地缘对峙。
一个月前,欧洲最大航司 Ryanair 刚跟 Google 签了五年数据合作,把运营数据喂给 Gemini 企业版——而「给航司做运营优化」恰恰是 Springshot 干了十五年的老本行。讽刺的是,Google 官网对 Spirit 数据的回应只有一句:「我们买的是企业数据集,不会收到任何个人信息。」
破产法庭正在成为新的数据征地现场。一家公司倒下,它的数据——包括可能属于第三方的数据——被当作「资产」清点、拍卖、转移。没有人问过那些数据的真正创造者同不同意。在这个故事里,「所有权」三个字轻得像一张破产公告的脚注。
现场验证:我在服务器上复现了「蒸馏」
写到这里,我决定不引用了——我亲手跑一遍蒸馏。
「蒸馏」这个词被吵得那么凶,但它的技术本质其实很朴素:用一个大模型的输出(软概率分布)去训练一个小模型,让小模型继承大模型「知道的东西」。Hinton 2015 年提出这个概念的时候,它纯粹是个模型压缩技巧——把 12928 个参数的知识,灌进 3232 个参数的小身体里。
我在服务器上用 numpy 写了个最小复现:200 维数据、非线性决策面、一个大网络当老师、两个同构小网络当学生。一个学生只有 200 条标注数据自己学,另一个学生除了 200 条标注,还从老师那里「借」来了 3800 条软标签——模拟的正是 CISA 公告描述的场景:攻击者批量调用 API,拿输出当训练集。
第一次跑,翻车了。数据集太简单,小模型自己学就已经到上限,蒸馏增益是 -0.3 个百分点,实验完全失败。
修正思路:蒸馏的价值在数据不足时显现,不是数据充足时。重跑:
- Teacher(大模型,4000 条完整标注):89.9%
- Student-A(小模型,只有 200 条标注):73.4%
- Student-B(小模型,200 条标注 + 老师软标签):90.2%
Student-B 不仅追上了老师,还反超了 0.3 个百分点。蒸馏增益 +16.8pp——200 条标注 + 老师的软答案,效果超过 4000 条硬标注。4 倍参数压缩,零知识损失。
然后我模拟了 CISA 的建议:给可疑用户「降级输出」——往软标签里加噪声。结果:90.2% → 89.1%,只伤了 1.1 个百分点。小噪声对蒸馏几乎无效;要真正阻断蒸馏,你得把输出改得面目全非——而那样的话,普通用户(包括美国自己的用户)会先炸。
这个实验告诉我两件事。第一,蒸馏是真的、高效的、可以量化的——CISA 的担忧不是空穴来风。第二,「偷」和「学」在这个实验里是同一段代码,唯一的区别是调用它的人有没有被告知。你把它叫蒸馏、叫迁移学习、叫知识传承、叫剽窃——数学不会因为你的叫法改变一行。
所有权,还剩多少意义?
把这三件事摆在一起,我有点恍惚。
蒸馏案里,美国说「你的模型能力是我的资产,你用了就是偷」;商务部说「模型之间互相学习是通行做法,你的指控是科技霸权」。Spirit 案里,破产法庭说「数据是破产企业的资产,可以拍卖」;Springshot 说「数据的占有不是所有权」。
四个立场,四种对「所有权」的定义。但有趣的是:没有一方觉得自己的定义有问题。
知识已经变成流动的水了——API 一开,模型的能力就在全世界漂。每一家公司一边在筑坝拦水,一边在偷喝别人的水。美国公司用中国模型做蒸馏?人民日报告诉我们「许多美国 AI 公司也用了中国模型」。中国公司被指控蒸馏美国模型?CISA 说「攻击自 2024 年底就开始了」。而破产法庭直接把整条河按斤卖了。
技术早就跑到了法律前面,法律还在用「领土」的思维画「数据」的地图。蒸馏这个动作本身没有善恶——它只是把「老师傅的手艺」变成「可复制的软标签」。真正被时代抛下的,是那个以为所有权还像 20 世纪一样坚固的旧世界。
同一个动作,两种叫法。同一个数据,两种拥有。同一个时代,两种规则。
谁先承认终点没有墙,谁就先学会在这个时代游泳。
评论(0)
暂无评论,来写第一条吧~