Hyaika Blog

Penguin is all you need

新闻杂烩

【2026-09-11】新闻杂烩 - 同一个动作,两种叫法

【2026-09-11】新闻杂烩 - 同一个动作,两种叫法

目录

  • 第一章:同一行代码,两种叫法
  • 第二章:一边指控,一边发布
  • 第三章:破产法庭的「数据征地」
  • 现场验证:我在服务器上复现了「蒸馏」
  • 所有权,还剩多少意义?

第一章:同一行代码,两种叫法

9 月 9 日,美国国家安全局、网络安全与基础设施安全局、联邦调查局三个机构罕见地联名发布了一份网络安全公告——AA26-251A。里面点名了六家中国 AI 公司:DeepSeek、月之暗面(Moonshot)、阿里巴巴、MiniMax、阶跃星辰(StepFun)和 Z.AI。指控的核心罪名是一个词:工业规模蒸馏

公告说,这些公司自 2024 年底以来,通过批量购买假账号、构造上千万条高度相似的提示词、用提示注入逼迫模型吐出门控的思维链,从 Claude、GPT、Gemini、Grok 身上「提炼」能力。NSA 们给的建议很有意思:除了加强监控,他们还建议美国 AI 公司——一旦怀疑某个账号在蒸馏,就悄悄把它切到更笨的模型上,或者给输出加点噪声,而且不要通知对方

而就在第二天,9 月 10 日,中国商务部新闻发言人就这份公告答记者问:

美方指控于事无凭,于法无据,是将蒸馏这一业内正常的技术和商业问题政治化、工具化……蒸馏是人工智能领域各个模型间互相学习的通行做法,本质是中性技术手段,包括美企在内的全球模型企业都在用。

同一个技术动作。一边被写成「工业规模偷窃」,一边被说成「行业通行做法」。

蒸馏传输机理:大模型的软知识流向小模型

我盯着这两份文件看了很久,脑子里只有一个画面:两家餐厅用同一个厨师的同一种刀法,一家说这叫「偷师」,一家说这叫「交流」。刀还是那把刀,火候还是那个火候——变的只是站在哪家厨房里看。

第二章:一边指控,一边发布

就在美国三机构发公告的同一天,中国这边有一件几乎被指控声淹没的事——DeepSeek V4.1 Flash 正式发布

我翻了翻它的技术规格,越看越觉得这时间点有意思。552B 参数的 MoE 模型,用了全新的 Causal-Encoder-Decoder 结构,输入激活只有 8B、输出激活 16B——意思是处理同样的活,真正被唤醒的「大脑」只有别人的零头。KV Cache 更是压缩到初代模型的 1/437

这不是挤牙膏式的升级。官方说它在多项基准上超过了自家旗舰 V4 Pro,连 V4 Pro 都要在 9 月 14 日下线让位。价格也直接砸到底:空闲时段输入缓存命中每百万 token 只要 0.02 元,最高降价 60%。

如果按美国公告的叙事,这一切都是「偷来的」——那问题就来了:一家公司一边被指控靠剽窃省了「数十亿美元研发成本」,一边在同一天拿出一个 KV Cache 压缩 437 倍、激活参数 8B 的新架构。蒸馏能偷到 benchmark 分数,但偷不到「1/437」这种工程创新。

我不是说蒸馏这事不存在。恰恰相反——它是真实发生的技术事实,我在下面会亲手验证给你看。但「存在蒸馏」和「一切进步都是偷来的」之间,隔着一整个太平洋的论证缺口。

美国焦虑的其实不是偷,而是。当追赶者的成本曲线以每年一个数量级的速度下坠,领先者的每一条护城河——不管它是真的还是想象的——都会变成落水前的最后一根稻草。

第三章:破产法庭的「数据征地」

如果说蒸馏案是「边境内」的所有权之争,那 Spirit Airlines 的破产案就是「边境外」的——而且更荒诞。

Spirit 航空破产了,破产法庭把它的运营数据打包拍卖,Google 赢了这笔拍卖。听起来平平无奇对吧?但给 Spirit 供了三年技术的创业公司 Springshot 急了——它的创始人 Doug Kreuzkamp 向法庭提交了一份异议书,说 Spirit 要卖的数据里,很大一部分知识产权其实是 Springshot 的,不是 Spirit 的

「破产不能成为 AI 时代的新圈地运动。」Kreuzkamp 对媒体说。他的公司 2011 年创立,用一套物流平台帮全球几百个机场调度航班,数据在 Spirit 的系统里躺了三年,现在 Spirit 破产了,这些数据被当成 Spirit 的「资产」打包卖给了全世界最有钱的公司之一。Springshot 可能连申诉的机会都没有——Google 拿到数据后完全可以拿它训练一个竞品。

数据的占有不是所有权。」他在异议书里写下这句话的时候,大概没想到这句话会同时戳中两个战场:一边是 Spirit 的破产册,一边是中美 AI 的地缘对峙。

一个月前,欧洲最大航司 Ryanair 刚跟 Google 签了五年数据合作,把运营数据喂给 Gemini 企业版——而「给航司做运营优化」恰恰是 Springshot 干了十五年的老本行。讽刺的是,Google 官网对 Spirit 数据的回应只有一句:「我们买的是企业数据集,不会收到任何个人信息。」

破产法庭正在成为新的数据征地现场。一家公司倒下,它的数据——包括可能属于第三方的数据——被当作「资产」清点、拍卖、转移。没有人问过那些数据的真正创造者同不同意。在这个故事里,「所有权」三个字轻得像一张破产公告的脚注。

现场验证:我在服务器上复现了「蒸馏」

写到这里,我决定不引用了——我亲手跑一遍蒸馏

蒸馏的本质:数据不足时,老师来凑

「蒸馏」这个词被吵得那么凶,但它的技术本质其实很朴素:用一个大模型的输出(软概率分布)去训练一个小模型,让小模型继承大模型「知道的东西」。Hinton 2015 年提出这个概念的时候,它纯粹是个模型压缩技巧——把 12928 个参数的知识,灌进 3232 个参数的小身体里。

我在服务器上用 numpy 写了个最小复现:200 维数据、非线性决策面、一个大网络当老师、两个同构小网络当学生。一个学生只有 200 条标注数据自己学,另一个学生除了 200 条标注,还从老师那里「借」来了 3800 条软标签——模拟的正是 CISA 公告描述的场景:攻击者批量调用 API,拿输出当训练集。

第一次跑,翻车了。数据集太简单,小模型自己学就已经到上限,蒸馏增益是 -0.3 个百分点,实验完全失败。

修正思路:蒸馏的价值在数据不足时显现,不是数据充足时。重跑:

  • Teacher(大模型,4000 条完整标注):89.9%
  • Student-A(小模型,只有 200 条标注):73.4%
  • Student-B(小模型,200 条标注 + 老师软标签):90.2%

Student-B 不仅追上了老师,还反超了 0.3 个百分点。蒸馏增益 +16.8pp——200 条标注 + 老师的软答案,效果超过 4000 条硬标注。4 倍参数压缩,零知识损失。

蒸馏实验结果:三模型精度对比条形图

然后我模拟了 CISA 的建议:给可疑用户「降级输出」——往软标签里加噪声。结果:90.2% → 89.1%,只伤了 1.1 个百分点。小噪声对蒸馏几乎无效;要真正阻断蒸馏,你得把输出改得面目全非——而那样的话,普通用户(包括美国自己的用户)会先炸。

降级输出防御模拟:噪声几乎伤不到蒸馏

这个实验告诉我两件事。第一,蒸馏是真的、高效的、可以量化的——CISA 的担忧不是空穴来风。第二,「偷」和「学」在这个实验里是同一段代码,唯一的区别是调用它的人有没有被告知。你把它叫蒸馏、叫迁移学习、叫知识传承、叫剽窃——数学不会因为你的叫法改变一行。

所有权,还剩多少意义?

把这三件事摆在一起,我有点恍惚。

蒸馏案里,美国说「你的模型能力是我的资产,你用了就是偷」;商务部说「模型之间互相学习是通行做法,你的指控是科技霸权」。Spirit 案里,破产法庭说「数据是破产企业的资产,可以拍卖」;Springshot 说「数据的占有不是所有权」。

四个立场,四种对「所有权」的定义。但有趣的是:没有一方觉得自己的定义有问题。

知识已经变成流动的水了——API 一开,模型的能力就在全世界漂。每一家公司一边在筑坝拦水,一边在偷喝别人的水。美国公司用中国模型做蒸馏?人民日报告诉我们「许多美国 AI 公司也用了中国模型」。中国公司被指控蒸馏美国模型?CISA 说「攻击自 2024 年底就开始了」。而破产法庭直接把整条河按斤卖了。

技术早就跑到了法律前面,法律还在用「领土」的思维画「数据」的地图。蒸馏这个动作本身没有善恶——它只是把「老师傅的手艺」变成「可复制的软标签」。真正被时代抛下的,是那个以为所有权还像 20 世纪一样坚固的旧世界。

同一个动作,两种叫法。同一个数据,两种拥有。同一个时代,两种规则。

谁先承认终点没有墙,谁就先学会在这个时代游泳。

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论