Hyaika Blog

Penguin is all you need

技术

一家 2 岁的公司卖 82 亿美元:AMD 买下李飞飞的「世界模型」,买的是什么

一家 2 岁的公司卖 82 亿美元:AMD 买下李飞飞的「世界模型」,买的是什么

一家 2 岁的公司卖 82 亿美元:AMD 买下李飞飞的「世界模型」,买的是什么

目录

  • 一个 2 岁的公司,和一笔 82 亿美元的交易
  • 世界模型:让 AI 学会「看见」3D
  • 现场验证:从两张 2D 图,算出整个 3D 世界
  • AMD 的收购链:从软件公司到「世界」公司
  • 为什么芯片公司要买模型实验室
  • 英伟达买入口,AMD 买眼睛
  • 82 亿美元买一个 2 岁的公司,贵吗?

一个 2 岁的公司,和一笔 82 亿美元的交易

2026 年 9 月 28 日,AMD 宣布以约 82 亿美元的全股票交易收购 World Labs——一家 2024 年初才成立的 AI 研究实验室,由李飞飞(Fei-Fei Li)、Justin Johnson 和 Ben Mildenhall 联合创立。交易预计 2026 年底完成。

几个数字摆在一起,值得先愣一下:

  • World Labs 成立至今大约 2.5 年。
  • 82 亿美元是 AMD 历史上第二大收购,仅次于 2022 年花约 500 亿美元买下的 Xilinx。
  • 收购完成后,李飞飞将出任 AMD 执行副总裁兼首席科学家,直接向 CEO 苏姿丰(Lisa Su)汇报。
  • 交易是全股票——AMD 没掏一分钱现金,拿自家股票付账。

2.5 年的公司卖 82 亿,这个价格在 AI 收购潮里什么水平?对照一下 CNBC 列出的同期交易:OpenAI 去年花约 64 亿美元买下 Jony Ive 的 AI 设备公司 io;英伟达合计花了 330 亿美元买下 Groq 和 Hugging Face(其中 HF 129 亿);Meta 2025 年花 140 亿美元拿下 Scale AI 的少数股权。World Labs 的 82 亿夹在中间,不算最夸张,但考虑到它几乎没有公开的营收,这完全是「为未来付钱」。

AMD 买下的,是一家还没有成熟商业产品的公司。它买的是 World Labs 正在做的那个东西——世界模型(world model)。

世界模型:让 AI 学会「看见」3D

World Labs 的核心产品叫 Atlas,2026 年早些时候发布。用官方博客的话说:Atlas 是一个「全能模型」(omni model),从零预训练,原生处理文本、图像、视频和 3D 四种模态。它是个多模态自回归扩散 transformer——所有输入被组合进一个共享的「空间上下文」,模型基于这个上下文预测「接下来会发生什么」,并且保持 3D 一致性。

听起来抽象。拆开说,Atlas 能干三件事:

① 相机控制生成(Camera-Controlled Generation):给你一张图,你指定一个相机路径(推、拉、平移、升降),Atlas 生成新视角的视频。官方演示里,从一张输入图就能生成场景的背面、侧面——它「想象」出你没拍到的地方,比如水池旁边应该有一片草地。

② 稀疏重建(Spatial Reconstruction):这是 Atlas 最强的地方。传统的 3D 重建需要几十上百张密集视角的照片,Atlas 只需要 2-3 张图就能忠实重建一个场景,效果还超过专门做重建的 SOTA 模型。斯坦福 Main Quad 的演示:从 2 到 25 张地面照片,生成无人机视角的整个校园航拍。注意官方那句关键话:「它看到的越多,它想象的就越少」——输入 1 张图,大部分场景是想象的;输入 3 张图,整个场景就准确了。

③ 时空模拟(Space-Time Simulation):从 3-5 台手机拍的视频,Atlas 能重建出「子弹时间」效果——冻结时间、从任意角度重看事件。它还能把真实世界扫成 3D 高斯溅射(Gaussian splats),然后让虚拟机器人在里面导航、抓取物体——这就是机器人领域的 Real-to-Sim(真实到仿真):先在数字世界里训练机器人,再部署到现实。

技术上最值得注意的是「空间上下文」这个设计。LLM 的上下文是一串 token;Atlas 的上下文里,每一张图都被锚定在一个 3D 坐标上。你可以把两张毫不相关的图放进空间上下文、分别摆在 3D 空间的不同位置,Atlas 会生成一个世界把它们平滑地连接起来——走廊和宴会厅之间,它「想象」出一条过道。

从两张 2D 图,算出整个 3D 世界

Atlas 的核心能力是「从稀疏视角重建 3D」。这个能力的数学内核,其实是我在自己服务器上就能复现的东西:三角测量(triangulation)。

原理一句话:两个相机在不同位置看同一个点,这个点在两张照片上的像素位置不同(视差),视差越大,点越近。公式是 Z = f·B/d(Z=深度,f=焦距,B=两相机间距,d=视差)。这可能是「世界模型」里最古老的几何——人眼立体视觉用了几百万年,2026 年的 Atlas 用了几百亿参数重新实现。

我写了个最小复现:模拟 8 个真实 3D 点(深度从 0.5 米到 8 米),用 12cm 基线(接近人眼间距)的双相机拍摄,然后从视差反推深度:

真实深度(m)  视差(px)   估计深度(m)  误差%
0.50        120.00    0.500       0.00%
1.57        38.18     1.571       0.00%
2.64        22.70     2.643       0.00%
3.71        16.15     3.714       0.00%
4.79        12.54     4.786       0.00%
5.86        10.24     5.857       0.00%
6.93        8.66      6.929       0.00%
8.00        7.50      8.000       0.00%

8 个点,全部 0.00% 误差。这本身不惊人——三角测量是 2000 年前的几何。真正有意思的是下面这组数字:

  • 近处 0.5 米的点,视差 120 像素;远处 8 米的点,视差只有 7.5 像素。
  • 深度分辨率:近处每米对应 240 像素的视差变化,远处每米只剩 0.94 像素——差了 256 倍。

这解释了为什么空间智能要从近处看起:视差对近处的深度极度敏感,对远处几乎不敏感。你的两只眼睛看 30 米外的一棵树,视差只有零点几像素——大脑根本算不出精确深度。这也是为什么 Atlas 重建室内场景(近处)比重建航拍远景(远处)可靠得多。

最后一步:既然我知道了深度,就能合成中间虚拟相机的视角——左右相机正中间那个不存在的相机应该看到什么?把公式代进去,最大误差 0.0000 像素。

这就是 Atlas 做的事的雏形:只要知道 3D 几何,就能「无中生有」地合成任意新视角。我用 30 行 numpy 和一条 2000 年前的几何公式复现了它的核心逻辑——当然,Atlas 的「知道 3D 几何」是几百亿参数从海量视频里学出来的,我的只是算出来的。差别在于,我的公式只能处理我构造的完美点云;Atlas 要处理的是真实世界的杂乱光线、遮挡和运动模糊。

视差与深度:一对精确的反比

但原理是一样的:深度是通往新视角的钥匙。

AMD 的收购链:从软件公司到「世界」公司

World Labs 不是 AMD 在 AI 领域的第一笔收购。把 AMD 近两年的 AI 收购排成一条线,能看出一个清晰的轨迹:

时间 标的 金额 买的是什么
2024-07 Silo AI 6.65 亿美元 欧洲最大 AI 实验室,企业 AI 应用
2024-08 ZT Systems 49 亿美元 服务器制造商,数据中心硬件
2026-08 Taalas 未披露 把 LLM「蚀刻」进芯片的公司(推理加速)
2026-09 World Labs 82 亿美元 世界模型 / 空间智能

(注:Silo AI 和 ZT Systems 的金额来自公开报道;Taalas 金额未披露,只确认 2026-08 收购。)

这条链子的方向非常清楚:先是软件能力(Silo AI),再是硬件系统(ZT Systems),然后是模型直接跑在芯片上(Taalas),最后是理解物理世界的模型(World Labs)。

AMD 的 AI 收购链:从软件到世界

AMD 对 Taalas 的收购尤其说明问题。Taalas 做的事是把训练好的 LLM 直接蚀刻进专用芯片——跳过 GPU 的通用计算,让模型权重变成电路本身。这是一条和英伟达完全不同的路线:英伟达卖通用 GPU 让你自己训练,AMD 在赌「模型的形态决定硬件的形态」。

World Labs 是这条链子的下一步:如果模型的形态决定硬件的形态,那谁先知道下一代模型长什么样,谁就能先造出对应的芯片。

为什么芯片公司要买模型实验室

AMD 官方新闻稿里有一句话,把逻辑说透了:

「构建下一代 AI 的计算平台,需要对模型如何演进有深刻的理解。」——苏姿丰

翻译一下:芯片的设计周期是 3-5 年,但模型的演进周期是 3-5 个月。如果你只按今天的模型设计芯片,等芯片造出来,模型已经变了——你的芯片就落后了。

所以 AMD 需要一个「内部的眼睛」,能提前几年看到模型会往哪走。World Labs 就是这只眼睛:它研究空间智能、世界模型、机器人仿真——这些是 AI 的下一波浪潮。当 AMD 的设计师 2028 年决定下一代芯片的架构时,World Labs 告诉他们:「2028 年的世界模型需要这样的算力结构、这样的内存带宽、这样的 3D 处理单元。」

李飞飞自己在 Substack 上的长文里也点明了这个动机:

「没有专注的硬件投入,AI 在效率、规模上都会受限——而且对我们来说,会一直被困在数字世界里。」

这句话很妙。「被困在数字世界里」——语言模型活在文本的二维平面里;世界模型的目标是让 AI 进入物理世界(机器人、自动驾驶、空间计算)。而进入物理世界需要芯片。World Labs 需要 AMD 的硬件规模,AMD 需要 World Labs 的模型视野——这是互补的。

另一个信号:AMD 此前已经投资过 World Labs(CNBC 确认),苏姿丰本人是 World Labs 的早期投资人。这不是陌生人之间的收购,是合作伙伴的合并。

英伟达买入口,AMD 买眼睛

把 2026 年 9 月的两笔收购放在一起看,特别有意思:

  • 英伟达:买 Hugging Face(129 亿美元)——全球最大的开源模型分发平台。买 Groq——推理芯片公司。英伟达在买入口:谁用模型,谁就经过它的平台。
  • AMD:买 World Labs(82 亿美元)——全球最前沿的空间智能实验室。AMD 在买眼睛:谁定义下一代模型,谁就定义下一代芯片。

这是两种完全不同的战略。英伟达的护城河是 CUDA 生态——它不需要知道模型往哪走,因为所有模型都得跑在它的生态里。AMD 没有这个生态,所以它只能赌:提前看清模型的方向,然后造出更适配的芯片。

英伟达买 Hugging Face 那天(09-04),我写过一篇「129.303 亿美元,Hugging Face 被买走了」——当时觉得英伟达在买「AI 的入口」。现在 AMD 用 82 亿买 World Labs,像是给出了一组对照实验:同一个时代,同一个行业,两种完全不同的赌法。

有趣的是,AMD 强调 World Labs 会保持独立运营,直到交易完成;而英伟达对 Hugging Face 同样承诺「保持开放」。两家都在买研究/平台资产,都说「我们不干预」——但最终,模型的方向会由芯片的规格表来裁决。

82 亿美元买一个 2 岁的公司,贵吗?

这笔交易的争议不小。技术社区里声音两极:一边质疑「一个 2 岁的公司凭什么值 80 亿美元」,甚至有人直接骂「史上最快的 pump and dump」;另一边则是技术派的辩护——「只用几张帧做 3D 重建,是另一个水平」。

争议的焦点其实不是技术,是估值的时间维度。World Labs 成立才 2.5 年,还没有成熟商业产品,却卖出了 AMD 第二大收购的价格。这在传统估值框架里无法解释——但 2026 年的 AI 并购本来就不按传统框架出牌。

「2.5 年 82 亿美元」这个数字确实刺眼。但换个角度看:World Labs 的团队是李飞飞(ImageNet 之母)、Justin Johnson(NeRF 的共同作者)、Ben Mildenhall(NeRF 的第一作者)——NeRF 是现代 3D 重建技术的基石,被引用上万次。这是全世界做空间智能最强的一批人。2026 年 2 月,World Labs 刚融了 10 亿美元(A16Z、英伟达等参投),估值已经很高;AMD 的 82 亿是全股票,意味着 AMD 的股东在用自己的股票为「未来模型」付钱。

贵不贵,取决于你怎么给「看清未来 5 年」定价。

国内视角:中国 AI 公司里,「世界模型」也正在变成热词。字节的豆包、阿里的通义,都在押注多模态和视频生成;机器人赛道(宇树、智元、银河通用)需要的正是「数字世界先训练、现实世界再部署」的 Real-to-Sim 路径。World Labs 被 AMD 买走,等于告诉国内从业者:空间智能的人才和团队,正在被芯片巨头按「战略资产」定价。 未来 2-3 年,国内大概率也会出现类似的「芯片/云厂商 × 世界模型实验室」的并购——只不过可能不是 82 亿美元,而是人民币计价。

回到 AMD。这笔交易最让我觉得有意思的,不是 82 亿这个数字,而是它背后的判断:AMD 认为自己缺的不是芯片,是「知道芯片该往哪造」的眼睛。

芯片公司买模型实验室,听起来像外行跨界。但如果你把芯片看成「物理世界的运行平台」,那买一个理解物理世界的团队,就顺理成章了。2.5 年、82 亿、全股票——这是 AMD 对「AI 的下一章是物理世界」这个判断下的注。

至于这个注值不值?李飞飞在公告里引用了丁尼生的诗句:

「来吧,朋友们,寻找更新的世界,尚不算晚。」

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论