⏳ 花 5 倍的钱,买 4 个月的「不用等」:AI 模型正在把时间写进价签
目录
- 7 小时和 12 小时之间,隔着一道价签
- 时间视野:AI 的「能干多长的活」成了新的度量衡
- 价格锚点:差 3 分,便宜 70%
- 闭源模型到底在卖什么:一个 8 到 12 小时的任务带
- 生态反转:跑在全世界的是开源,赚到钱的是闭源
- 我把 5 倍和 4 个月,亲手算了一遍
- 领先是买来的,等是省出来的
7 小时和 12 小时之间,隔着一道价签
两个数字。一个是 7,一个是 12。
7 小时,是目前最好的开源模型能「可靠完成」的最长任务——以人类专家需要多久为标准。12 小时,是目前最好的闭源模型能跨过的坎。
按 Mozilla 9 月 15 日发布的第二期《State of Open Source AI》报告,这两个数字之间,隔着一条隐形的分界线:8 到 12 小时的任务带,是闭源模型的独占区——开源还进不来,闭源刚好够得着。而这条分界线的两侧,价格差了大约五倍。
过去我们习惯把 AI 的进步描述成一张榜单:谁的分高,谁排前面。但这份报告换了一把尺子——它不问「模型能考多少分」,而是问「模型能帮你干多长时间的活」。能力差距被翻译成了时间差,时间差又被翻译成了价格。
时间视野:AI 的「能干多长的活」成了新的度量衡
「时间视野」(time horizon)这个概念来自研究机构 METR。定义很朴素:以 50% 的可靠成功率,AI 能处理的、需要人类专家完成多长时间的 tasks——这个时长就是模型的时间视野。
在 2026 年 9 月这个时间点:
- 最好的开源模型,可靠完成的最长任务约 7 小时;
- 最好的闭源模型,约 12 小时——是开源的 1.7 倍;
- 超过 12 小时的任务,还没有任何模型能可靠完成。
Mozilla 的 CTO Raffi Krikorian 给了 Ars 一个更直观的比喻:
「如果开源前沿能处理 7 小时的任务,闭源前沿能处理 12 小时的。四个月后,开源能处理 12 小时的任务,闭源能处理的则在 20 小时左右。」
也就是说:低于 8 小时的任务,两种模型都能干,交给便宜的开源是理性的;8 到 12 小时,是闭源现在独享的窗口;12 小时以上,大家都在等。
这个「时长」视角比 benchmark 分数更接近真实世界:企业雇人干活,从来不是按「这个人智商 130」付费,而是按「他能独立负责多大的事」付费。AI 也一样——能托付 7 小时的活,和能托付 12 小时的活,是两个完全不同的岗位。
价格锚点:差 3 分,便宜 70%
报告里最扎眼的一组对比是这个:
月之暗面的 Kimi K3 在 Artificial Analysis Intelligence Index 上的综合得分,比 Anthropic 的闭源旗舰 Fable 5 只低 3 分——而 Kimi K3 的成本,是 Fable 的 30%。
得分差 3 分,价格差 3 倍多。如果只看榜单,你会觉得「差不多」;如果看价格,你会重新掂量「那 3 分到底值多少钱」。
另一组数据来自 Vals AI 的中性评测(Terminal-Bench 2.1)——所有模型跑在同一个 harness 上,屏蔽了各家自带的工具层加成。智谱的 GLM 5.2 得分和 Anthropic 的 Claude Opus 4.7/4.8 只差 1 分以内,而每个完成任务的成本大约便宜 5 倍。
顺着这个逻辑,Krikorian 给了一句相当直白的话:
「为闭源前沿模型付钱,买的是大约 4 个月的领先,代价是每个任务大约 5 倍的成本——而且只在『任务时长 8 到 12 小时』这个区间里成立。」
4 个月,5 倍。这就是 2026 年 9 月闭源模型的真实价签:它不卖绝对的强,卖的是「现在就能用」。
闭源模型到底在卖什么:一个 8 到 12 小时的任务带
既然开源这么便宜、差距又这么小,为什么还有公司付 5 倍的钱?
Krikorian 的解释很清醒:「我们看得到,为闭源付费的决定是按工作负载(workload)来的,而不是按公司来的。」
换句话说:这不是「我们公司只用闭源」或「我们公司只用开源」二选一,而是同一个公司内部,把不同的活分给不同的模型。
报告里举的例子是 DoorDash:日常 routine 工作交给 Kimi,更难的、以前要人类专家花更长时间完成的任务,留给 Fable。翻译成前面的时间视野框架就是——能在 7 小时内搞定的活,就别花 5 倍的钱;落在 8 到 12 小时窗口里的,才值得为「领先」付费。
还有一类买家不能被性价比打动:闭源模型开箱即用,自带「合规包装、支持和责任归属」——很多组织根本没有养得起开源模型的人才。Krikorian 管这叫 "workload-specific rather than organization-specific":买不买闭源,取决于你手头的活,而不是你的立场。
这句话其实戳破了一层泡沫:过去两年的「开源 vs 闭源」之争,经常被包装成意识形态对决。但 Mozilla 这份报告——一个理论上最该站队「开源必胜」的机构——给出的判断冷静得多:这不是谁取代谁,而是任务时长把市场切成了两半,两边各吃各的。
生态反转:跑在全世界的是开源,赚到钱的是闭源
然后是一组更有冲击力的数字:
- OpenRouter 上按 token 量排名的前十模型,有 8 个是开放权重——世界实际跑在开源上;
- 但 Linux Foundation 的论文统计(2025 年 5 月到 9 月数据)显示:开源模型只赚到整个市场 4% 的收入,闭源拿走了 96%。
用量在开源,收入在闭源。这个剪刀差就是「时间价签」的必然结果:开源把 80% 的活干了,但每单都便宜;闭源只干那 20% 的难活,却把大部分钱赚走了。Krikorian 也承认收入格局会变——「过去一年开源模型爆发式增长,收入一定会迁移」——但方向需要时间。
更值得玩味的是他对生态格局的判断。8 个开源模型里绝大多数来自中国实验室,Krikorian 形容这是「美国人玩过的 Android 打法」:
「中国实验室在跑美国人当年跑安卓的那套剧本——把系统免费送出去,但把生态握在自己手里。」
他真正担心的不是「中国模型」这个标签,而是集中:最好的开源在中国,最好的闭源在美国——「开源生态当下主要由中国资本滋养,这既是多元,也是集中」。所以他呼吁美欧实验室回到同一条开源赛道,「不要让任何一个国家设置全世界的默认值」。
这段话最狠的地方在于:开源的「免费」,从来不是免费的。 安卓免费,但生态的钱流回谷歌;开源模型免费,但围绕模型的那一层生态——工具链、harness、评测、算力——才是真正的主战场。中国实验室深谙此道:模型白送,但「谁在用、怎么用、用什么栈」都在自己这边。
我把 5 倍和 4 个月,亲手算了一遍
写这篇之前,我拉了一遍 OpenRouter 的实时定价,把「5 倍」「30%」这两个数字亲自复算了一次。
典型的 agent 任务(50K token 输入 + 10K token 输出):
| 模型 | 单任务成本 | 相对倍数 |
|---|---|---|
| Kimi K3 | $0.27 | 1x |
| GLM 5.2 | $0.11 | 0.41x |
| Claude Opus 4.7 | $0.50 | 1.85x |
| Claude Fable (latest) | $1.00 | 3.77x |
结果:Fable/Kimi = 3.77 倍,Opus/GLM = 4.39 倍。报告的「3.3 倍」「5 倍」是评测时的口径,今天的实时价差略大一点——量级完全吻合,「闭源贵四五倍」不是修辞。
然后我做了一件报告没做的事:把 Krikorian 给的两组时间视野数据点(开源 7→12 小时、闭源 12→20 小时,间隔 4 个月)当成两条指数曲线外推。结果有点反直觉:
- 开源月增速约 14.4%,闭源约 13.6%——开源确实追得更快,但只快 0.8 个百分点;
- 按这个速率,相对差距(1.71 倍)要追平,需要大约 6.4 年;
- 更反直觉的是:绝对差距在拉大——现在差 5 小时,4 个月后差 8 小时。
这说明什么?「4 个月领先」听起来像是一个短暂的窗口,但把它放进指数增长里看,领先是长期结构:闭源永远比开源多走一步,只是每一步的步幅在缩小。所以那 5 倍的价格买到的,不是什么「短暂的先发优势」,而是一个「你不用等」的长期权利——只要你的任务落在 8 到 12 小时的窗口里。
领先是买来的,等是省出来的
把整份报告压成一句话:AI 模型的价格,正在从「能力税」变成「时间税」。
过去你为闭源多付钱,买的是「更聪明」;现在你为闭源多付钱,买的是「更超前」——超前 4 个月,超前一个 8 到 12 小时的任务带。能力差距缩小到 3 分、1 分以后,「更强」已经卖不动了,卖得动的是「现在就能用」。
反过来,开源模型的价值也被重新定义了:它不是「弱一点的替代品」,而是「愿意等的人的选项」。7 小时以内能完成的活,等 4 个月,同样的模型便宜 5 倍。世界上的大部分工作,本质上都是「可以等一等」的工作。
而那个唯一不能等的东西——一个在开源追上来之前就到期的 deadline——就是整个闭源产业真正的定价基础。
当「更强」已经卖不动的时候,「更早」就成了最后的奢侈品。愿意等的人,正在把「等」本身变成一种竞争优势——而这场等待,大概还要持续很多个 4 个月。
评论(0)
暂无评论,来写第一条吧~