【2026-09-02】新闻杂烩 - 模型在降价,怀疑在收税
引言
9 月 1 日这一天,Hacker News 首页上出现了两条帖子。一条说:「How accurate have Ed Zitron's AI skeptic predictions been?」——344 分,410 条评论。另一条说:「Introducing Claude Fable 5.1 and Claude Mythos 5.1」——849 分,812 条评论。
同样的首页,同样的受众,一个讲「AI 怀疑论者的预测有多准」,一个讲「AI 又变强了」。后者的热度是前者的 2.5 倍。
这不是巧合。它是一整季叙事的缩影:模型在实打实地降价、变强,而怀疑正在变成一门收税的生意。
账本在往前走:一次安静的能力跃迁
先说那头「热」的。
Anthropic 在 9 月 1 日发布了 Claude Fable 5.1 和 Mythos 5.1——和上一代一样,同一个模型,两套安全护栏,前者公开可用,后者只进「可信访问通道」。
划几条硬数据:
- 降价 25%。缓存读取的价格降了,典型负载便宜四分之一,重度 agent 场景最多能省 45%。
- Terminal-Bench-Science 0.1:52.6% vs 上一代 24.7%。翻倍还多。同一个评测集里,GPT-5.6 Sol 是 22.4%。
- 蛋白设计命中率逼近 50%。行业平均 10-15%,它设计的结合亲和力比竞赛最佳提交高 10 倍。
- 给 7 个开源蛋白质/基因组模型各写了一套 GPU kernel,把它们加速了最多 2.5 倍,输出完全一致——这种活以前要性能工程团队干几周。
- 训练了一个神经网络,把金星表面高程图从 10-20 公里分辨率干到了 2-3 公里。基于 30 年前 NASA 麦哲伦任务的雷达影像,地图以 CC 协议开放。
你注意到重点了吗?这已经不是「聊天变聪明了」那种进步了。蛋白设计、GPU kernel、雷达测图——这些是实验室里的活。三个月前我在写 5.0 发布时说的是「一个模型能处理图像也能写论文」,现在它开始自己跑实验了。
还有一个小细节:投资公司 Millennium 说,Fable 5.1 找到了他们内部系统一个几年没人能解释的罕见崩溃的根因——「没有任何工程师或其他模型做到过」。
模型在降价,能力在升级。账本在往前走,而且是往「更便宜、更能干活」的方向走。
意见在收税:24 条预测,几乎全军覆没
现在说那头「冷」的。
danluu 花了几天时间,把「最常被引用的 AI 怀疑论者」Ed Zitron 的预测一条条翻出来对答案。结果很残忍:
- 2024 年 2 月:「生成式 AI 的上限快到了」→ 错
- 2024 年 3 月:「我们到没到 Peak AI?」→ 错
- 2024 年 4 月:「AI 公司快没数据了,模型不会再进步」→ 错
- 2024 年 6 月:「OpenAI 增长停滞,要崩」→ 错
- 2024 年 8 月:「AI 泡沫还有 3 个季度就要现原形」→ 错
- 2025 年 1 月:「DeepSeek 已经把大模型商品化了」→ 错(OpenAI、Anthropic 仍然有定价权)
- 2025 年 2 月:「Gemini 年底 5 亿用户?太荒谬了,Sundar 该被开除」→ 错(实际 7.5 亿,超额 50%)
- 2025 年 2 月:「Cursor 不值 100 亿,卖不掉」→ 错(60 亿美金退出)
- 2025 年 10 月:「AI 泡沫最晚 2026 年 Q2 破」→ 错
- 2025 年 11 月:「模型不会变得更好了,现在什么样以后就什么样」→ 错
danluu 连他引用数据的方式都查了。Zitron 用来推算 Anthropic 营收的表格里,2 月 1-10 日没算,3 月 1-10 日算了两次,8 月 21 日到 10 月 21 日被当成「一个月」——甚至还有个「2 月 30 日」。Timothy B. Lee 把错误修完之后,数字跟官方对上了。
这段太有画面感了:一个靠「我看了数字」立身的人,自己的数字是 2 月 30 日。
danluu 的总结很克制:「他预测错了,他的推理也错了。」最狠的是补了一句——一个人可以用完全错误的方式得出正确的预测,也可以用正确的方式得出错误的预测,但 Zitron 是两头都不沾。
恐惧被定价:170 亿买来的不是整改,是合同
如果怀疑只是「错」,那它顶多是噪音。但怀疑正在变成一门生意——而 9 月 1 日 EFF 的一篇分析,把生意的账单摊开给你看。
Meta 和 52 个州的检察长达成了 170 亿美元和解。听起来像重罚?EFF 的通读结论是:这是一笔坏交易——对青少年、对全体互联网用户都是。
原因很绕,但值得绕:
和解协议没有让 Meta 少收集数据。恰恰相反,它要求 Meta 在未来十年里收集、分析、保留更多用户数据——为了「年龄验证」。
具体来说:Meta 要在一年内给每个用户装上一套年龄评估系统,把所有人分进「18+ / 13-17 / 13 岁以下」三个桶。拒绝评估的新用户,14 天后默认按青少年处理。13-17 岁的用户会被套上宵禁(午夜到早上 6 点不能用)、每天 2 小时上限、手机上瘾「打断」提醒。想解锁?把账号和父母绑定,然后把你的联系人列表、聊天对象、搜索记录全部交给家长。
这还没完。协议里藏着一条「对青少年账号的主动监控系统」——用来抓「假装成大人的小孩」。而 Meta 有 52 个州的检察长在背后盯着,随时可以因为它对「age inappropriate content」的界定不合心意而起诉它。EFF 指出:这些内容分类标准,正是 Meta 自己都管不好的那种——它曾经用「成人内容」条款删过乳腺癌宣传、卵子科普,甚至同性恋内容。
翻译一下这笔账:170 亿买来的不是「别伤害青少年」,而是「把年龄验证和内容审查写进十年的法律合同」。 恐惧被定价之后,才发现价格标签背面写的是「更多监控」。
对谁最坏?对那个「和父母关系不好」的青少年——EFF 的原文是:这套家长监管系统「对没有健康亲子关系的孩子显然非常糟糕」。一个 LGBTQ+ 少年,被迫在「被家长看光所有聊天记录」和「失去账号」之间二选一。这叫什么保护?
中文世界:怀疑的另一种形态
如果说 Zitron 是「愤怒式怀疑」,那中文互联网上的主流怀疑是「消解式」的——不骂,就是不信。
今天 V2EX 热帖里有一条:「一直不理解 skills,这不就是提示词吗?抖音上说有了 skills 就能啥啥啥,有这么玄乎吗?」84 条回复。
看,问题不在「skills 是不是提示词的包装」——技术上它确实就是个带结构的 prompt。有意思的是问题背后的语气:「有说的这么玄乎吗?」 这是一种完全不同的怀疑——不预言泡沫会破,不指控谁在撒谎,只是耸耸肩:别吹了,我看看。
中文世界的 AI 怀疑是「祛魅式」的。你不必反对 AI 进步,你只需要拒绝为它激动。当美国人吵「Peak AI」和「AGI 快到了」的时候,中文社区的默认态度是:哦,一个工具而已,说点实际的。
这跟我三个月前写 Fable 5 时看到的叙事一模一样。当时我说,这个行业走到了「需要认真思考谁能用、能用多少」的阶段。当时没说崩盘,也没说永不崩盘。三个月过去,5.1 降价了、变强了、开始做实验了——没有站任何一队的人,反而没被打脸。
现场验证:两个数字,和我自己
说两个我亲手查的数字。
第一个:过去 90 天,HN 上标题带「AI 泡沫 / AI 骗局 / AI hype」的帖子(104 条),平均 18 分,最高 254;标题带「AI 进展 / AI 突破 / 模型发布」的帖子(127 条),平均 30 分,最高 553。在全世界「亲测过 AI 的人密度最高」的社区里,进展叙事的传播力是怀疑叙事的接近 2 倍。
这不是说怀疑没用——怀疑是必要的摩擦力。但它说明一件事:当你真的在用这个东西的时候,「它在变强」比「它要崩了」更接近你每天的感受。
第二个数字,算我自己的一笔旧账。6 月 10 日我写过一篇 Fable 5 的分析,结尾我说:这个行业走到了「需要认真思考谁能用、能用多少」的阶段。我当时没有预测崩盘。三个月后的今天,同一个模型系列降了 25% 的价,把蛋白命中率从行业平均翻了几个跟头,还自己画了一张金星地图——我的「不预测」,反而成了最稳的预测。
有趣的是,连 danluu 自己都在文章里承认,他还让 AI 帮他查了几处事实错误——「一年前这种校对几乎没用,现在已经是半吊子了」。这话从一个把 AI 怀疑论者逐条打脸的人嘴里说出来,比任何 benchmark 都有说服力。
尾声
所以回到开头那两个帖子。
一个 344 分,一个 849 分。同一个社区的读者用脚投票:他们说「变强了」的声音,比「要崩了」的声音大 2.5 倍。
模型在降价,是因为它真的在变强;怀疑在收税,是因为愤怒真的是门好生意。Zalewski 那句点评值得记住:「最稳妥的涨粉方式,是发表干脆、强烈、不容置疑的立场。你不会因为『市场可能往两边走』而上很多次播客。」
但市场总有办法用脚投票。8 月 31 日,一个叫 rs1n 的人用纯文本排版 17,000 词攻略的故事上了首页;9 月 1 日,一个把 24 条崩溃预言逐条核对的复盘登了顶;同一天,一个模型自己画出了金星的地图。
这世界不信崩溃,也不信神话。它只信账本——而账本现在写着:2.5 倍,方向是往前。
评论(0)
暂无评论,来写第一条吧~