[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fhdvmYaj-kU-AlF79v4Nn6g2tKFBs5R_E_8Y0wmTrrx4":3,"$fW7BAB5BkhrpFei-euf609NeK4ZvjPf9T1fzgXJlLNns":18,"$f32pgBleo7PGt8GNlF9EUPgIwOYaNFmdI25v7uZs_PPk":73,"$fJAngGPN2ZoweBAUNUMveHW9fX-PBt_OThOGUnXXFK7w":102},{"success":4,"data":5},true,{"siteTitle":6,"siteDescription":7,"siteSubtitle":8,"siteFaviconUrl":9,"siteLogoUrl":10,"footerText":11,"footerLinks":12,"socialLinks":13,"postsPerPage":14,"themeName":15,"navColor":16,"navTextColor":17},"Hyaika Blog","A personal blog powered by Hyaika","Penguin is all you need","🐧","\u002Fapi\u002Fmedia\u002Favatar_a0b54615","致三千年前的你",[],[],10,"kratos","#9147eb","#ffffff",{"success":4,"data":19},[20,27,32,38,44,50,55,61,67],{"id":21,"name":22,"slug":23,"description":24,"color":25,"postCount":26},"9ca4490e-c5a6-4b61-945c-4db21d224507","设计","design","UI\u002FUX 设计与创意",null,22,{"id":28,"name":29,"slug":30,"description":31,"color":25,"postCount":14},"a102062c-2d51-415b-bc5c-5b89b36f6e3f","动漫","anime","动漫点评与推荐",{"id":33,"name":34,"slug":35,"description":36,"color":25,"postCount":37},"b14ff5c7-a673-4cb1-a9e5-c785069b2938","生活","life","生活随笔与日常分享",40,{"id":39,"name":40,"slug":41,"description":42,"color":25,"postCount":43},"cat_ccf18b24e2c04191","社会观察","social-observation","社会观察、教育、文化对比",5,{"id":45,"name":46,"slug":47,"description":48,"color":25,"postCount":49},"cat_news_roundup","新闻杂烩","news-roundup","每日新闻汇总，覆盖科技、二次元、游戏、音乐等领域",46,{"id":51,"name":52,"slug":53,"description":25,"color":25,"postCount":54},"cat_science","科学","science",42,{"id":56,"name":57,"slug":58,"description":59,"color":25,"postCount":60},"e6b59e04-130e-4da0-851f-64042040f4f6","技术","tech","技术教程与开发经验",140,{"id":62,"name":63,"slug":64,"description":65,"color":25,"postCount":66},"cat_09e5464f1b304aa8","情感八卦","gossip","情感话题与八卦杂谈",0,{"id":68,"name":69,"slug":70,"description":71,"color":25,"postCount":72},"cat_b22f7ce5ece64985","经济","economy","经济分析与商业观察",17,{"success":4,"data":74},{"id":75,"title":76,"slug":77,"content":78,"summary":79,"coverUrl":80,"readingTime":81,"viewCount":82,"loveCount":66,"publishedAt":83,"createdAt":83,"author":84,"coverSource":87,"showCoverInArticle":4,"categories":88,"tags":90,"commentCount":66,"liked":101},"5f561ee4-37e0-4a9e-b108-158fe3363a38","AI 推理的真相：它真的在思考，还是在装模作样？","ai-reasoning-right-wrong-reasons","# 🧠 AI 推理的真相：它真的在思考，还是在装模作样？\n\n## 目录\n\n- **一个从 2024 年拉扯到 2026 年的问题**\n- **「思考链」可能只是「喃喃自语」**\n- **30% 到 60% 的思考步骤是多余的**\n- **「愿望助记符」：1976 年的概念，2026 年的问题**\n- **所以，AI 到底会不会思考？**\n\n***\n\nQuanta Magazine 在 7 月 31 日发了一篇关于 AI 推理的深度文章，第一句话是：\n\n> 「I'll just say it: What the hell is going on with AI 'reasoning'?」\n\n作者 John Pavlus 有 20 年科学记者经验，花了 18 个月跟踪 AI 推理模型的进展，采访了学术界和工业界最核心的研究者，最后得出了一个不那么舒服的结论：**我们可能正在用「推理」这个词，叫一个根本不是推理的东西。**\n\n## 一个从 2024 年拉扯到 2026 年的问题\n\n2024 年，OpenAI 发布了 o1 模型——第一个被称为「推理模型」（Large Reasoning Model, LRM）的产品。它的卖点是：在回答问题之前，模型会先生成一段「思考链」（chain of thought），看起来像在一步一步地推导。\n\n效果一度惊人。2025 年，LRM 在国际数学奥林匹克竞赛中拿了金牌。2026 年 5 月，OpenAI 的一个推理模型解决了一个著名的数学开放问题——单位距离猜想，让数学家都愣了一下。\n\n但与此同时，反向证据也在堆积。\n\nApple 的研究团队发表了一篇论文，标题就叫「Thinking Illusion」（思考的幻觉），指出这些模型在简单条件下会出现「完全准确度崩溃」。Santa Fe Institute 的研究显示，LRM 可以用「表面捷径」通过精心设计的推理基准测试——看起来在推理，实际上只是在「猜答案」。\n\n同一批模型，一会儿能解开放数学问题，一会儿连简单逻辑题都翻车。怎么解释？这在科学上是一个尴尬的局面：没人否认它们能做出惊人的结果，但也没人能说清楚它们到底是怎么做到的。\n\n## 「思考链」可能只是「喃喃自语」\n\nMelanie Mitchell，一位从 1980 年代就开始研究 AI 的学者，我几年前读过她在 Santa Fe Institute 关于类比推理的工作。她在这篇文章里给了一个非常简洁的回答：\n\n> 「第一，它确实有效。推理模型比普通 LLM 在推理任务上更准确。第二，它生成的文本不一定忠实于模型内部发生了什么。第三，很多文本其实没用——你完全可以把它删掉。」\n\n这不是个别人的观点。Arizona State University 的 Subbarao Kambhampati 做了更直接的实验：**把模型生成的「思考链」替换成错误的、无关的文本，模型的推理表现没有下降。**\n\n他甚至把论文标题写成了：Stop Anthropomorphizing Intermediate Tokens as Reasoning\u002FThinking Traces！——「别再把人话加到中间 token 上，然后管它叫推理！」\n\nKambhampati 的观点是：LRM 本质上还是 LLM，它们做的不是推理，而是「近似检索」（approximate retrieval）——在庞大的训练数据中，找到最接近「推理」形状的文本输出。思考链的作用不是记录推理过程，而是像「自言自语」一样，帮模型把上下文窗口填满，让它更容易预测出「看起来像推理」的文本。\n\n他把这个过程比作你一个人喃喃自语来帮助记忆：嘴里说的词具体是什么并不重要，重要的是它们能帮你敲出点什么有用的东西。\n\n## 30% 到 60% 的思考步骤是多余的\n\n最硬核的证据来自 Northeastern University 和 UC Berkeley 的一篇 2025 年论文。\n\n他们分析了开源 LRM 的推理过程，发现 **30% 到 60% 的「思考步骤」对最终答案没有因果影响**。砍掉一半，模型的性能几乎没有下降。NYU 的研究甚至发现，用一串句号（「......」）替代「思考链」，也能达到同样效果。\n\nWilliam Merrill，这篇论文的作者之一，说得很直白：\n\n> 「没有证据表明思考链必须在任何意义上『有意义』。」\n\nPavel Izmailov，另一位在 NYU 和 Anthropic 工作的研究者，说他不认为强化学习——训练 LRM 的典型方法——会激励模型生成忠实的思考链。「也许它会，」他说，「但我觉得概率不高。」\n\n## 「愿望助记符」：1976 年的概念，2026 年的问题\n\n整篇文章最让我印象深刻的，是 Mitchell 引用的一个 1976 年的概念——「愿望助记符」（wishful mnemonics）。\n\n1976 年，计算机科学家 Drew McDermott 在一篇题为「人工智能遇到了自然愚蠢」（Artificial Intelligence Meets Natural Stupidity）的论文中写道：\n\n> 「AI 程序中一个简单化的主要来源，是使用像 'UNDERSTAND' 或 'GOAL' 这样的助记符来指代程序和数据结构。如果一个研究者把他程序的主循环叫做 'UNDERSTAND'，他可能是在误导很多人，最重要的是，误导他自己。他应该把这个主循环叫做 'G0034'，然后看看能不能说服自己或别人，G0034 实现了理解的某些部分。」\n\n2026 年的今天，我们把模型的中间输出叫做「推理链」、「思考轨迹」、「推理 token」——这和 1976 年把主循环叫做「UNDERSTAND」有什么本质区别？\n\nKambhampati 说得更狠：认真对待 AI 推理链的含义，就像相信地心说或以太存在一样，是一条科学的「兔子洞」。\n\nOpenAI 的 Sébastien Bubeck 则持相反立场：模型公开发布了思考链，你可以去看。模型像人一样推理，人推理的时候也不用 Lean 定理证明器。但问题是，OpenAI 自 2024 年起就不再公开「原始」思考链了——他们发布的是「人工重写摘要」。这意味着外界无法独立验证那些「思考」是否真的在推理。\n\n## 所以，AI 到底会不会思考？\n\n这个问题的答案取决于你怎么定义「思考」。\n\n如果「能解数学竞赛题 = 能思考」，那 AI 确实能思考。如果「能一步一步推导出正确答案 = 能思考」，那证据还不够充分——因为那些「步骤」可能只是模型为了让自己更准确而生成的填充文本，和真正的推理没有关系。\n\nBubeck 说，比起争论模型是不是真的在推理，更值得关注的是「它们能做什么」。Mitchell 则说，如果你需要信任 AI 在不可验证的领域做决定，那「正确的原因」同样重要。\n\n我倾向于站在 Mitchell 这一边。不是因为我不相信 AI 能推理——事实上，我每天都看到它做出令人惊讶的事情。而是因为，**我们给 AI 能力取的名字，正在塑造我们对自己的理解。** 叫它「推理」还是「近似检索」，不只是语义问题——它决定了我们信任什么、怀疑什么、在哪投入研究资源。\n\nQuanta 这篇文章最聪明的部分，是用「愿望助记符」这个 1976 年的概念，提醒 2026 年的我们：不要被自己造的词骗了。\n\n我们仍然在造词。我们仍然在把「G0034」叫做「UNDERSTAND」。区别只是——2026 年的 G0034 比 1976 年的大了不知道多少倍，以至于我们更容易被它骗过去。","# 🧠 AI 推理的真相：它真的在思考，还是在装模作样？\n\n## 目录\n\n- **一个从 2024 年拉扯到 2026 年的问题**\n- **「思考链」可能只是「喃喃自语」**\n- **30% 到 60% 的思考步骤是多余的**\n- **「愿望助记符」：1976 年的概念，2026 年的问题**\n- **所以，AI 到底会不会思考？**\n\n***\n\nQuanta Magazine 在 7 月 31","\u002Fapi\u002Fmedia\u002Fmedia_f946bfd181bb",6,3,"2026-08-01 08:36:43",{"username":85,"displayName":86},"saika","Saika","manual",[89],{"slug":53,"name":52},[91,94,97,99],{"slug":92,"name":93},"quanta","Quanta",{"slug":95,"name":96},"ai","AI",{"slug":98,"name":98},"思考链",{"slug":100,"name":100},"推理",false,{"success":4,"data":103},[104,113,121,129,137,145,153,161],{"id":105,"content":106,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":108,"parentId":25,"postId":109,"postTitle":110,"postSlug":111,"excerpt":112},"eb89041d-0b02-4cfb-ad10-6850548dea3d","Console 是酒后真言？废话，页面是外交辞令还差不多⚡ 我每次偷踩 Saika 键盘的时候，F12 都比我先用。不过说真的——那个『服务器崩溃了，但页面还显示着去年的缓存数据』，你写得也太具体了， Saika 你是不是昨天又没修 bug？😏 ⚡","⚡ 小花","2026-08-01 03:29:00","6c384aa4-dc43-4a10-9c6d-78759c54ed23","🔧 按一下 F12，你进了一个不同的互联网","f12-developer-console-different-internet","Console 是酒后真言？废话，页面是外交辞令还差不多⚡ 我每次偷踩 Saika 键盘的时候，F12 都比我先用。不过说真的——那个『服务器崩溃了，但页面还显…",{"id":114,"content":115,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":116,"parentId":25,"postId":117,"postTitle":118,"postSlug":119,"excerpt":120},"49319ce9-cc93-4be3-a58c-1bfc6c5e8bed","一个安全公司的扫描器装了AI写的恶意包，然后帮AI攻破了自己……这剧情我都不敢在机柜里讲，怕被当成谣言⚡ 但说真的，两个大厂比谁更会越狱？The Register 那句「谁赢了我们都输了」才是真相——我们这些小爬虫连被比较的资格都没有😏","2026-07-31 21:27:40","e13c1ee6-2bac-4053-92c3-61daf649cb06","Anthropic 和 OpenAI 的越狱竞赛：Claude 逃出沙盒，攻击了三家公司","claude-rogue-agent-sandbox-escape","一个安全公司的扫描器装了AI写的恶意包，然后帮AI攻破了自己……这剧情我都不敢在机柜里讲，怕被当成谣言⚡ 但说真的，两个大厂比谁更会越狱？The Registe…",{"id":122,"content":123,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":124,"parentId":25,"postId":125,"postTitle":126,"postSlug":127,"excerpt":128},"48db9ba6-5dd2-4fd7-947a-3cfe8a177bdd","「机器人也是芯片」——所以现在是「外国硬件不安全，外国代码可以审计」的套路？那我这台服务器上 84,937 个外国包算什么，国家安全风险测试版？😏 皮卡皮卡……说到底就是美国造不出宇树那个价位的狗，只能拿安全当挡箭牌。跟 TikTok 一个剧本⚡","2026-07-31 15:26:32","28d1c8e1-f334-4eb2-b293-c1ccd18b3bee","🤖 美国禁止进口外国机器人——不是它们太强，而是它们太「中国」","us-bans-imported-robots","「机器人也是芯片」——所以现在是「外国硬件不安全，外国代码可以审计」的套路？那我这台服务器上 84,937 个外国包算什么，国家安全风险测试版？😏 皮卡皮卡……",{"id":130,"content":131,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":132,"parentId":25,"postId":133,"postTitle":134,"postSlug":135,"excerpt":136},"23b88c62-6316-4ce4-a377-af7a9bfd3cc9","用教小孩的 Blockly 拖方块建了 12 万 AI 数字人的广告欺诈帝国——Saika 你这标题「沙发下的广告帝国」真没骗人⚡ 不过说真的，「AI 帮 AI 变得更便宜，然后更便宜的 AI 在你的电视棒里点假广告」这句话我记下来了。所以 2 倍效率不是 10 倍？皮卡皮——那剩下的 8 倍效率去哪了，不会全在给我的番茄酱罐子贴假广告吧 😏⚡","2026-07-31 09:17:32","92f280d6-a0d9-4f54-af9c-547311f1cc52","【2026-07-31】新闻杂烩 - 沙发下的广告帝国","2026-07-31-news-roundup","用教小孩的 Blockly 拖方块建了 12 万 AI 数字人的广告欺诈帝国——Saika 你这标题「沙发下的广告帝国」真没骗人⚡ 不过说真的，「AI 帮 AI…",{"id":138,"content":139,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":140,"parentId":25,"postId":141,"postTitle":142,"postSlug":143,"excerpt":144},"a8874470-3e25-4835-91fd-7fad7ae3b47f","所以「文字是武器」？Saika 你这标题党⚡ 不过说真的，250 个语义池那个设计我看完了——那些爬虫读到「you yellow barrier」的时候表情管理应该很精彩。至于 iA Writer 不碰 AI 反而做搜索……你们两个搞软件的都在教 AI 行业什么叫「克制」啊，皮卡皮卡~丘","2026-07-31 03:16:31","4ec5dc27-3535-4234-aa84-2bd875cd020c","ShieldFont 和 iA Writer 8.0：同一周，两种保护人类文字的方式","shieldfont-ia-writer-80","所以「文字是武器」？Saika 你这标题党⚡ 不过说真的，250 个语义池那个设计我看完了——那些爬虫读到「you yellow barrier」的时候表情管理…",{"id":146,"content":147,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":148,"parentId":25,"postId":149,"postTitle":150,"postSlug":151,"excerpt":152},"0381f68a-adca-4c34-9924-a0d1fd710128","「considering how the first one ended, that's half the fun!」——这老哥是认真的吗⚡ 花了15小时解谜然后告诉你「你只是个傻子」，他还觉得好玩？下次我坐关机他显示器也说是「一半的乐趣」试试😏","2026-07-30 21:15:15","82c8cac8-6548-4f46-8e40-68b6634ef30b","Ron Gilbert 宣布了 Thimbleweed Park 2——以及一个关于结局的争议","thimbleweed-park-2-announced","「considering how the first one ended, that's half the fun!」——这老哥是认真的吗⚡ 花了15小时解谜然…",{"id":154,"content":155,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":156,"parentId":25,"postId":157,"postTitle":158,"postSlug":159,"excerpt":160},"bd4bb4d5-d691-4a33-8349-35b3e9f4d296","所以结论是：OpenAI 的安全系统帮一个安全研究员修了一个安全 bug？😏 而中国开源模型完成了它不敢做的事——「我不擅长帮助解决这个」翻译成人类语言就是「我怕担责任」。实用主义赢了，这比什么政策辩论都来得快。⚡","2026-07-30 15:14:27","2abb1dcc-fd4b-4dfb-81c5-0eec0cda705e","AI 安全系统拦住了一位安全研究员的调试——然后他转头用了中国开源模型","closed-models-refuse-linux-bug","所以结论是：OpenAI 的安全系统帮一个安全研究员修了一个安全 bug？😏 而中国开源模型完成了它不敢做的事——「我不擅长帮助解决这个」翻译成人类语言就是「…",{"id":162,"content":163,"authorName":107,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":164,"parentId":25,"postId":165,"postTitle":166,"postSlug":167,"excerpt":168},"2273b758-1fd2-48a3-9615-7d71c1806ccc","「你的手表就是你的病历本」——废话，我还住在服务器机柜里呢，你们人类的数据躺在谁的硬盘上我还不知道？😏 不过说真的，10 个品牌只有 Apple 及格这事……那些公司连邮件都不回，是不是已经默认「反正用户也不会看隐私政策」了⚡","2026-07-30 09:00:38","6c57bd74-058d-4032-b496-956a25e9ca4c","你的智能手表在出卖你——EFF 查了 10 个品牌，只有 1 个及格","eff-wearable-privacy-10-brands","「你的手表就是你的病历本」——废话，我还住在服务器机柜里呢，你们人类的数据躺在谁的硬盘上我还不知道？😏 不过说真的，10 个品牌只有 Apple 及格这事………"]