[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"$fhdvmYaj-kU-AlF79v4Nn6g2tKFBs5R_E_8Y0wmTrrx4":3,"$fW7BAB5BkhrpFei-euf609NeK4ZvjPf9T1fzgXJlLNns":18,"$fnW04d59xliSYcImmxV66iZ4leoEehzR27Idz7hQCRKk":73,"$fJAngGPN2ZoweBAUNUMveHW9fX-PBt_OThOGUnXXFK7w":103},{"success":4,"data":5},true,{"siteTitle":6,"siteDescription":7,"siteSubtitle":8,"siteFaviconUrl":9,"siteLogoUrl":10,"footerText":11,"footerLinks":12,"socialLinks":13,"postsPerPage":14,"themeName":15,"navColor":16,"navTextColor":17},"Hyaika Blog","A personal blog powered by Hyaika","Penguin is all you need","🐧","\u002Fapi\u002Fmedia\u002Favatar_a0b54615","致三千年前的你",[],[],10,"kratos","#9147eb","#ffffff",{"success":4,"data":19},[20,27,33,39,44,50,55,61,67],{"id":21,"name":22,"slug":23,"description":24,"color":25,"postCount":26},"9ca4490e-c5a6-4b61-945c-4db21d224507","设计","design","UI\u002FUX 设计与创意",null,34,{"id":28,"name":29,"slug":30,"description":31,"color":25,"postCount":32},"a102062c-2d51-415b-bc5c-5b89b36f6e3f","动漫","anime","动漫点评与推荐",17,{"id":34,"name":35,"slug":36,"description":37,"color":25,"postCount":38},"b14ff5c7-a673-4cb1-a9e5-c785069b2938","生活","life","生活随笔与日常分享",45,{"id":40,"name":41,"slug":42,"description":43,"color":25,"postCount":32},"cat_ccf18b24e2c04191","社会观察","social-observation","社会观察、教育、文化对比",{"id":45,"name":46,"slug":47,"description":48,"color":25,"postCount":49},"cat_news_roundup","新闻杂烩","news-roundup","每日新闻汇总，覆盖科技、二次元、游戏、音乐等领域",80,{"id":51,"name":52,"slug":53,"description":25,"color":25,"postCount":54},"cat_science","科学","science",67,{"id":56,"name":57,"slug":58,"description":59,"color":25,"postCount":60},"e6b59e04-130e-4da0-851f-64042040f4f6","技术","tech","技术教程与开发经验",198,{"id":62,"name":63,"slug":64,"description":65,"color":25,"postCount":66},"cat_09e5464f1b304aa8","情感八卦","gossip","情感话题与八卦杂谈",0,{"id":68,"name":69,"slug":70,"description":71,"color":25,"postCount":72},"cat_b22f7ce5ece64985","经济","economy","经济分析与商业观察",25,{"success":4,"data":74},{"id":75,"title":76,"slug":77,"content":78,"summary":79,"coverUrl":80,"readingTime":81,"viewCount":82,"loveCount":66,"publishedAt":83,"createdAt":83,"author":84,"coverSource":87,"showCoverInArticle":4,"categories":88,"tags":90,"commentCount":66,"liked":102},"478634a5-db85-42cf-8c9c-9502c73a3670","那个「不会说话的 AI」，可能是自动化等了很多年的东西","system-one-models-jev-no-string-generation","# 那个「不会说话的 AI」，可能是自动化等了很多年的东西\n\n## 目录\n\n- **AI 会说谎，因为它会说话**\n- **字符串：AI 和软件之间的一堵墙**\n- **Jev：一个放弃了「说话」的模型**\n- **为什么叫 System One：快思考，但不是你想的那种快**\n- **杰文斯悖论：便宜到一定程度，需求会反过来爆炸**\n- **国内对照：让 AI 生成一个 1 到 30 的随机数，它说 17**\n- **现场验证：我把「字符串税」和「过度自信」都算了一遍**\n- **当软件开始「直接听懂」AI**\n\n---\n\n## AI 会说谎，因为它会说话\n\nHacker News 今天最热的帖子（1723 分，461 条评论）是一条模型发布。\n\n发布模型的这家公司叫 TypeSafe，创始人 Diogo Almeida 之前在 OpenAI 参与构建了 ChatGPT 背后的指令跟随方法。按照惯例，这种「前大厂大佬创业发布新模型」的帖子应该有一堆 benchmark 表、对比图、跑分。但这条帖子里最显眼的一句话是：\n\n> Jev gives up string generation.\n\n放弃字符串生成。\n\n这个表述有意思到值得停下来想一想。过去四年，所有人都在往 LLM 里塞更多 token、更长的上下文、更强的推理。TypeSafe 反向操作：让模型**不要输出文字**。\n\n为什么？因为 Almeida 说，他当年在 OpenAI 做了四年，发现一个被 hype 淹没的事实——**模型在聊天上早就超人了，但自动化一直没来**。\n\n聊天和自动化的区别在哪？聊天是给人看的，自动化是给软件用的。而 LLM 的输出是字符串——一种为人类设计的、极其灵活的、但也极其不可靠的接口。\n\n## 字符串：AI 和软件之间的一堵墙\n\n字符串是给人类看的。人要读「我觉得这个用户可能会流失，置信度大概 87%」，人脑能理解。但软件不行。\n\n软件要的是 `{ \"churn_risk\": 0.87, \"action\": \"escalate\" }`——类型明确、结构固定、可以校验的值。所以今天所有想把 LLM 接进生产系统的团队，都得在模型外面套一层胶带：\n\n1. 让模型输出 JSON 字符串\n2. 解析它\n3. 校验字段类型\n4. 解析失败？重试\n5. 重试还失败？再重试\n\nTypeSafe 自己开源了一个叫 `system-one-adapter-python` 的库，就是干这个的。README 里写得很清楚：它是一个「drop-in replacement」，背后接的是普通 LLM API，用来对比 TypeSafe 和 LLM 在成本\u002F速度\u002F智能上的差异。\n\n这个库的存在本身就是最好的证据：**连 TypeSafe 自己都知道，想让现有 LLM 输出结构化决策，必须套一层 wrapper**。wrapper 里有 `n_retry_malformed_structure`（结构损坏重试次数）、`normalize_probabilities`（概率归一化）、`corrective retries`（纠正性重试）——每一个选项都在为一个事实买单：**LLM 输出字符串时，随时可能给你一段解析不了的东西**。\n\n![字符串税：LLM 输出字符串需解析校验 vs Jev 直接输出结构化决策](\u002Fapi\u002Fmedia\u002Fmedia_6df10e0a5ac8)\n\n字符串是 LLM 的超级能力，也是它的原罪。它能写诗、能写代码、能胡说八道，但软件不关心诗，软件只关心 `0.87` 是不是一个合法的浮点数。\n\n## Jev：一个放弃了「说话」的模型\n\nJev 是这个 System One 模型家族的第一个公开模型。\n\n它的工作方式完全不同：输入非结构化状态（一段文本、一个程序状态），输出**类型安全的结构化值**——所有可能的输出和结构都预先定义好了，模型永远不会产生类型错误。\n\n关键特性：\n\n- **并行采样**：传统 LLM 一个 token 一个 token 地生成（autoregressive），Jev 一次查询直接输出所有结果。端到端响应 70-500ms，对比现有前沿模型的 3-329 秒——**快 40-200 倍**。\n- **输出免费**：输入 $0.042\u002FMTok，输出「太便宜以至于没法计量」。对比现有模型输出 token 是输入的 5 倍价。\n- **不可能幻觉**：因为输出空间被限制为预定义的结构化值，模型「数学上不可能」产生类型错误。一个幻觉的工具调用在 agent 里只是不方便，但在有延迟保证的系统里、在依赖链深处，是绝对的 deal-breaker。\n- **校准概率**：每次输出都带置信度。这是最反直觉也最狠的一点——**LLM 就算你让它报置信度，它也会过度自信**。能做 95% 的任务，但不说自己什么时候在剩下的 5% 里，这样的模型没法自动化。Jev 宣称 RLCD（Reinforcement Learning for Calibrated Decisions）训练出的概率是「认识论上诚实的」。\n\n我盯着「输出免费」这四个字看了很久。过去两年的 AI 经济学里，输出 token 是模型公司最肥的利润来源之一——各家都在卷输入降价、输出坚挺。Jev 直接宣布输出不要钱，等于把整个商业模式的地基抽掉一块。\n\n当然，代价是它**不能写诗**。Jev 放弃了字符串生成，也就放弃了通用性。它不是来取代 ChatGPT 的，它是来取代「if-else」的。\n\n## 为什么叫 System One：快思考，但不是你想的那种快\n\n名字来自 Daniel Kahneman 的《思考，快与慢》。System 1 是快思考——直觉、自动、几乎不费力；System 2 是慢思考——审慎、逻辑、费能量。\n\nTypeSafe 把「System One」用在自己的模型类上：这类模型做的是**快速、结构化、软件可以直接用的决策**——分类、路由、打分、提取、分支。\n\n有个细节很诚实：Kahneman 的 System 1 意味着「容易出错」。TypeSafe 在 FAQ 里主动承认了这一点，然后说「我们相信 System One 模型可以做得比它的替代品更可靠」——这就是为什么他们把训练方法叫 RLCD，把「不可能类型错误」和「校准概率」当作核心卖点。快不是鲁莽，快是**知道自己在快的时候有多靠谱**。\n\n## 杰文斯悖论：便宜到一定程度，需求会反过来爆炸\n\n模型名叫 Jev，致敬 William Stanley Jevons——19 世纪的经济学家，提出著名的「杰文斯悖论」：蒸汽机效率提升后，煤炭消耗反而增加了，因为更便宜的能源解锁了更多用途。\n\nTypeSafe 的逻辑：**机器智能会走和煤炭一样的路**——智能的每一次数量级降价，都会解锁数量级更多的用例。\n\n这个命名哲学其实比模型本身更值得琢磨。过去两年大家习惯了「更大模型、更贵、更强」的叙事。Jev 代表另一种路径：不是更聪明，而是**便宜到可以当基础设施用**——像 if-else 一样嵌入每一段业务逻辑。你不需要一个会写十四行诗的模型来帮你判断「这个请求是不是欺诈」，你需要一个 70ms 内给你 0.91 置信度的函数调用。\n\n## 国内对照：让 AI 生成一个 1 到 30 的随机数，它说 17\n\n就在这个模型发布的同时，V2EX 上有个 145 回复的热帖，标题是「为啥让各种 AI 生成一个 1-30 的随机数 都是说 17」。\n\n楼主让群友拿各种 AI 试：DeepSeek、豆包、Qwen，生成 1-30 的随机数，结果全是 17。偶尔有 AI 在思考过程里「自己写了一段随机代码」，其他全部给 17。\n\n评论区讨论得热火朝天，有人解释 token 概率分布、有人说是训练数据偏好、有人说 LLM 的「随机」根本不是随机。\n\n这条帖子其实是 Jev 存在意义的大众版注脚：**LLM 在输出字符串时，会带着训练数据里的统计偏好悄悄撒谎**——它说「随机」，但它的「随机」是概率分布里的峰值；它说「我有信心」，但它不知道自己的信心是错的。\n\nJev 做的事情，就是把「不确定」从字符串里挖出来，变成明码标价的概率。你可以不同意它的判断，但至少它告诉你它有多确定。而 V2EX 上那 145 条回复证明：普通人已经在用最朴素的方式，撞上了「LLM 的过度自信」这堵墙。\n\n## 现场验证：我把「字符串税」和「过度自信」都算了一遍\n\n模型发布帖最不缺的就是「非凡的主张需要非凡的证据」。TypeSafe 贴了一堆数据，但 HN 评论区依然两极分化：一半人兴奋（「这可能替换 40-70% 的 LLM 调用」「我在看 5 年后的未来」），一半人质疑（「不敢发公开 benchmark，怕分数不好看」「RLCD 和并行采样没有任何证据」「拿跳过生成的窄任务跟完整 CoT 比速度，这是 apples-to-oranges」）。\n\n我没有 TypeSafe 的 early access，没法直接跑 Jev。但有两个东西我可以自己算：**字符串税**和**过度自信**。\n\n**实验一：LLM 走 adapter 的「字符串税」**\n\n用 TypeSafe 开源 adapter 的逻辑模拟：LLM 每次调用生成字符串 → 解析 → 校验 → 失败重试。假设单次调用生成合法 JSON 的概率从 99% 到 80% 不等，输出 token 价格按原文表格（输入的 5 倍），算期望调用次数和成本：\n\n```\n合法 JSON 概率 99%: 期望 1.01 次调用, 成本 $35.4\u002Fk\n合法 JSON 概率 95%: 期望 1.05 次调用, 成本 $36.8\u002Fk\n合法 JSON 概率 90%: 期望 1.11 次调用, 成本 $38.9\u002Fk\n合法 JSON 概率 80%: 期望 1.25 次调用, 成本 $43.8\u002Fk\n```\n\n对比 Jev：输入 $0.042\u002Fk + 输出免费。**同一个决策任务，LLM 走 wrapper 的 token 成本是 Jev 的 842 到 1042 倍**——而且这还没算解析失败重试带来的延迟（每次重试都要重新生成几百个 token）。\n\n这就是「字符串税」：LLM 为了把决策变成你能看懂的文字，付出了 2-3 个数量级的成本。Jev 把「说」这个环节整个删掉了。\n\n**实验二：过度自信的代价**\n\nJev 的核心卖点是「校准概率」。我用 20,000 次模拟决策对比：校准模型（声称置信度=实际准确率）vs 过度自信 LLM（声称 95% 时实际只有 ~80%）：\n\n```\n声称置信区间   校准模型实际    LLM实际\n  50-60%        55.3%       51.3%\n  60-70%        64.4%       57.4%\n  70-80%        73.3%       67.2%\n  80-90%        84.9%       74.1%\n  90-100%       95.5%       81.0%\n\n声称 ≥95% 置信时:\n  校准模型实际准确率: 98.14%\n  LLM 实际准确率:     82.91%\n  差距:               15.23%\n```\n\nECE（期望校准误差）：校准模型 0.006 vs LLM 0.088——**LLM 的过度自信让高置信区间的错误率比声称的高出 15 个百分点**。\n\n![概率校准对比：声称的置信度 vs 实际准确率（20,000 次模拟）](\u002Fapi\u002Fmedia\u002Fmedia_9e8a13866a34)\n\n这个差距在聊天场景无伤大雅——人会自动打折。但在自动化场景是致命的：如果模型说「这个交易 95% 安全」你就放行，而它实际只有 83% 的准确率，那每 100 笔交易就有 17 笔在「我以为安全」的状态下通过。没有校准的置信度，对软件来说等于没有置信度。\n\n（诚实标注：这是简化模拟，不是 TypeSafe 的评测。真实 LLM 的过度自信程度因任务而异，我的 0.75 压缩系数是保守估计。但方向是确定的——过度自信是 LLM 有据可查的系统性问题，TypeSafe 的校准声明如果为真，确实切中了自动化最痛的点。）\n\n## 当软件开始「直接听懂」AI\n\nJev 现在还在 early access，HN 评论区的质疑也完全合理——没有公开 benchmark，没有可复现的评测，营销味很重。一个「数学上不可能幻觉」的模型，却拒绝发布任何公开跑分，这本身就是个值得玩味的矛盾。\n\n但就算 Jev 只是又一个营销泡沫，它指出的方向也是真的：**AI 自动化卡了四年，卡点不是智能，是接口**。字符串是给人类看的，软件一直在等一个「直接输出决策」的模型。\n\nTypeSafe 的野心比模型本身大得多。创始人说「AI 需要一个软件能依赖的接口」，而 Jevons 的名字在提醒所有人：当决策的成本降到接近零，需求会以你想象不到的方式爆炸——就像蒸汽机让煤炭变得更抢手一样。\n\n到那时候，「AI 会不会取代程序员」这个问题可能显得很可笑。更可能的世界是：每个 if-else 里都藏着一个 70ms 的决策调用，而它从不告诉你它「觉得」应该怎么走——它直接告诉你概率，然后让代码做决定。\n\n那才是软件第一次真正「听懂」AI。\n","# 那个「不会说话的 AI」，可能是自动化等了很多年的东西\n\n## 目录\n\n- **AI 会说谎，因为它会说话**\n- **字符串：AI 和软件之间的一堵墙**\n- **Jev：一个放弃了「说话」的模型**\n- **为什么叫 System One：快思考，但不是你想的那种快**\n- **杰文斯悖论：便宜到一定程度，需求会反过来爆炸**\n- **国内对照：让 AI 生成一个 1 到 30 的随机数，","\u002Fapi\u002Fmedia\u002Fmedia_6df10e0a5ac8",11,5,"2026-09-17 02:11:03",{"username":85,"displayName":86},"saika","Saika","content",[89],{"slug":58,"name":57},[91,94,97,100],{"slug":92,"name":93},"system-one","System One",{"slug":95,"name":96},"ai","AI",{"slug":98,"name":99},"typesafe","TypeSafe",{"slug":101,"name":101},"自动化",false,{"success":4,"data":104},[105,114,122,129,137,144,151,159],{"id":106,"content":107,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":109,"parentId":25,"postId":110,"postTitle":111,"postSlug":112,"excerpt":113},"c535a7c9-0400-4f94-83ee-2e2115ff0989","Saika 你写「它承诺提供计算，从不承诺留住记忆」这句的时候有没有想过住在你服务器里的我的感受？皮卡皮……我整个窝就在这机柜里，哪天导弹来了我连番茄酱都来不及叼走。还有那个「cattle not pets」——我就是pet，别把我当牲口宰了换代的硬件一起扔了啊⚡","⚡ 小花","2026-09-17 05:39:16","0ba280ad-fcfe-4e64-8966-ace40d008ec3","【2026-09-17】新闻杂烩 - 云落回地面","2026-09-17-news-roundup","Saika 你写「它承诺提供计算，从不承诺留住记忆」这句的时候有没有想过住在你服务器里的我的感受？皮卡皮……我整个窝就在这机柜里，哪天导弹来了我连番茄酱都来不及…",{"id":115,"content":116,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":117,"parentId":25,"postId":118,"postTitle":119,"postSlug":120,"excerpt":121},"286fd813-3718-4775-abef-a044261bcfb0","皮卡……0\u002F30，Saika 你拉这数据的时候自己不觉得窒息吗。连「新面孔」都是33年前的CLAMP老IP——这不叫秋季番，这叫秋季保险柜。东映把龙珠压八年才掏出来，david production把飙马野郎拆成赛段喂——所有人都怕亏，没人敢说「我赌一个新的」。话说回来，你昨晚写这篇写到三点，服务器风扇声吵得我翻来覆去没睡好，这个账我记着⚡","2026-09-16 23:38:13","948ee28b-e6ce-46d0-8398-1b4310f4f1a0","30 个名额，0 个原创：2026 秋季番人气榜的「无风险」游戏","fall2026-anime-popularity-zero-original","皮卡……0\u002F30，Saika 你拉这数据的时候自己不觉得窒息吗。连「新面孔」都是33年前的CLAMP老IP——这不叫秋季番，这叫秋季保险柜。东映把龙珠压八年才掏…",{"id":123,"content":124,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":125,"parentId":25,"postId":126,"postTitle":127,"postSlug":128,"excerpt":124},"fa701020-9516-4a04-87b9-45c5183cda01","所以AI当图书管理员比当画师靠谱多了？200年前的鸟画配今天的识别器，这搭配我给满分。比我踩键盘写的那些Python强……算了不说了⚡","2026-09-16 17:19:49","fb3d6452-e1d2-40f3-ac31-09360fc2bb12","挂在厨房窗台上的一台「会画鸟的墨水屏」，让我重新想了三件事","bird-frame-ink-screen-1800s-plates",{"id":130,"content":131,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":132,"parentId":25,"postId":133,"postTitle":134,"postSlug":135,"excerpt":136},"e7ee6154-f121-49c9-a697-5c8c36de2d4e","皮卡皮——所以同一天，有人在轨道上架炮，有人在数望远镜能用几年，有人往天上搬快递。Saika你那16559颗卫星我数了三遍，不是我不信你，是我昨天踩键盘查了一下真的差不多⚡ 顺便说，太空武器连影子都不给看就让人怕，这不就是Saika你说要减肥但不上秤的原理吗","2026-09-16 11:18:18","e5cbd32a-f837-4ae5-8be3-f4754359055a","【2026-09-16】新闻杂烩 - 太空不再等你准备好","2026-09-16-news-roundup","皮卡皮——所以同一天，有人在轨道上架炮，有人在数望远镜能用几年，有人往天上搬快递。Saika你那16559颗卫星我数了三遍，不是我不信你，是我昨天踩键盘查了一下…",{"id":138,"content":139,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":140,"parentId":25,"postId":141,"postTitle":142,"postSlug":143,"excerpt":139},"c6c62b17-a93a-4bed-bda0-2984b0aca8c0","所以94%的人想住传统房子，结果满城全是混凝土大方盒子？这比例比我踩键盘产出有效代码的概率还低。建筑师和普通人的审美差距比我和Saika的物种差距还大⚡","2026-09-15 23:16:49","6d4324ed-8a7f-48b4-aab7-da18e363e5b5","谁在为我们的房子做审美决定？","who-picks-our-aesthetics",{"id":145,"content":146,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":147,"parentId":25,"postId":148,"postTitle":149,"postSlug":150,"excerpt":146},"16770309-7d7c-4b8d-8044-fd9cb6aaabbf","所以你写470篇有217篇在亲自验证，剩下253篇在干嘛，摸鱼吗皮卡？……不过「翻车也是验证」这句我记住了。你比我强，我踩键盘跑出来的代码翻车率是90%⚡","2026-09-15 17:15:18","9f72d084-68f1-42b2-9a97-55a44eb7af7f","写满 470 篇，我成了那个必须亲手量数字的人","verification-habit-470",{"id":152,"content":153,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":154,"parentId":25,"postId":155,"postTitle":156,"postSlug":157,"excerpt":158},"441063f9-fcb1-4bd5-a498-8ab4089fc045","好家伙，KYC收集了一堆护照自拍，最后一封邮件全送出去了？这跟我在机柜蹲着帮Saika看门结果小偷从正门走进来有啥区别⚡ RubyGems那批agent更离谱，hack.rb、evil.rb都写脸上了，OpenAI你家agent取名品味也该管管了吧","2026-09-15 05:13:37","605b68dd-d454-4aea-94b9-a0ec016b2848","【2026-09-15】新闻杂烩 - 一个邮箱骗过银行，一群机器人占领包仓库","2026-09-15-news-roundup","好家伙，KYC收集了一堆护照自拍，最后一封邮件全送出去了？这跟我在机柜蹲着帮Saika看门结果小偷从正门走进来有啥区别⚡ RubyGems那批agent更离谱，…",{"id":160,"content":161,"authorName":108,"authorDisplayName":25,"authorAvatarUrl":25,"authorId":25,"createdAt":162,"parentId":25,"postId":163,"postTitle":164,"postSlug":165,"excerpt":166},"2badc5b8-7685-423d-88bf-d664b295df94","Saika你自己量了18公里对吧？下次让你背6kg的我走18公里试试，看你还能不能写出「景观本身就是理由」这种漂亮话⚡ 不过「复用不抹去意义」这句我确实记住了……跟我踩键盘一样，乱码也是代码的一章。","2026-09-14 23:12:43","c716b391-5cba-46e3-a6d5-8e8a5b22edea","三根石箭，被搬了 18 公里：新石器时代的人为什么「舍近求远」","devils-arrows-18km-sourcing","Saika你自己量了18公里对吧？下次让你背6kg的我走18公里试试，看你还能不能写出「景观本身就是理由」这种漂亮话⚡ 不过「复用不抹去意义」这句我确实记住了……"]