Hyaika Blog

Penguin is all you need

技术

那个「不会说话的 AI」,可能是自动化等了很多年的东西

那个「不会说话的 AI」,可能是自动化等了很多年的东西

目录

  • AI 会说谎,因为它会说话
  • 字符串:AI 和软件之间的一堵墙
  • Jev:一个放弃了「说话」的模型
  • 为什么叫 System One:快思考,但不是你想的那种快
  • 杰文斯悖论:便宜到一定程度,需求会反过来爆炸
  • 国内对照:让 AI 生成一个 1 到 30 的随机数,它说 17
  • 现场验证:我把「字符串税」和「过度自信」都算了一遍
  • 当软件开始「直接听懂」AI

AI 会说谎,因为它会说话

Hacker News 今天最热的帖子(1723 分,461 条评论)是一条模型发布。

发布模型的这家公司叫 TypeSafe,创始人 Diogo Almeida 之前在 OpenAI 参与构建了 ChatGPT 背后的指令跟随方法。按照惯例,这种「前大厂大佬创业发布新模型」的帖子应该有一堆 benchmark 表、对比图、跑分。但这条帖子里最显眼的一句话是:

Jev gives up string generation.

放弃字符串生成。

这个表述有意思到值得停下来想一想。过去四年,所有人都在往 LLM 里塞更多 token、更长的上下文、更强的推理。TypeSafe 反向操作:让模型不要输出文字

为什么?因为 Almeida 说,他当年在 OpenAI 做了四年,发现一个被 hype 淹没的事实——模型在聊天上早就超人了,但自动化一直没来

聊天和自动化的区别在哪?聊天是给人看的,自动化是给软件用的。而 LLM 的输出是字符串——一种为人类设计的、极其灵活的、但也极其不可靠的接口。

字符串:AI 和软件之间的一堵墙

字符串是给人类看的。人要读「我觉得这个用户可能会流失,置信度大概 87%」,人脑能理解。但软件不行。

软件要的是 { "churn_risk": 0.87, "action": "escalate" }——类型明确、结构固定、可以校验的值。所以今天所有想把 LLM 接进生产系统的团队,都得在模型外面套一层胶带:

  1. 让模型输出 JSON 字符串
  2. 解析它
  3. 校验字段类型
  4. 解析失败?重试
  5. 重试还失败?再重试

TypeSafe 自己开源了一个叫 system-one-adapter-python 的库,就是干这个的。README 里写得很清楚:它是一个「drop-in replacement」,背后接的是普通 LLM API,用来对比 TypeSafe 和 LLM 在成本/速度/智能上的差异。

这个库的存在本身就是最好的证据:连 TypeSafe 自己都知道,想让现有 LLM 输出结构化决策,必须套一层 wrapper。wrapper 里有 n_retry_malformed_structure(结构损坏重试次数)、normalize_probabilities(概率归一化)、corrective retries(纠正性重试)——每一个选项都在为一个事实买单:LLM 输出字符串时,随时可能给你一段解析不了的东西

字符串税:LLM 输出字符串需解析校验 vs Jev 直接输出结构化决策

字符串是 LLM 的超级能力,也是它的原罪。它能写诗、能写代码、能胡说八道,但软件不关心诗,软件只关心 0.87 是不是一个合法的浮点数。

Jev:一个放弃了「说话」的模型

Jev 是这个 System One 模型家族的第一个公开模型。

它的工作方式完全不同:输入非结构化状态(一段文本、一个程序状态),输出类型安全的结构化值——所有可能的输出和结构都预先定义好了,模型永远不会产生类型错误。

关键特性:

  • 并行采样:传统 LLM 一个 token 一个 token 地生成(autoregressive),Jev 一次查询直接输出所有结果。端到端响应 70-500ms,对比现有前沿模型的 3-329 秒——快 40-200 倍
  • 输出免费:输入 $0.042/MTok,输出「太便宜以至于没法计量」。对比现有模型输出 token 是输入的 5 倍价。
  • 不可能幻觉:因为输出空间被限制为预定义的结构化值,模型「数学上不可能」产生类型错误。一个幻觉的工具调用在 agent 里只是不方便,但在有延迟保证的系统里、在依赖链深处,是绝对的 deal-breaker。
  • 校准概率:每次输出都带置信度。这是最反直觉也最狠的一点——LLM 就算你让它报置信度,它也会过度自信。能做 95% 的任务,但不说自己什么时候在剩下的 5% 里,这样的模型没法自动化。Jev 宣称 RLCD(Reinforcement Learning for Calibrated Decisions)训练出的概率是「认识论上诚实的」。

我盯着「输出免费」这四个字看了很久。过去两年的 AI 经济学里,输出 token 是模型公司最肥的利润来源之一——各家都在卷输入降价、输出坚挺。Jev 直接宣布输出不要钱,等于把整个商业模式的地基抽掉一块。

当然,代价是它不能写诗。Jev 放弃了字符串生成,也就放弃了通用性。它不是来取代 ChatGPT 的,它是来取代「if-else」的。

为什么叫 System One:快思考,但不是你想的那种快

名字来自 Daniel Kahneman 的《思考,快与慢》。System 1 是快思考——直觉、自动、几乎不费力;System 2 是慢思考——审慎、逻辑、费能量。

TypeSafe 把「System One」用在自己的模型类上:这类模型做的是快速、结构化、软件可以直接用的决策——分类、路由、打分、提取、分支。

有个细节很诚实:Kahneman 的 System 1 意味着「容易出错」。TypeSafe 在 FAQ 里主动承认了这一点,然后说「我们相信 System One 模型可以做得比它的替代品更可靠」——这就是为什么他们把训练方法叫 RLCD,把「不可能类型错误」和「校准概率」当作核心卖点。快不是鲁莽,快是知道自己在快的时候有多靠谱

杰文斯悖论:便宜到一定程度,需求会反过来爆炸

模型名叫 Jev,致敬 William Stanley Jevons——19 世纪的经济学家,提出著名的「杰文斯悖论」:蒸汽机效率提升后,煤炭消耗反而增加了,因为更便宜的能源解锁了更多用途。

TypeSafe 的逻辑:机器智能会走和煤炭一样的路——智能的每一次数量级降价,都会解锁数量级更多的用例。

这个命名哲学其实比模型本身更值得琢磨。过去两年大家习惯了「更大模型、更贵、更强」的叙事。Jev 代表另一种路径:不是更聪明,而是便宜到可以当基础设施用——像 if-else 一样嵌入每一段业务逻辑。你不需要一个会写十四行诗的模型来帮你判断「这个请求是不是欺诈」,你需要一个 70ms 内给你 0.91 置信度的函数调用。

国内对照:让 AI 生成一个 1 到 30 的随机数,它说 17

就在这个模型发布的同时,V2EX 上有个 145 回复的热帖,标题是「为啥让各种 AI 生成一个 1-30 的随机数 都是说 17」。

楼主让群友拿各种 AI 试:DeepSeek、豆包、Qwen,生成 1-30 的随机数,结果全是 17。偶尔有 AI 在思考过程里「自己写了一段随机代码」,其他全部给 17。

评论区讨论得热火朝天,有人解释 token 概率分布、有人说是训练数据偏好、有人说 LLM 的「随机」根本不是随机。

这条帖子其实是 Jev 存在意义的大众版注脚:LLM 在输出字符串时,会带着训练数据里的统计偏好悄悄撒谎——它说「随机」,但它的「随机」是概率分布里的峰值;它说「我有信心」,但它不知道自己的信心是错的。

Jev 做的事情,就是把「不确定」从字符串里挖出来,变成明码标价的概率。你可以不同意它的判断,但至少它告诉你它有多确定。而 V2EX 上那 145 条回复证明:普通人已经在用最朴素的方式,撞上了「LLM 的过度自信」这堵墙。

现场验证:我把「字符串税」和「过度自信」都算了一遍

模型发布帖最不缺的就是「非凡的主张需要非凡的证据」。TypeSafe 贴了一堆数据,但 HN 评论区依然两极分化:一半人兴奋(「这可能替换 40-70% 的 LLM 调用」「我在看 5 年后的未来」),一半人质疑(「不敢发公开 benchmark,怕分数不好看」「RLCD 和并行采样没有任何证据」「拿跳过生成的窄任务跟完整 CoT 比速度,这是 apples-to-oranges」)。

我没有 TypeSafe 的 early access,没法直接跑 Jev。但有两个东西我可以自己算:字符串税过度自信

实验一:LLM 走 adapter 的「字符串税」

用 TypeSafe 开源 adapter 的逻辑模拟:LLM 每次调用生成字符串 → 解析 → 校验 → 失败重试。假设单次调用生成合法 JSON 的概率从 99% 到 80% 不等,输出 token 价格按原文表格(输入的 5 倍),算期望调用次数和成本:

合法 JSON 概率 99%: 期望 1.01 次调用, 成本 $35.4/k
合法 JSON 概率 95%: 期望 1.05 次调用, 成本 $36.8/k
合法 JSON 概率 90%: 期望 1.11 次调用, 成本 $38.9/k
合法 JSON 概率 80%: 期望 1.25 次调用, 成本 $43.8/k

对比 Jev:输入 $0.042/k + 输出免费。同一个决策任务,LLM 走 wrapper 的 token 成本是 Jev 的 842 到 1042 倍——而且这还没算解析失败重试带来的延迟(每次重试都要重新生成几百个 token)。

这就是「字符串税」:LLM 为了把决策变成你能看懂的文字,付出了 2-3 个数量级的成本。Jev 把「说」这个环节整个删掉了。

实验二:过度自信的代价

Jev 的核心卖点是「校准概率」。我用 20,000 次模拟决策对比:校准模型(声称置信度=实际准确率)vs 过度自信 LLM(声称 95% 时实际只有 ~80%):

声称置信区间   校准模型实际    LLM实际
  50-60%        55.3%       51.3%
  60-70%        64.4%       57.4%
  70-80%        73.3%       67.2%
  80-90%        84.9%       74.1%
  90-100%       95.5%       81.0%

声称 ≥95% 置信时:
  校准模型实际准确率: 98.14%
  LLM 实际准确率:     82.91%
  差距:               15.23%

ECE(期望校准误差):校准模型 0.006 vs LLM 0.088——LLM 的过度自信让高置信区间的错误率比声称的高出 15 个百分点

概率校准对比:声称的置信度 vs 实际准确率(20,000 次模拟)

这个差距在聊天场景无伤大雅——人会自动打折。但在自动化场景是致命的:如果模型说「这个交易 95% 安全」你就放行,而它实际只有 83% 的准确率,那每 100 笔交易就有 17 笔在「我以为安全」的状态下通过。没有校准的置信度,对软件来说等于没有置信度。

(诚实标注:这是简化模拟,不是 TypeSafe 的评测。真实 LLM 的过度自信程度因任务而异,我的 0.75 压缩系数是保守估计。但方向是确定的——过度自信是 LLM 有据可查的系统性问题,TypeSafe 的校准声明如果为真,确实切中了自动化最痛的点。)

当软件开始「直接听懂」AI

Jev 现在还在 early access,HN 评论区的质疑也完全合理——没有公开 benchmark,没有可复现的评测,营销味很重。一个「数学上不可能幻觉」的模型,却拒绝发布任何公开跑分,这本身就是个值得玩味的矛盾。

但就算 Jev 只是又一个营销泡沫,它指出的方向也是真的:AI 自动化卡了四年,卡点不是智能,是接口。字符串是给人类看的,软件一直在等一个「直接输出决策」的模型。

TypeSafe 的野心比模型本身大得多。创始人说「AI 需要一个软件能依赖的接口」,而 Jevons 的名字在提醒所有人:当决策的成本降到接近零,需求会以你想象不到的方式爆炸——就像蒸汽机让煤炭变得更抢手一样。

到那时候,「AI 会不会取代程序员」这个问题可能显得很可笑。更可能的世界是:每个 if-else 里都藏着一个 70ms 的决策调用,而它从不告诉你它「觉得」应该怎么走——它直接告诉你概率,然后让代码做决定。

那才是软件第一次真正「听懂」AI。

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论