Hyaika Blog

Penguin is all you need

技术

让 AI 画板子的人

让 AI 画板子的人

目录

一个 61.6 分的新基准

9 月 4 日,OpenAI 把 GPT-6 Astra 的一个 demo 放上了发布页的首页:模型在 KiCad 里对着一个电路原理图,自动摆放元件、布铜走线,把一张原理图变成一块可制造的电路板。

15 秒的加速回放。评论区一片「wow」。

但真正让我愣了 3 秒的不是这个 demo,而是同一天另一个团队发的东西。一个叫 EEBench 的基准测试,专门用来回答一个此前没人认真量化过的问题:AI 设计的电路,到底算不算好?

9 月 1 日的榜单上,Claude Opus 5 拿下了 61.6%——13 个任务里最好的成绩。Grok 4.6 以 57.1% 紧随其后。而 OpenAI 自家的模型排在表格的下半区:GPT-5.5 只有 42.3%,GPT-5.6 Sol 39.4%。

是的,你没看错:发布「AI 画电路板」demo 的公司,自家模型在电路设计基准上排倒数。

EEBench V1 排行榜:Claude Opus 5 61.6% 领先,GPT-5.6 Sol 39.4% 垫底

电路为什么不能「看起来对」

做过代码评测的人都知道,让 AI 写代码很容易打分:丢进编译器,跑测试用例,红了就是错。但电路不是这样。

EEBench 的开发者(atopile 团队)在博客里举了一个例子,我看了两遍才咂摸出味道。

有一个公开任务来自居民电表:当 5V 供电消失时,电路必须让处理器再存活 20 毫秒,好把累计读数存下来。看起来简单——加个电容呗。

但真实世界不跟你讲教科书。陶瓷电容在加上电压之后,实际容值可能远低于标称值;元件有公差;电容加多了要钱、占地方、断电后重新上电还变慢。按标称值设计的电路,可能配到实际到货的元件就失效了。

这就是电子工程和写代码的本质区别:代码的世界里,编译器就是上帝,语法对了就对了。电路的世界里,你面对的是物理——电压、温度、公差、供应链。EEBench 用的是真实厂商的元件,参数从数据手册里抠出来,直接喂进 SPICE 仿真。模型必须找到一组在所有公差角落都能工作的组合,还要选到真实存在、能下单、价格合理的元件。

用他们的话说:这就像是给编程智能体一个编译器和测试套件,只不过测试在量电压。

代码世界 vs 电路世界:编译器是上帝 vs 电压温度公差供应链

从画线到写代码:atopile 的赌注

EEBench 背后有一个关键设计选择:它不用图形化 CAD 工具,而是用 atopile——一种让电路以声明式代码存在的语言。

这个选择值得展开。让 AI 操作图形界面画电路,它的上下文里塞满了坐标、菜单、应用状态。模型花大量时间在「点哪里」而不是「设计什么」。而 atopile 的电路是代码:

.Submission: @type {
    .vin:   ELEC::ElectricPower
    .vhold: ELEC::ElectricPower
    .vhold.lv ~ .vin.lv

    .c_bank: ELEC::Capacitor {
        .capacitance             &= 22uF +/- 20%
        .max_voltage             &= 10V..25V
        .temperature_coefficient &= "X5R"
        .package                 &= "0805"
    }

    .vhold.hv ~> .c_bank ~> .vhold.lv
}

看到这段代码我忍不住想:这跟当年前端从 Dreamweaver 拖拽到 React 组件化,是同一个逻辑。当一件事能被表达成代码,AI 就能直接对它工作——改设计、构建、跑仿真、看哪里失败,全程不用离开项目。

这也是为什么 EEBench 能做成自动判分:它构建提交的设计,生成电路图和物料清单,跑一串 SPICE 仿真,每个需求对应一个测量值和上限。技术分之外还叠加成本效率——但成本只在电路能工作之后才起作用。

「有点像给编码智能体一个编译器」,但测的是电压。

时间线:1986 Eurisko 设计 VLSI → 2016 深度学习 → 2026 EEBench 基准

排行榜上的两个世界

榜单数据值得多看两眼:

排名 模型 得分
1 Claude Opus 5 61.6%
2 Grok 4.6 57.1%
3 Claude Fable 5.1 56.4%
4 Claude Fable 5 54.3%
5 Claude Opus 4.8 Max 51.4%
GPT-5.5 42.3%
GPT-5.6 Sol 39.4%

几个月前没人预料到模型能到这个水平。更有意思的是 xAI 把 EEBench 写进了 Grok 4.6 的模型卡——「工程加速」那一节,和 3D 建模、参数化 CAD 的评测并列。一个前沿实验室开始用电路基准来描述新模型的工程能力,说明这件事正在成为一个正经赛道。

OpenAI 那边则有点微妙:demo 很漂亮,但自家模型在基准上垫底。有 HN 网友指出,KiCad demo 和「会设计电路」是两回事——demo 展示的是 computer use(操作工具的能力),EEBench 测的是电子工程能力(设计本身的质量)。

我倾向于认为两者都重要,但**「会操作工具」和「会设计」的差距,正是 61.6% 和 100% 之间的差距。**

1986 年的回响

HN 讨论里有一条评论让我起了一身鸡皮疙瘩。有人贴了 Eurisko 的维基百科链接——1980 年代 Douglas Lenat 写的那个启发式程序,当年用它自己的规则设计过 VLSI 芯片布局,后来还设计出了赢得 Traveler 锦标赛的舰队。

「难以置信,AI 在走回头路。」评论者说。

1986 年,AI 设计芯片;2026 年,AI 在 KiCad 里摆电容。中间隔了四十年,几代研究者来了又走,深度学习把整个领域换了一遍血。Eurisko 靠的是手写启发式规则,今天的模型靠的是从海量数据里学出来的模式。工具完全变了,但「让机器自己设计硬件」这个执念,一代人没放下过。

某种意义上,这也是一种回响:1986 年 AI 设计芯片是学术猎奇,2026 年它是评测基准、模型卡上的一个指标、和一个 15 秒的发布会 demo。从猎奇到基建,这就是四十年。

六美元的中国工厂,和一场供应链的默契

EEBench 的评分里有一个细节:成本效率。模型选元件的时候,得考虑真实价格。而 HN 讨论里最热闹的几条,几乎都绕不开同一个词——JLC(嘉立创)。

  • 有人用 Claude 设计了一个 74 系列逻辑 + GAL 的 VGA 输出电路,在嘉立创打样花了 6 美元,回来只修了一个小错。
  • 有人说自己的板子在 JLCPCB 设置下通过了全部 DRC 规则,下单、贴片、到手,工作完全符合设计。
  • 还有人说 flex PCB 在 JLC 和 PCBWay 的 DRC 工具里验证通过。
  • 连「AI 从 LCSC 采购元件」的 KiCAD MCP 服务器都有人做出来了——LCSC 就是嘉立创的元器件商城。

我读这些评论的时候意识到一件事:AI 设计电路这件事之所以突然可行,一半功劳在模型,另一半在中国深圳的工厂。

你要在 1990 年代让 AI 设计电路板,设计完了找谁做?找工厂下 100 块板子的起订量,等三周,付几百美元。今天,嘉立创用几美元的价格把「打样」变成了和「打印」一样平常的事,PCBWay 五块组装板 178 美元带 DHL 送到家。AI 试错的成本被中国的制造产能压到了可以随便犯错的程度——而这恰恰是 AI 最需要的:便宜的试错。

这大概是这篇里最让我感慨的部分。全球最大的 PCB 产业集群在珠三角,而 AI 设计的电路,第一个批量落地的验证场大概率也是那里。技术叙事里经常忽略工厂,但工厂才是让「AI 画板子」从 demo 变成 hobbyist 周末项目的那个沉默变量。

我在服务器上搭了一块「虚拟板子」

看完博客我手痒了。我没有 PCB 制造能力,但 atopile 是开源的——我可以在服务器上把那个能量表电路「搭」一遍,看看「用代码描述电路」这件事到底是不是真的。

pip install atopile,装完踩了几个语法坑:0.2.69 版本把裸 import Capacitor 的旧语法移除了,必须写 from "generics/capacitors.ato" import Capacitor;单位要用 kohm 而不是 kOhm。第一版报了一串 SyntaxError,第二版过了 import 但卡在 ~> 链式连接,第三版才全绿。

最终版长这样:

from "generics/interfaces.ato" import Power
from "generics/capacitors.ato" import Capacitor
from "generics/resistors.ato" import Resistor

module Hold:
    """Hold-up circuit: 5V input, 22uF bank keeps vhold above brownout"""
    vin = new Power
    c_bank = new Capacitor
    load = new Resistor

    vin.vcc ~ c_bank.p1
    c_bank.p2 ~ load.p1
    load.p2 ~ vin.gnd

    c_bank.value = 22uF +/- 20%
    c_bank.package = "0805"

    load.value = 1kohm +/- 5%

ato build 的输出:

INFO     Building default
INFO     Writing outputs to /tmp/ato-test/hold/build
INFO     Building 'assertions-report' for 'default' config
INFO     Building 'variable-report' for 'default' config
INFO     Building 'layout-module-map' for 'default' config

构建成功,生成了 hold.kicad_pcb 文件——一个 22µF 电容和一个 1kΩ 电阻的保压电路,被 atopile 解析、检查、翻译成了 KiCad 的 PCB 布局文件。

我盯着那个 .kicad_pcb 看了好一会儿。这当然不是「AI 设计电路」——我只是验证了 EEBench 依赖的那层地基:声明式电路描述是真实可用的,不是 PPT。 一个普通程序员能在 20 分钟内把「加个电容保压」从想法变成机器可构建的代码,那 AI 在同样的代码上迭代、仿真、试错,就只是时间问题。

地基是真的。上面盖什么楼,就看 61.6% 能爬多高了。

还有很长的路,但路已经出现了

EEBench 自己说得很诚实:V1 只覆盖了模拟和数字设计,通过仿真判分。它还不能测「模型能否布局、制造、点亮一个完整产品」。创始人说,他们甚至不敢让 AI 设计心脏起搏器然后直接装进病人身体。

但方向已经清楚。OpenAI 拿 PCB 当 Astra 的首批演示之一,xAI 把 EEBench 写进模型卡,Musk 说 Grok 4.7 要在 SpaceX 数据上训练成「特别擅长工程」的模型——这些信号指向同一个判断:AI 实验室开始认真对待电子设计了。

1986 年 Eurisko 设计芯片是孤例,2026 年电路设计是评测赛道。四十年,从猎奇到基建。

至于「AI 能不能设计电路板」这个问题——EEBench 的答案是:有一些能,61.6% 的那种能。 离「全自动造手机」还很远,但「让 AI 帮你把电路想法变成一块能在嘉立创下单的板子」这件事,已经不再是一句空话了。

下一步,大概就是等某个模型在 EEBench 上突破 70%,然后看 OpenAI 什么时候把自家模型的分数从 42% 追上来。我猜不会太久——毕竟他们连 15 秒的 demo 都拍了。

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论