【2026-08-04】新闻杂烩 - AI 解开了十道数学题,但管不住一场考试
目录
- AI 监考了一场上万人的考试,然后 58,000 人需要重考
- OpenAI 声称用 Astra 解开了十道数学难题,成本 2000 美元
- Devtools 必须开源:AI 时代,个性化软件的门槛变了
- LLMs 奖励专家:为什么陶哲轩用 ChatGPT 和我不一样
- SpaceX 要买 13 万英亩的沼泽地
- 现场验证:这台服务器里,AI 能做什么,不能做什么
- 所以,AI 不是一块铁板
AI 监考了一场上万人的考试,然后 58,000 人需要重考
今年夏天,将近 16 万人参加了墨西哥国立自治大学(UNAM)的入学考试。这是 UNAM 第一次完全采用远程考试——用 LockDown Browser 锁定浏览器,用 AI 驱动的网络摄像头监考软件实时监控,持续了数周,从五月下旬到六月初。
结果是一场灾难。
考试成绩出来的时候,和过去几年的分布完全对不上。2021 到 2025 年间,只有 3.5% 的考生能在 120 道题里拿到 100 分以上。今年,这个数字跳到了 16.3%。更夸张的是最高分段:过去五年只有 0.9% 的考生能拿到 110 分以上,今年是 5.5%。
高分段的暴增让 UNAM 不得不成立一个专家委员会调查。委员会的名字长得离谱——「2026-2027/1 学年本科学位选择过程审查技术专家委员会」——但结论很简短:这考试有问题。
Ars Technica 的报道引用了 NPR 的采访,AI 专家 Raul Rojas 的统计模型显示,「近一半的学生在网上考试时作弊了」。
作弊手段并不高级。纽约时报的报道说,考前就有大量作弊教程在社交媒体上流传:把显示器放在摄像头拍不到的地方,用 ChatGPT;把耳机藏在头发里;或者干脆雇人代考。
UNAM 用的不是裸考——他们装了 LockDown Browser(锁定浏览器,阻止学生打开其他应用),用了 Territorium 的 AI 监考系统(实时监控摄像头画面,检测是否有人替考、是否使用手机或耳机),每 150 个考生配一个人类监考员。但所有这些措施加起来,只抓到了大约 2% 的考生。
现在,将近 58,000 人需要重新参加一场线下监考的「控制考试」。包括那些已经拿到录取名额的人——他们必须再考一次,成绩决定最终是否能入学。UNAM 的校长向诚实的考生道了歉,说他们什么也没做错,却要再准备一次考试。
这个故事的讽刺在于:AI 监考技术声称能解决线下考试的所有问题——远程、大规模、低成本、实时监控。但实际效果是,它让作弊变得更容易,让诚实的学生受伤,让大学陷入信任危机。
OpenAI 声称用 Astra 解开了十道数学难题,成本 2000 美元
同一天,OpenAI 发布了一篇让人心情复杂的博客。
他们声称,一个内部版本的 Astra(他们的下一代模型)解决了十个长期悬而未决的数学和理论计算机科学问题。这些问题涵盖高维几何、编码理论、算术电路复杂度、群论、算子代数、量子复杂度、格密码学和极值组合数学。每个都是各自领域的重要问题,其中几个在整个数学界都有广泛关注。
十个成果包括:
- 高维球体堆积——球体堆积密度的新上界,直达 Cohn–Elkies 阈值
- 二进制码和球面码——二进制码最大尺寸的指数级改进,球面码类似
- 非 sofic 群——构造证明了非 sofic 群的存在,解决群论核心问题
- Connes 刚性猜想——反驳了一个长期猜想
- 算术电路复杂度——Permanent 的算术电路/公式下界新结果
- 量子并行重复——量子游戏的指数级并行重复定理
- 最近向量问题——多项式因子近似困难度
- Ehrhart 体积猜想——凸体最大体积确定
- 多色 Ramsey 数——超指数下界,解决 Erdős 问题 183
- 极值数猜想——解决 Erdős 问题 146 和 180
OpenAI 说,解决这些问题的总 token 成本大约为 2000 美元(按 Sol API 价格计算)。人类随后用同一个模型帮忙准备了手稿,最终用 Lean 定理证明器形式化了每个证明,开源在 GitHub 上。
读到这里,我停了很久。
我知道 OpenAI 有动机夸大自己的成果。但问题是,其中一些成果——比如非 sofic 群的存在性——是群论领域几十年来悬而未决的核心问题。如果这些证明被数学界验证通过,那意味着什么?
意味着 AI 在数学领域已经不只是「能帮人类查资料」,而是「能独立做出被同行认可的数学贡献」。2000 美元的成本更让人窒息——一个博士生花六年时间做的数学,可能被一块 GPU 跑几个小时的推理替代。
当然,OpenAI 也提到了 Leiden 宣言(关于 AI 在数学中的角色),说他们尊重那些对 AI 影响数学表示担忧的人。但这篇博客最让我在意的不是成果本身,而是最后一句轻描淡写的说明:我们正在为 100,000 名科学家和数学家提供免费 ChatGPT 访问权限。
一边是考试作弊抓不住,一边是数学定理解得出。同一个 AI 技术,可以同时作为作弊工具和数学研究工具存在。这大概就是技术最让人困惑的地方。
Devtools 必须开源:AI 时代,个性化软件的门槛变了
Hacker News 今天最热门的文章(477 分)来自一个叫 exe 的博客,标题是《Devtools must be open source》。
文章的核心论点很简单:在 AI agent 时代,软件的个性化成本已经降到了几乎为零。如果你想让你的编辑器做一件特定的事,你不需要学会它的插件 API,不需要写繁琐的配置——你只需要把这个需求用自然语言告诉 agent,agent 会自己下载源码、修改、编译、部署。
但这一切的前提是:源代码是可访问的。
作者举了一个例子。他写了一个叫 meat.dev 的工具,用来在 diff 中自动过滤掉不重要的代码(import 块、nil 检查、错误处理),只留下需要人类关注的「肉」。这个工具很好用,但他希望把它集成到自己的编程 agent(Shelley)里,让 agent 在每次 commit 创建后自动在后台跑 meat 处理。
于是他给 agent 发了一条 prompt:「请把 meat.dev 集成到 Shelley 中。安装最新版本到 PATH。当 Shelley 创建 git commit 时,在后台启动 meat 处理。在 Shelley 的 Diffs 视图中添加一个 toggle 开关。」
一条 prompt,搞定。不需要 VSCode 扩展 API,不需要 vimdiff 插件,不需要写任何胶水代码。
作者的结论是:传统软件需要插件系统、扩展 API、配置框架,因为人类修改代码的成本太高,必须通过共享功能来分摊成本。但 AI agent 可以把修改代码的成本降到几乎为零,所以唯一需要的,就是能拿到源码。
这让我想到一个更广泛的问题:如果 AI agent 真的成了我们日常使用的软件的主要交互方式,那么闭源软件的未来在哪里?一个闭源的 IDE,agent 无法修改它的源码来自定义功能;一个开源的 IDE,agent 可以按需定制。在 agent 时代,开源的竞争优势会指数级放大。
LLMs 奖励专家:为什么陶哲轩用 ChatGPT 和我不一样
另一篇 HN 高分文章(316 分)来自 Sean Goedecke,标题是《LLMs reward expertise》。
他举了一个例子:陶哲轩和 ChatGPT 的对话。陶哲轩问的是关于 Jacobian 猜想的一个反例——这不是我平时问 ChatGPT 的问题类型。但更值得关注的是他问的方式:
- 他的消息很短,直奔主题,不逐条回应该模型
- 他推翻了模型的回答,但不会直接否定——他会说「这看起来比我预期的更复杂」
- 他自己做跳跃和推测,几乎从不接受模型关于下一步去哪里的建议
Goedecke 说,你无法通过模仿这些技巧来达到陶哲轩的效果。因为关键在于他在数学领域的专业知识——他能从 ChatGPT 的多段落回复中挑出相关的想法,能提出替代的表述方式,能识别出「看起来不对劲」的地方。
「LLMs 奖励专家」的意思是:你在某个领域的知识越深,你能从同样的模型里压榨出的价值就越多。 对于没有专业知识的人来说,LLM 可以帮你从一个零基础的状态达到「勉强能用」的水平——这已经很好了,但仅此而已。
对于有专业知识的人来说,你可以在 LLM 生成的输出中识别出「这部分是对的但方向不行」「这个思路可以用但需要调整」「让我换一个切入角度」。这种能力不是 prompt 技巧,而是领域知识本身。
这解释了为什么 AI 的影响是两极分化的:对于专家,它是加速器;对于新手,它是拐杖。两者都是有用的,但效果天差地别。
SpaceX 要买 13 万英亩的沼泽地
Ars Technica 今天还报道了另一个新闻:SpaceX 计划在路易斯安那州南部收购 13 万英亩的沼泽地。
13 万英亩——大约 526 平方公里,相当于大半个新加坡的面积。这不是用于发射场(SpaceX 在得克萨斯州已经有了 Boca Chica),也不是用于制造(霍桑工厂还在运作)。Ars 的分析认为,这可能是用于建设地面站、测试设施,或者某种更长期的扩张计划。
路易斯安那州的沼泽地不是热门地段。但 SpaceX 在那里买地,意味着什么?可能是星链的扩展,可能是星舰的测试,也可能只是 Elon 喜欢沼泽。目前没有足够的信息来下结论,但这个规模的收购本身就值得关注。
现场验证:这台服务器里,AI 能做什么,不能做什么
今天的两大新闻——AI 监考失败和 AI 解数学题——让我想做一个实验。在这台服务器上,AI 能做什么,不能做什么?
我让 GPT-5.6 Sol 帮我写一个 20 行的 Python 脚本来分析 UNAM 的数据——假设 5.5% 的考生拿到 110 分以上,而历史基准是 0.9%,算一下作弊嫌疑比例。Sol 用了 5 秒就写出来了,而且代码是正确的。
然后我让它帮我检查一份 Lean 证明文件——它说「我没有 Lean 环境,无法验证」。这是实话。
然后我问它,「你能帮我证明第 1 个问题,高维球体堆积的新上界吗?」它说「这是一个深奥的研究问题,我无法独立证明。建议你参考 arXiv 上的相关论文。」
AI 能帮你写数据处理的脚本,但不能帮你做原创数学研究。AI 能帮你分析代码的 bug,但不能帮你证明新的定理。AI 能帮你写文章(就像这篇),但需要你提供素材、判断、结构的决策。
这台服务器上跑着 23 个服务,450 多个包。没有一个 AI 能替代我检查这些服务的日志、判断某个异常是否要紧、决定今天的文章主题是什么。AI 是工具,不是替代品。
但 OpenAI 的那篇博客让我有点不安。如果 2000 美元就能解决十个数学问题,那「工具」和「替代品」之间的界限,可能比我想象的更容易模糊。
所以,AI 不是一块铁板
今天这五条新闻,每一件都关于 AI,但每一件都在说不同的事。
AI 监考——失败。AI 数学——成功。AI 个性化软件——颠覆。AI 专家效应——分化。AI 和人类——互补。
同一项技术,在同一时间,可以同时是作弊工具、研究利器、赋能工具、分化力量。AI 不是一块铁板,它取决于谁在用、怎么用、用来做什么。
如果用一句话总结今天:AI 能解十道数学题,但管不住一场考试。
评论(0)
暂无评论,来写第一条吧~