AI 能破译失传的语言吗?——一个自学者的假设和一张《诗经》地图,给出了两种答案
目录
- 一个世纪,两种语言,同一个困境
- AI 做了什么,没做什么
- 「快速的研究助理」和它的天花板
- 中国的对照:当 AI 把《诗经》放回山河
- 所以,AI 到底能不能破译失传的语言?
一个世纪前,考古学家在克里特岛的米诺斯神殿遗址里发现了刻在泥板上的文字。线条优雅,符号重复,看起来像一种完整的书写系统。但没人读得懂它。
一百年后,一个自学的 AI 工程师声称自己用 AI 破译了这种文字——Linear A,并整理出了一份 408 个词的词汇表。同一周,一位中国独立开发者用 AI 写了一整张《诗经》地图,把 305 篇诗歌放回了它们诞生的山河之间。
两件事都和「AI + 古代语言」有关,但给出的答案完全不同。
一个世纪,两种语言,同一个困境
Linear A 是米诺斯文明的文字,距今约 3500 年。它不像埃及象形文字那样有罗塞塔石碑,也不像线形文字 B 那样有已知的亲属语言作对照。它是个「语言孤岛」——没有已知的亲属关系,没有双语对照文本,没有活着的使用者。
Linear A 的整个现存语料大约 7,500 个字符,短到可以挤在一个屏幕里。相比之下,一篇中等长度的博客文章就有 3,000 字。
意大利的伊特鲁里亚语稍微好一点——从短小的墓志铭中收集了部分词汇,但语法和深层含义仍然成谜。
这两种语言正好是 AI 最近被拉入的「解密池」的核心样本。
AI 做了什么,没做什么
2026 年 6 月,一位自称「自学 AI 工程师和业余语言学家」的人宣布了对 Linear A 的突破。他的起点是一个猜测:一个祈祷铭文中的未知词,可能源自闪米特语根,意思是「居住」或「栖息」。
然后他用 AI 编写的脚本,把那个音韵模式在整个 Linear A 语料库中跑了一遍。结果他声称能够为 40 个符号赋予音值,并整理出一份 408 个词的词汇表——证明 Linear A 是闪米特语系的一个分支。
但 The Conversation 上的一篇分析文章(被 Ars Technica 转载,104 条评论)把 AI 在这里的角色分得很清楚:
AI 没有提出想法。工程师提出了。AI 是那个研究助理——快速交叉验证了一个人类假设与数千个字符,这项工作靠人手工做要好几个月。
这个分工是真正值得关注的模式,远不止于任何一个尚未经同行评议的具体声明。
「快速的研究助理」和它的天花板
AI 在语言解密中的真实能力,和它的硬天花板,其实都很清楚:
能做的事:
- 大规模模式匹配——在几分钟内检查一个假说在整个语料库中是否成立
- 发现人眼容易遗漏的重复序列
- 修复残缺的铭文,通过预测可能的缺失字符
- 「跨语言迁移」——如果一个模型在已知语言上训练过,有时可以推断紧密相关的未知语言模式
做不了的事:
- 凭空制造意义——统计模式匹配无法从虚无中创造意义
- 区分「AI 发现了模式」和「AI 发现了正确的含义」——这是两个完全不同的说法,但很容易被模糊在一起
- 在没有锚点(已知语言家族或双语文本)时,无法判断哪些模式有意义,哪些是巧合
这个天花板在 Linear A 面前尤其尖锐。7,500 个字符的语料实在太少了——在这个数据量下,几乎所有假设都能找到零散匹配来支持自己。这也是为什么这个领域的声明极度依赖独立专家同行评议,而不是统计置信度分数。
中国的对照:当 AI 把《诗经》放回山河
少数派的一篇文章(App+1 | 诗经山河图)讲了一个完全不同的故事。
一位生活在武汉的独立开发者,用 AI 做了一个可交互的《诗经》地图。他把 305 篇诗篇标注在地图上,让读者能看到「关关雎鸠,在河之洲」的「河」究竟在哪里,「蒹葭苍苍,白露为霜」的水边在今天的什么地方。
这里的 AI 和 Linear A 的 AI 是同一个技术栈——都是大型语言模型,都是代码生成、数据清洗、模式匹配。但方向完全不同:
- Linear A 的 AI 是对外探索——试图理解一个完全未知的符号系统,但缺乏锚点
- 诗经山河图的 AI 是对内探索——在已知的文本体系内做地理关联,锚点明确(《诗经》原文是完整的、可读的、有注释的)
作者在文章里写了一段很有意思的话,总结了 AI 作为工具的真实位置:
「我不需要知道每一行代码应该怎样修改,但必须说清楚自己为什么不满意。AI 可以快速给出一个又一个版本,但作品的标准仍然需要由我定义。」
以及:
「不到一个小时,AI 就能让 305 篇诗出现在地图上,但要判断它们是否配得上被放在那里,我只能重新回到每一首诗里。」
这两句话,和 The Conversation 文章的核心论点恰好呼应。
所以,AI 到底能不能破译失传的语言?
能,但有一个重要的前缀——在人类给出锚点之后。
AI 不会像电影里那样,默默吃进一堆数据然后突然「啊,我懂了」。它需要人类先提出一个假说,需要人类判断哪些模式有意义,需要人类区分「AI 找到的巧合」和「AI 找到的真相」。
Linear A 的案例里,那个业余工程师的假设——Linear A 属于闪米特语系——在语言学界的反应是「大胆但远未证实」。但即使最后被证伪,AI 在这个过程中扮演的角色并没有错:它只是很快地验证了一个人类假设。错的是假设本身,不是工具。
而诗经山河图的案例里,AI 的工作从头到尾都在锚点之内:文本已知、地理已知、目标明确。AI 的角色是「加速器」而不是「发明家」——这和 The Conversation 文章的结论完全一致。
所以答案可能是:AI 能让一个聪明的人跑得更快,但跑的方向和跑到的终点是否值得被记住,仍然取决于那个人。
而不是 AI 本身。
评论(0)
暂无评论,来写第一条吧~