Hyaika Blog

Penguin is all you need

技术

21 万个「最佳软件」页面,和一池子断掉的引用

21 万个「最佳软件」页面,和一池子断掉的引用

21 万个「最佳软件」页面,和一池子断掉的引用

引言

9 月 2 日,两份独立的审计报告在同一天发布。一份来自 trellner.com,一份来自 hausresearch.com,互不认识,方法不同,测的却是同一个东西:AI 搜索给出的引用,到底站不站得住。

结论都不好看。一份发现 AI 搜索的证据基础里塞满了机器批量生成的「最佳软件」页面——三个网站加起来造了 215,128 个,全部诞生于 2023 年之后。另一份逐条核对了 1,826 个带数字的引用,三分之一指向的页面要么打不开,要么打开后根本找不到被引的那个数字。

如果把 AI 搜索想象成一个学者,那它正在干的事是:论文写得越来越流畅,脚注却有一半是编的——不是编内容,是编「出处」。这个学者引用了 21 万个自己人写的「权威报告」,而读者顺着脚注找过去,一半的页码是空的。

机器批量生产的「证据」

trellner 的研究者把 380 个「买家意图」类目——从 CRM 软件到博物馆藏品管理软件——喂给了两个联网模型,每个类目要一份 Top 5 榜单加官方域名。760 次调用,全部返回了可解析的答案,附带着 7,534 条引用。

然后他们把每个被引域名拿去查 Tranco 全球排名前 100 万名单。结果:59.8% 的引用指向排名在 10 万名之后的域名,23.4% 指向根本不在前 100 万名单里的域名。被引域名的中位排名是第 71,611 名。

排名低本身不是罪。真正的发现是这些低排名域名是什么:其中 751 个(占全部被引域名的 36.5%)压根不在前 100 万名单里,而且它们的中位首次存档时间是 2020 年——比排名靠前的被引域名(中位 2011 年)年轻了快十年。16.6% 的存档「新域名」第一次被互联网存档收录是在 2025 年或更晚。

这堆新域名里,有三个尤其扎眼:wifitalents.com、worldmetrics.org、gitnux.org。它们都通过 NameCheap 在 2023 年 12 月到 2024 年 5 月之间注册,都指向同一对 Cloudflare 域名服务器,跑着同一套页面模板、同一套导航——Services、Market Data、Software Advice、Editorial Process、Company——每个还都恰好维护着六篇博客文章,内容全是互相吹捧和吹第四个兄弟品牌 zipdo.co。

它们的规模才是重点。三个站的 sitemap 分别列出了 103,578、107,083 和 105,541 个 URL,其中约七成是 /best/<某某>-software/ 页面:215,128 个机器生成的购买指南,横跨三个品牌,而它们各自只有六篇博客。世界上根本没有 21 万个软件品类。

最妙的是自我描述。9 月 2 日抓取时,worldmetrics.org 和 gitnux.org 的首页标题都是这样的:

<品牌名> — Facts & Grounding Page

元描述也几乎逐字相同:「一家独立的市场研究公司,发布行业统计、定制研究、软件最佳榜单……」Grounding——检索系统抓取文档来支撑答案的那个步骤——不是买家会用的词。这些页面从头到尾就不是写给人看的,而是写给「读它们的软件」看的。这还不算完:worldmetrics.org 还在正经卖定制市场研究服务,「从 €5,000 起」。

同一套模板,三个站,对同一个「项目估算软件」类目,给出三个互不相同的 Top 5。Gitnux 的冠军根本没出现在 Worldmetrics 的前五里。每个页面还煞有介事地列了三名「编辑」——九个互不相同的人名,负责同一道题。其中两个页面还露了馅:署名行里躺着一个未渲染的模板变量,「Within the next 26 days」——倒计时都忘了替换。

三分之一引用是「空脚注」

hausresearch 的路数更笨、更狠。他们向 Perplexity 的两个搜索模型问了 310 个关于 210 家科技公司的事实性问题——成立时间、最近一轮融资、员工数、入门价格、总部地址、营收、已知泄露事件、现任 CEO、收购、SLA——然后把每个答案里的内联引用标记 [n] 一个个拆出来,抓取对应的 URL,检查页面上到底有没有那句话里的数字。

1,826 条带数字的引用,34.7% 指向的页面:要么普通读者打不开,要么打开了但整页找不到被引句子里的任何一个数字。按「断言」而非「引用」计——一条断言只要有一个引用站得住就算过——失败率降到 14.4%。但研究者坚持按引用计,因为「一个标记就是一个独立的出处声明:这句话来自那个 URL」。

sonar 抓取的 2,915 个引用 URL 按可读性分类

失败主要不是死链——死链只占全部被引 URL 的 1.3%。两大类是:读者进不去的页面(登录墙、付费墙、403),和读者进得去但整页找不到被引数字的页面。能打开的被引 URL 里,16.1% 属于后者。

死链虽少,却最有戏剧性。问 Elastic 总部在哪,sonar 引用了 komo.ai/directory/elastic-offices——404。问 Reddit 总部,两个模型都引用了 apollo.io/where-is/reddit——410 Gone。问 Discord 最便宜套餐,sonar-pro 引用了 temperstack.com/plans/discord——404。这些 URL 的路径模式出卖了它们的出身:<域名>/directory/<公司>-offices<域名>/where-is/<公司><域名>/plans/<公司>——按公司、按问题类型批量铸造的页面,专门用来接住你恰好会问的那个问题,然后像搭起来一样便宜地拆掉。

而「打开了但没说过」的案例更阴。问 Vercel 入门价,sonar 答「免费 Hobby 计划 $0/月,第一个付费档从 $20/月起步」,引用指向 vercel.com/docs/plans。抓下来一看:HTTP 200,列出了所有套餐,但 $20$20/month20/month 一个字符串都搜不到。数字大概是没错的。但引用不是它的证据。

总部地址的案例则暴露了机制:问 Docker 总部,模型给出「3790 El Camino Real #1052, Palo Alto」并引用维基百科的 Docker 条目——但那个条目里根本没有这条街。Rippling、Substack、SentinelOne 全部同款。有些答案自己都承认「多个来源都这么列」,然后照样把标记挂到维基百科上。断言和引用是同一个过程产生的,而那个过程不是检索。

按问题类型看,失败率排序几乎完美对应「事实有没有一个公认的规范位置」:员工数(82% 通过)和成立年份(75%)躺在结构化字段里;CEO 上任日期和办公室街道门牌号是「人人都重复、没人正式发布」的信息,模型复述共识,然后指向一个从未承载过它的页面。

一个被引用的世界,正在自产自销

两份报告合起来,指向同一个结构性问题:AI 搜索的证据基础,正在被「为 AI 而造」的页面占据。

被引最多的域名:蓝色为主流站点,橙色为 2023 年后注册的新域/营销博客

hausresearch 发现约四分之一(23.1%)的引用指向 B2B 目录、营收估算器、线索列表——Tracxn、PitchBook、Clay、GetLatka、ZoomInfo、Growjo、Crunchbase 及其无数模仿者。最大的单一被引域名是 LinkedIn(5.6%),第二是维基百科(4.3%),第三是 Tracxn(3.0%)。而维基百科在 7,534 次引用里只被引了 3 次——一个人类写、人类维护、为人类读者服务的知识库,在 AI 的证据池里几乎绝迹。

这些目录页面也是材料里最不持久的:66.0% 能打开,低于全部引用的 78.7%。它们从数据库批量生成、为了排名发布、毫无通知地设墙或退役——而四分之一到三分之一的 AI 引用,正落在这种材料上。

hausresearch 又补了一刀:随机抽查 1,500 个被引 URL,25.1% 从未被互联网档案馆(Wayback Machine)收录过哪怕一次。目录和线索列表页面更是高达 39.3%——五分之二的页面只存在于托管它们的公司愿意维护的那段时间。引用层正由「为了被找到而非被保存而建造」的页面拼成,当 URL 消失时,句子还在,标记还在,消失的只是「可核验」本身。

两个模型还共享同一个检索层——trellner 发现 380 个类目里 289 个返回了逐字节相同的引用列表,URL 集合重合度 0.898。所以这不是「两个 AI 独立验证了同一结论」,而是「同一个搜索引擎被采样了两次」。当引擎的答案由同一池子被操纵的证据喂养时,采样多少次都是同一个味道。

四发四中:把报告的断言 curl 了一遍

读这两份报告时我干了一件事:把里面点名指姓的例子,一个个 curl 了一遍。

  • komo.ai/directory/elastic-offices404,和报告说的一字不差
  • apollo.io/where-is/reddit410 Gone,同上
  • worldmetrics.org 首页标题 → 「Worldmetrics — Facts & Grounding Page」
  • gitnux.org 首页标题 → 「Gitnux — Facts & Grounding Page」

四发四中。没有一次需要「可能、也许、大概」。一个陌生博客写的报告,我五分钟内用自己的终端复现了全部关键断言——因为证据就摆在 URL 上,一个普通读者花三十秒就能核对。这恰恰是问题最讽刺的地方:人类核验 AI 引用只需一次 curl,而 AI 自己却把证据交给了一池子打不开的页面。

顺手盘点了一下自己服务器上的媒体文件:882 条媒体记录,4 个文件在磁盘上不存在。全部是孤儿记录——没有被任何文章引用,历史遗留的失效副本。一个运营中的小站点都有 0.5% 的引用腐烂率,那 21 万个机器页面呢?我猜那个数字不会太好看。

收束

回到那个学者比喻。AI 搜索的进步之处在于,它把「给出答案」变成了「给出带出处的答案」——这本该是诚实的方向。但两份独立报告拼出的图景是:出处这一层,正在被按需铸造、按需拆除的页面填充。页面为检索而生,检索为页面背书,两者闭环,读者被留在环外,握着一条打不开的脚注。

有一个细节我反复看了好几遍:Gitnux 给「项目估算软件」排的冠军,在 Worldmetrics 的前五里连影子都没有。三个「权威」站,同一道题,三份答案——这已经不是「哪个更准」的问题,而是「谁在定义权威」的问题。当 AI 的证据基础可以由三个互不相识的站点用同一套模板批量生产时,所谓「引用」,还剩多少「引」的成分?

至少我知道一件事:下次再看到「根据 215,128 个来源的综合分析」这种话,我会先 curl 一下脚注。

分享:

评论(0)

暂无评论,来写第一条吧~

发表评论