See What AI Says
BENCH-2026-08-34 · 扫描于 2026 年 8 月 28 日

我们扫了 34 家头部品牌。大多数它们也没做。

如果你是一家中小企业,关于这整件事,第一个该问的问题是:这是真事, 还是有人在卖一种新的焦虑。所以在测任何一个客户之前,我们先去测了市场的顶端: 34 家你认识的公司,逐项检查 GEO 行业让你去做的那些事。 下面是我们查到的全部,包括那些反过来说明「你什么都不用买」的部分。

我们具体做了什么

2026 年 8 月 28 日,我们向 34 个网站请求了一份固定的 URL 清单, 然后读回来的东西。零次 AI 调用、零成本、中间没有任何解读—— 这是一次文件和响应头的扫描,和一份报告里跑在你自己网站上的那部分机械检查是同一套东西。 这也正是它的边界,下面会专门讲。

这 34 家,分三组:

对每一家,我们请求了 10 个面向 AI 的文件(llms.txtagents.mdai.txt、agentic discovery sitemap、 .well-known/mcp.json 等),读了 robots.txt 并逐条比对 22 个已知的 AI 爬虫,再拉下首页,数它的结构化数据、 它的 h1 元素,以及在任何 JavaScript 运行之前, HTML 里有多少个词是可读文本。

34 家里有 3 家把我们挡了。Warby Parker 返回 403、 Patagonia 返回 404、away.com 直接断开连接—— 几乎可以肯定是机器人防护对一个机房 IP 的反应,不是关于它们网站的什么结论。 所以它们的首页是未测,不是 0;下面每一个计数的分母, 都是我们真正读得到的 31 个首页和 30 个 robots.txt。 Roborock 的 robots.txt 也没能加载。

发现 1:那个被要求你去写的文件,它们大多数没有

llms.txt 是很多 GEO 套餐的招牌交付物。34 家里:

文件有的家数
/llms.txt34 家里 22 家
/llms-full.txt34 家里 12 家
/agents.md(或 /AGENTS.md34 家里 9 家
/sitemap_agentic_discovery.xml34 家里 7 家
/.well-known/mcp.json34 家里 4 家
/.well-known/ai-plugin.json34 家里 1 家
/ai.txt34 家里 0 家
/.well-known/agents.md34 家里 0 家
/mcp34 家里 0 家

按行业分得很干净。16 家软件公司里有 13 家提供 llms.txt; 8 家 DTC 品牌里 4 家,10 家中国出海品牌里 5 家。 客户是开发者的公司会发布开发者文件。 这个解释没有「头部已经跑在你前面了」那么刺激,但它更符合数据。

有两条得说出来,因为它们照样在被卖: 这个样本里没有任何一家提供 ai.txt, 以及谷歌自己的文档说它不读 llms.txt。 一个文件不是一个开关。

发现 2:一半以上的「AI 自我介绍」是购物平台写的

9 个站带了 agents.md——就是那个告诉 AI agent 你是谁、 该怎么和你打交道的文件。9 个我们全读了。 其中 6 个是同一个文件。

Allbirds、Glossier、Gymshark、Brooklinen、EcoFlow 和 UGREEN 各自提供一份 4,129–4,311 字节的文档,标题是 # Agent Instructions — {brand}, 并且这 6 份每一份都把 AI agent 指向 shop.app—— Shopify 自己的结账——不多不少八次。 逐字符比对,Allbirds 那份和 UGREEN 那份只差一个品牌名和一个政策链接。 6 家里有 5 家的 llms.txt 也恰好是五条链接。

这个文件我们以前见过。我们在打磨方法的时候扫过一家一个人做手工护肤品的小店, 它站上也是这一份——同样的模板,同样八次指向别人家的结账。 所以现在,一个大型运动服饰品牌和一个在自家闲置房间里做肥皂的人, 用同一段话向 AI 介绍自己,而且这段话两个人都不是自己写的。

有 3 个站自己写了。Shopify 那份 12,522 字节,Zapier 1,205,Anker 6,610—— Anker 是这个样本里唯一一家拿到平台默认版之后又重写了的: 它把 shop.app 整个删掉,加进了区域市场和规范产品链接的章节。

这件事对你的意义不是这些文件没用。是有一个写过一个 是两种状态,而任何一份审计要是把前者报成一个绿勾,它测的是你的托管服务商。

发现 3:自己写的那几份,基本上是一张目录

在能明显看出是自己写 llms.txt 的公司里, 主流格式就是把自家页面列成一张带注释的清单。 Stripe 那份挂了 288 条链接,HubSpot 201 条,SHEIN 190 条。 平台生成的那些是五条。

这是对它们做了什么的描述,不是它管用的证据。 我们没有测这些文件里的任何一个有没有改变助手谈论这家公司的方式, 而且据我们所知,也没有别人公布过这个测量。

发现 4:几乎没有人在屏蔽 AI 爬虫

这是中小企业主问我们最多的问题:我该不该把 AI 爬虫挡掉? 在我们能读到的 30 个 robots.txt 里, 只有 7 个提到了我们检查的那 22 个 AI 爬虫中的任何一个, 而且只有 3 个真的挡了

站点完全禁掉的 AI 爬虫数
Canva12
Figma7
Notion2
另外 27 个读得到的站一个都没有

挡了的这三家,产品都是设计或文档画布,也就是它们自己有一个很明显的训练数据方面的理由。 其余全部放行。如果有人跟你说要把 AI 爬虫关在门外作为防守, 市场顶端做的正好相反。

发现 5:连最基础的东西在顶端也不是人人都有

这一条改变了我们写报告的方式。在我们读得到的 31 个首页里:

检查项通过的头部站点
首页上至少有一个 h131 家里 21 家
有任何 JSON-LD 结构化数据31 家里 20 家
Organization 标记31 家里 14 家
AggregateRating 标记31 家里 2 家
Review 标记31 家里 0 家

这里面有 10 家公司的首页上没有 h1。有 11 家完全不发布结构化数据。 至于评价标记——一个几乎出现在有史以来每一份 SEO 检查清单上的常驻项—— 31 个站里只有 2 个以聚合评分的形式出现,以单条评价形式出现的一个都没有。

可读文本也很不均匀。首页在任何 JavaScript 运行之前, HTML 里给出的文本词数中位数是 1,059,最多的一家给了 40,745。 有 4 家不到 300:UGREEN 72 个词,Gymshark 和 Narwal 各 1 个词, Temu 一个都没有。它们的页面在浏览器里对人显然是好用的—— 但一个 AI 系统读原始 HTML 的时候几乎什么都看不到; 而我们没有跑 JavaScript,所以这一项测的只是第一次响应里到达了什么。

那一家小企业到底差多远

至少在这些机械检查上,比营销话术说的近得多。 右边那一列是我们在验证方法时用完整流程跑过的 5 家小企业。 我们不点它们的名,也不发布任何一个单独结果—— 这条规则对每一个买报告的人都适用, 所以样本报告也是化名的。 5 家是极小的样本,下面的数字请当成一个草图看,不是一个比率。

检查项头部品牌5 家小企业
首页有 h131 家里 21 家5 家里 1 家
Organization 标记31 家里 14 家5 家里 2 家
Review / AggregateRating 标记31 家里 2 家5 家里 0 家
robots.txt 里提到任何 AI 爬虫30 家里 7 家5 家里 0 家

请按顺序读这几行。第一行是一个真实的差距,值得谁花十分钟去补。 第二行是相对于一个多数的差距,而那个多数本身还不到压倒性。 第三行和第四行根本不是差距—— 不管什么规模,没有人在做,一份把它们列成你的失分项的报告,是在凑字数。

这现在是我们写报告的一条规则:一项检查必须先和这个基准比过, 才能被称为一个问题。 低于基准是问题。和基准持平,最多是一个机会。高于基准,要明说这是一个优势。 这条规则直接从我们的审计清单里删掉了两项, 也是为什么你的报告不会是一张 60 行的「你还没做的事」。

这项研究说明不了什么

它是一次文件扫描。它测的是这些公司部署了什么,它测的就只有这个。

如果你是一家中小企业,从这一页该拿走什么

三件事,没有一件是「去买点什么」。

  1. 你没有推销话术暗示的那么落后。 这些公司里超过一半除了一个 llms.txt 之外没有任何专门的 AI 文件, 有 agents.md 的那些里有三分之二是购物平台替它们写的, 其中 11 家完全不发布结构化数据。 谁报个价说要帮你「追上头部」,你该问是哪些头部,然后把这一页给他看。
  2. 别去屏蔽 AI 爬虫。 我们能读到的 30 个站里有 27 个全部放行。 这是这一页上最便宜的一件事:现在就去看一眼你自己的 robots.txt,免费。
  3. 文件不是那个有意思的问题。 这一页上的东西全是基础设施,而基础设施是你一个下午就能抄完的部分。 它回答不了的是:当一个客户问起的时候,助手会不会说出你的名字—— 而在这件事上,站在市场顶端显然并不取决于有没有这些文件, 因为这里面好几家一个都没有。

要知道第二件事,唯一的办法是去问那些助手,在你的品类里,看回来的是什么。 那才是测量,而且你不付我们钱也可以开始做。

真正的那次测量是怎么做的 →

23 个问题,3 个 AI 面, 一次提及怎么算,以及哪些东西我们测不了。

看这个基准用在报告里是什么样 →

一份真实公司的完整报告,它的审计发现是对着这次扫描比的, 不是对着一张检查清单比的。

先从你自己的 robots.txt 和结构化数据看起。

预检免费,在你决定任何事之前就把这些发现给你看。完整报告 $29.90,一次。

查我的网站

我们想用 Google Analytics 统计有多少人看了这个页面、又有多少人真的买了报告—— 除此之外不做别的。它会往你的浏览器写 cookie,并把你的 IP 发给谷歌, 所以得先问你一句。说不也完全不影响你用这个网站。 具体收了什么