如果你是一家中小企业,关于这整件事,第一个该问的问题是:这是真事, 还是有人在卖一种新的焦虑。所以在测任何一个客户之前,我们先去测了市场的顶端: 34 家你认识的公司,逐项检查 GEO 行业让你去做的那些事。 下面是我们查到的全部,包括那些反过来说明「你什么都不用买」的部分。
2026 年 8 月 28 日,我们向 34 个网站请求了一份固定的 URL 清单, 然后读回来的东西。零次 AI 调用、零成本、中间没有任何解读—— 这是一次文件和响应头的扫描,和一份报告里跑在你自己网站上的那部分机械检查是同一套东西。 这也正是它的边界,下面会专门讲。
这 34 家,分三组:
对每一家,我们请求了 10 个面向 AI 的文件(llms.txt、
agents.md、ai.txt、agentic discovery sitemap、
.well-known/mcp.json 等),读了 robots.txt
并逐条比对 22 个已知的 AI 爬虫,再拉下首页,数它的结构化数据、
它的 h1 元素,以及在任何 JavaScript 运行之前,
HTML 里有多少个词是可读文本。
34 家里有 3 家把我们挡了。Warby Parker 返回 403、
Patagonia 返回 404、away.com 直接断开连接——
几乎可以肯定是机器人防护对一个机房 IP 的反应,不是关于它们网站的什么结论。
所以它们的首页是未测,不是 0;下面每一个计数的分母,
都是我们真正读得到的 31 个首页和 30 个 robots.txt。
Roborock 的 robots.txt 也没能加载。
llms.txt 是很多 GEO 套餐的招牌交付物。34 家里:
| 文件 | 有的家数 |
|---|---|
/llms.txt | 34 家里 22 家 |
/llms-full.txt | 34 家里 12 家 |
/agents.md(或 /AGENTS.md) | 34 家里 9 家 |
/sitemap_agentic_discovery.xml | 34 家里 7 家 |
/.well-known/mcp.json | 34 家里 4 家 |
/.well-known/ai-plugin.json | 34 家里 1 家 |
/ai.txt | 34 家里 0 家 |
/.well-known/agents.md | 34 家里 0 家 |
/mcp | 34 家里 0 家 |
按行业分得很干净。16 家软件公司里有 13 家提供 llms.txt;
8 家 DTC 品牌里 4 家,10 家中国出海品牌里 5 家。
客户是开发者的公司会发布开发者文件。
这个解释没有「头部已经跑在你前面了」那么刺激,但它更符合数据。
有两条得说出来,因为它们照样在被卖:
这个样本里没有任何一家提供 ai.txt,
以及谷歌自己的文档说它不读 llms.txt。
一个文件不是一个开关。
9 个站带了 agents.md——就是那个告诉 AI agent 你是谁、
该怎么和你打交道的文件。9 个我们全读了。
其中 6 个是同一个文件。
Allbirds、Glossier、Gymshark、Brooklinen、EcoFlow 和 UGREEN
各自提供一份 4,129–4,311 字节的文档,标题是
# Agent Instructions — {brand},
并且这 6 份每一份都把 AI agent 指向 shop.app——
Shopify 自己的结账——不多不少八次。
逐字符比对,Allbirds 那份和 UGREEN 那份只差一个品牌名和一个政策链接。
6 家里有 5 家的 llms.txt 也恰好是五条链接。
这个文件我们以前见过。我们在打磨方法的时候扫过一家一个人做手工护肤品的小店, 它站上也是这一份——同样的模板,同样八次指向别人家的结账。 所以现在,一个大型运动服饰品牌和一个在自家闲置房间里做肥皂的人, 用同一段话向 AI 介绍自己,而且这段话两个人都不是自己写的。
有 3 个站自己写了。Shopify 那份 12,522 字节,Zapier 1,205,Anker 6,610——
Anker 是这个样本里唯一一家拿到平台默认版之后又重写了的:
它把 shop.app 整个删掉,加进了区域市场和规范产品链接的章节。
这件事对你的意义不是这些文件没用。是有一个和写过一个 是两种状态,而任何一份审计要是把前者报成一个绿勾,它测的是你的托管服务商。
在能明显看出是自己写 llms.txt 的公司里,
主流格式就是把自家页面列成一张带注释的清单。
Stripe 那份挂了 288 条链接,HubSpot 201 条,SHEIN 190 条。
平台生成的那些是五条。
这是对它们做了什么的描述,不是它管用的证据。 我们没有测这些文件里的任何一个有没有改变助手谈论这家公司的方式, 而且据我们所知,也没有别人公布过这个测量。
这是中小企业主问我们最多的问题:我该不该把 AI 爬虫挡掉?
在我们能读到的 30 个 robots.txt 里,
只有 7 个提到了我们检查的那 22 个 AI 爬虫中的任何一个,
而且只有 3 个真的挡了:
| 站点 | 完全禁掉的 AI 爬虫数 |
|---|---|
| Canva | 12 |
| Figma | 7 |
| Notion | 2 |
| 另外 27 个读得到的站 | 一个都没有 |
挡了的这三家,产品都是设计或文档画布,也就是它们自己有一个很明显的训练数据方面的理由。 其余全部放行。如果有人跟你说要把 AI 爬虫关在门外作为防守, 市场顶端做的正好相反。
这一条改变了我们写报告的方式。在我们读得到的 31 个首页里:
| 检查项 | 通过的头部站点 |
|---|---|
首页上至少有一个 h1 | 31 家里 21 家 |
| 有任何 JSON-LD 结构化数据 | 31 家里 20 家 |
Organization 标记 | 31 家里 14 家 |
AggregateRating 标记 | 31 家里 2 家 |
Review 标记 | 31 家里 0 家 |
这里面有 10 家公司的首页上没有 h1。有 11 家完全不发布结构化数据。
至于评价标记——一个几乎出现在有史以来每一份 SEO 检查清单上的常驻项——
31 个站里只有 2 个以聚合评分的形式出现,以单条评价形式出现的一个都没有。
可读文本也很不均匀。首页在任何 JavaScript 运行之前, HTML 里给出的文本词数中位数是 1,059,最多的一家给了 40,745。 有 4 家不到 300:UGREEN 72 个词,Gymshark 和 Narwal 各 1 个词, Temu 一个都没有。它们的页面在浏览器里对人显然是好用的—— 但一个 AI 系统读原始 HTML 的时候几乎什么都看不到; 而我们没有跑 JavaScript,所以这一项测的只是第一次响应里到达了什么。
至少在这些机械检查上,比营销话术说的近得多。 右边那一列是我们在验证方法时用完整流程跑过的 5 家小企业。 我们不点它们的名,也不发布任何一个单独结果—— 这条规则对每一个买报告的人都适用, 所以样本报告也是化名的。 5 家是极小的样本,下面的数字请当成一个草图看,不是一个比率。
| 检查项 | 头部品牌 | 5 家小企业 |
|---|---|---|
首页有 h1 | 31 家里 21 家 | 5 家里 1 家 |
Organization 标记 | 31 家里 14 家 | 5 家里 2 家 |
Review / AggregateRating 标记 | 31 家里 2 家 | 5 家里 0 家 |
robots.txt 里提到任何 AI 爬虫 | 30 家里 7 家 | 5 家里 0 家 |
请按顺序读这几行。第一行是一个真实的差距,值得谁花十分钟去补。 第二行是相对于一个多数的差距,而那个多数本身还不到压倒性。 第三行和第四行根本不是差距—— 不管什么规模,没有人在做,一份把它们列成你的失分项的报告,是在凑字数。
这现在是我们写报告的一条规则:一项检查必须先和这个基准比过, 才能被称为一个问题。 低于基准是问题。和基准持平,最多是一个机会。高于基准,要明说这是一个优势。 这条规则直接从我们的审计清单里删掉了两项, 也是为什么你的报告不会是一张 60 行的「你还没做的事」。
它是一次文件扫描。它测的是这些公司部署了什么,它测的就只有这个。
三件事,没有一件是「去买点什么」。
llms.txt 之外没有任何专门的 AI 文件,
有 agents.md 的那些里有三分之二是购物平台替它们写的,
其中 11 家完全不发布结构化数据。
谁报个价说要帮你「追上头部」,你该问是哪些头部,然后把这一页给他看。robots.txt,免费。要知道第二件事,唯一的办法是去问那些助手,在你的品类里,看回来的是什么。 那才是测量,而且你不付我们钱也可以开始做。
我们想用 Google Analytics 统计有多少人看了这个页面、又有多少人真的买了报告—— 除此之外不做别的。它会往你的浏览器写 cookie,并把你的 IP 发给谷歌, 所以得先问你一句。说不也完全不影响你用这个网站。 具体收了什么。