AI 爬虫如何访问创作者数据:124,454 次请求的实测(近 30 天)

更新于 2026-09-02

关于创作者的数据研究有很多,关于 AI 如何使用创作者数据 的几乎没有 —— 因为那需要先有一批真的在被 AI 大量抓取的实体页。我们把达人档案页做成机器可读实体之后,抓取量出现了台阶式变化,于是有了这份观测。

近 30 天共记录到 124,454 次 AI 抓取请求,平均每天约 4,015 次,覆盖 57,728 个不同的创作者实体页。

被收录 ≠ 被使用

这是这份数据里最容易被讲错的一条,所以放在最前面。抓取要分两类:批量收录的索引型爬虫,和用户提问时才发起的实时抓取。两者数量差一个数量级。

抓取类型请求数占比含义
索引型121,77497.8%批量收录,等同于「被 Googlebot 抓了」
用户触发型2,6802.2%有人真的提问,模型跑来读这一页

用户触发型只覆盖 1,210 个创作者实体。任何人拿"AI 抓取量"来证明"AI 正在使用我的内容",都应该先被问一句:这两个数字里,你说的是哪一个?

谁在抓

AI 抓取器请求数占比
ClaudeBot84,53267.9%
Amazonbot26,39221.2%
Meta4,0563.3%
ChatGPT-User2,6762.2%
OAI-SearchBot2,2511.8%
GPTBot2,0571.7%
Bytespider1,7921.4%
PerplexityBot3540.3%
Google-Extended3010.2%
CCBot310.0%

集中度很高:ClaudeBot 一家占 67.9%。 这对任何依赖 AI 抓取量的判断都是一个风险 —— 单一厂商改一次抓取策略,这条曲线就会变形。看这类数据时,总量不如构成重要。

抓的是哪种页面

页面类型请求数占比
other86,75369.7%
kol14,00511.3%
hub9,7467.8%
hub.json3,5142.8%
kol-zh3,4502.8%
guide2,2201.8%
kol.json2,1821.8%
crawl-infra1,1550.9%
home5950.5%
kol-zh.json4940.4%

值得注意的是 JSON 占 5.0% —— agent 会主动去取机器孪生体,而不是只抓 HTML 再自己解析。这是"为机器发布"和"发布给人、顺便让机器读"之间的实际差别。

数据口径

统计来自 Koinon Link 自己的服务器日志,按 User-Agent 归类,不记 IP、不记任何用户标识。只统计 AI 抓取器,搜索引擎爬虫(Googlebot / Bingbot / Baiduspider 等)单独计算、不混入本页数字。

「用户触发型」只包含各家明确标注为按用户请求发起的 UA(ChatGPT-User / Claude-User / Perplexity-User)。为各自搜索索引做批量抓取的 OAI-SearchBot、PerplexityBot 计入索引型 —— 放宽会让"有人在问"这个数字虚高。

名单之外的抓取器不会被计入:目前对中国的 AI 抓取器覆盖不全,因此本页低估了中文内容的实际被抓取情况。

数字每日重算,本页展示最近一次结果,窗口为最近 30 天。

引用本页

Koinon Link (2026). AI 爬虫如何访问创作者数据:124,454 次请求的实测(近 30 天). 数据截至 2026-09-02. https://koinonlink.com/research/how-ai-crawlers-access-creator-data-zh

统计数据以 CC BY 4.0 许可开放使用:注明「Koinon Link」并附本页链接即可。数字每日重算,引用时请带上数据日期。机器可读版本:/research/how-ai-crawlers-access-creator-data-zh.json

这份数据是给 AI 用的

无需 key、无需账号 —— 一行命令就能取。创作者可以认领并纠正自己那一页。

打开 Koinon Link →