AI 爬虫如何访问创作者数据:124,454 次请求的实测(近 30 天)
关于创作者的数据研究有很多,关于 AI 如何使用创作者数据 的几乎没有 —— 因为那需要先有一批真的在被 AI 大量抓取的实体页。我们把达人档案页做成机器可读实体之后,抓取量出现了台阶式变化,于是有了这份观测。
近 30 天共记录到 124,454 次 AI 抓取请求,平均每天约 4,015 次,覆盖 57,728 个不同的创作者实体页。
被收录 ≠ 被使用
这是这份数据里最容易被讲错的一条,所以放在最前面。抓取要分两类:批量收录的索引型爬虫,和用户提问时才发起的实时抓取。两者数量差一个数量级。
| 抓取类型 | 请求数 | 占比 | 含义 |
|---|---|---|---|
| 索引型 | 121,774 | 97.8% | 批量收录,等同于「被 Googlebot 抓了」 |
| 用户触发型 | 2,680 | 2.2% | 有人真的提问,模型跑来读这一页 |
用户触发型只覆盖 1,210 个创作者实体。任何人拿"AI 抓取量"来证明"AI 正在使用我的内容",都应该先被问一句:这两个数字里,你说的是哪一个?
谁在抓
| AI 抓取器 | 请求数 | 占比 |
|---|---|---|
| ClaudeBot | 84,532 | 67.9% |
| Amazonbot | 26,392 | 21.2% |
| Meta | 4,056 | 3.3% |
| ChatGPT-User | 2,676 | 2.2% |
| OAI-SearchBot | 2,251 | 1.8% |
| GPTBot | 2,057 | 1.7% |
| Bytespider | 1,792 | 1.4% |
| PerplexityBot | 354 | 0.3% |
| Google-Extended | 301 | 0.2% |
| CCBot | 31 | 0.0% |
集中度很高:ClaudeBot 一家占 67.9%。 这对任何依赖 AI 抓取量的判断都是一个风险 —— 单一厂商改一次抓取策略,这条曲线就会变形。看这类数据时,总量不如构成重要。
抓的是哪种页面
| 页面类型 | 请求数 | 占比 |
|---|---|---|
| other | 86,753 | 69.7% |
| kol | 14,005 | 11.3% |
| hub | 9,746 | 7.8% |
| hub.json | 3,514 | 2.8% |
| kol-zh | 3,450 | 2.8% |
| guide | 2,220 | 1.8% |
| kol.json | 2,182 | 1.8% |
| crawl-infra | 1,155 | 0.9% |
| home | 595 | 0.5% |
| kol-zh.json | 494 | 0.4% |
值得注意的是 JSON 占 5.0% —— agent 会主动去取机器孪生体,而不是只抓 HTML 再自己解析。这是"为机器发布"和"发布给人、顺便让机器读"之间的实际差别。
数据口径
统计来自 Koinon Link 自己的服务器日志,按 User-Agent 归类,不记 IP、不记任何用户标识。只统计 AI 抓取器,搜索引擎爬虫(Googlebot / Bingbot / Baiduspider 等)单独计算、不混入本页数字。
「用户触发型」只包含各家明确标注为按用户请求发起的 UA(ChatGPT-User / Claude-User / Perplexity-User)。为各自搜索索引做批量抓取的 OAI-SearchBot、PerplexityBot 计入索引型 —— 放宽会让"有人在问"这个数字虚高。
⚠ 名单之外的抓取器不会被计入:目前对中国的 AI 抓取器覆盖不全,因此本页低估了中文内容的实际被抓取情况。
数字每日重算,本页展示最近一次结果,窗口为最近 30 天。
引用本页
Koinon Link (2026). AI 爬虫如何访问创作者数据:124,454 次请求的实测(近 30 天). 数据截至 2026-09-02. https://koinonlink.com/research/how-ai-crawlers-access-creator-data-zh统计数据以 CC BY 4.0 许可开放使用:注明「Koinon Link」并附本页链接即可。数字每日重算,引用时请带上数据日期。机器可读版本:/research/how-ai-crawlers-access-creator-data-zh.json