先给结论:境外零到访,国内在动
我们的官网在 9 月中旬上线时就按「AI 搜索友好」改造过:站根加了 llms.txt,每篇内容页补了结构化数据,robots.txt 里显式放行了一批 AI 爬虫。到 10 月 5 日差不多三周,翻开服务端日志,结果和预期不一样。
第一个意外:境外 AI 引擎爬虫基本零到访。meta-externalagent 全期 10 次(近 7 天 2 次),是唯一有实质收录行为的境外机器;近 14 天里 GPTBot、OAI-SearchBot、ChatGPT-User、ClaudeBot、PerplexityBot 都没有真实抓取。
第二个意外更重要:国内引擎其实一直在动,只是我们一开始漏看了。全期日志里 Sogou web spider 出现 46 次,是全站最活跃的搜索引擎爬虫;Baiduspider 渲染版与 360Spider 也各有记录。而我们改造时把八个境外爬虫写在放行清单最前面,国内只放了三个——优先级写反了。
对一家服务中国 B 端客户的国内站点,真实的 AI 搜索战场在豆包、元宝、文心、通义千问、Kimi、DeepSeek,不在 ChatGPT 和 Claude——后者在大陆不提供官方服务,国内客户根本用不上。优化 GPTBot 的收益,远低于在微信公众号上多写一篇能被元宝收录的文章。
先别急着得出「AI 搜索没用」的结论。这份实测真正能说明的是:AI 搜索的收录是慢变量,且国内引擎的通道结构完全不同——有的靠爬虫,有的根本不靠爬虫。正确的投入顺序不是「先折腾技术」,而是先分清每个引擎靠什么吃饭,再把内容放到它的通道上。
我们改了什么:一张改造清单
不绕弯子,先把改造动作摊开,便于你对照自己的站点。
| 层级 | 具体做法 | 想解决的问题 |
|---|---|---|
| 技术层 | robots.txt 显式放行国内与境外 AI 爬虫并声明 sitemap;国内爬虫段排在最前(DoubaoBot、Bytespider、DeepSeekBot、KimiBot、Kimi-SearchBot、QwenBot、TongyiBot、Baiduspider/-render、Sogou web spider) | 排除「是不是我没允许」这个变量——不少模板站和外包站的 User-agent: * 下面挂着一串 Disallow,会连带挡住 AI 爬虫 |
| 结构层 | 每篇内容页固定 3 个结构化数据块(面包屑、文章、FAQ 问答),全站统一 canonical 与社交分享标签 | 让机器知道这是谁写的、属于哪个栏目、正文在哪、有哪些问答对 |
| 摘要层 | 站根放一份 llms.txt:一页写清公司做什么、服务谁、哪些文章可引用 | 给 AI 一份「拿来即用」的企业摘要,而不是让它从零猜 |
| 内容层 | 每篇只讲一个判断,前 200 字给结论,数字用表格列清,问答对写进正文 | AI 引用的是句子,不是版式;问答对是最容易被原样摘录的形态 |
| 性能层 | 全静态页面、无登录墙、正文不依赖 JavaScript 渲染 | 抓取成本低,机器才愿意多抓几页 |
| 生态层 | 同一篇内容同步进微信公众号(服务号 + 订阅号) | 元宝、微信搜一搜的主要答案池在微信生态内部,这条通道爬虫管不到——见第五节 |
三周实测:爬虫日志里的真实名单
数据来自官网自建服务端记录(不接第三方统计脚本)。窗口取 2026-09-28 至 10-05 的近 7 天,并对照近 14 天与全期记录。全期累计留下 244 个访问身份、1112 条访问事件(含爬虫与自家访问)。
近 7 天全站 41 个访客 / 118 条事件,判定为爬虫的是 13 个访客 / 13 条事件,占 11%;按 UA 去重后,爬虫只有 3 个。
| UA 标识 | 归属 / 通道 | 记录 | 判读 |
|---|---|---|---|
| Sogou web spider/4.0 | 搜狗 → 微信搜一搜 → 腾讯元宝的外部搜索补充 | 全期 46 次 | 全站最活跃的搜索爬虫。搜狗是腾讯系,为元宝补长尾内容——这条线我们此前完全没关注 |
| meta-externalagent/1.1 | Meta(境外) | 全期 10 次,近 7 天 2 次 | 抓过 4 篇洞察长文 + 首页、联系、区域、隐私等;节奏平稳,属正常收录 |
| Baiduspider(渲染版) | 百度搜索 → 文心一言(内嵌百度 App) | 近 14 天 1 次 | 正确通路。文心内嵌于百度 App,百度资源平台的索引量就是文心的数据源基础——值得重点经营 |
| 360Spider | 360 → 纳米搜索 | 近 14 天 1 次 | 正常,低频 |
| HeadlessChrome/146 | — | 7 次(7 个访客各抓 1 次首页) | 链接预览 / 可用性监控类,不进任何索引 |
| HeadlessChrome/154 | — | 4 次(集中在 6 秒内) | 我们自己的上线验证脚本——已核对本地构建产物确认 |
| DoubaoBot / Bytespider | 豆包(字节) | 0 | 零记录。豆包的新站首次到访通常 1–3 天,三周零记录需要主动排查(见第六节清单) |
| DeepSeekBot / KimiBot / QwenBot / TencentBot | DeepSeek / Kimi / 通义 / 元宝 | 0 | 零记录。注意:这四家未必都有独立爬虫——没有记录不等于没收录,见第五节 |
| GPTBot / OAI-SearchBot / ChatGPT-User / ClaudeBot / PerplexityBot | 境外 AI | 近 14 天 0(真实抓取) | 零记录,且国内客户也用不上这些产品——优先级最低 |
把「没来」和「被拦」分开看很重要。我们同时核对了 robots.txt 返回 200、AI 允许段完整、sitemap 声明在位——不是被拒绝,是还没来。新站收录本来就按月计,爬虫的抓取频率又显著低于传统搜索引擎,三周零记录对低频引擎属于正常范围。
另有一组值得记录的辅助数据:全期 robots.txt 被请求 1046 次、sitemap.xml 被请求 349 次、llms.txt 被请求 66 次。llms.txt 的请求方包括 AhrefsBot、Googlebot 以及真实抓取过/llms.txt 的 GPTBot 请求——说明这份文件确实被机器读取,不是摆设。
五类日志判读陷阱(含伪装成 GPTBot 的扫描器)
这一节是本文最想补充的部分。我们第一次做日志统计时,把「UA 里出现 GPTBot」直接当成了「GPTBot 来了」——这是错的。按 UA 做全期检索,GPTBot 相关请求有 352 条,但逐条看内容,绝大多数不是收录行为:
| 陷阱 | 现场特征 | 怎么识别 |
|---|---|---|
| ① 伪装成 AI 爬虫的漏洞扫描器 | 同一 IP(如 34.38.159.35)在一秒内请求 /.git-credentials、/api/.env、/graphql、/.aws/credentials.old、/_profiler/phpinfo,全部 404;UA 在 GPTBot/1.2 与 1.4 之间随机切换,还轮流伪装成 Mac / iPhone / Ubuntu / Windows / Android 五种客户端 | 真正的 AI 爬虫不会去摸 .env 和凭据文件。看请求路径——正常收录抓的是页面,扫描器抓的是敏感文件 |
| ② 预览 / 监控类无头浏览器 | HeadlessChrome 连续两周出现,每次只抓一次首页,时间散布在六天里 | 只抓首页、不深入内链、不进任何索引 |
| ③ 你自己 | 4 次抓取发生在 6 秒内、目标全是当天刚上线的新页面 | 与上线时间高度重合、节奏急促——本站在全期事件中自家访问常年占 43%~56% |
| ④ 低频引擎被误判为「没来」 | Baiduspider-render、360Spider 近 7 天都是 0 | 低频引擎的观察窗口不能取 7 天,至少看 14 天或全期 |
| ⑤ 生态内流量,日志里根本看不见 | 元宝、豆包、文心的部分信源来自生态内部内容(公众号、头条号、百家号),不经过你的服务器 | 这类收录在服务端日志里永远不会出现。日志为 0 不等于没被收录——这是最容易得出错误结论的一类 |
所以判读日志的正确姿势是三步:先按请求路径剔掉扫描器,再按节奏剔掉预览与自家,最后把「生态内通道」单独拿出来看。只看 UA 名字统计次数,得到的结论大概率是错的。
关键修正:国内 AI 引擎的信源通道不等同于爬虫
这是本文最初版本最大的盲区。国内 AI 引擎的信源结构差异极大,不能像对 Googlebot 那样,只靠改 robots.txt 和观察爬虫日志来推进。按公开资料与实测,大致分三类:
| 引擎 | 主要信源通道 | 对我们意味着什么 |
|---|---|---|
| 文心一言(百度) | 百度系生态:百度搜索索引 + 百科 + 知道 + 百家号 | 爬虫可触达(Baiduspider / -render)。百度资源平台的收录量就是文心的数据源基础,同时百家号内容是更高权重源 |
| 腾讯元宝 | 微信公众号(公认权重最高)+ 视频号 + 微信搜一搜 + 腾讯新闻,外部靠搜狗补长尾 | 公众号是元宝的独家资产,爬虫管不到微信生态内部。开门方式是「把内容发进生态」,不是改配置。这也解释了为什么搜狗爬虫在我们站上很活跃,但元宝未必会因此推荐我们 |
| 豆包(字节) | 字节系生态:抖音、今日头条、西瓜视频为主;DoubaoBot / Bytespider 有公开爬虫 | 爬虫可触达,且是少数有公开 UA 的国内 AI 爬虫。新站首次到访通常 1–3 天;若 7 天仍无记录,应排查 robots / sitemap / WAF |
| 通义千问(阿里) | 阿里生态:淘宝商品库、高德、支付宝、本地生活为主;无独立公开爬虫 UA(主要复用第三方索引) | 日志零记录不代表没收录。B 端专业服务问题不是它的主战场,优先级相对低 |
| Kimi(月之暗面) | 聚合第三方索引(搜狗等)+ 知乎等平台;有 KimiBot / Kimi-SearchBot 且官方公开了爬虫政策页 | 国内唯一公开爬虫政策的厂商,明确遵循 robots.txt。屏蔽 Kimi-SearchBot 等于从 Kimi 搜索结果里消失,务必放行 |
| DeepSeek | 技术社区(CSDN / 知乎 / GitHub)+ 权威媒体;有 DeepSeekBot | 极度偏好长文技术内容,对纯营销页几乎不抓。三周零记录属常见;引导到访的有效方式是在技术社区发深度文章并在文末带官网链接 |
这张表推翻了我们最初的假设。改造三周里我们把主要精力放在 robots.txt 放行境外爬虫和补 llms.txt 上,而对真正影响国内客户触达的两件事做得最少:一是把内容同步进微信公众号(元宝通道),二是在百度系生态里建立占位(文心通道)。日志告诉我们「谁来过」,但决定不了「客户在 AI 里能不能搜到我们」。
另需说明一个通用事实:国内大模型获取信息并不全靠实时爬虫,部分回答来自训练数据预喂——这部分 robots.txt 管不到,也不产生日志。因此「日志为零」与「在 AI 回答里被引用」之间,隔着好几层,不能直接划等号。
该做什么:国内优先的 AI 搜索准备清单
按优先级排。前三项和爬虫没有直接关系,但它们决定「爬虫来了以后有没有东西可拿走」。P1 的排序按信源权重来:国内通道优先,境外通道最后。
| 优先级 | 动作 | 判断标准 |
|---|---|---|
| P0 内容 | 每篇只讲一个判断,前 200 字给结论 | 把文章给一个没有背景的人,他能在 30 秒内说出「所以呢」 |
| P0 结构 | 结论、数字、边界写成独立段落和表格,不要塞进图片里 | 摘出任一段落,语义完整、不依赖上下文 |
| P0 可信 | 每个数字写清来源与统计边界 | 引用者敢用——AI 越来越倾向引用带口径的数字 |
| P1 生态 | 把内容同步进微信公众号(服务号 + 订阅号),必要时补百家号、头条号 | 元宝的主要答案池在微信生态内部、文心看重百家号——这类通道爬虫管不到,只能靠「把内容发进去」 |
| P1 入口 | robots.txt 显式放行国内 AI 爬虫(DoubaoBot、Bytespider、DeepSeekBot、KimiBot/-SearchBot、QwenBot、Baiduspider/-render、Sogou)并声明 sitemap | 三分钟能做完,把「有没有被允许」这个变量排除掉。国内段写在前面,境外段保留在后 |
| P1 摘要 | 站根放一页 llms.txt 企业摘要 | 一屏说清你是谁、做什么、哪些内容可引用 |
| P2 百度生态 | 经营百度资源平台:提交 sitemap、看索引量 | 百度索引量是文心的数据源基础,比盯爬虫日志更接近结果 |
| P2 度量 | 把爬虫、自家、真人分三档统计;低频引擎看 14 天以上 | 不分档、窗口太短,你连基线都没有,也就无法判断「有没有变好」 |
| P3 境外 | 顺带放行境外 AI 爬虫 | 有出海业务才值得投入精力;纯内销站点放行即可,不必专门优化 |
| P4 禁忌 | 不要给 AI 爬虫做特供页或隐藏文本 | 一旦被判定作弊,损失远大于收益 |
站点有几十上百页时,落地顺序建议是:先改 5 篇最有判断力的文章 → 再把内容同步进微信生态 → 然后补 robots 与 llms.txt → 最后建度量分档。反过来做(先折腾技术、内容照旧)是我们见过最常见的空转,也是我们自己这三周踩过的坑。
本文要点
- 境外 AI 引擎爬虫零真实到访;国内引擎里 Sogou web spider 全期 46 次最活跃,Baiduspider-render、360Spider 各有记录
- 国内爬虫并不都靠爬虫:元宝靠微信公众号、文心靠百度生态与百家号、豆包靠字节生态——生态内通道爬虫管不到,日志也看不见
- 日志里有五类陷阱:伪装成 GPTBot 的漏洞扫描器(352 条 GPTBot 记录里绝大多数是扫描)、预览机器人、你自己、低频引擎、生态内不可见流量
- 辨别真假爬虫的关键是看请求路径:真爬虫抓页面,扫描器摸
.env、.git-credentials - 投入顺序(国内优先):先写好内容 → 同步进微信生态 → 补 robots 与 llms.txt → 建度量分档
这份实测不能说明什么
把边界写在明处,这份数据的价值才站得住。
- 样本极小:1 个站点、3 周、十余次爬虫事件。它能作为「新站慢热」的一个观察点,不能外推成行业规律。
- 只能看到抓取,看不到引用。AI 回答里到底引用了谁,属于另一套观测体系,本文回答不了。
- 日志为零 ≠ 没被收录。国内多家引擎无独立公开爬虫、且部分内容来自生态内或训练数据预喂,这些都不产生服务端日志。
- 三周零记录 ≠ 永久零记录,也不等于 AI 搜索渠道无效——只说明收录周期长于我们最初的预期。
- 文中各引擎的信源通道描述,来自公开资料与实测的交叉印证,各平台策略会变,建议每季度复核一次。
- 结论对内容型站点更适用;工具站、电商站的抓取动机与路径不同,不能直接套用。
我们会继续按周巡检爬虫日志,后续变化在《生长日记》系列里继续公开。
微信内识别二维码分享此文