SEO 与营销工具

robots.txt 检查工具

发布 robots.txt 前,按精确 product token 与路径检查粘贴文本中的 Allow 和 Disallow 规则。

robots.txt 检查工具用浏览器内的一段规则检查逻辑处理粘贴文本。它会合并相同 product token 的多个规则组;没有精确组时才使用星号组,并显示最终命中的规则行。

浏览器本地处理

robots.txt 检查工具

工具逻辑在当前浏览器中运行

User-agent: * Disallow: /preview/ User-agent: AuditBot Allow: /preview/public/

Googlebot

/preview/public/page?draft=1

规则判断

输入内容后选择一个处理方式。

使用方法

三步完成处理

  1. 01

    粘贴准备发布的 robots.txt 文本,保留会影响目标路径的 User-agent、Allow 和 Disallow 行。

  2. 02

    输入一个精确 product token 和路径;粘贴完整 HTTP URL 时,工具只取路径与查询字符串参与匹配。

  3. 03

    检查命中的行,再用一个应公开路径、一个应禁止路径和每个计划支持的 product token 重复测试。

product token 规则组如何选择?

工具对输入 token 做不区分大小写的精确比较。相同 token 出现在多个规则组时会合并这些组;只有没有精确组时才回退到星号组。因此 NotGooglebot 不会误选 Googlebot 组。

可复现的最长规则示例

如果 AuditBot 的匹配组同时含有 `Disallow: /reports/` 与 `Allow: /reports/public/`,路径 `/reports/public/q2.pdf` 会因后者更长而允许。同长度的 Allow 与 Disallow 冲突时 Allow 优先;空 Disallow 不生效,路径模式可用星号与末尾美元符。

浏览器内处理的精确边界

本工具 handler 读取输入框并在当前浏览器计算,不请求站点 robots.txt、不提交 URL,也不调用爬虫 API。页面仍可能加载常规站点资源或已配置的统计脚本,因此这不是“整页绝对零网络”承诺;不要输入密码、令牌或私钥。

错误、忽略项与上线复核

缺少可用 User-agent 组或完整 URL 无效时会报错。注释、Sitemap、Crawl-delay 等 unsupported 字段不参与判断;完整 URL 的 fragment 也不参与。矩阵通过后仍要另行核对线上文件的状态码与正文,并用服务器日志或官方工具验证真实抓取。

常见问题

关于这个工具

多个同名 User-agent 组会怎样处理?

工具会合并所有含相同精确 product token 的组,再从合并后的 Allow 和 Disallow 中选择最长匹配;不会只取第一组。

为什么输入完整 URL 后看不到 fragment?

匹配使用 pathname 与 query;井号后的 fragment 不会发送给服务器,也不进入这个规则检查。请对照输出里的“路径”确认实际测试值。

显示允许是否代表会被收录?

不代表。允许只说明所选规则没有禁止这个样例路径。页面发现、HTTP 响应、页面级指令、canonical、内容质量与外部平台策略都要另行取证。

工具为什么不检查 Sitemap 或 Crawl-delay?

本试点只实现 User-agent、Allow 与 Disallow 的路径决策。Sitemap 地址要单独检查,Crawl-delay 与其他 crawler 方言也应以目标爬虫的当前官方说明为准。

延伸阅读

继续探索

最后更新: