sitemap URL 怎么提取?检查 loc 链接和索引文件

解释如何从 sitemap XML 或 sitemap index 中提取 loc URL,并检查域名、路径、数量和常见边界。

先区分 urlset 和 sitemap index

普通 sitemap 的 urlset 通常列出页面 URL,每个 url 下面会有一个 loc。sitemap index 则可能列出多个子 sitemap 文件,每个 sitemap 下面也会有一个 loc。

两种文件都可以提取 loc,但含义不同:urlset 输出多半是页面 URL,sitemap index 输出多半是子 sitemap 地址。检查时要先确认自己粘贴的是哪一种。

0

提取后检查域名和关键路径

URL 清单出来后,先看协议和域名是否统一。正式站点通常不希望 sitemap 中混入开发域名、预览域名或旧域名。

接着检查关键路径是否出现,例如首页、主要分类、工具页、文章目录和代表文章。数量变化很大时,应回到构建或内容数据层面查原因。

去重后再做人工对照

提取工具可以按文本去重,帮助发现重复 loc。若需要和上一版 sitemap 对比,可以把提取结果复制到表格或文本工具中,再按行比较。

重复并不一定说明页面坏了,但它会让 sitemap 难以审阅。对静态站点来说,sitemap URL 应尽量来自清晰的路由和发布数据。

提取 URL 不是抓取或提交

从 sitemap 文本中提取 loc,不会访问这些 URL,也不会检查 HTTP 状态、canonical、noindex、重定向或外部平台处理情况。它只是把 XML 中的链接整理成清单。

如果还要配合 robots.txt 发布前检查,可以把关键 URL 的路径部分列出来,逐条核对是否被规则误拦。

常见问题

关于本文主题

可以直接粘贴 sitemap index 吗?

可以,但要注意输出可能是子 sitemap 地址,而不是最终页面 URL。需要页面 URL 时,还要查看子 sitemap 内容。

提取到 URL 就说明页面可访问吗?

不能这样判断。提取只说明 XML 文本里出现了 loc,是否可访问需要另外检查 HTTP 状态和页面内容。

为什么要检查域名?

sitemap 通常应使用正式 canonical 域名。混入预览域名或旧域名会让人工审核和机器读取都更难判断当前公开范围。

延伸阅读

继续探索