上线前核对抓取与索引配置,核心是确认三件事:爬虫能顺利访问页面、页面返回的是可索引内容、站点明确告诉搜索引擎哪些地址值得收录。自己建网站时,这三步最好在正式对外之前完成,否则上线后再改,已经抓取或收录的错误版本可能长期留在结果里。核对的目标不是保证收录,而是排除自己造成的障碍。
最常见的问题是网站还没准备好,就用 robots.txt 或访问密码把整站封了,上线时忘了解除。核对时打开浏览器访问自己的 robots.txt 地址,看是否出现整站禁止的规则,例如 Disallow: /。如果确实写了这条,搜索引擎爬虫就不会正常抓取,页面自然不会进入索引。
除了 robots.txt,还要检查服务器层面是否对爬虫返回了拒绝状态。可以用命令行工具模拟一次请求,观察返回码:
curl -I -A "Mozilla/5.0 (compatible; Googlebot/2.1)" https://你的域名/
返回 200 表示可以正常访问;返回 403、401 或 503 都说明爬虫可能被拦。需要区分“可能原因”和“已经定位的原因”:返回 403 可能是防火墙规则,也可能是权限配置,不要看到 403 就断定是某一处设置,要逐项排查。
爬虫看到的页面和你浏览器里看到的不一定一样。自己建网站时,如果用了前端渲染,要确认关键内容在原始 HTML 里就能读到,而不是全靠脚本加载后才出现。
<meta name="robots" content="noindex">,这条会让页面不被索引。200,而不是跳转或错误页。noindex 和 robots.txt 的区别要分清:robots.txt 禁止抓取,爬虫看不到内容;noindex 允许抓取但要求不收录。如果两者同时用,noindex 可能因为页面根本抓不到而无法生效。想移出索引,通常应允许抓取并保留 noindex。
站点地图不是收录保证,但它能帮助爬虫发现你希望被索引的地址。自己建网站时,至少确认站点地图里列出的都是返回 200、允许抓取、没有 noindex 的页面。如果地图里混入大量错误页或已删除页,会浪费抓取预算,也降低这份文件的可信度。
内部链接同样重要。首页和栏目页应该能通过普通链接到达重要内容,不要只靠脚本点击或搜索框。可以做一个简单检查:从首页出发,只点链接,能否在三到四次点击内到达主要页面。如果到不了,爬虫发现这些页面的机会也会变少。
正式上线后,用搜索引擎提供的站长验证工具提交站点地图,并查看抓取统计和索引覆盖报告。不同搜索引擎、网页搜索、平台推荐和付费广告是分开的系统,这里核对的是自然搜索的抓取与索引,不涉及广告投放。
判断结果时看两类信号:一是抓取是否成功,二是页面是否被选为索引。被抓取不等于被索引,索引也不等于有排名。如果发现大量页面显示“已抓取,尚未索引”,优先检查内容是否重复、是否单薄、是否有明确入口,而不是反复提交。
下一步可以这样做:先列出你希望被收录的核心页面,逐个用 curl 或浏览器源代码核对返回码、robots 规则和 noindex 状态,再检查站点地图是否只包含这些合格地址。把这份清单留到上线后一周再复查一次,对比抓取和索引报告,就能判断问题是出在配置还是内容本身。