上线前核对抓取与索引配置,核心是确认三件事:搜索引擎能正常访问页面、页面明确允许被索引、站点结构能把这些页面串联起来。最容易被忽略的是“能访问”和“允许索引”之间的差别——页面返回正常状态码,但被 robots 规则或 meta 标签挡在索引之外,上线后流量为空的常见原因就在这里。下面用一个假设例子走一遍完整核对流程。
假设你负责一个用 CMS 搭建的企业站,栏目包括首页、产品列表、产品详情、新闻列表、新闻详情、关于我们。开发环境里这些页面都能打开,现在要切到正式域名上线。上线前你需要在 CMS 后台和服务器两侧分别核对,而不是只看浏览器能不能打开。
抓取通道由 robots.txt 和服务器访问控制共同决定。核对时打开正式域名下的 /robots.txt,逐行看是否有 Disallow: / 这类整站屏蔽规则。开发阶段为了防止测试内容被抓取,常会加上这条规则,上线时忘了删,结果整站无法被抓取。
/product/、/news/。noindex 的 HTTP 响应头,它比页面里的 meta 标签更隐蔽。判断结果:robots.txt 允许抓取、服务器不限制访问、响应头没有 noindex,三者同时满足才算抓取通道畅通。缺一项,后续所有索引配置都没有意义。
抓取和索引是两件事。页面能被抓取,不代表会被收录。在 CMS 里逐个模板检查 meta robots 标签,重点是列表页和详情页模板。常见错误是模板里写死了 <meta name="robots" content="noindex">,开发时用来避免测试内容进入索引,上线后没有改回来。
核对方法:打开几个代表性页面的源代码,搜索 noindex 和 nofollow。产品详情、新闻详情这类需要被收录的页面不应带 noindex;后台、搜索结果页、重复的筛选参数页可以保留 noindex。
适用条件:如果站点有分页、筛选、排序参数,要明确哪些参数页允许索引、哪些不允许。全部放开容易产生大量近似页面,全部屏蔽又可能切断详情页的抓取路径,需要按实际结构决定。
再好的页面,如果没有入口链接,抓取程序也很难发现。核对站点地图和内部链接两处。
/sitemap.xml,确认它存在、格式正确、包含主要栏目和详情页,并且里面的网址是正式域名而不是测试域名。判断结果:站点地图里的网址数量与站内实际重要页面数量大致对应,且每个页面都能通过至少一条普通链接到达,说明发现路径基本完整。
上线时常出现 www 与非 www、http 与 https 同时可访问的情况,同一内容对应多个地址。核对时选定一个主域名,其余地址做 301 跳转,并确认跳转是永久跳转而不是临时跳转。CMS 后台的站点地址配置也要与主域名一致,否则生成的链接、站点地图和资源路径可能仍指向旧地址。
检查项:访问备用域名,看是否跳到主域名;查看页面源代码里的 canonical 标签,确认它指向主域名下的对应地址;确认图片、样式、脚本的引用路径不是测试域名。
配置核对完成后,先不要急着提交大量地址。用抓取测试类工具对首页和几个详情页各请求一次,确认返回状态、robots 状态和实际抓取到的内容与预期一致。确认无误后,再通过站点地图或单页提交方式让抓取程序知晓新地址,并在之后几天观察索引状态是否按预期增加。如果发现某个栏目迟迟没有收录,回到第二步和第三步,优先检查该栏目的模板是否带 noindex、是否有内部链接指向它。