把 Google 搜索收录做成可复用检查清单,核心不是罗列所有 SEO 知识,而是固定一条处理链:先确认页面是否被 Google 抓取,再判断它为什么没被索引,然后只处理当前最可能的原因,最后用同一组观察项复查。清单要能让人在十分钟内决定“先做什么、做完看什么”,而不是每次从零猜。
Google 搜索收录通常包含两个动作:Googlebot 抓取页面,以及 Google 把页面加入索引。页面被抓取不等于会被索引,被索引也不等于会获得排名。检查清单的第一项应当是记录当前状态,而不是直接改代码。
site: 查询只能作为粗略参考,结果不完整,不能当作收录数量的准确统计。判断结果:如果显示“已抓取,但未编入索引”,问题多半在内容质量或重复度;如果显示“已发现,但未抓取”,优先看抓取预算和链接路径;如果完全查不到,先检查 robots.txt 和页面是否返回正常状态码。
同一个现象可能有多个解释,清单的价值在于逐项排除,而不是一上来就断言唯一原因。以下每一项都写成“检查项 + 判断依据 + 处理动作”。
Disallow。注意:robots.txt 的抓取限制不等于可靠的索引移除,它只阻止抓取,不保证页面从索引消失。curl -I 或浏览器开发者工具看状态码。301、302、404、5xx 都会影响抓取和索引判断。<meta name="robots"> 和 HTTP 响应头中的 X-Robots-Tag。两处任意一处写了 noindex,页面就不会被索引。适用条件:这套勾选项适合单页或小批量页面排查。如果站点有成千上万个网址同时未收录,应先按模板和目录分组,而不是逐页勾选。
时间和人手有限时,不要平均用力。排序依据是:该问题影响多少页面、修复成本多高、是否阻塞后续所有检查。
判断结果:如果修改 robots.txt 后页面从“被阻止”变为“已发现”,说明抓取路径已通,下一步观察是否进入“已抓取”。如果状态没有变化,不要反复改同一项,转而检查链接和内容层面。
复查不是重新猜一遍,而是用和初次相同的项目对比。建议在清单里保留日期、网址、状态、处理动作、复查结果五列。每次只改一个变量,否则无法判断是哪一步起了作用。
复查要点:
HTTPS 不保证安全无漏洞,也不保证排名;它只是排查时的一个基础项,不应被当成收录的充分条件。不同搜索引擎对同一页面的处理可能不同,若同时关注其他引擎,需要分别核查,不能把 Google 的结果直接套用。
下一步:拿一个当前未收录的具体网址,按上面的勾选项从 robots.txt 和状态码开始逐项记录,形成你自己的第一版清单,再根据复查结果增删条目。