确认动态页面在360搜索中的可见内容,不能只看浏览器打开后的画面。正确做法是:先查看360蜘蛛实际抓取到的HTML源码,再判断正文是否存在于源码中、是否依赖JavaScript执行后才出现,最后用360搜索的收录结果做交叉核对。如果源码里没有正文,只有脚本占位,那么该内容对360搜索来说很可能不可见。
动态页面常见两种形态:一种是服务端渲染,请求返回的HTML里已经包含标题、正文、链接;另一种是前端渲染,HTML只返回空容器和JavaScript文件,正文要等脚本执行后才出现。对360搜索而言,判断可见内容的第一步是区分这两种情况。
可执行步骤:
Ctrl+U 查看网页源代码,而不是按 F12 看Elements面板。<div id="app"></div>、<script> 这类占位结构,判断正文是否由脚本注入。curl -A "360Spider" 页面URL 获取原始响应,确认服务器返回给爬虫的HTML与浏览器源码是否一致。判断结果:源码中能直接找到正文,说明可见内容不依赖脚本执行;源码中只有空容器,说明需要进一步确认360蜘蛛是否执行JavaScript。如果服务器对360Spider返回了不同内容,还要检查是否存在误判或刻意差异。
“动态页面”不等于“内容不可见”。需要把问题拆成三种情况分别判断:
需要特别说明:robots.txt 的抓取限制不等于可靠的索引移除。即使屏蔽了某个JS或接口,已经收录的页面仍可能保留在结果中;站点地图也不保证收录。要确认可见内容,最终仍要回到“蜘蛛实际拿到了什么”这个证据上。
源码检查之后,还需要看360搜索实际展示了什么。操作方法:在360搜索中用 site:你的域名 查看收录概况,再搜索页面标题或正文中的独特句子,观察结果摘要是否来自真实正文。
核对时重点看三项:
注意:收录结果有延迟,今天修改了渲染方式,不代表明天就会更新。判断时应以当前蜘蛛抓取到的源码为主要依据,搜索结果为辅。
如果要把一个动态页面改成360搜索可见,不能只丢给开发一句“做下SEO”。按结果倒推,需要明确以下交付物:
curl -A "360Spider" 获取的HTML中能直接搜到正文独特句子;页面标题、正文、主要链接均出现在源码中;360搜索重新抓取后,结果摘要能反映正文内容。适用条件:这套验收适用于已有页面或项目的改进。如果页面正文必须依赖用户登录、表单提交或个性化接口才出现,那么公开可见内容本身就不存在,需要先决定哪些部分允许被搜索看到。HTTPS 不保证安全无漏洞或排名,它只是传输层的一项条件,不能替代上述可见性检查。
下一步:挑一个当前收录不理想的动态页面,用 curl -A "360Spider" 抓一次源码,把正文独特句子能否命中作为第一项检查结果记录下来,再决定是改渲染方式还是先处理robots.txt与接口拦截。