搜狗建站收录百度却搜索不到原因:蜘蛛抓取其实有这2个偏好

搜狗建站收录百度却搜索不到原因:蜘蛛抓取其实有这2个偏好

新站点上线后的第3天,搜索引挚日志文件access.log记录下大量数据。一家企业周一开通服务器,周三下午14点查询,搜狗放出15个页面。在百度搜索框输入完全一致的标题,结果显示0条记录。查看宝塔面板的服务器日志发现,IP段为116.179.32.x的Baiduspider在周二凌晨2点访问首页3次,返回状态码200。IP段为123.125.71.x的Sogou web spider访问12次。两家搜索引擎的爬虫程序对待新域名的抓取频次与放出时间有着完全不同的设定。

百度对新注册域名的考察期长达21天到28天。新域名在百度的初始信誉分15分,满分100分。前端展示及格线60分。500个小时的考察期,百度蜘蛛把下载的HTML文件存放在名为sandbox-temp的临时数据库里。爬虫提取网页底部的ICP备案号,与工信部数据库里的18位统一社会信用代码进行比对。备案号对不上,信誉分扣除15分。备案号完全一致,系统加20分。网页在这个阶段不会出现在前端搜索结果中。

搜狗的数据库每天补充5000万个新网页来维持信息量。搜狗对新域名的初始信誉分要求仅10分。服务器在48小时内能正常通信,延迟低于300毫秒,搜狗蜘蛛把抓取到的网页标题和描述强制渲染出来。排位安排在第15页或者第20页之后。搜狗爬虫无视域名有没有3年的建站历史,抓取到300个汉字的内容塞进数据库。

百度的文本提取算法剥离掉网页里的<div><span>等标签,专门计算纯汉字的数量。一篇包含200个汉字和5张图片的企业简介,被系统打上低质短内容标签。普通资讯文章的最低字数门槛800字。蜘蛛读取这800字,计算纯文本词频。文章内容与百度现有数据库里的老文章有75%的重复率,系统判定抄袭,临时数据库里的这篇网页被永久删除。

搜狗的HTML解析标准放宽要求。网页里有300个汉字,搜狗建库存储。相似度检测的容忍度高达90%。改换文章首尾段落,通过搜狗的去重检测。搜狗蜘蛛每次下载网页分配50KB的内存,放弃读取复杂的CSS和JS脚本文件。百度蜘蛛分配150KB以上的内存,把整个网页的视觉排版完全模拟出来,排版错乱扣除10分。

百度搜索资源平台官方指南提到,加载时间超过1.5秒的网页,蜘蛛中断抓取进程,当天的抓取配额减少50%。

百度蜘蛛抓取新站的6个硬性指标设定:

  • 首字节响应时间控制在200毫秒以内。

  • 过去36个月,该域名的历史解析记录里0条被惩罚痕迹。

  • 每周一上午9点,网站有3篇全新的纯原创文章发布。

  • 网页的标题标签内包含15个汉字长度的精准短句。

  • 100%的图片属性填写10个字以内的图片内容说明。

  • 单个网页向外导出的友情链接数量上限5个。

百度的蜘蛛与搜狗蜘蛛抓取参数对比数据表:

抓取参数项目百度蜘蛛 (Baiduspider)搜狗蜘蛛 (Sogou web spider)
新站初始信誉分15分10分
考察期天数21天 - 28天1天 - 2天
纯文本字数下限800字300字
内容重复度上限25%10%
内存分配大小150KB50KB
每日抓取配额100个URL不限量
延迟容忍度1.5秒内3.0秒内

网站管理员登录宝塔面板或阿里云控制台,下载当天的access.log日志。使用代码编辑器打开,按快捷键搜索爬虫标识符。统计返回的状态码。200代表蜘蛛成功带走文件。404代表文件丢失。503代表服务器中央处理器占用率达到100%。一个正常运行一周的新站,每天有50个200状态码。连续出现5个503状态码,百度蜘蛛停止抓取48小时。新站的抓取配额限制在每天100个网页以内,超过部分全部丢弃。

应对百度抓取规则的7个执行操作:

  • 在百度搜索资源平台绑定站点,提交包含100个条目的可扩展标记语言格式地图文件。

  • 撰写字数达到1200字的行业技术评测文章,包含具体的型号和参数。

  • 上传的5张产品实拍图,使用压缩工具将单张大小限制在80KB以内。

  • 寻找2个建站时间超过5年的同行业网站,交换首页链接。

  • 在文章底部放置3篇相关阅读文章的链接,把跳出率控制在60%以下。

  • 开启服务器的代码压缩功能,将网页体积从120KB压缩到30KB。

  • 安装数字证书,把明文传输协议替换为加密协议,开启443端口通信。

花钱购买10000个论坛群发外链,24小时内触发百度的反作弊系统。域名的信誉分掉到负50分。从负分恢复到正常状态,保持网站连续180天无违规操作,每天更新2篇纯手工原创文章。使用采集软件一天生成500个没有排版、没有段落的机翻网页,访客停留时间不足3秒,跳出率高达95%。三个月的时间跨度,搜索引擎把这500个页面连同网站首页一起从数据库中彻底抹除。

服务器的物理位置距离访客的真实地理位置相差3000公里,页面加载时间增加400毫秒。在北京备案的网站,服务器放在海外机房,跨洋光缆的数据传输产生15%的丢包率。百度蜘蛛的爬取节点部署在国内的北京、上海、广州三大数据中心。爬虫每次发起网络握手连接,耗时超过800毫秒,系统判定该站点不符合国内用户的浏览标准,拒绝分配展示排名。

降低惩罚风险的4个操作动作:

  • 不在同一台物理主机上绑定超过10个没有任何真实流量的空壳域名。

  • 不在文章内容的头部、中部、尾部塞入超过3次完全一样的长尾词。

  • 修改网页大标题标签的频率不超过每个月1次,每次改动字数不超过5个字。

  • 不使用脚本代码把真实的文字替换成图片格式躲避审查。

使用Nginx架构的服务器抗并发能力优于Apache架构。100个用户在同一秒钟点击网页,Nginx占用的内存仅2.5MB。蜘蛛在高峰期凌晨2点到4点之间进行批量抓取,稳定的内存占用率保证状态码维持在200。内存飙升到8GB上限,服务器宕机重启,蜘蛛抓取到空白文件。连续3天发生宕机,该域名的沙盒期延长30天,放行时间无限期搁置。

网页代码的层级嵌套深度严重影响抓取成功率。企业网站的代码主体标签到正文段落标签,中间隔了8个布局区块层级,百度蜘蛛解析到第5层放弃读取。搜狗蜘蛛停留在第3层。网页源码体积超过2MB,蜘蛛提取有效文本的耗时超过1.2秒,抓取状态强制转为206断点续传。当天的收录配额按作废处理。

精简网页代码的3个硬性指标:

  • 删除无用的样式表冗余类名,将排版文件体积控制在50KB内。

  • 把所有的特效脚本调用代码放在网页底部的闭合标签上方。

  • 整体代码的层级嵌套保持在4层以内。

手机端与电脑端的适配状态被计入抓取评分。百度移动端蜘蛛占比达到85%。使用自适应设计的网站,同一个排版文件在375像素宽度的屏幕上加载时间低于1秒。蜘蛛分配的移动端初始信誉分增加15分。电脑端网页使用代码强制跳转到移动端二级目录,两次重定向消耗600毫秒,蜘蛛抓取成功率下降40%。