百度是如何收录网页的?百度蜘蛛收录一个网站的的全过程揭秘

所属分类: 网站运营 / 网站优化 阅读数: 51
收藏 0 赞 0 分享

  搜索引擎工作过程非常复杂,今天和大家分享一下我所了解的百度蜘蛛是怎么实现网页收录的。

  搜索引擎工作大致可以分为四个过程。

  1、蜘蛛爬行抓取。

  2、信息过滤。

  3、建立网页关键词索引。

  4、用户搜索输出结果。

  蜘蛛爬行抓取

  当百度蜘蛛来到一个页面时,它会跟踪页面上的链接,从这个页面爬行到下一个页面,就好像一个递归过程,这样常年累月,不止疲倦的工作。比如蜘蛛来到了我的博客首页http://blog.sina.com.cn/netSEOer,它会先读取根目录下的robots.txt文件,如果没有禁止搜索引擎抓取,那么蜘蛛就开始针对网页上的链接,进行逐一跟踪爬行。比如我的置顶文章“SEO概述|什么是SEO SEO到底是干嘛的”,引擎就会多进程式的来到这篇文章所在的网页抓取信息,如此循坏,没有终结。

  信息过滤

  为了避免重复爬行和抓取网址,搜索引擎会有一个记录已爬行和未被爬行的地址库,如果你有一个新网站时,你可以去百度官网提交网站的网址,引擎就会记录它,并把它归类到未爬行的网址,然后蜘蛛就会根据这个表格,从数据库中提取URL,访问并抓取页面。

  蜘蛛并不会收录所有的页面,它要经过严格检测。当蜘蛛在爬行和抓取一个网页的内容时,会进行一定程度的复制内容检测,如果网页所在的网站权重低,而且大部分文章都是抄袭来的话,蜘蛛就很可能不喜欢你的网站了,不在继续爬行,也就不收录你的网站。

  建立网页关键词索引

  当蜘蛛抓取了一个页面之后,首先会对页面文字内容进行分析。通过分词技术,将网页的内容简化到关键词,并把关键词和对应的网址制成表格建立索引。

  索引又有正向索引和反向索引,正向索引是把网页内容对应的关键词,反向是关键词对应的网页信息。

  输出结果

  当用户搜索了某个关键词之后,就会通过前面建立的索引表进行关键词匹配,通过反向索引表找到关键词对应的页面,通过引擎对网页综合评分计算以后,根据网页的评分来决定网页的先后顺序排名。

  相关推荐:

  网站优化 百度蜘蛛到底喜欢什么?

  怎么查询ip是否为百度蜘蛛ip? tracert指令的使用方法

更多精彩内容其他人还在看

采用正当网站策略来优化网站的方法(图文)

网站优化中需要注意哪些策略呢
收藏 0 赞 0 分享

对淘宝网搜索规则以及排名规则的探讨(图文)

把淘宝的搜索规则弄懂了.才会更有利于商品的排名及名称优化
收藏 0 赞 0 分享

百度知道做电影流量关键词的技巧分析

 现在做关键词的手段各式各样,最终的目的还是为了流量。一部热门影片的搜索指数高到吓人,但能够出现在百度搜索结果前列的个人网站并不多,大部分都是百度百科,时光网,贴吧,大牌视频网站。
收藏 0 赞 0 分享

SEO是什么?SEO搜索引擎优化相关术语介绍

SEO(Search Engine Optimization),汉译为搜索引擎优化,是较为流行的网络营销方式及NNT流量,主要目的是增加特定关键字的曝光率以增加网站的能见度,进而增加销售的机会
收藏 0 赞 0 分享

6.22百度k站事件给我们的反思 做优质内容站

相信大家最近一段时间都知道6.22 6.28百度地震的事件吧。最近我在一些seo论坛和一些站长论坛听到很多人都说百度从6月22日开始很多网站被k了,相距6月28日又有很多站长反应被k站的问题
收藏 0 赞 0 分享

百度最喜欢什么样的网站分享

其实不论是什么网站,只要用户喜欢,自己热爱的网站,能帮助到别人的网站就是好网站,自然也就百度喜欢了,坚持与优质内容
收藏 0 赞 0 分享

链接的数量、广泛多样化是把双刃剑 成功要得法

搜索引擎越来越重视用户体验已经是个趋势,但是这并不能否定链接和原创内容的重要性
收藏 0 赞 0 分享

让你更好的利用外链资源做网站推广(四点原则)

外链在网站推广中的作用大家都是知道的,那么关于外链资源的应用有哪些方法和技巧呢,武汉seo公司要是能够运用好外链资源,seo优化就能起到事半功倍的作用
收藏 0 赞 0 分享

网站上线后应按照方法做seo推广工作小结

刚刚新建起来的一个网站,下一步的工作就是做好网站推广了,那么网站推广工作的展开要怎么开始呢,所要做的基本工作是哪些,下面武汉seo公司就为新手朋友做个简单介绍吧
收藏 0 赞 0 分享

利用相关性提高网站关键词排名的方法

大家都知道网站的相关性对整个网站的专业性,网站的权威性,网站的权重高低都有一个非常重要的评价,如果我们能从网站的主题,内容,以及外链等加以深化做到相关性非常高的话对网站关键词排名是非常有好处的
收藏 0 赞 0 分享
查看更多