百度对搜索结果排序的一些标准解析

所属分类: 网站运营 / 网站优化 阅读数: 157
收藏 0 赞 0 分享

一、特征词库的类别的建立与更新

众所周知,百度有特征词库,通过特征词库,可以对用户查询序列,进行判断。例如:当用户搜索“天龙八部在线观看” 、 “射雕英雄传在线观看” 、 “鹿鼎记在线观看” 、 “电视剧在线观看”  时, 由于这些待挖掘序列中的 “天龙八部” 、 “射雕英雄传” 、 “鹿鼎记” 、 “电视剧” 在需求特征词库中属于视频类需求的特征词, 并且 “在线观看” 这一关键词与上述视频类需求的特征词的共现频次达到一定阈值(共现阈值)时,根据关键词 “在线观看” , 提取关键词 “在线观看” 与视频需求类别的映射关系, 并根据映射关系来建立或更新需求特征词库。


二、对词条的分类

首先对查询序列进行切词处理获得切分后的词条, 再通过诸如对词条进行语义分析或根据词条在需求特征词库中进行匹配查询等方式, 来获得所述候选需求类别。例如:用户的查询序列为 “土豆上的热门影视剧” 时, 通过对其进行切词处理, 得到 “土豆 /热门 / 影视剧” , 由于影视剧一词具有明显的需求类别, 诸如视频、 下载、 图片、 演员介绍,再通过诸如对词条进行语义分析或根据所述词条在需求特征词库中进行匹配查询等方式, 来获得候选需求类别。

当挖掘序列相对应的分类结果的用户累计点击次数超过预设点击阈值时, 基于所述分类结果所对应的需求类别, 提取待挖掘序列与需求类别的映射关系, 并根据映射关系来建立或更新需求特征词库,例如, 当待挖掘序列为“日本地震” 时, 根据该待挖掘序列对应的分类结果, 如视频类搜索结果、 新闻类搜索结果、图片类搜索结果, 若视频类搜索结果对应的用户累计点击次数为 300, 新闻类搜索结果对应的用户累计点击次数为 25000, 图片类搜索结果对应的用户累计点击次数为 700, 预设点击阈值为 10000 时, 将待挖掘序列对应的分类结果的用户累计点击次数与预设点击阈值进行比较, 并根据高于所述预设点击阈值的分类结果所对应的需求类别, 即新闻需求类别, 提取该待挖掘序列与新闻需求类别间的所述映射关系, 并根据映射关系来建立或更新需求特征词库。


三、获取需求度

1、获取与用户的查询序列相对应的原始搜索结果

2、获取与查询序列相对应的候选需求类别

对原始搜索结果进行处理,根据查询序列, 通过诸如对查询序列进行语义分析或根据查询序列在需求特征词库中进行匹配查询等方式, 来获得候选需求类别。例如, 当用户的查询序列为 “土豆上的热门影视剧” 时, 通过对其进行切词处理, 得到 “土豆 / 热门 /影视剧” , 由于影视剧一词具有明显的需求类别, 诸如视频、 下载、 图片、 演员介绍, 对该查询序列进行语义分析或在需求特征词库中进行匹配查询, 来获得候选需求类别, 例如根据 “影视剧” 可知该查询序列对应的候选需求类别包括视频、 下载、 图片、 演员介绍。

3、根据查询序列与候选需求类别,确定与查询序列相对应的类别需求度

根据查询序列和候选需求类别, 通过诸如对该查询序列所对应的搜索结果按类别进行统计分析或者对关于搜索结果的历史点击记录按类别进行统计分析, 确定所述查询序列对于每一候选需求类别的类别需求度。例如:“×× 影视明星” 时, 根据查询序列,得到候选需求类别包括视频、 新闻、 背景介绍、 音乐、 图片, 然后根据查询序列和候选需求类别, 通过诸如对该查询序列所对应的搜索结果按类别进行统计分析或者对关于搜索结果的历史点击记录按类别进行统计分析, 确定与所述查询序列相对应的类别需求度,  如, “×× 影视明星” 查询序列在视频类的类别需求度为 0.3 ; 查询序列在新闻类的类别需求度为 0.3 ; 查询序列在背景介绍类的类别需求度为 0.1 ; 查询序列在音乐类的类别需求度为 0.2 ; 以及查询序列在图片类的类别需求度为 0.1。

需求度确定:

用户的查询序列为 “×× 影视明星” , 将查询序列在需求特征词库中进行匹配查询,当在需求特征词库中匹配查询到 ×× 影视明星属于明星列表并且该明星列表对应的需求类别包括视频、 新闻、 背景介绍、 音乐和图片时,得到与查询序列相对应的候选需求类别包括视频、 新闻、 背景介绍、 音乐和图片。结合该查询序列相应的大量用户的点击统计分析, 如:统计分析结果中表明视频类搜索结果、 新闻类搜索结果、 背景介绍类搜索结果、 音乐类搜索结果与图片类搜索结果的用户点击频次分别为 60000 次、 10000 次、 10000 次、 10000 次和10000 次, 则查询序列对于视频类搜索结果的类别需求度为 0.6, 而对于图片类搜索结果的类别需求度为0.1。

4、根据类别需求度, 将搜索结果提供给用户。

根据所述类别需求度, 将搜索结果提供给所述用户。还是以“×× 影视明星”为例: 当用户的查询序列为 “×× 影视明星” 时, 查询序列在视频类的类别需求度为 0.3, 在新闻类的类别需求度为 0.3, 在背景介绍类的类别需求度为0.1, 在音乐类的类别需求度为0.2, 在图片类的类别需求度为0.1时, 若查询序列的搜索结果列表中的第一页显示 10 条搜索结果, 根据类别需求度,将 3 条视频类的搜索结果、 3 条新闻类的搜索结果、 1 条背景介绍类的搜索结果、 2 条音乐类的搜索结果提供给用户, 并且将剩余的所有搜索结果中与查询序列相关度最高的 1 条搜索结果在第一页提供给用户。

根据类别需求度,将类别需求度与搜索结果提供给用户。具体地,根据查询序列与候选需求类别, 通过诸如对该查询序列所对应的搜索结果按类别进行统计分析或者对关于搜索结果的历史点击记录按类别进行统计分析, 确定了与查询序列相对应的类别需求度后,以诸如特别字体、 浮动窗口等方式, 将搜索结果相对应的类别需求度与搜索结果提供给所述用户。百度已使用此类技术,可在百度搜索结果页面中找找。


四、对结果的优选

查询相关属性包括以下至少任一项 :
1.搜索结果与所述查询序列的相关度 ;
2.搜索结果的权威度 ;
3.搜索结果的时效性。

1.相关度:优选结果不仅根据搜索结果所对应的类别需求度, 而且还结合搜索结果与查询序列之间的相关度, 将搜索结果提供给对应的用户。当搜索结果所对应的新闻类搜索结果的类别需求度和音乐类搜索结果的类别需求度相同时, 将所述搜索结果对应的类别需求度与搜索结果和查询序列之间的相关度结合, 将所述搜索结果提供给用户。
(1)网站内容是否和网站主题相关。
可以方便搜索引擎把你网站进行定位,方便对你网站进行类目分类。准确的类目分类对提升网站在某一个行业中的权威度有很大的好处。
(2)网站中的内容是否能够满足用户需求。
这个讨论的太多了。就不一一详解。

2.权威度:确定查询序列的类别需求度后, 搜索结果对应的类别需求度与搜索结果的权威度结合提供给用户,例如:查询序列对应的新闻类搜索结果的权威度较高而查询序列对应的音乐类搜索结果的权威度较低时,将查询序列对应的新闻类搜索结果和音乐类搜索结果依次提供给所述用户对应的用户。
权威不等于知名,知名反作用于权威。
权威度的计算方法比较复杂,有很多的基数作为参考,以下列出“可能”决定权威度的一部分基数。
(1)网站品牌词的搜索量。
(2)与网站相关的长尾词的流量。
(3)直接访问流量。
(4)url中的体现的权威度(在索引库中存在的时间,在搜索中的表现,政府网站等)。
(5)口碑与社交媒体的转载。搜索引擎一直在监控网络上用户的一举一动。不过因为一些“原因”有些是直接效果,有些是间接效果,或者没效果。不过所有可以点击的link都是有用的。
(6)网站更新频率。嘿~!这个网站还有人维护呢。不是死站。短期内不维护(春节放假7天)影响不大。当长时间不维护。真的可能会降权。
(7)页面代码的规范化。虽然现在已经过了扣细节的时代,但是搜索引擎还是通过源代码来获取页面信息。适当的减噪,可以让搜索引擎更方便的判断主体内容,主题,页面结构等。
(8)所有元标签内容的质量与相关度。tkd的重要性不用说了。
(9)外部投票:百度的外部链接算法,最近看了个百度的文章,貌似是:把网站所有的有外链的页面建成一个合集,把其他一些结构相似的页面建立一个合集,通过合集之间的互换外部投票的权重,得到结构相似的页面外部投票的权重,在加上内部投票权重,等于未处理的原始页面权重。
(10)相关文章内容是否丰富。(文章数量,质量,配图情况等)

3.时效性:不仅根据搜索结果所对应的类别需求度,而且还结合搜索结果的时效性,将搜索结果提供给用户。例如:查询序列对应的新闻类搜索结果的时效性较强而查询序列对应的音乐类搜索结果的时效性较弱时, 将查询序列对应的新闻类搜索结果和音乐类搜索结果依次提供给用户对应的用户。
多见于时效性很强的内容。如:mh370飞机失事前,排名在mh370搜索结果页面的主要为mh370飞机的订票,介绍等信息。当飞机失事后,随着新闻类目需求的增加,搜索结果页面也随之进行了变化。

更多精彩内容其他人还在看

SEO新站点nofollow标签的妙用

Nofollow是最早由Google领头新创的一个标签,目的是尽量减少垃圾链接对搜索引擎的影响。近日有网友咨询nofollow标签怎么用?今天我们就来看看SEO新站点nofollow标签的妙用有哪些
收藏 0 赞 0 分享

针对SEO所必备的搜索引擎工作原理知识

这篇文章主要介绍了针对SEO所必备的搜索引擎工作原理知识,简单地讲解了搜索引擎处理数据的一般流程,帮助SEO者针对搜索网站进行相关优化,需要的朋友可以参考下
收藏 0 赞 0 分享

网站为何被降权?网站降权诊断分析以及恢复排名操作

网站降权是指搜索引擎对网站评定的级别下降,是搜索引擎对网站进行的一种处罚方式,导致网站整体排名下降,但通常多为网站自身作弊导致的,改正错误一段时间后会自行恢复,本文将提供网站降权诊断分析以及恢复排名操作供大家了解,希望对大家有所帮助和启发
收藏 0 赞 0 分享

网站SEO优化最容易进入的四个误区

我们发现一个网站经常优化过后排行和收录还是不好,今天我们就用一个广告衫网站seo的几个错误点作为实例,来个大家分析网站SEO优化绝对不能进入的误区,需要的朋友可以参考下
收藏 0 赞 0 分享

SEO友情链接交换技巧 专业SEO交换友情链接必须要知道的一些SEO知识

友情链接是网站和网站之间优势互补的一种比较便捷的合作形式,其操作形式是分别在自己的网站上放置对方网站的LOGO链接或锚文本链接,这样可以达到互相推广的目的,因此常作为一种网站推广最基本手段
收藏 0 赞 0 分享

网站不收录的因素有哪些 如何注意

常常会有人问到网站为什么不收录,网站为什么收录这么少的问题,其实网站的收录并不与排名有直接的联系,那么本文来分析网站不收录的因素有哪些,感兴趣的小伙伴们可以参考一下
收藏 0 赞 0 分享

新手必读:百度下拉框暗藏的SEO技巧

随着百度算法的调整,搜索引擎的宗旨就越来越明显,“客户体验度”自然被很多站长摆在桌面,那么作为一个SEO人员,百度下拉框暗藏什么SEO秘诀呢?本文将提供相关内容供大家了解,希望对大家有所帮助和启发
收藏 0 赞 0 分享

如何挖掘网站长尾关键词?58同城seo优化解析详解

一个网站想要获得海量的流量,就一定要懂得做长尾关键词的排名优化。那么什么是长尾关键词呢?如何挖掘网站长尾关键词?本文将提供58同城seo优化解析详解供大家了解,希望对大家有所帮助和启发
收藏 0 赞 0 分享

营销技巧:如何做到半年不更新文章和发布外链都能稳定排名

刚刚接触营销知识的时候,完全不知道营销知识和SEO有半毛钱关系,但很多排名大咖都是靠营销结合SEO进行操作,有时候就纳闷了,为何人家半年不更新一篇文章,每天流量爆满,本文将提供相关经验供大家了解,希望对大家有所帮助和启发
收藏 0 赞 0 分享

安全宝CDN加速服务的配置和使用攻略

这篇文章主要介绍了安全宝的CDN加速服务的配置和使用攻略,文中还讲到了安全宝的防盗链和云web防火墙等附加功能,需要的朋友可以参考下
收藏 0 赞 0 分享
查看更多