网站日志中的不完整url或莫名其妙的url抓取的分析

所属分类: 网站运营 / 建站经验 阅读数: 121
收藏 0 赞 0 分享

在分析日志的过程中,往往会发现404状态下有一些或者很多的不完整的url或者比原url多出字段的莫名其妙的网站本身不存在的url的抓取。在群里面也见有人问过类似的情况,觉得这是一个大家普遍都会遇见的问题,有猜测过有可能是被别人采集才导致这样的问题出现,在上课的时候问过国平老大,当时国平老大说有可能是爬虫在抓取url的时候下载不完整,但是这都没有一个具体的数据来支撑,总是觉得很朦胧没把握。

现在,google管理员工具可以很清晰的用数据为你揭晓这其中的诧异了,google管理员工具是国平老大非常推崇的一个seo工具,有人觉得做百度的人不需要google的东西,因为百度和google的算法有差别,那下面介绍google管理员的这个功能可以告诉你这样的想法是大错特错的,管理员工具是一个按照网站seo各项考核标准制定的一个最最权威的seo工具,做seo需要的数据,绝大部分都可以从这里面获取,下面就来介绍管理员工具的这个功能(好像是最近更新的,以前不是这样子)。

首页看下百度日志里面的怪异404

1.png

这些url的入口在哪里呢?搜索引擎是从什么地方获取这些url的?

Google告诉你

首先介绍下google管理员工具关于抓取错误的功能

2.png

下面是另一个网站由于改版问题没做跳转和抓取拦截所造成的找不到抓取错误,有一很完整的曲线可以让你很清晰的看见网站存在的这方面的问题的变化趋势

3.png

和服务器问题造成的抓取错误

5.png

接第一张图(同一个网站)

一开始从日志中观察到这些错误,但是不知道这些错误的来源

7.png

现在可以知道这些错误的url是从何而来

点击第102条,弹出下面的框,url不在sitemap中,但是在自己的其他网站里面出现,说明网址是网站自身存在的但是已经被删除了

8.png

点击第110条,弹出下面的框,可以看到搜索引擎是从其他网站过来的(或是采集站,或是其他)

9.png

点击进入具体的来源页面可以看到

至此,可以很明确的知道,到底网站日志里面的出现的那些莫名其妙的url到底是怎么回事了,是自己站内存在的还是站外错误构成的。最近更新的还有其他的功能,感兴趣的朋友可以亲自用用体验下。

原文地址:光年论坛

更多精彩内容其他人还在看

个人网站可以申请经营性ICPP许可证

中国草根站长给工信部的一个建议,中国个人网站应实施ICPP准入制度.
收藏 0 赞 0 分享

虚拟主机基础知识全接触 新手必备知识

虚拟主机,是在网络服务器上划分出一定的磁盘空间供用户放置站点、应用组件等,提供必要的站点功能与数据存放、传输功能。
收藏 0 赞 0 分享

网络编辑应该如何突破职业发展瓶颈 推荐

网络编辑突破职业发展瓶颈的几点准备,让你更具价值。
收藏 0 赞 0 分享

如何降低网站跳出率 网站运营分析

跳出率必须分开分析,因为主要有四种不同的用户来源:低价值的引荐、其他网站的直接链接、搜索引擎和忠实的用户。
收藏 0 赞 0 分享

对即将上线的奇艺视频网站的思考

百度旗下视频公司近日公布了“奇艺”这一中文名称及域名,并透露,“奇艺”将于3月份上线。
收藏 0 赞 0 分享

网站功能不同设计服务公司的报价自然不同

首先,网站功能不同价格肯定也不同,复杂的价格自然很高,简单的自然就低。
收藏 0 赞 0 分享

电子商务平台服务的核心价值

网站运营:电子商务平台服务的核心价值.
收藏 0 赞 0 分享

不同公司网页设计报价不同的原因分析

根据不同地区的经济水平和实际的行业状况,这些通用性的准则不一定都能发挥效用,但是仍然可以使我们保持清晰的头脑,在价格因素日趋透明的情况下保证自己的利益。
收藏 0 赞 0 分享

提高Alexa排名的20种方法小结

操纵与提高Alexa排名的方法总结.
收藏 0 赞 0 分享

大型网站建站要考虑数据库压力和服务器负载

所谓大型网站就是访问量与流量都很大的一些网站,因此在建站初期就要考虑好当流量达到某一级别是是否可以支撑网站继续正常运营下去。
收藏 0 赞 0 分享
查看更多