首页网页制作网络编程脚本专栏数据库网站运营网络安全平面设计 CMS教程

Python反爬虫伪装浏览器进行爬虫

所属分类：脚本专栏 / python 阅读数： 1560

收藏 0赞 0分享

对于爬虫中部分网站设置了请求次数过多后会封杀ip，现在模拟浏览器进行爬虫，也就是说让服务器认识到访问他的是真正的浏览器而不是机器操作

简单的直接添加请求头，将浏览器的信息在请求数据时传入：

打开浏览器--打开开发者模式--请求任意网站

如下图：找到请求的的名字，打开后查看headers栏，找到User-Agent，复制。然后添加到请求头中

代码如下：

import requests
url = 'https://www.baidu.com'
headers ={
    'User-Agent':'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_3) AppleWebKit/537.36 (KHTML, like Gecko) '
           'Chrome/65.0.3325.181 Safari/537.36'
    }
rq = requests.get(url=url, headers=headers)
print(rq.text)

更深的伪装浏览器，添加多个浏览器信息，每次请求的时候随机发送浏览器信息，让服务器了解不是一个浏览器一直在访问，（可以百度查找user-agent）

代码如下：

import requests
import random

url = 'https://www.baidu.com'
headers_lists =(
    'Mozilla/5.0 (Macintosh; Intel Mac OS X 10_13_3) AppleWebKit/537.36 (KHTML, like Gecko) '
           'Chrome/65.0.3325.181 Safari/537.36',
    'Mozilla/4.0(compatible;MSIE7.0;WindowsNT5.1;Maxthon2.0',
    'Opera/9.80(Android2.3.4;Linux;Operamobi/adr-1107051709;U;zh-cn)Presto/2.8.149Version/11.10',
    'Mozilla/5.0(WindowsNT6.1;rv:2.0.1)Gecko/20100101Firefox/4.0.1',
    'Mozilla/5.0(Android;Linuxarmv7l;rv:5.0)Gecko/Firefox/5.0fennec/5.0',)

rq = requests.get(url=url,headers={'User-Agent':random.choice(headers_lists)})
print(rq.text)

完整的请求体解释：

以下是笔者访问百度的请求体。

Accept：浏览器端可以接受的媒体类型

Accept-Encoding：浏览器申明自己接收的编码方法

Accept-Language：浏览器申明自己接收的语言

Connection:keep-alive 客户端和服务器之间还在连接中，如果关闭就是close

Host:请求报头域主要用于指定被请求资源的Internet主机和端口号

User-Agent：使用的操作系统和浏览器的名称和版本

Cookie:是用来存储一些用户信息以便让服务器辨别用户身份的

以上就是本文的全部内容，希望对大家的学习有所帮助，也希望大家多多支持脚本之家。

更多精彩内容其他人还在看

python numpy数组复制使用实例解析

这篇文章主要介绍了python numpy数组复制使用实例解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

收藏 0赞 0分享

TENSORFLOW变量作用域（VARIABLE SCOPE）

这篇文章主要介绍了TENSORFLOW变量作用域（VARIABLE SCOPE），文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

收藏 0赞 0分享

Tensorflow Summary用法学习笔记

这篇文章主要介绍了Tensorflow Summary用法学习笔记，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

收藏 0赞 0分享

pytorch 利用lstm做mnist手写数字识别分类的实例

今天小编就为大家分享一篇pytorch 利用lstm做mnist手写数字识别分类的实例，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

收藏 0赞 0分享

pytorch1.0中torch.nn.Conv2d用法详解

今天小编就为大家分享一篇pytorch1.0中torch.nn.Conv2d用法详解，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

收藏 0赞 0分享

python标识符命名规范原理解析

这篇文章主要介绍了python标识符命名规范原理解析,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

收藏 0赞 0分享

pytorch如何冻结某层参数的实现

这篇文章主要介绍了pytorch如何冻结某层参数的实现，文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值，需要的朋友们下面随着小编来一起学习学习吧

收藏 0赞 0分享

如何给Python代码进行加密

这篇文章主要介绍了如何给Python代码进行加密,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

收藏 0赞 0分享

pytorch nn.Conv2d()中的padding以及输出大小方式

今天小编就为大家分享一篇pytorch nn.Conv2d()中的padding以及输出大小方式，具有很好的参考价值，希望对大家有所帮助。一起跟随小编过来看看吧

收藏 0赞 0分享

Python GUI自动化实现绕过验证码登录

这篇文章主要介绍了python GUI自动化实现绕过验证码登录,文中通过示例代码介绍的非常详细，对大家的学习或者工作具有一定的参考学习价值,需要的朋友可以参考下

收藏 0赞 0分享

查看更多

网络赚钱

更多

站长故事

更多

建站极客

合作伙伴

外卖点餐小程序

QCMS建站系统

小程序SAAS平台

松江网站建设

站长素材网

合同模板网

好听名字网

在线工具

网站地图

建站极客移动版

聚合全网技术文章，根据你的阅读喜好进行个性推荐

© 2012 - 2020 www.zhanzhang360.cn Some Rights Reserved.

沪ICP备13040166号-22