luminati官网（luminati官网候鸟防关联浏览器）

投稿用户 • 2023年 4月 20日 16:09:54 • 资质办理 • 阅读 4

一、前言在使用爬虫的时候，很多网站都有一定的反爬措施，甚至在爬取大量的数据或者频繁地访问该网站多次时还可能面临ip被禁，所以这个时候我们通常就可以找一些代理ip，和不用的浏览器来继续爬虫测试。下面就开始来简单地介绍一下User-Agent池和免费代理ip池。二、User-Agent池User-Agent就是用户代理，又叫报头，

一、前言

在使用爬虫的时候，很多网站都有一定的反爬措施，甚至在爬取大量的数据或者频繁地访问该网站多次时还可能面临ip被禁，所以这个时候我们通常就可以找一些代理ip，和不用的浏览器来继续爬虫测试。下面就开始来简单地介绍一下User-Agent池和免费代理ip池。

二、User-Agent池

User-Agent 就是用户代理，又叫报头，是一串字符串，相当于浏览器的身份证号，我们在利用python发送请求的时候，默认为： python-requests/2.22.0，所以我们在利用爬虫爬取网站数据时，频繁更换它可以避免触发相应的反爬机制。

构建User-Agent池，这里介绍两种方法：1，手动构造随机函数。2，第三方库fake-useragent

方法1：构造随机函数

自己手动编写User-Agent池，然后随机获取其中一个就行了。

def get_ua():
    import random
    user_agents = [
        'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.95 safari/537.36 OPR/26.0.1656.60',
		'Opera/8.0 (Windows NT 5.1; U; en)',
		'Mozilla/5.0 (Windows NT 5.1; U; en; rv:1.8.1) Gecko/20061208 Firefox/2.0.0 Opera 9.50',
		'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; en) Opera 9.50',
		'Mozilla/5.0 (Windows NT 6.1; WOW64; rv:34.0) Gecko/20100101 Firefox/34.0',
		'Mozilla/5.0 (X11; U; Linux x86_64; zh-CN; rv:1.9.2.10) Gecko/20100922 Ubuntu/10.10 (maverick) Firefox/3.6.10',
		'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/534.57.2 (KHTML, like Gecko) Version/5.1.7 Safari/534.57.2 ',
		'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/39.0.2171.71 Safari/537.36',
		'Mozilla/5.0 (X11; Linux x86_64) AppleWebKit/537.11 (KHTML, like Gecko) Chrome/23.0.1271.64 Safari/537.11',
		'Mozilla/5.0 (Windows; U; Windows NT 6.1; en-US) AppleWebKit/534.16 (KHTML, like Gecko) Chrome/10.0.648.133 Safari/534.16',
		'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/30.0.1599.101 Safari/537.36',
		'Mozilla/5.0 (Windows NT 6.1; WOW64; Trident/7.0; rv:11.0) like Gecko',
		'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/536.11 (KHTML, like Gecko) Chrome/20.0.1132.11 TaoBrowser/2.0 Safari/536.11',
		'Mozilla/5.0 (Windows NT 6.1; WOW64) AppleWebKit/537.1 (KHTML, like Gecko) Chrome/21.0.1180.71 Safari/537.1 LBBROWSER',
		'Mozilla/4.0 (compatible; MSIE 6.0; Windows NT 5.1; SV1; QQDownload 732; .NET4.0C; .NET4.0E)',
		'Mozilla/5.0 (Windows NT 5.1) AppleWebKit/535.11 (KHTML, like Gecko) Chrome/17.0.963.84 Safari/535.11 SE 2.X MetaSr 1.0',
		'Mozilla/4.0 (compatible; MSIE 7.0; Windows NT 5.1; Trident/4.0; SV1; QQDownload 732; .NET4.0C; .NET4.0E; SE 2.X MetaSr 1.0) ',
    ]
    user_agent = random.choice(user_agents) # 随机抽取对象
    return user_agent

# 调用
get_ua()

至于，在哪里找这些浏览器，网上一大堆，复制过来即可。

实际环境调用随机User-Agent池

import requests

def get_page(url):
    ua = get_ua()
    headers = {'User-Agent': ua}
    response = requests.get(url=url, headers=headers)
    print(response.text)

if __name__ == '__main__':
    get_page('https://www.baidu.com')

方法2： fake-UserAgent 库自动生成

注：此库在2018年已经停止更新，版本目前停止在0.1.11，所以生成的浏览器版本都比较低。如果有网站检测浏览器版本号大小(范围)的话，就可能会被检测到。

安装：

pip install fake-useragent

调用第三方库，生成指定浏览器的user-agent

from fake_useragent import UserAgent
ua = UserAgent()

ua.ie
# Mozilla/5.0 (Windows; U; MSIE 9.0; Windows NT 9.0; en-US);
ua.msie
# Mozilla/5.0 (compatible; MSIE 10.0; Macintosh; Intel Mac OS X 10_7_3; Trident/6.0)'
ua['Internet Explorer']
# Mozilla/5.0 (compatible; MSIE 8.0; Windows NT 6.1; Trident/4.0; GTB7.4; InfoPath.2; SV1; .NET CLR 3.3.69573; WOW64; en-US)
ua.opera
# Opera/9.80 (X11; Linux i686; U; ru) Presto/2.8.131 Version/11.11
ua.chrome
# Mozilla/5.0 (Windows NT 6.1) AppleWebKit/537.2 (KHTML, like Gecko) Chrome/22.0.1216.0 Safari/537.2'
ua.google
# Mozilla/5.0 (Macintosh; Intel Mac OS X 10_7_4) AppleWebKit/537.13 (KHTML, like Gecko) Chrome/24.0.1290.1 Safari/537.13
ua['google chrome']
# Mozilla/5.0 (X11; CrOS i686 2268.111.0) AppleWebKit/536.11 (KHTML, like Gecko) Chrome/20.0.1132.57 Safari/536.11
ua.firefox
# Mozilla/5.0 (Windows NT 6.2; Win64; x64; rv:16.0.1) Gecko/20121011 Firefox/16.0.1
ua.ff
# Mozilla/5.0 (X11; Ubuntu; Linux i686; rv:15.0) Gecko/20100101 Firefox/15.0.1
ua.safari
# Mozilla/5.0 (iPad; CPU OS 6_0 like Mac OS X) AppleWebKit/536.26 (KHTML, like Gecko) Version/6.0 Mobile/10A5355d Safari/8536.25

# and the best one, random via real world browser usage statistic
ua.random

官方文档：https://fake-useragent.readthedocs.io/en/latest/

实际示例代码：

from fake_useragent import UserAgent
import requests

ua=UserAgent()
#请求的网址
url="http://www.baidu.com"
#请求头
headers={"User-Agent":ua.random}
#请求网址
response=requests.get(url=url,headers=headers)
#响应体内容
print(response.text)
#响应状态信息
print(response.status_code)
#响应头信息
print(response.headers)

三、IP代理池

开源IP代理池，这里推荐两个：

https://github.com/Python3WebSpider/ProxyPool

https://github.com/jhao104/proxy_pool

这里用第二个测试，使用人数更多，而且一直在更新。

1：下载启动

Linux下载

git clone git@github.com:jhao104/proxy_pool.git
#或者
git clone https://github.com/jhao104/proxy_pool.git

使用docker compose启动

#进入目录
cd proxy_pool/
#启动代理池
docker compose up -d

启动web服务后, 默认配置下会开启 http://127.0.0.1:5010 的api接口服务:

api：

/get ：GET，随机获取一个代理，可选参数: ?type=https 过滤支持https的代理
/pop ：GET，获取并删除一个代理，可选参数: ?type=https 过滤支持https的代理
/all ：GET，获取所有代理，可选参数: ?type=https 过滤支持https的代理
/count ：GET，查看代理数量，
/delete ：GET，删除代理， ?proxy=host:ip

访问浏览器测试，我这里IP，192.168.152.100

2：爬虫使用

如果要在爬虫代码中使用的话，可以将此api封装成函数直接使用，例如

import requests

def get_proxy():
    return requests.get("http://127.0.0.1:5010/get/").json()

def delete_proxy(proxy):
    requests.get("http://127.0.0.1:5010/delete/?proxy={}".format(proxy))

# your spider code

def getHtml():
    # ....
    retry_count = 5
    proxy = get_proxy().get("proxy")
    while retry_count > 0:
        try:
            html = requests.get('http://www.example.com', proxies={"http": "http://{}".format(proxy)})
            # 使用代理访问
            return html
        except Exception:
            retry_count -= 1
    # 删除代理池中代理
    delete_proxy(proxy)
    return None

更多使用方法，参考官方文档：https://proxy-pool.readthedocs.io/zh/latest/

以上是基本使用方法，都是免费的，质量有限，如需要付费的。

付费代理推荐: luminati-china. 国外的亮数据BrightData（以前叫luminati）被认为是代理市场领导者，覆盖全球的7200万IP，大部分是真人住宅IP，成功率扛扛的。

本文内容由互联网用户自发贡献，该文观点仅代表作者本人。本站仅提供信息存储空间服务，不拥有所有权，不承担相关法律责任。如发现本站有涉嫌抄袭侵权/违法违规的内容，请发送邮件至 1553299181@qq.com 举报，一经查实，本站将立刻删除。
如若转载，请注明出处：https://www.lmux.cn/22742.html

投稿用户

0 0

lazada招聘官网（lazada招聘官网首页）

上一篇 2023年 4月 20日 16:06:52

手机消毒器真的有用吗（手机消毒器真的有用吗知乎）

下一篇 2023年 4月 20日 16:12:57

北京现在时间，全国各地时间与北京时间差

大家好，今天来为大家解答北京现在时间这个问题的一些问题点，包括全国各地时间与北京时间差也一样很多人还不知道，因此呢，今天就来为大家分析分析，现在让我们一起来看看吧！如果解决了您的问题，还望您关注下本站哦，谢谢~本文目录北京几点天黑全国各

投稿用户
资质办理 2023年 8月 16日
93 0
预防火灾安全知识，防止触电和火灾的安全措施有哪些

大家好，今天来为大家解答预防火灾安全知识这个问题的一些问题点，包括防止触电和火灾的安全措施有哪些也一样很多人还不知道，因此呢，今天就来为大家分析分析，现在让我们一起来看看吧！如果解决了您的问题，还望您关注下本站哦，谢谢~本文目录如何预防火灾如何正确预防火灾预防火灾的基本措施防止触电和火灾的安全措施有哪些如

投稿用户
资质办理 2023年 8月 1日
6 0
out短语，关于out词组总结

很多朋友对于out短语和关于out词组总结不太懂，今天就由小编来为大家分享，希望可以帮助到大家，下面一起来看看吧！本文目录所有的out短语，拜托各路神workout等于哪个短语dieout的用法及短语关于out词组总结out的反义词of所有的out短语，拜托各路神checkout[中考]结账

投稿用户
资质办理 2023年 8月 13日
4 0
资质办理

非典可怕还是新冠可怕(非典可怕还是埃博拉可怕)

地理有关资源。环保。灾害的小论文，300字左右。初二的保护环境 “我想有个家，我想有个家，我想有个家……家！在哪儿呢？？？”这是增城电视台〈〈公益〉〉栏目中播出的动画片，一对无家…

投稿用户
2022年 9月 18日
38 0
u开头的职业(以u开头的有关于职业的英语单词)

各位老铁们，大家好，今天由我来为大家分享u开头的职业，以及以u开头的有关于职业的英语单词的相关问题知识，希望对大家有所帮助。如果可以帮助到大家，还望关注收藏下本站，您的支持是我们最大的动力，谢谢大家了哈，下面我们开始吧！本文目录j字开头的单词有那些狙击职业杀手拼音怎样写以u开头的有关

投稿用户
资质办理 2023年 9月 26日
58 0
一笑而过歌词？一笑而过是什么歌

大家好，今天来为大家解答一笑而过歌词这个问题的一些问题点，包括一笑而过是什么歌也一样很多人还不知道，因此呢，今天就来为大家分析分析，现在让我们一起来看看吧！如果解决了您的问题，还望您关注下本站哦，谢谢~本文目录一笑而过是什么歌

投稿用户
资质办理 2023年 10月 7日
2 0
物尽其用的意思物尽其用的意思是什么，出处是哪里

其实物尽其用的意思的问题并不复杂，但是又很多的朋友都不太了解物尽其用的意思是什么，出处是哪里，因此呢，今天小编就来为大家分享物尽其用的意思的一些知识，希望可以帮助到大家，下面我们一起来看看这个问题的分析吧！物尽其用的意思是什么，出处是哪里意思是每个人都可以充分的发挥自己的所有才华与能力，各种东西凡有可用之处，都要尽量利用。人尽其才的出处：《淮南子·兵略训》：凡此五官之

投稿用户
资质办理 2023年 11月 14日
2 0
减肥可以吃坚果吗(为什么减脂要吃坚果)

大家好，关于减肥可以吃坚果吗很多朋友都还不太明白，今天小编就来为大家分享关于为什么减脂要吃坚果的知识，希望对各位有所帮助！本文目录减脂餐坚果什么时候吃坚果吃多了会长胖吗为什么减脂要吃坚果减肥中可以吃哪些坚果减肥期间能吃哪些坚果减脂餐坚果什么时候吃健身完30

投稿用户
资质办理 2023年 11月 10日
2 0
怎么开菠萝蜜？怎样开菠萝蜜最简便方法

老铁们，大家好，相信还有很多朋友对于怎么开菠萝蜜和怎样开菠萝蜜最简便方法的相关问题不太懂，没关系，今天就由我来为大家分享分享怎么开菠萝蜜以及怎样开菠萝蜜最简便方法的问题，文章篇幅可能偏长，希望可以帮助到大家，下面一起来看看吧！本文目录如何开菠萝蜜开菠萝蜜的神招菠萝蜜怎样完整的切开怎么开菠萝蜜最简单怎样开菠萝蜜最简便方法如何开菠萝蜜对半打开后再横向切开：超级大个的菠萝蜜我们要首先把它分为小份，处

投稿用户
资质办理 2023年 11月 11日
2 0
体温计量程什么是温度计的量程什么是温度计的分度值

大家好，关于体温计量程很多朋友都还不太明白，不过没关系，因为今天小编就来为大家分享关于什么是温度计的量程什么是温度计的分度值的知识点，相信应该可以解决大家的一些困惑和问题，如果碰巧可以解决您的问题，还望关注下本站哦

投稿用户
资质办理 2023年 8月 21日
20 0

luminati官网（luminati官网候鸟防关联浏览器）

一、前言

二、User-Agent池

三、IP代理池

相关推荐