Python爬虫模拟登陆哔哩哔哩(bilibili)并突破点选验证码功能

2024-06-24 16:20:06

写在前面

今天带给大家一个突破点选验证码的案例，利用爬虫模拟登陆哔哩哔哩，并且把一些采坑的地方给大家强调一下！

一、需求分析

模拟登陆哔哩哔哩

网站链接: https://passport.bilibili.com/login

效果图如下：

验证成功后会自动跳转B站的登录界面，为了保护我的信息安全，我用了假用户名

二、编程思路

首先利用xpath或者css选择器等方法找到要输入内容的元素位置，然后用自动化爬虫工具Selenium模拟点击输入等操作来进行登录并分析页面，获取点选验证码的点选图片，通过将图片发送给快识别打码平台识别后获取坐标信息，根据快识别返回的数据，模拟坐标的点选，即可实现登录。

三、前期准备

1.下载chrome driver

就是下载谷歌浏览器的驱动器，当然如果你用其他浏览器那么就要下载其他浏览器的相应驱动，这里我以chrome浏览器为例，为什么要用英文呢？啊，这还用问当然是为了洋气啦！(手动狗头)

下载驱动的时候必须要下载相应的版本，可以在浏览器上方输入chrome://version，即可查看自己的chrome版本。

然后进入 https://npm.taobao.org/mirrors/chromedriver/网站下载相应版本的驱动。

2.安装selenium库

由于是第三方库，所以在使用selenium之前需要先安装：

pip install selenium

安装的时候建议大家换镜像源，具体方法可以参考这篇文章

链接: https://www.jb51.net/article/202564.htm

3.对接打码平台

根据我们前面的编程思路我们需要到快识别网站http://www.kuaishibie.cn/根据给出的开发文档和我们所需要的打码功能构建一个自己的api。

代码如下:

#快识别网址 http://www.kuaishibie.cn/

#interface

import base64

import json

import requests

def base64_api(uname,pwd,img):

'''

验证码识别接口

:param uname: 快识别用户名

:param pwd: 快识别密码

:param img: 图片路径

:return: 返回识别结果

'''

with open(img, 'rb') as f:

base64_data = base64.b64encode(f.read())

b64 = base64_data.decode()

data = {'username': uname, 'password': pwd, 'image': b64,'typeid':21}

#result = json.loads(requests.post('http://api.ttshitu.com/base64', json=data).text)

result = json.loads(requests.post('http://api.ttshitu.com/imageXYPlus', json=data).text)

if result['success']:

return result['data']['result']

else:

return result['message']

三、完整代码

代码中的一些难点和相关步骤我都做了注释，根据上面给出的编程思路大家一步一步做就好了，我就不再详细解释了，如果任何问题欢迎评论区提问或者私信我都可以喔~

#login_bilibili

from selenium import webdriver

import time

from PIL import Image

from selenium.webdriver import ActionChains #导入动作链模块

KUAI_USERNAME = '快识别账号'

KUAI_PASSWORD = '快识别密码'

USERNAME = 'B站账号'

PASSWORD = 'B站密码'

#创建浏览器对象

driver = webdriver.Chrome(executable_path='chromedriver.exe')

#打开请求网页页面

driver.get('https://passport.bilibili.com/login')

driver.implicitly_wait(10) #隐式等待浏览器渲染完成，sleep是强制等待

#driver.execute_script('document.body.style.zoom='0.67'') #浏览器内容缩放67%

driver.maximize_window()#最大化浏览器

'''

用selenium自动化工具操作浏览器，操作的顺序和平常用浏览器操作的顺序是一样的

'''

找到用户名和密码框输入密码

'''

user_input = driver.find_element_by_xpath('//*[@id='login-username']') #使用xpath定位用户名标签元素

user_input.send_keys(USERNAME)

time.sleep(1)

user_input = driver.find_element_by_xpath('//*[@id='login-passwd']') #用户密码标签

user_input.send_keys(PASSWORD)

time.sleep(1)

#点击登录

Login_input = driver.find_element_by_css_selector('#geetest-wrap > div > div.btn-box > a.btn.btn-login')

Login_input.click()

time.sleep(5)

#对图片验证码进行提取

img_label = driver.find_element_by_css_selector('body > div.geetest_panel.geetest_wind > div.geetest_panel_box.geetest_no_logo.geetest_panelshowclick > div.geetest_panel_next > div > div') #提取图片标签

#保存图片

driver.save_screenshot('big.png') #截取当前整个页面

time.sleep(5)

#location可以获取这个元素左上角坐标

print(img_label.location)

#size可以获取这个元素的宽(width)和高(height)

print(img_label.size)

#计算验证码的左右上下横切面

left = img_label.location['x']

top = img_label.location['y']

right = img_label.location['x'] + img_label.size['width']

down = img_label.location['y'] + img_label.size['height']

im = Image.open('big.png')

im = im.crop((left,top,right,down))

im.save('yzm.png')

#对接打码平台

from interface import base64_api #显示报错也无妨，可以运行的不要被唬住

img_path = 'yzm.png'

result = base64_api(uname=KUAI_USERNAME, pwd=KUAI_PASSWORD, img=img_path)

print(result)

print('验证码识别结果：', result)

result_list = result.split('|')

for result in result_list:

x = result.split(',')[0]

y = result.split(',')[1]

ActionChains(driver).move_to_element_with_offset(img_label, int(x), int(y)).click().perform() # perform()执行整个动作链

#点击确认按钮

driver.find_element_by_css_selector('body > div.geetest_panel.geetest_wind > div.geetest_panel_box.geetest_no_logo.geetest_panelshowclick > div.geetest_panel_next > div > div > div.geetest_panel > a > div').click()

input() # 用户输入阻塞浏览器关闭

# 关闭浏览器

driver.quit()

注：chrome driver一定要和项目文件放在一起，这样更加方便也更稳定。interface接口文件最好也喝项目文件在一起，方便import导入

然后就可以自动登录到B站啦，还在等什么，赶紧试试吧~

Python爬取网易云音乐辑的图片、专辑名和专辑出版时间

本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. 作者:阿里波特来源:CSDN Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 h ...
该死！B 站上这些 Python 视频真香！

作者丨wLsq 来源丨经授权转自Python数据科学(ID:PyDataScience) 大家好,我是东哥. 无论什么时候,都有初学者存在找不到学习资源的困惑.其实呢,一般通过百度.知乎估计也都能找到 ...
自动抢票之 12306 登录篇

来源:Python 技术「ID: pythonall」逢年过节 12306 的票总是要靠抢,前几天小编就在抢周一去上海的票,实在是抢不到呀,就撸了一个自动抢票的脚本. 抢票的思路就是使用 selen ...
【编程课堂】selenium 祖传爬虫利器

一些网页,比如微博,只有在登录状态才能进行页面的访问,或者对数据有比较复杂的验证和保护,直接通过网络请求进行登录并获取数据就会比较麻烦.这种时候,就该本篇的主角 selenium 上场了. Selen ...
Python实现数据技术|爬虫便可获取免费百度文库付费文档

相信大家在百度文档中看到了比较合适的文档之后就有了想下载学习一下的想法,但是有些时候文章更多的需要付费下载,针对于文档中能发现语句是分为一个一个的标签中的文本进行输出的.如果你有耐心和任劳任怨的想法, ...
【视频】有了selenium，小白也可以自豪的说：“去TMD的抓包、cookie”

请输入标题 bcdef 今天带给大家的是一款爬虫神器-selenium,使用该库可以对付绝大部分的网站,不论这网站反爬策略多么的厉害,在selenium面前经常失效. 请输入标题 ab ...
Python爬虫之urllib模拟登录及cookie的那点事

在web sprider crawl过程中,许多网站都需要登录后才能访问,一般如果我们不用爬虫框架的前提下,常规用的就两个库 ,urllib库和requests库,本文将用最基础的urllib库,以 ...
哔哩哔哩正式登陆港交所，陈睿：中国千万UP主将随视频化浪潮走向全世界

哔哩哔哩正式登陆港交所:陈睿称中国千万UP主将随视频化浪潮走向全世界. 本文为IPO早知道原创作者|苏打微信公众号|ipozaozhidao 据IPO早知道消息,2021年3月29日,回港&quo ...
python模拟登陆之下载

好长时间没有更新博客了,哈哈. 今天公司给了这么一个需求,现在我们需要去淘宝获取上一天的订单号,然后再根据订单号去另一个接口去获取订单详情,然后再给我展示到web! 中间涉及到的技术点有: 模拟登陆 ...
python爬虫22 | 以后我再讲「模拟登录」我就是狗

接下来就是学习python的正确姿势做爬虫绕不开模拟登录为此小帅b给大家支了几招 python爬虫19 | 遇到需要的登录的网站怎么办?用这3招轻松搞定! 有些网站的登录很弱鸡传个用户名和密 ...
【Python爬虫】：使用高性能异步多进程爬虫获取豆瓣电影Top250

在本篇博文当中,将会教会大家如何使用高性能爬虫,快速爬取并解析页面当中的信息.一般情况下,如果我们请求网页的次数太多,每次都要发出一次请求,进行串行执行的话,那么请求将会占用我们大量的时间,这样得不偿 ...
【Python爬虫】：破解网站字体加密和反反爬虫

前言:字体反爬,也是一种常见的反爬技术,例如58同城,猫眼电影票房,汽车之家,天眼查,实习僧等网站.这些网站采用了自定义的字体文件,在浏览器上正常显示,但是爬虫抓取下来的数据要么就是乱码,要么就是变成 ...
Python爬虫学习笔记(三)

Cookies: 以抓取https://www.yaozh.com/为例 Test1(不使用cookies): 代码: import urllib.request# 1.添加URLurl = &quo ...
【Python爬虫】：爬取58同城二手房的所有房产标题

我们首先打开58同城的网站: 观察网站的版面: 发现所有的title都是以h3开头,并且具有class为" property-content-title-name " 因此我们可以 ...
Python爬虫新手入门教学（九）：多线程爬虫案例讲解

前言本文的文字及图片来源于网络,仅供学习.交流使用,不具有任何商业用途,如有问题请及时联系我们以作处理. Python爬虫.数据分析.网站开发等案例教程视频免费在线观看 https://space. ...

Python爬虫模拟登陆哔哩哔哩(bilibili)并突破点选验证码功能

相关推荐