博客
关于我
python 原生cookie 转化为字典cookie
阅读量:282 次
发布时间:2019-03-01

本文共 1702 字,大约阅读时间需要 5 分钟。

在实际开发中,获取并处理浏览器中的cookie值是一个常见但复杂的任务。尤其是在不同浏览器之间切换时,cookie的格式和处理方式可能会有所不同。以下是关于如何在Python中处理cookie值并使用requests库进行爬虫的详细方法。

一、获取浏览器中的cookie值

在现代浏览器中,cookie值通常以键值对的形式存储,形式类似于cookie_name=cookie_value。通过右键点击浏览器中的cookie选项,可以直接复制这些值并粘贴到代码中。

然而,除了直接复制外,某些浏览器(如火狐)导出的cookie值可能包含编码后的特殊字符,这些字符需要经过处理才能正确使用。因此,使用Python脚本来自动解析cookie值是一个更可靠的方法。

二、Python脚本处理cookie值

以下是一个示例Python脚本,用于解析并存储cookie值:

cookie = 'cna=xaYUEGbE2X0CAd7f2Qhq4DAA; thw=cn;nk=%5Cu65E0%5Cu58F0%5Cu6EF4%5Cu5BF9%5Cu767D; l_g=Ug%3D%3D; cookie17=UonZBGCaYSPQhQ%3D%3D; l=AiIimIoKS0HVED4ao4GprqAT8qKEcyaN; isg=AkxMGzVSdzRypWPIho7m3FdsHapqgvAvBpI7WaYNWPeaMew7zpXAv0KDp47z'
cookieDict = {}
cookies = cookie.split("; ")
for co in cookies:
co = co.strip()
if '=' in co:
key, value = co.split('=', 1)
value = value.replace('"', '')
cookieDict[key] = value

三、使用requests库进行爬虫

在获取了cookie值后,可以将它们添加到requests库的请求头中,从而模拟浏览器的行为进行爬虫。以下是一个示例:

import requests
cookieDict = {
'cna': 'xaYUEGbE2X0CAd7f2Qhq4DAA',
'thw': 'cn',
'nk': '%u65E0%u58F0%u6EF4%u5BF9%u767D',
'l_g': 'Ug%3D%3D',
'cookie17': 'UonZBGCaYSPQhQ%3D%3D',
'l': 'AiIimIoKS0HVED4ao4GprqAT8qKEcyaN',
'isg': 'AkxMGzVSdzRypWPIho7m3FdsHapqgvAvBpI7WaYNWPeaMew7zpXAv0KDp47z'
}
url = 'http://www.tianya.cn/'
response = requests.get(
url,
cookies=cookieDict
)
response.raise_for_status()

四、注意事项

  • cookie的编码:确保cookie值已经正确解码。如果cookie值中包含URL编码的字符,需要在请求时使用原始字符。
  • Session对象:如果需要保持cookie不变,可以使用requests.Session()对象,并在每次请求时传递cookie参数。
  • 处理异常:在发送请求前,使用response.raise_for_status()方法检查响应状态码,避免由于网络问题或错误请求而导致程序崩溃。
  • 五、优化建议

  • 代码格式化:在实际使用前,建议对代码进行格式化处理,确保可读性。
  • 错误处理:添加异常捕获机制,确保程序在遇到无法解析的cookie值时能够平滑处理。
  • 版本控制:将cookie处理逻辑封装到函数中,方便维护和扩展。
  • 通过以上方法,可以有效地获取和使用浏览器中的cookie值,实现爬虫任务。

    转载地址:http://baio.baihongyu.com/

    你可能感兴趣的文章
    Netty工作笔记0007---NIO的三大核心组件关系
    查看>>
    Netty工作笔记0011---Channel应用案例2
    查看>>
    Netty工作笔记0013---Channel应用案例4Copy图片
    查看>>
    Netty工作笔记0014---Buffer类型化和只读
    查看>>
    Netty工作笔记0020---Selectionkey在NIO体系
    查看>>
    Vue踩坑笔记 - 关于vue静态资源引入的问题
    查看>>
    Netty工作笔记0025---SocketChannel API
    查看>>
    Netty工作笔记0027---NIO 网络编程应用--群聊系统2--服务器编写2
    查看>>
    Netty工作笔记0050---Netty核心模块1
    查看>>
    Netty工作笔记0057---Netty群聊系统服务端
    查看>>
    Netty工作笔记0060---Tcp长连接和短连接_Http长连接和短连接_UDP长连接和短连接
    查看>>
    Netty工作笔记0063---WebSocket长连接开发2
    查看>>
    Netty工作笔记0070---Protobuf使用案例Codec使用
    查看>>
    Netty工作笔记0077---handler链调用机制实例4
    查看>>
    Netty工作笔记0084---通过自定义协议解决粘包拆包问题2
    查看>>
    Netty工作笔记0085---TCP粘包拆包内容梳理
    查看>>
    Netty常用组件一
    查看>>
    Netty常见组件二
    查看>>
    netty底层源码探究:启动流程;EventLoop中的selector、线程、任务队列;监听处理accept、read事件流程;
    查看>>
    Netty心跳检测机制
    查看>>