python 原生cookie 转化为字典cookie-白红宇

python 原生cookie 转化为字典cookie

阅读量：282 次

发布时间：2019-03-01

本文共 1679 字，大约阅读时间需要 5 分钟。

在实际开发中，获取并处理浏览器中的cookie值是一个常见但复杂的任务。尤其是在不同浏览器之间切换时，cookie的格式和处理方式可能会有所不同。以下是关于如何在Python中处理cookie值并使用requests库进行爬虫的详细方法。

一、获取浏览器中的cookie值

在现代浏览器中，cookie值通常以键值对的形式存储，形式类似于cookie_name=cookie_value。通过右键点击浏览器中的cookie选项，可以直接复制这些值并粘贴到代码中。

然而，除了直接复制外，某些浏览器（如火狐）导出的cookie值可能包含编码后的特殊字符，这些字符需要经过处理才能正确使用。因此，使用Python脚本来自动解析cookie值是一个更可靠的方法。

二、Python脚本处理cookie值

以下是一个示例Python脚本，用于解析并存储cookie值：

cookie = 'cna=xaYUEGbE2X0CAd7f2Qhq4DAA; thw=cn;nk=%5Cu65E0%5Cu58F0%5Cu6EF4%5Cu5BF9%5Cu767D; l_g=Ug%3D%3D; cookie17=UonZBGCaYSPQhQ%3D%3D; l=AiIimIoKS0HVED4ao4GprqAT8qKEcyaN; isg=AkxMGzVSdzRypWPIho7m3FdsHapqgvAvBpI7WaYNWPeaMew7zpXAv0KDp47z'cookieDict = {}cookies = cookie.split("; ")for co in cookies:    co = co.strip()    if '=' in co:        key, value = co.split('=', 1)        value = value.replace('"', '')        cookieDict[key] = value

三、使用requests库进行爬虫

在获取了cookie值后，可以将它们添加到requests库的请求头中，从而模拟浏览器的行为进行爬虫。以下是一个示例：

import requestscookieDict = {    'cna': 'xaYUEGbE2X0CAd7f2Qhq4DAA',    'thw': 'cn',    'nk': '%u65E0%u58F0%u6EF4%u5BF9%u767D',    'l_g': 'Ug%3D%3D',    'cookie17': 'UonZBGCaYSPQhQ%3D%3D',    'l': 'AiIimIoKS0HVED4ao4GprqAT8qKEcyaN',    'isg': 'AkxMGzVSdzRypWPIho7m3FdsHapqgvAvBpI7WaYNWPeaMew7zpXAv0KDp47z'}url = 'http://www.tianya.cn/'response = requests.get(    url,    cookies=cookieDict)response.raise_for_status()

四、注意事项

cookie的编码：确保cookie值已经正确解码。如果cookie值中包含URL编码的字符，需要在请求时使用原始字符。

Session对象：如果需要保持cookie不变，可以使用requests.Session()对象，并在每次请求时传递cookie参数。

处理异常：在发送请求前，使用response.raise_for_status()方法检查响应状态码，避免由于网络问题或错误请求而导致程序崩溃。

五、优化建议

代码格式化：在实际使用前，建议对代码进行格式化处理，确保可读性。

错误处理：添加异常捕获机制，确保程序在遇到无法解析的cookie值时能够平滑处理。

版本控制：将cookie处理逻辑封装到函数中，方便维护和扩展。

通过以上方法，可以有效地获取和使用浏览器中的cookie值，实现爬虫任务。

转载地址：http://baio.baihongyu.com/

你可能感兴趣的文章

Objective-C实现MidpointIntegration中点积分算法（附完整源码）