行业资讯
📅 2026/8/3 4:36:51
【Python爬虫从入门到实战】Requests库与XPath解析详解(附豆瓣Top250抓取案例)
前言在Python爬虫的世界里requests和lxml (XPath)是一对黄金搭档。前者负责高效地获取网页数据后者负责精准地提取目标信息。本文将结合豆瓣电影Top250实战案例带你彻底掌握这两个核心工具。第一部分基础知识体系1. Requests 库HTTP 请求的利器requests是一个基于urllib3封装的 HTTP 客户端库被称为“给人类使用的 HTTP 库”。核心特点API 简洁直观自动处理连接管理、Cookie 持久化。支持多种协议支持 Keep-Alive 和连接池。安全性支持 SSL 证书验证、Session 会话保持。自动解码内置 JSON 解码器自动处理压缩响应。关键概念URL互联网上某个资源的地址如https://www.baidu.com/s?wdpython。Headers (请求头)伪装浏览器的关键。User-Agent告诉服务器你是谁浏览器版本、操作系统。如果不加这个很容易被服务器识别为爬虫并拦截403 Forbidden。常用方法与属性方法/属性说明示例requests.get()发送 GET 请求response requests.get(url, headersheaders)requests.post()发送 POST 请求requests.post(url, datadata)response.text获取字符串形式的响应内容用于解析 HTMLresponse.content获取二进制响应内容用于下载图片、视频response.status_code获取状态码200 (成功), 404 (未找到), 500 (服务器错误)response.encoding设置/获取编码格式response.encoding utf-8IP 代理 (Proxies)当访问频率过高导致 IP 被封时需要使用代理 IP 来隐藏真实身份或突破访问限制。proxies { http: http://106.14.170.158:18, https: http://106.14.170.158:18 } requests.get(url, proxiesproxies)2. XPath 解析器精准的数据提取XPath (XML Path Language) 是一种在 XML/HTML 文档中查找信息的语言。相比于正则表达式它更适合处理结构化的 DOM 树。XPath解析器获取XPath解析器是浏览器的插件或者拓展在浏览器的插件或者拓展商城就能找到推荐下载XPath Helper以下以Microsoft拓展商城为例在我们想要获取其内容路径的页面打开XPath解析器按住shift键移动鼠标到想要的内容如果将鼠标移动到内容上面没有路径显示就单击一下左键这时就会出现相关内容。节点关系根节点整个文档的源头。父/子/兄弟节点描述元素之间的层级关系。文本节点包含在标签内的文字内容。路径表达式绝对路径从根节点开始写如/html/body/div[1]/div...不推荐太脆弱。相对路径使用//开头从全文档搜索匹配节点如//div[classitem]推荐。常用语法速查语法说明示例/选取直接子节点/div/a//选取所有后代节点不考虑位置//div//span.选取当前节点常用于循环内部继续查找..选取父节点选取属性//a/hreftext()选取文本内容//div/text()[]谓语条件筛选//div[idmain]进阶函数与轴下面通过一个本地 HTML 文件hello.html来演示 XPath 的进阶用法。该文件包含一个ul列表里面有多个带有不同id属性的li标签内容如下!DOCTYPE html html langen head meta charsetUTF-8 / title学习Xpath/title /head body ul li idlhfPython爬虫/li lirequests库/li li idzlgxqXpath解析器/li liget请求/li lipost请求/li li idzwq classc1Hello World/li /ul /body /htmlfrom lxml import etree 解析本地文件 html_etree etree.parse(D:\PYTHON基础\python\Python_spider\hello.html) 1. 查找 ul 下面的 li 标签 —— 多种路径写法 li_list1 html_etree.xpath(/html/body/ul/li/text()) # 绝对路径 li_list2 html_etree.xpath(//ul/li/text()) # 相对路径 li_list3 html_etree.xpath(//li/../text()) # 父节点 li_list4 html_etree.xpath(//li/./text()) # 当前节点 2. 查询所有带 id 属性的 li 标签 li_list5 html_etree.xpath(//ul/li[id]/text()) 3. 查找 id 为 zwq 的标签的 class 属性值 li_list6 html_etree.xpath(//ul/li[idzwq]/class) 4. 查找 id 为 zwq 的 li 标签的文本 li_list7 html_etree.xpath(//ul/li[idzwq]/text())运行输出演示# li_list1绝对路径和 li_list2相对路径输出相同 [Python爬虫, requests库, Xpath解析器, get请求, post请求, Hello World] li_list5所有带 id 属性的 li 标签文本 [Python爬虫, Xpath解析器, Hello World] li_list6id 为 zwq 的标签的 class 属性值 [c1] li_list7id 为 zwq 的 li 标签文本 [Hello World]contains()模糊匹配属性检查字符串是否包含子字符串。例如//div[contains(class, btn)]可以匹配 class 为btn-primary的标签。示例查找 id 中包含字母l的 li 标签。li_list8 html_etree.xpath(//ul/li[contains(id,l)]/text())输出[Python爬虫, Hello World]starts-with()匹配以某字符串开头的属性。示例查找 id 中以l开头的 li 标签。li_list9 html_etree.xpath(//ul/li[starts-with(id,l)]/text())输出[Python爬虫]string-length()根据字符串长度筛选。示例查找 id 长度等于 3 的 li 标签。li_list10 html_etree.xpath(//ul/li[string-length(id)3]/text())输出[Python爬虫, Hello World]逻辑运算符 or组合多个条件。示例查找 id 为lhf或zwq的 li 标签注意正确写法需要把or条件放在同一个谓语[]内而不是写成两个独立的li[...]。li_list11 html_etree.xpath(//ul/li[idlhf or idzwq]/text())输出[Python爬虫, Hello World]position() 与 last()根据位置筛选。示例查找前 3 个 li、最后一个 li、以及第 1 个 li。li_list12 html_etree.xpath(//ul/li[position()4]/text()) li_list13 html_etree.xpath(//ul/li[last()]/text()) li_list14 html_etree.xpath(//ul/li[1]/text())输出# li_list12前 3 个 li [Python爬虫, requests库, Xpath解析器] li_list13最后一个 li [Hello World] li_list14第 1 个 li [Python爬虫]索引注意 XPath 的索引是从1开始的而不是 0。例如//li[1]是第一个 li。第二部分实战演练——爬取豆瓣电影 Top2501. 需求分析目标抓取电影名称、导演、主演、年份、国家、类型、评分、评价人数及引言。存储保存为 CSV 文件。难点分页处理URL 规律。数据清洗文本中包含大量\xa0空格和换行符。异常处理防止程序中断。2. 完整代码实现from lxml import etree import requests import csv import time 配置区 1. 构造请求头伪装成浏览器 headers { User-Agent: Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/120.0.0.0 Safari/537.36 } 2. 准备CSV文件 with open(douban_250.csv, w, encodingutf-8-sig, newline) as file: writer csv.writer(file) # 写入表头 writer.writerow([电影名称, 导演, 主演, 年份, 国家, 类型, 评分, 评价人数, 引言]) # 循环抓取区 # 豆瓣Top250共10页每页25部start参数每次增加25 for start in range(0, 250, 25): url fhttps://movie.douban.com/top250?start{start} print(f正在抓取第 {start // 25 1} 页: {url}) try: # 3. 发送请求 response requests.get(urlurl, headersheaders, timeout10) # 检查响应状态非200会抛出异常 response.raise_for_status() # 设置编码防止乱码 response.encoding utf-8 except Exception as e: print(f页面请求失败{e}) continue 4. 解析 HTML html etree.HTML(response.text) 获取所有电影项的列表定位到每一个电影的容器 items html.xpath(//div[classitem]) 数据提取与清洗区 for item in items: try: # --- 提取电影名称 --- # .// 表示在当前 item 节点下查找 title_list item.xpath(.//span[classtitle][1]/text()) title title_list[0].strip() if title_list else 暂无名称 # --- 提取详细信息导演/主演/年份等 --- # 这里获取的是 p 标签下的所有文本列表通常包含两行 info_lines item.xpath(.//div[classbd]/p[1]/text()) # 初始化变量 director actors year country movie_type 暂无数据 if info_lines: # 清洗数据去除首尾空白和 \xa0 (不间断空格) # replace(\xa0, ) 是关键步骤 clean_line_1 info_lines[0].strip().replace(\xa0, ).replace(\n, ) # 解析第一行导演和主演 if 主演: in clean_line_1: parts clean_line_1.split(主演:) director parts[0].replace(导演:, ).strip() actors parts[1].strip() elif 导演: in clean_line_1: director clean_line_1.replace(导演:, ).strip() # 解析第二行年份 / 国家 / 类型 if len(info_lines) amp;amp;gt; 1: line_2 info_lines[1].strip().replace(\xa0, ).replace(\n, ) # 使用 split(/) 分割注意有些数据可能缺失 details [x.strip() for x in line_2.split(/)] if len(details) amp;amp;gt; 3: year details[0] country details[1] movie_type details[2] elif len(details) 2: year details[0] country details[1] # --- 提取评分 --- rating_list item.xpath(.//span[classrating_num]/text()) rating rating_list[0].strip() if rating_list else 暂无评分 # --- 提取评价人数 --- # 这里的 xpath 路径可能需要根据实际网页微调通常是 span[4] 或者通过 text 内容判断 rating_num_raw item.xpath(.//div[classstar]/span[4]/text()) rating_num rating_num_raw[0].replace(人评价, ).strip() if rating_num_raw else 0 # --- 提取引言 --- quote_list item.xpath(.//p[classquote]/span/text()) quote quote_list[0].strip() if quote_list else 暂无引言 # 5. 写入 CSV writer.writerow([title, director, actors, year, country, movie_type, rating, rating_num, quote]) except Exception as e: print(f解析单条数据出错: {e}) continue 礼貌爬取休眠 2 秒 time.sleep(2) print(抓取完成数据已保存至 douban_250.csv)3. 代码关键点解析避坑指南关于\xa0的处理在实战中你会发现打印出来的字符串里有很多\xa0。这是 HTML 中的“不间断空格”Non-breaking space。问题直接使用.split()有时无法完美分割或者导致字符串看起来很乱。解决使用replace(\xa0, )将其替换为普通空格然后再进行strip()和split()操作。XPath 的相对路径在for item in items:循环内部提取具体字段时XPath 必须以.开头例如.//span...。错误写法//span[classtitle]—— 这会去整个网页找所有的 title导致每次循环都拿到第一部电影的名字。正确写法.//span[classtitle]—— 只在当前的item范围内查找。异常捕获的重要性网络请求和数据处理都非常容易出错比如某个电影没有引言或者网络突然断开。使用try-except包裹请求代码防止因一次 404 导致整个程序崩溃。使用try-except包裹解析代码防止因某部电影数据结构特殊缺字段导致报错中断。总结通过本案例我们不仅复习了requests发送请求和XPath解析数据的语法更重要的是学习了如何处理脏数据。爬虫不仅仅是把网页下载下来更核心的价值在于将非结构化的网页数据转化为结构化的、干净的数据。希望这篇教程对你的学习有所帮助如有问题欢迎在评论区交流。