简而言之:Expedia 依赖 JavaScript 渲染和反机器人保护机制,因此单纯的 requests 调用无法返回酒店列表。本指南将介绍如何使用开发者工具识别 CSS 选择器、通过爬取 API 构建可运行的爬虫、在结果页面间分页浏览,以及导出干净的 CSV 数据。
Expedia 爬取是指从 Expedia 的搜索结果中自动提取酒店价格、评分、空房情况和位置数据,这对价格监控工具、旅行比价应用以及竞争基准分析非常有用。如果您曾尝试使用基本的 HTTP 客户端却只得到一个空页面,您已经知道问题所在:Expedia 会动态加载其酒店列表,因此数据并不包含在原始 HTML 响应中。
本指南面向希望获得实用且易于维护解决方案的 Python 开发者和数据工程师。我们将探讨 Expedia 为何难以抓取、如何使用浏览器开发者工具识别 CSS 选择器、如何构建能处理 JavaScript 渲染和代理轮换的爬虫,以及如何在多个结果页面间分页浏览——此外还将介绍在将数据写入 CSV 之前如何清理提取的数据。




