跳至内容

Blog

洞察与工程

深入探讨网络数据基础设施、数据提取技术以及大规模结构化数据的未来。

最新文章

181 文章

如何在 Node-Fetch 中使用代理:实用指南
指南

如何在 Node-Fetch 中使用代理:实用指南

简要说明:Node-Fetch 没有内置代理开关,因此您需要通过代理选项将 HTTP、HTTPS 或 SOCKS5 代理接入请求。本指南从头到尾介绍了如何在 Node-Fetch 中使用代理:经过验证的 HTTP 和 HTTPS 代理、SOCKS5、轮换、重试、TLS 边缘情况、故障排除以及 Node 18+ 原生获取的现代 undici 路由。

Mihnea-Octavian Manolache3 min read
阅读文章
用 Python 对 JavaScript 表进行网络抓取:从隐藏的 API 到 Playwright
指南

用 Python 对 JavaScript 表进行网络抓取:从隐藏的 API 到 Playwright

简而言之:用 Python 对 JavaScript 表格进行网络刮擦很少需要无头浏览器。打开 DevTools,找到与网格融为一体的 JSON 端点,用请求重放它,对它进行分页,只有当网络调用被签名、加密或以其他方式密封时,才返回 Playwright。

Andrei Ogiolan2 min read
阅读文章
如何使用 Colly 在 Golang 中抓取 HTML 表格:端到端指南
指南

如何使用 Colly 在 Golang 中抓取 HTML 表格:端到端指南

简要说明:本指南展示了如何在 Golang 中从头到尾地刮擦 HTML 表格:在 Colly、goquery 和 golang.org/x/net/html 之间进行选择,以正确的 <tbody> 为目标,将行建模为类型化结构,并导出干净的 JSON 和 CSV。你还能获得分页、反阻塞和 JavaScript 渲染的表格模式。

Andrei Ogiolan3 min read
阅读文章
Playwright Web Scraping:Python 和 Node.js 完全指南
指南

Playwright Web Scraping:Python 和 Node.js 完全指南

简要说明:Playwright 为您提供了全面的浏览器自动化功能,可用于刮擦 JavaScript 繁重的网站,并为 Python 和 Node.js 提供一流的支持。本指南将指导您完成安装、元素提取、代理配置、反检测、分页、图片下载以及将数据导出为 CSV 或 JSON 等操作,并提供两种语言的并行代码示例。

Mihnea-Octavian Manolache3 min read
阅读文章
如何从 Google 地图中抓取评论:实用 Python 指南
指南

如何从 Google 地图中抓取评论:实用 Python 指南

简要说明:要想知道如何从 Google 地图中抓取评论,有三种方法:旋转代理后的 DIY Selenium 抓取器、带有渲染说明的抓取 API 或返回解析 JSON 的结构化地图评论 API。本指南用 Python 演示了这三种方法,包括可复制粘贴的代码、分页模式、防拦截策略,以及将原始评论转化为企业可实际使用的内容的最后清理步骤。

Andrei Ogiolan3 min read
阅读文章
使用 Python 和 wget 轻松下载网页和文件
指南

使用 Python 和 wget 轻松下载网页和文件

使用 Python 和 wget 实现网页抓取和文件下载的自动化。学习如何利用这些工具收集数据并节省时间。

Gabriel Cioci2 min read
阅读文章

开始构建

准备好扩展您的数据收集规模了吗?

加入2,000多家企业,使用WebScrapingAPI在无需任何基础设施开销的情况下,以企业级规模提取网络数据。