利用机器人从网站收集信息和资料的做法被称为“网络爬取”。与抓取屏幕上可见像素的“屏幕抓取”不同,网络爬虫服务提供商收集的是存储在服务器中的基本HTML代码和数据。随后,爬虫程序可以将整个网站的内容复制到其他地方。
许多依赖数据收集的数字公司都使用网络爬取技术。从事市场调研的公司利用爬虫从社交媒体和论坛获取信息。网站会被网络搜索算法爬取,随后这些算法会分析其数据并给出评分。
比价网站会利用机器人从合作商家网站获取产品价格及详情。此外,网络爬取还被用于哄抬价格和盗取内容等活动。遭到爬取的网站可能蒙受重大经济损失,特别是对于那些依赖价格竞争策略或从事内容分发业务的公司而言。
从特定网站大规模窃取内容的行为被称为内容抓取。在线产品目录和依赖数字内容吸引流量的网站是常见的攻击目标。对于这些企业而言,内容抓取攻击可能致命。
例如,对于虚拟本地商家名录而言,创建数据库内容需要投入大量时间、成本和精力。一旦被抓取,这些内容可能会被公之于众、用于垃圾信息发送,或被出售给竞争对手。




