Spidr : Ruby开发的Web爬虫

Spidr : Ruby开发的Web爬虫
Spidr是一个多功能的Ruby web 爬虫库。它可以抓取一个网站，多个域名或某些链接。Spidr被设计成快速和容易使用。

Follows:
- a tags.
- iframe tags.
- frame tags.
- Cookie protected links.
- HTTP 300, 301, 302, 303 and 307 Redirects.
- HTTP Basic Auth protected links.
Black-list or white-list URLs based upon:
- URL scheme
- Host name
- Port number
- Full link
- URL extension
Provides call-backs for:
- Every visited Page.
- Every visited URL.
- Every visited URL that matches a specified pattern.
- Every URL that failed to be visited.
Provides action methods to:
- Pause spidering.
- Skip processing of pages.
- Skip processing of links.
Restore the spidering queue and history from a previous session.
Custom User-Agent strings.
Custom proxy settings.
HTTPS support.

本文由用户 jopen 自行上传分享，仅供网友学习交流。所有权归原作者，若您的权利被侵害，请联系管理员。

转载本站原创文章，请注明出处，并保留原始链接、图片水印。

本站是一个以用户分享为主的开源技术平台，欢迎各类分享！