Grub-分布式Web爬虫

Grub 非彼 GRUB (GNU GRUB)。今天看到卢亮的 Larbin 一种高效的搜索引擎爬虫工具 一文提到 Nutch,Google 找了一下,发现了这个 Grub。此 Grub 是个分布式应用程序(类似 SETI@home ,寻找地外智能生物),该软件的目标有些惊人:

track down every site in the world and provide a real-time map of the Web

Grub 的资助者是 Looksmart 公司。如果感兴趣,可以下载客户端工具,用空闲的 CPU 资源与网络带宽为 Web 搜索添加一份自己的力量,共同构建世界上最大的最灵敏(?)的 URL 信息数据库。客户端工具目前有 Windows 版本和 Linux 版本,最新的版本号是 2.5 。

该工具的界面一瞥:

Grub.Distributed Web Crawling.png

在这里可以查看一些用户统计信息,可以看到排名第一的用户已经贡献了768,071,848 个 URL (to Dec-24-2004)。

| | TrackBacks (0) | | Edit

Generator | Trampoline



自定义搜索

添加评论

关于这篇文章

这篇文章由 Fenng 于 December 24, 2004 10:43 PM 发布

上一篇:PC Magazine 年度人物

下一篇:这一年读过的小说 --《收获》篇

回到首页查看最近的文章或者是查看所有归档文章

DBA notes 的订阅数量,点击则可进行订阅
Feed 订阅数量,点击即可订阅最新内容