woaidongmao

文章均收录自他人博客，但不喜标题前加-[转贴]，因其丑陋，见谅！~

随笔 - 1469, 文章 - 0, 评论 - 661, 引用 - 0

数据加载中……

Larbin 一种高效的搜索引擎爬虫工具

我就在这里对larbin做一个简单的介绍。因为相对于复杂的系统来讲，larbin具有高度的可配置性，和良好的工作效率。１］larbin的简介
larbin是一种开源的网络爬虫/网络蜘蛛，由法国的年轻人 Sébastien Ailleret独立开发。larbin目的是能够跟踪页面的url进行扩展的抓取，最后为搜索引擎提供广泛的数据来源。

Larbin只是一个爬虫，也就是说larbin只抓取网页，至于如何parse的事情则由用户自己完成。另外，如何存储到数据库以及建立索引的事情 larbin也不提供。

latbin最初的设计也是依据设计简单但是高度可配置性的原则，因此我们可以看到，一个简单的larbin的爬虫可以每天获取５００万的网页，实在是非常高效。

2] Larbin的性能特征
高效是我对 larbin 的评价。
今年四月份的时候我对larbin的性能做过一个测试，luliang.dhs.org是我自己常用的服务器，CPU 为1G，内存512，其它的性能一般，因为是三年前购置的。

我将我自己的网页六翼作为入口，运行larbin进行５层内的url的抓取。

当时纪录的一些数据：
Internet IO: 500-700k/per second （我想大约我的网络下载的瓶颈了吧）
CPU top: 5%-15%
disk consume: 1M/s ，基本上一个小时爬 3个G 的网页。差不多20万的页面
url 解析: 200万－300万每小时

3] larbin 的作用
很多人初见 larbin 不知道从哪里下手，那么我来简单介绍一下 larbin 的功能和实际应用。
1. larbin 获取单个、确定网站的所有联结，甚至可以镜像一个网站。
2. larbin建立 url 列表群，例如针对所有的网页进行 url retrive后，进行xml的联结的获取。或者是 mp3 。
3. larbin 定制后可以作为搜索引擎的信息的来源（例如可以将抓取下来的网页每2000一组存放在一系列的目录结构里面）。

总归，larbin应当是一个被广大搜索引擎爱好者应当引起注意的一个产品，虽然其功能逐渐被 Nutch 所接受和替代，但是其在爬虫上的优美设计的确值得称道。

posted on 2009-01-04 14:12 肥仔阅读(4516) 评论(2) 编辑收藏引用所属分类: Web-后台

# re: Larbin 一种高效的搜索引擎爬虫工具回复 更多评论

你这样描述，虽然对这个larbin有了进一步的了解，但是对于像我这样的linux初学者，对这个larbin还是一筹莫展，要是可以制作个使用教程该多好呀，呵呵。
另外问下这个larbin是不是增量式的爬虫呢？谢谢~

2010-03-07 16:58 | 一段汇编

# re: Larbin 一种高效的搜索引擎爬虫工具 回复 更多评论

文章均收录自他人博客，但不喜标题前加-[转贴]，因其丑陋，见谅！~
汗，那起码也要加上原文出处呀~ 譬如此文呢？

2010-03-07 17:01 | 一段汇编

刷新评论列表

只有注册用户登录后才能发表评论。
【推荐】100%开源！大型工业跨平台软件C++源码提供，建模，组态！

相关文章: Godaddy的DNS被屏蔽的解决办法浅谈URL最后带斜杠对SEO优化的影响 URL 重定向. HTTP 301 理解HTTP协议中的"Transfer-Encoding: chunked" Nginx 源码分析 ---- Fastcgi 模块(上)/(下) FastCGI中文规范 Fastcgi协议定义解释与说明 FastCGI协议报文的分析从 RoR部署看缓冲原理及fastcgi解析 Fast CGI 工作原理

网站导航: 博客园 IT新闻 BlogJava 博问 Chat2DB 管理

# re: Larbin 一种高效的搜索引擎爬虫工具回复 更多评论

# re: Larbin 一种高效的搜索引擎爬虫工具 回复 更多评论

woaidongmao

Larbin 一种高效的搜索引擎爬虫工具

评论

导航

常用链接

留言簿(10)

随笔分类

随笔档案

搜索

最新评论

阅读排行榜

评论排行榜

woaidongmao

Larbin 一种高效的搜索引擎爬虫工具

评论

# re: Larbin 一种高效的搜索引擎爬虫工具 回复 更多评论

# re: Larbin 一种高效的搜索引擎爬虫工具 回复 更多评论

导航

常用链接

留言簿(10)

随笔分类

随笔档案

搜索

最新评论

阅读排行榜

评论排行榜

# re: Larbin 一种高效的搜索引擎爬虫工具回复更多评论

# re: Larbin 一种高效的搜索引擎爬虫工具回复更多评论