首页 诗词 字典 板报 句子 名言 友答 励志 学校 网站地图
当前位置: 首页 > 教程频道 > 其他教程 > 开源软件 >

Nutch保留要抓取的起始网页

2012-07-30 
Nutch保存要抓取的起始网页在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内

Nutch保存要抓取的起始网页

在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内容:?

http://www.163.com/

http://www.baidu.com/

http://www.sina.com.cn/

http://www.renren.com/

更改\home\apache-nutch-1.4-bin\runtime\local\conf\regex-urlfilter.txt最下面:

# accept anything else

#+^http://([a-z0-9]*\.)*(.*\.)*.*/ ?

#+^http://([a-z0-9]*\.)*nutch.apache.org/

+^http://([a-z0-9]*\.)*renren.com/

+^http://([a-z0-9]*\.)*163.com/

+^http://([a-z0-9]*\.)*baidu.com/

+^http://([a-z0-9]*\.)*sina.com.cn/

?

如果配置了solr,就可以执行了: bin/nutch crawl urls -solr http://localhost:8983/solr/ -depth 5 -topN 100 -threads 4 >&log.txt

热点排行