Nutch保留要抓取的起始网页

2012-07-30

Nutch保存要抓取的起始网页在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内

Nutch保存要抓取的起始网页

在\home\apache-nutch-1.4-bin\runtime\local下新建urls新建url.txt输入如下内容:?

http://www.163.com/

http://www.baidu.com/

http://www.sina.com.cn/

http://www.renren.com/

更改\home\apache-nutch-1.4-bin\runtime\local\conf\regex-urlfilter.txt最下面：

# accept anything else

#+^http://([a-z0-9]*\.)*(.*\.)*.*/ ?

#+^http://([a-z0-9]*\.)*nutch.apache.org/

+^http://([a-z0-9]*\.)*renren.com/

+^http://([a-z0-9]*\.)*163.com/

+^http://([a-z0-9]*\.)*baidu.com/

+^http://([a-z0-9]*\.)*sina.com.cn/

如果配置了solr，就可以执行了： bin/nutch crawl urls -solr http://localhost:8983/solr/ -depth 5 -topN 100 -threads 4 >&log.txt

热点排行

开源软件