2011-09-10 55 views
1

我有nutch/hadoop與2 datanode服務器。我會嘗試抓取一些網址,但Nutch的失敗,此錯誤:Nutch抓取錯誤 - 輸入路徑不存在

Fetcher: segment: crawl/segments 
Fetcher: org.apache.hadoop.mapred.InvalidInputException: Input path does not exist: hdfs://devcluster01:9000/user/nutch/crawl/segments/crawl_generate 
    at org.apache.hadoop.mapred.FileInputFormat.listStatus(FileInputFormat.java:190) 
    at org.apache.hadoop.mapred.SequenceFileInputFormat.listStatus(SequenceFileInputFormat.java:44) 
    at org.apache.nutch.fetcher.Fetcher$InputFormat.getSplits(Fetcher.java:105) 
    at org.apache.hadoop.mapred.JobClient.writeOldSplits(JobClient.java:810) 
    at org.apache.hadoop.mapred.JobClient.submitJobInternal(JobClient.java:781) 
    at org.apache.hadoop.mapred.JobClient.submitJob(JobClient.java:730) 
    at org.apache.hadoop.mapred.JobClient.runJob(JobClient.java:1249) 
    at org.apache.nutch.fetcher.Fetcher.fetch(Fetcher.java:1107) 
    at org.apache.nutch.fetcher.Fetcher.run(Fetcher.java:1145) 
    at org.apache.hadoop.util.ToolRunner.run(ToolRunner.java:65) 
    at org.apache.nutch.fetcher.Fetcher.main(Fetcher.java:1116) 

有人能幫助我嗎?我不知道如何解決這個問題! 許多Thx!

+0

你究竟想要運行什麼? – GreyCat

回答

1

驗證nutch/crawl/segments/crawl_generate路徑是否正確。

任一路徑錯誤或解析階段未完成。

1

nutch的生成階段在segments目錄內創建「crawl_generate」。這包含提取階段中使用的提取列表。您得到的錯誤是因爲獲取階段無法獲取獲取列表。確保生成的輸出在提取試圖找到它的位置填充。

相關問題