2016-08-29 11 views
2

こんにちは、特定のドメイン上のすべてのリンクを取得するために実行される基本スパイダーを持っています。私はそれが状態を維持して、それがどこから残っているかを再開できるようにしたい。私は与えられたURL http://doc.scrapy.org/en/latest/topics/jobs.htmlに従ってきました。しかし、最初はうまくいき、Ctrl + Cで終了します。そして、再開しようとすると、クロールは最初のURL自体で停止します。それが終了すると、以下治療スパイダーは状態を保存しません(永続状態)

はログです:ここでは

2016-08-29 16:51:08 [scrapy] INFO: Dumping Scrapy stats: 
{'downloader/request_bytes': 896, 
'downloader/request_count': 4, 
'downloader/request_method_count/GET': 4, 
'downloader/response_bytes': 35320, 
'downloader/response_count': 4, 
'downloader/response_status_count/200': 4, 
'dupefilter/filtered': 149, 
'finish_reason': 'finished', 
'finish_time': datetime.datetime(2016, 8, 29, 16, 51, 8, 837853), 
'log_count/DEBUG': 28, 
'log_count/INFO': 7, 
'offsite/domains': 22, 
'offsite/filtered': 23, 
'request_depth_max': 1, 
'response_received_count': 4, 
'scheduler/dequeued': 2, 
'scheduler/dequeued/disk': 2, 
'scheduler/enqueued': 2, 
'scheduler/enqueued/disk': 2, 
'start_time': datetime.datetime(2016, 8, 29, 16, 51, 7, 821974)} 
2016-08-29 16:51:08 [scrapy] INFO: Spider closed (finished) 

は私のクモです:

from scrapy.spiders import CrawlSpider, Rule 
from scrapy.linkextractors import LinkExtractor 
from Something.items import SomethingItem 

class maxSpider(CrawlSpider): 
    name = 'something' 
    allowed_domains = ['thecheckeredflag.com', 'inautonews.com'] 
    start_urls = ['http://www.thecheckeredflag.com/', 'http://www.inautonews.com/'] 

    rules = (Rule(LinkExtractor(allow=()), callback='parse_obj', follow=True),) 


    def parse_obj(self,response): 

    for link in LinkExtractor(allow=self.allowed_domains,deny =()).extract_links(response): 
     item = SomethingItem() 
     item['url'] = link.url 
     yield item 
     #print item 

Scrapyバージョン:Scrapy 1.1.2

Pythonのバージョン:2.7

私はより多くの情報を投稿する必要がある場合は、私に教えてください私は、治療に新しいです。

+0

Terminal/CMDコールはどのように見えますか?彼らが提案するような構文を使っていますか? 'scrap crawl somespider -s JOBDIR = crawls/somespider-1'? – dblclik

+0

はい、まったく同じです。それは正常にはじめて実行されますが、上記を再開すると履歴書の統計が表示されます –

+0

スクレーパーの実行開始時にログを貼り付けることはできますか?どこで設定が行われますか。 –

答えて

2

これは、スパイダープロセスが突然殺されたためです。

Ctrl + Cキーを押すとスパイダーが正しくシャットダウンされませんでした。クローラーが正常にシャットダウンすると、正常に再開します。

したがって、基本的にクローラが終了/シャットダウンして再開することを確認してください。

関連する問題