Python URLManager.add_new_url 예제들

프로그래밍 언어: Python

클래스/타입: URLManager

메소드/함수: add_new_url

hotexamples.com에서의 예제들: 1

Python URLManager.add_new_url - 1개의 예제가 발견되었습니다. 이것들은 오픈소스 프로젝트에서 추출된 Python의 URLManager.add_new_url 패키지로부터 RDFDatabank에 대한 실세계 최고 등급의 예제들입니다. 예제들을 평가하여 예제의 품질 향상에 도움을 줄 수 있습니다.

자주 사용되는 메소드들

보기 숨기기

getRandom(3)

URLManager(2)

UrlManager(1)

add_new_url(1)

get_new_url(1)

has_new_url(1)

예제 #1

파일 보기

파일: test.py 프로젝트: wangjiancn/FirstSpider

class SpiderMan(object):
    def __init__(self):
        self.manager = URLManager()
        self.downloader = HtmlDownloader()
        self.parser = HtmlParser()
        self.output = DataOutput()

    def crawl(self, root_url):
        self.manager.add_new_url(root_url)
        while (self.manager.has_new_url()
               and self.manager.old_url_size() < 100):
            try:
                new_url = self.manager.get_new_url()
                html = self.downloader.download(new_url)
                new_urls, data = self.parser(new_url)
                self.manager.add_new_url(new_urls)
                self.output.store_data(data)
                print('已经抓取了{}个连接'.format(self.manager.old_url_size()))
            except Exception:
                print('爬取失败')
        self.output.output_html()