Subversion Repositories SmartDukaan

Rev

Rev 158 | Rev 226 | Go to most recent revision | Details | Compare with Previous | Last modification | View Log | RSS feed

Rev Author Line No. Line
158 ashish 1
'''
2
Created on 16-May-2010
3
 
4
@author: gaurav
5
'''
6
 
7
 
8
from scrapy.spider import BaseSpider
9
from scrapy.selector import HtmlXPathSelector
10
from scrapy.http import Request
11
 
12
from demo.items import DemoItem
13
from scrapy.contrib.spidermiddleware import referer
14
from scrapy.http.headers import Headers
15
from scrapy.http.request.form import FormRequest
16
from scrapy.log import msg
17
from scrapy.http.response import Response
18
 
19
from datastore import DataAccessor
20
from datastore.DataAccessor import DataHelper
21
 
22
 
23
class indiaplaza_spider(BaseSpider):
24
 
25
    def __init__(self):
26
       self.domain_name = "indiaplaza"
27
       ct = 18
28
       no = 1
29
       while(no<=ct):
30
            str1 = "http://www.indiaplaza.in/mobile-phones-Mobiles-1.htm?PageNo="+str(no)
31
            self.start_urls.append(str1)
32
            no=no+1
33
 
34
    def start_requests(self):
178 ashish 35
        da = DataHelper()
36
        da.add_supplier(self.domain_name, "www.indiaplaza.com")
158 ashish 37
        listreq = []
38
        for url1 in self.start_urls:
39
            request = Request(url = str(url1), callback=self.parse,dont_filter=True,)
40
            request.headers.setdefault("Referer", "http://www.indiaplaza.in")
41
            listreq.append(request)
42
        return listreq
43
 
44
    def parse(self, response):
45
        str1 = "http://www.indiaplaza.in"
46
        hxs = HtmlXPathSelector(response)
47
        phone_info = hxs.select('//tr/td/table[@id="browsesku"]')
48
        items = []
49
        #msg(len(phone_info))
50
        #msg(response.body)
51
        for i in phone_info:
52
            item = {}
53
            item['title'] = i.select('.//div[@class="skuimg"]/a/@title')[0].extract()
54
            item['url'] = i.select('.//div[@class="skuimg"]/a/@href')[0].extract()
55
 
56
 
57
            items.append(item)
58
 
59
        f = open('/home/gaurav/Desktop/indiaplaza_info.txt', 'a')
60
        da = DataHelper()
61
        for item in items:
62
            str2 = str1 + str(item['url'])
63
            #amnt = item['price'].replace(",","")
64
            #amnt = amnt.replace("Rs.", "")
65
            #amnt = amnt.strip()
66
 
67
            #pr = int(amnt) + vatplustax
68
            da.add_ipbasic(item['title'],str2)    
69
            print item['title']
70
            #print str(item['title'])
71
            print str(item['title']).strip()
72
            #print str2
73
            f.write(str(item['title']).strip())
74
            f.write("\n")
75
            f.write(str2.strip())
76
            f.write("\n\n")
77
        f.close()            
78
SPIDER = indiaplaza_spider()