Subversion Repositories SmartDukaan

Rev

Rev 178 | Go to most recent revision | Details | Last modification | View Log | RSS feed

Rev Author Line No. Line
158 ashish 1
'''
2
Created on 16-May-2010
3
 
4
@author: gaurav
5
'''
6
 
7
 
8
from scrapy.spider import BaseSpider
9
from scrapy.selector import HtmlXPathSelector
10
from scrapy.http import Request
11
 
12
from demo.items import DemoItem
13
from scrapy.contrib.spidermiddleware import referer
14
from scrapy.http.headers import Headers
15
from scrapy.http.request.form import FormRequest
16
from scrapy.log import msg
17
from scrapy.http.response import Response
18
 
19
from datastore import DataAccessor
20
from datastore.DataAccessor import DataHelper
21
 
22
 
23
class indiaplaza_spider(BaseSpider):
24
 
25
    def __init__(self):
26
       self.domain_name = "indiaplaza"
27
       ct = 18
28
       no = 1
29
       while(no<=ct):
30
            str1 = "http://www.indiaplaza.in/mobile-phones-Mobiles-1.htm?PageNo="+str(no)
31
            self.start_urls.append(str1)
32
            no=no+1
33
 
34
    def start_requests(self):
35
        listreq = []
36
        for url1 in self.start_urls:
37
            request = Request(url = str(url1), callback=self.parse,dont_filter=True,)
38
            request.headers.setdefault("Referer", "http://www.indiaplaza.in")
39
            listreq.append(request)
40
        return listreq
41
 
42
    def parse(self, response):
43
        str1 = "http://www.indiaplaza.in"
44
        hxs = HtmlXPathSelector(response)
45
        phone_info = hxs.select('//tr/td/table[@id="browsesku"]')
46
        items = []
47
        #msg(len(phone_info))
48
        #msg(response.body)
49
        for i in phone_info:
50
            item = {}
51
            item['title'] = i.select('.//div[@class="skuimg"]/a/@title')[0].extract()
52
            item['url'] = i.select('.//div[@class="skuimg"]/a/@href')[0].extract()
53
 
54
 
55
            items.append(item)
56
 
57
        f = open('/home/gaurav/Desktop/indiaplaza_info.txt', 'a')
58
        da = DataHelper()
59
        for item in items:
60
            str2 = str1 + str(item['url'])
61
            #amnt = item['price'].replace(",","")
62
            #amnt = amnt.replace("Rs.", "")
63
            #amnt = amnt.strip()
64
 
65
            #pr = int(amnt) + vatplustax
66
            da.add_ipbasic(item['title'],str2)    
67
            print item['title']
68
            #print str(item['title'])
69
            print str(item['title']).strip()
70
            #print str2
71
            f.write(str(item['title']).strip())
72
            f.write("\n")
73
            f.write(str2.strip())
74
            f.write("\n\n")
75
        f.close()            
76
SPIDER = indiaplaza_spider()