Rev 178 | Go to most recent revision | Blame | Compare with Previous | Last modification | View Log | RSS feed
'''Created on 16-May-2010@author: gaurav'''from scrapy.spider import BaseSpiderfrom scrapy.selector import HtmlXPathSelectorfrom scrapy.http import Requestfrom demo.items import DemoItemfrom scrapy.contrib.spidermiddleware import refererfrom scrapy.http.headers import Headersfrom scrapy.http.request.form import FormRequestfrom scrapy.log import msgfrom scrapy.http.response import Responsefrom datastore import DataAccessorfrom datastore.DataAccessor import DataHelperclass indiaplaza_spider(BaseSpider):def __init__(self):self.domain_name = "indiaplaza"ct = 18no = 1while(no<=ct):str1 = "http://www.indiaplaza.in/mobile-phones-Mobiles-1.htm?PageNo="+str(no)self.start_urls.append(str1)no=no+1def start_requests(self):listreq = []for url1 in self.start_urls:request = Request(url = str(url1), callback=self.parse,dont_filter=True,)request.headers.setdefault("Referer", "http://www.indiaplaza.in")listreq.append(request)return listreqdef parse(self, response):str1 = "http://www.indiaplaza.in"hxs = HtmlXPathSelector(response)phone_info = hxs.select('//tr/td/table[@id="browsesku"]')items = []#msg(len(phone_info))#msg(response.body)for i in phone_info:item = {}item['title'] = i.select('.//div[@class="skuimg"]/a/@title')[0].extract()item['url'] = i.select('.//div[@class="skuimg"]/a/@href')[0].extract()items.append(item)f = open('/home/gaurav/Desktop/indiaplaza_info.txt', 'a')da = DataHelper()for item in items:str2 = str1 + str(item['url'])#amnt = item['price'].replace(",","")#amnt = amnt.replace("Rs.", "")#amnt = amnt.strip()#pr = int(amnt) + vatplustaxda.add_ipbasic(item['title'],str2)print item['title']#print str(item['title'])print str(item['title']).strip()#print str2f.write(str(item['title']).strip())f.write("\n")f.write(str2.strip())f.write("\n\n")f.close()SPIDER = indiaplaza_spider()