推广

做SEO怎么用好scrapy

iseeyu3年前 (2024-01-26)推广142

SEO怎么用好scrapy?python的爬虫框架,scrapy,收集效率相当高,一只蜘蛛跑一万url收集题目之类的10分钟不到就搞定了,当然了,不妨同时跑多只蜘蛛。

首先是scrapy的安装教程,就不搬砖了,直接贴上位置:

http://blog.csdn.net/pleasecallmewhy/article/details/19354723

而后是新建名目标教程:

http://blog.csdn.net/pleasecallmewhy/article/details/19642329

之后就不妨收集了。

在Scrapy里,运用的是叫做 XPath selectors的机制,它基于 XPath表明式。所以,假如要收集仍然要了解下Xpath(正则也行)。之后的事情就简单多了。底下融合自身写的一只爬虫来吧,这个应当是属于scrapy简单的爬虫了:

baidu_spider.py 取排名,题目,快照,和url(暂未引入其余模块获得真切url),当然,想取描述相同的,再写一个xpath法则,并在items.py中对应的肋下增添dec=Field()能够(拜见新建名目标教程)。

from scrapy.spider import Spider

from scrapy.selector import Selector

from tutorial.items import BaiduItem

class BaiduSpider(Spider):

name = "baidu"

allowed_domains = ["baidu.com"]

start_urls = ["http://www.baidu.com/s?q1=%BD%F0%B8%D5%C9%B0"]

def parse(self,response):

sel = Selector(response)

sites = sel.xpath('//div[@class="result c-container "]'

items = []

for site in sites:

item = BaiduItem()

item['num'] = site.re('(id="d{1,3}"'

item['title'] = site.xpath('h3/a/text()'.extract()

item['link'] = site.xpath('h3/a/@href'.extract()

item['date'] = site.re('�(d{4}-d{2}-d{2})�'

items.append(item)

return items

复制代码

运转号令:

json数据:

上边是一个简单的使用,在此基本上,咱们将以上代码改进,批量获得一些内容:

以爬某站的spider为例:

1、url.txt存储url,一行一个。读取后作为参数传给start_urls。

2、咱们要取的是他的全部h1,那么修正xpath表明式。

3、url.txt需求放在根目次下,蜘蛛也是在根目次下号令行运转。运转的号令为scrapy crawl mouzhan -o items.json -t json.(这里咱们保存成功了json格式,文件名叫做items.json)

from scrapy.spider import Spider

from scrapy.selector import Selector

from tutorial.items import MouzhanItem

class MouzhanSpider(Spider):

name = "mouzhan"

allowed_domains = ["mouzhan.com"]

start_urls = open('url.txt','r'.readlines()

def parse(self,response):

sel = Selector(response)

sites = sel.xpath('//h1/text()'.extract()

items = []

for site in sites:

item = MouzhanItem()

item['h1'] = site

items.append(item)

return items

复制代码

收集到的数据:

后输送的文件是json格式(也不妨存储为csv等格式),编码是unicode,收集的中文在读取时处理下能够。测试的是一只蜘蛛10分钟1万url。不妨同时运转多只蜘蛛。这里没有研究ip代理,ua那些器材,不晓得是收集的网站没有限制仍然scrapy内部有处理,不过查了下,scrapy不妨自行配置代理的。

scrapy也只是刚接触,并未有更深的研讨,可是相对而言收集的速度相当快,我用beautifulsoup分析html收集的脚本要运转2个半小时才能收集1万数据,应当是不用给定url,在写的过程中制订法则就不妨让蜘蛛去爬的。

至于scrapy在seo上的使用,我也说不走出多少,起码用这个器材用来查排名应当不慢(杀鸡焉用牛刀),批量查收录之类的,收集效率也高,至于收集谁,收集回来的器材怎么用,看你自身了。ps(轻喷:原本我也不晓得学这器材做什么,反正我是小企业站,暂且不晓得用来做什么。)

扫描二维码推送至手机访问。

版权声明:本文由西安泽虎代运营发布,如需转载请注明出处。

转载请注明出处https://www.0291.com.cn/post/97237.html

相关文章

商业思维-做生意一定要修炼格局-黄力泓

商业思维-做生意一定要修炼格局-黄力泓

做生意的格局其实是你面对自己修炼的格局因为做生意,一定是跟人打交道,那么人打交道的时候,这里面有一个最现实的问题,就是我的观念,我们经常会去强调我,我想跟你说什么货,我认为什么做生意是要谈的不是我,而是我们啊,如何我们之间来商量什么商业,商业是商量。还有就是做生意的时候,其...

靠自媒体月入2W+的闺蜜,告诉我赚钱的7个方法

靠自媒体月入2W+的闺蜜,告诉我赚钱的7个方法

昨夜,与闺蜜聊天惊闻她3月份靠经营自媒体收入达到2万多,祝贺、羡慕之余,赶紧向她请教盈利的方法。她送给我7句话,让刚刚加入到自媒体运营,一时摸不到门路,深感前路迷惘的我获益匪浅。现将7个方法整理成,与大家分享。1、找准定位。现在做自媒体的人非常多,要想在茫茫人海中脱颖而出,...

五种全网营销方式,你get到了吗。

五种全网营销方式,你get到了吗。

是很受企业欢迎的一种营销方式,与传统的营销方式相比,传播更加的快速,覆盖范围更大,而在效果方面更是翻倍,企业在执行的时候可以相应步骤及方案,而现在很多企业在做全网营销的时候,不知道制定方案,更不知道有哪向种,那接下来优化猩小编分享企业做全网营销,这五种营销型方案了解吗? 一般全网营销包含...

分享企业建设手机网站带来的优势有哪些。

分享企业建设手机网站带来的优势有哪些。

第一、巨大的潜在用户群 据不完全统计,全国移动手机端的用户现已超越PC端用户集体,估计2022年全球手机用户将到达48亿,占全球挨近一半的人员。面临如此巨大的数据,公司建立,将会敞开更大的移动商场!经过随身携带的手机网络,许多公司现已初步随时随地的经商了,你愿意失掉那5亿的巨大商场吗?...

曼果教育:淘宝新手卖家怎么做好淘宝运营

曼果教育:淘宝新手卖家怎么做好淘宝运营

和淘宝网店其他部分的运营一样,店铺直播也是需要进行运营的。卖家进行淘宝直播运营,能够帮助店铺直播更好地运营起来。不过新手卖家在做这一项工作的时候,可能因为缺乏经营而抓不住重点。那么,下面我们就来跟大家分享一些相关方面的知识,供大家参考。 1、明确下一场直播的主要内...

Seo如何提高网站的访问的速度。

Seo如何提高网站的访问的速度。

不知道大家有没有这样的经历,当我们访问一个网站的时候,网站需要很长时间才能访问,或者重复刷新多次都打不开,这个时候多数人就会选择直接关闭网站,除非网站的内容对这个用户特别的重要。当网站出现这样的情况,不管是从优化角度还是用户角度来说,都是非常致命的,特别是一些企业类的网站,经常会在线上搞一些促销活动...

现在,非常期待与您的又一次邂逅

我们努力让每一部企业宣传片和抖音短视频成为商业大片