使用Scapy爬虫时,为什么管道持久化存储文件为空?(爬虫.为空.持久.管道.文件...)
本文分析了使用Scapy爬虫时,管道持久化存储文件为空的常见问题,并提供详细的排查和解决方法。问题核心在于Pipeline中文件指针未正确初始化,导致写入操作失败。
以下是一个示例代码片段,展示了问题所在以及解决方案:
爬虫代码 (biedou_spider.py):
import scrapy import sys sys.path.append(r'd:project_testpydemodemo1xunlianmyspiderqiubai') from ..items import qiubaiitem class biedouspider(scrapy.Spider): name = "biedou" start_urls = ["https://www.biedoul.com/wenzi/"] def parse(self, response): dl_list = response.xpath('/html/body/div[4]/div[1]/div[1]/dl') for dl in dl_list: title = dl.xpath('./span/dd/a/strong/text()')[0].extract() content = dl.xpath('./dd//text()').extract() content = ''.join(content) item = qiubaiitem() item['title'] = title item['content'] = content yield item break #此处break语句仅用于测试,实际应用中应移除
Item定义 (items.py):
import scrapy class qiubaiitem(scrapy.Item): title = scrapy.Field() content = scrapy.Field()
Pipeline代码 (pipelines.py): (错误代码)
class qiubaipipeline(object): def __init__(self): self.fp = None def open_spdier(self, spider): #拼写错误:open_spdier print("开始爬虫") self.fp = open('./biedou.txt', 'w', encoding='utf-8') def close_spider(self, spider): print("结束爬虫") self.fp.close() def process_item(self, item, spider): title = str(item['title']) content = str(item['content']) self.fp.write(title + ':' + content + ' ') return item
运行爬虫时,错误信息显示AttributeError: 'NoneType' object has no attribute 'close',这正是由于open_spdier方法名拼写错误导致的。 open_spider 方法未被调用,self.fp 始终为 None。
Pipeline代码 (pipelines.py): (修正代码)
class QiubaiPipeline(object): #建议类名首字母大写 def __init__(self): self.fp = None def open_spider(self, spider): #修正拼写错误 print("开始爬虫") self.fp = open('./biedou.txt', 'w', encoding='utf-8') def close_spider(self, spider): print("结束爬虫") try: self.fp.close() except AttributeError: print("文件未打开") #增加异常处理 def process_item(self, item, spider): title = str(item['title']) content = str(item['content']) try: self.fp.write(title + ':' + content + ' ') except AttributeError: print("文件未打开,写入失败") #增加异常处理 return item
通过更正open_spider方法名,并添加异常处理,确保即使出现错误也能优雅地处理,避免程序崩溃。 此外,建议类名使用首字母大写规范。 移除parse方法中的break语句,才能完整地处理所有数据。 确保biedou.txt 文件有写入权限。
这个修正后的Pipeline就能正确地将爬取的数据写入biedou.txt 文件。 记住仔细检查代码中的拼写错误,并添加适当的错误处理,这对于调试和维护代码至关重要。
以上就是使用Scapy爬虫时,为什么管道持久化存储文件为空?的详细内容,更多请关注知识资源分享宝库其它相关文章!