文章詳情頁
python - Scrapy ItemLoader數據清洗疑問
瀏覽:88日期:2022-06-30 08:28:51
問題描述
在使用scrapy抓取數據時,利用itemloader這個類,使用selector取出的值為空時,進入scrapy.Field()里調用filter(),selector取值不為空的確返回'有值',如果selector取出[]或'',那么value進入filter()之后,并不會返回'無值'
def filter(value): if value:return '有值' else:return '無值' # 下面就簡寫了,熟悉的應該能看的懂 scrapy.Field(filter())
有什么辦法將抓取為空的值,經過filyer()之后變成'無值'
問題解答
回答1:謝邀~不太了解Scrapy,所以題主這個我不太好說我用PHP自己寫的爬蟲大體思路是:1.先是根據正則和一些循環,把要收集的頁面放到隊列里,按類別分類,例如分頁的列表頁一個隊列,列表里的數據內容頁一個隊列。2.然后利用xpath來爬取相關內容頁的數據,爬取的過程中對一些爬取到的數據進行如題主所需的那樣進行處理。3.組裝數據,按照自己所需的標準保存數據。
大體就是這樣,我絕對大部分爬蟲框架也大概都是這種思路吧,無非是在此基礎上增加了,反爬機制,多線程,多進程,增量爬取等等功能。所以,題主找到你這個框架的爬取數據那里進行處理或組裝數據的地方進行處理都行。
相關文章:
1. angular.js - 三大框架react、vue、angular的分析2. python 如何實現PHP替換圖片 鏈接3. mysql - 一個表和多個表是多對多的關系,該怎么設計4. android-studio - Android 動態壁紙LayoutParams問題5. mysql主從 - 請教下mysql 主動-被動模式的雙主配置 和 主從配置在應用上有什么區別?6. angular.js - 不適用其他構建工具,怎么搭建angular1項目7. html5 - iOS的webview加載出來的H5網頁,怎么修改html標簽select的樣式字體?8. 主從備份 - 跪求mysql 高可用主從方案9. python如何不改動文件的情況下修改文件的 修改日期10. python - django 里自定義的 login 方法,如何使用 login_required()
排行榜
