作者本机环境:
系统-windows10
编程语言-Python
Python版本-Python3.6.8
解析工具-Xpath(解析工具不唯一,均可,这里只演示xpath)
编写工具-Pycharm
本内容使用Python语言进行编写,而Python也是编写爬虫比较好的一款编程语言,小白可以快速入门,语法比其他编程语言稍简单一些,那么这里使用的Python面向对象去写的这么一个爬虫文件,对天眼查网站进行爬取,页面经过分析是静态网页,内容抓取相对动态网站要简单的多;直接是按照这样一个思路来写代码,分析出不同页面的url进行分页处理,而拿到的列表页要对其每一个详情的url进行提取,提取到之后使用详情url发起请求抓取详情页面。
在这里补充一点,我使用的是Python3.6.8,而大家可以根据自己的情况去选择,这里是使用的普通爬虫requests进行爬取,那么Python还有强大的第三方库Scrapy框架,能够达到更高效,并且在RedisSpider的延伸中对于爬取到的数据存储速度上非常快,因为redis数据库是基于内存进行存储数据的,更是有一个可以去重的这样一个功能;而scrapy内部的去重原理在源码中是有一个set集合进行去重的,了解Python的肯定对这点不陌生——set集合去重
import requests
from lxml import etree
class TianYanCha():
def __init__(self, url):
self.url = url
# 请求头
self.headers = {
"User-Agent": "Mozilla/5.0 (Windows NT 10.0; Win64; x64) AppleWebKit/537.36 (KHTML, like Gecko) Chrome/80.0.3987.149 Safari/537.36",
"Cookie": "aliyungf_tc=AQAAAL9zfjMqLAQAGpXaG0rH+SQSMyir; csrfToken=D4W5eHOZUdVKKtVN8B5RcWil; jsid=SEM-BAIDU-PZ2003-VI-000001; TYCID=ee9c15b0727811eabdfbb3a9464b1d4e; undefined=ee9c15b0727811eabdfbb3a9464b1d4e; ssuid=7522613240; bannerFlag=false; _ga=GA1.2.2024087523.1585567433; _gid=GA1.2.1441861791.1585567433; Hm_lvt_e92c8d65d92d534b0fc290df538b4758=1585567432,1585568902; refresh_page=0; RTYCID=06e1215159ed40e9b936441fe8b79c12; token=9b83740966314eef9746e9fee609fd9a; _utm=8c3b6195c8d347ccab2335d8abd7a664; CT_TYCID=25b749040e3a45c98de53deb2d0d8104; cloud_token=9d4a9eb888e64a1bb4da17049cf08014; Hm_lpvt_e92c8d65d92d534b0fc290df538b4758=1585571475; _gat_gtag_UA_123487620_1=1",
"Content-Type": "application/json; charset=UTF-8",
"Accept-Encoding": "gzip, deflate, br",
}
self.item_list = {} # 存储队列
def zhixing(self):
self.response = requests.get(url=self.url, headers=self.headers).text # 起始URL
# print(self.response)
self.fen1 = etree.HTML(self.response)
self.datas1 = self.fen1.xpath(
'//div[@class="search-result-single "]/div[@class="content"]/div[@class="header"]/a/@href')
# print(self.datas1) # 详情页url
for self.dataaa in self.datas1:
self.urls = self.dataaa # 详情页url地址
# print(self.urls)
def xiang_qing(self):
import time
time.sleep(1)
self.response_content = requests.get(url=self.urls, headers=self.headers).text
self.datalist = etree.HTML(self.response_content)
self.datas = self.datalist.xpath('//div[@class="box -company-box "]')
# 公司数据
for self.data in self.datas:
self.item_list["公司名称"] = self.data.xpath('./div[@class="content"]/div[@class="header"]/h1/text()')
self.item_list['注册资本'] = self.data.xpath(
'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[1]/td[2]/div/text()')
self.item_list['成立日期'] = self.data.xpath(
'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[2]/td[2]/div/text()')
self.item_list['行业'] = self.data.xpath('//*[@id="_container_baseInfo"]/table[2]/tbody/tr[5]/td[4]/text()')
self.item_list['注册地址 '] = self.data.xpath(
'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[10]/td[2]/text()')
self.item_list['经营范围'] = self.data.xpath(
'//*[@id="_container_baseInfo"]/table[2]/tbody/tr[11]/td[2]/span/text()')
self.item_list['法定代表人'] = self.data.xpath(
'//*[@id="_container_baseInfo"]/table[1]/tbody/tr[1]/td[1]/div/div[1]/div[2]/div[1]/a/@title')
print(self.item_list)
if __name__ == '__main__':
for i in range(1,100):
url = "https://www.tianyancha.com/search/p"+str(i)+"?key=%E5%9B%BD%E5%AE%B6%E7%94%B5%E7%BD%91" # 分页
tianyancha = TianYanCha(url)
tianyancha.zhixing()
tianyancha.xiang_qing()
网友评论