流程:
1.Python爬虫采集物流数据等存入mysql和.csv文件;
2.使用pandas+numpy或者MapReduce对上面的数据集进行数据清洗生成最终上传到hdfs;
3.使用hive数据仓库完成建库建表导入.csv数据集;
4.使用hive之hive_sql进行离线计算,使用spark之scala进行实时计算;
5.将计算指标使用sqoop工具导入mysql;
6.使用Flask+echarts进行可视化大屏实现、数据查询表格实现、含预测算法;
![](https://img.haomeiwen.com/i21576447/f3804f729bd8e56f.png)
![](https://img.haomeiwen.com/i21576447/b3bf69267729ecd2.png)
![](https://img.haomeiwen.com/i21576447/b2070f525dd20cc4.png)
![](https://img.haomeiwen.com/i21576447/94f95dfc9f0a09db.png)
![](https://img.haomeiwen.com/i21576447/f1ed51eb73926e52.png)
![](https://img.haomeiwen.com/i21576447/f7426fd537850535.png)
![](https://img.haomeiwen.com/i21576447/84267502852402a8.png)
流程:
1.Python爬虫采集物流数据等存入mysql和.csv文件;
2.使用pandas+numpy或者MapReduce对上面的数据集进行数据清洗生成最终上传到hdfs;
3.使用hive数据仓库完成建库建表导入.csv数据集;
4.使用hive之hive_sql进行离线计算,使用spark之scala进行实时计算;
5.将计算指标使用sqoop工具导入mysql;
6.使用Flask+echarts进行可视化大屏实现、数据查询表格实现、含预测算法;
本文标题:计算机毕业设计hadoop+spark+hive物流大数据分析平
本文链接:https://www.haomeiwen.com/subject/kceqqjtx.html
网友评论