美文网首页hadoop 大数据底层理解
云计算领域 公开数据集

云计算领域 公开数据集

作者: Tim在路上 | 来源:发表于2020-10-31 18:04 被阅读0次

近些年,随着云计算的快速兴起,各大公司都纷纷建立自己的数据中心,微软在数据中心方面的投入超过了 150 亿,阿里巴巴仅在张北的数据中心就投入了 180 亿。在数据中心的高额投入下,机器的资源使用效率却面临了很大的问题。以 Google 的数据中心为例,其生产环境下机器的平均 CPU 利用率只有 20%,Amazon 的 AWS EC2 平均 CPU 利用率只有 7%~17%。

为了更好的解决数据中心所面临的挑战,各大公司纷纷开始公开自己集群的数据集,希望通过数据集的方式,让研究者更好的了解在大规模的场景下所遇到的问题。

以下为整理的部分公司开源的数据集和传送门,会在慢慢的更新。

Google

1. 传送门:google/cluster-data

2. 公开时间:2011年、2019年

3. 数据集时间跨度:30天

Microsoft Azure

1. 传送门:Azure/AzurePublicDataset

2. 数据内容:Azure 虚拟机、Azure serverless function

3. 2017年:虚拟机,30天数据

4. 2019年:Serverless function,14天数据

Alibaba Co-located cluster

1. 传送门:alibaba/clusterdata

2. 2017年:1000+ 台机器,24小时的数据

3. 2018年:4000+ 台机器,9天的数据

4. 均为阿里内部私有云集群的数据

Two sigma、LANL Mustang、LANL OpenTrinity

1. 传送门:Parallel Data Lab Project: ATLAS

2. 数据集时间跨度:分别为9个月、五年、3个月

数据分析相关论文

Google

Microsoft

AWS

Alibaba

Two sigma

On the diversity of cluster workloads and its impact on research results(ATC 2018)

相关文章

网友评论

    本文标题:云计算领域 公开数据集

    本文链接:https://www.haomeiwen.com/subject/sszsvktx.html