20 个安全可靠的免费数据源,各领域数据任你挑

2019 年 5 月 15 日 数据库开发

(给数据分析与开发加星标,提升数据技能


英文:Julie Joyce,编译:机器之心


本文作者列出了 20 种被广泛认可的免费数据源,其中信息涵盖天文地理、政法医经等,可以说是很全面了。不过数据源中的大部分数据集都采集的美国信息,也有少部分是关于其他国家或全球的,大家尽可从中筛选自己需要的数据集。



我们都喜欢免费的东西,对吧?实际上,虽然网络上充斥着各种免费信息,但这些信息有时是错误或具有误导性的。但以下这 20 个是被广泛认为相当可信的免费数据源。


Google Dataset Search


地址:

https://toolbox.google.com/datasetsearch



它可以让你搜索到已经根据 schema.org 标准进行正确标记的可用数据集。虽然这可以被视为一站式数据集商店,包括像来自 NASA 和 ProPublica 等来源的数据,但对于一些特定目标来说,其它数据集可能更好用。


你可以看到所有搜索结果,每个结果包括:


  • 数据集名称

  • 最近更新时间

  • 数据集简介


其中一些结果可以让你获得更多信息,例如数据集中可用的格式。


Google Trends


地址:

https://trends.google.com/trends/explore



使用此工具,你可以搜索关键字并查看有关它们的各种信息,包括:


  • 按照时间的搜索热度

  • 按照地区的搜索热度

  • 相关主题

  • 相关搜索


你可以选择不同的选项,包括要查看的国家(或全球),将其缩小到各个类别,或将搜索范围限制在所有网站、图片、新闻、购物或 YouTube 上。


你还可以将搜索结果与另一主题进行对比。


U.S. Census Bureau


地址:

https://www.census.gov/



你可以从这个数据集中获得与人口、经济和地理相关的信息,也可以按主题或搜索进行浏览。


如果你需要统计内容,这会是一个很好用的工具。它们有一些很好的可视化效果,你也可以将其嵌入到内容中。


EU Open Data Portal


地址:

http://data.europa.eu/euodp/en/data/



该数据集中的可用数据包括:


  • 地理

  • 金融

  • 统计学

  • 选举结果

  • 法案

  • 有关犯罪、交通、健康、环境和科学研究的信息


这是一个既可搜索又可浏览的平台。


美国 Data.gov


地址:

https://www.data.gov/



作为美国政府开放数据的主页,该网站允许访问联邦、州、地方和部落政府提供的各种主题信息。


英国 Data.gov


地址:

https://data.gov.uk/



与美国的 Data.gov 类似,该网站允许访问各种主题的数据。这些数据由中央政府、地方当局和公共机构提供。


Health Data


地址:

https://healthdata.gov/



该网站可搜索的主题包括医疗设备、环境卫生、药物滥用、精神健康等等。


The World Factbook


地址:

https://www.cia.gov/library/publications/the-world-factbook/



该数据集包含 267 个国家和地区的信息,这是一个数据宝库,每周更新一次有关全球的信息。


你可以选择要查看的国家,然后点击你喜欢的任何主题(如经济或交通)。该网站是可检索的。它还有一个关于世界领导人和一个关于 CIA Maps 的专栏。


Altmetric


地址:

https://www.altmetric.com/top100/2018/



Altmetric 有些数据是需要付费的,但它们还提供每年发布的最具热度的前 100 篇文章,这非常有用。


最新的是 2018 年的数据,可以往前搜索到 2013 年的数据。他们还提供一些免费工具。


Open Corporates


地址:

https://opencorporates.com/



Open Corporates 是全球最大的公司开放数据集,可让你访问超过 1 亿家公司的信息。


你可以按公司或高级职员进行搜索,并在需要的时候限制你的搜索范围。


National Center for Environmental Information


地址:

https://www.ncdc.noaa.gov/data-access



这个数据集涵盖地球物理学、大气和海洋数据。他们目前是世界上最大的气候和天气信息提供商。


他们还提供了旧工具的链接,这些工具目前可能在网站上不可使用,但可用于其他地方。


Reddit


地址:

https://www.reddit.com/r/datasets



虽然你需要注册,但它是免费的。你可以搜索数据集并查找提供信息和请求信息的人。


总的来说,Reddit 也是一个寻找信息并了解行业趋势的好地方。


Kaggle 数据集


地址:

https://www.kaggle.com/datasets



Kaggle 目前有将近 16,000 个数据集。你可以找到从运动队球员统计到洛杉矶停车引语任何范畴的数据。


NASA 的 Earth Data


地址:

https://earthdata.nasa.gov/?_fsi=BqJ6IiI5



地球观测系统数据和信息系统包含了美国宇航局的地球观测数据,其中包含如 NC 地表温度和碳通量等信息。


Pew Internet


地址:

https://www.pewinternet.org/datasets/?_fsi=BqJ6IiI5



如果你需要的是社会学数据,这是一个很好的数据源。


你还可以通过浏览找到一些有趣的文章。虽然需要注册才能查看和下载数据集,但它也是免费的。


Centers for Disease Control and Prevention


地址:

https://www.cdc.gov/datastatistics/index.html



该网站包括各种健康主题,可让你访问大量可浏览和可搜索的数据。甚至可以通过各种与主题相关的网站创建自己过滤的数据集。


Bureau of Labor Statistics


地址:

https://www.bls.gov/data/



你可以在这里找到有关美国劳动力市场活跃度、工作条件和价格变化的数据。


Five Thirty Eight


地址:

https://data.fivethirtyeight.com/



这个网站有关于政治、体育、科学、健康、经济和文化方面的数据。


Group Lens


地址:

https://grouplens.org/datasets/



Group Lens 上有几个可用的数据集,这些数据集对特定的项目很有用。一些数据集已有十多年的历史。你可以在这里得到很多关于书籍和电影的信息。


GitHub 上的 BuzzFeed News


地址:

https://www.searchenginejournal.com/twitter-is-still-verifying-users-despite-pausing-the-application-process/303589/



这个网站给你提供了来自 Buzzfeed 的数据。如果你想了解 2016 年至 2018 年期间的假新闻,那么这个就是你的最佳选择。


额外福利:免费图像


我想推荐一个很好的免费图像来源列表以及列表中的所有数据,绝对不容错过哦!


地址:

https://www.searchenginejournal.com/find-free-images-online/298887/



推荐阅读

(点击标题可跳转阅读)

想学数据可视化?这里有一门 4 小时的 Kaggle 微课程

数据科学家必知的 5 个深度学习框架

33 款可用来抓数据的开源爬虫软件工具



看完本文有收获?请转发分享给更多人

关注「数据分析与开发」加星标,提升数据技能

好文章,我在看❤️

登录查看更多
0

相关内容

数据集,又称为资料集、数据集合或资料集合,是一种由数据所组成的集合。
Data set(或dataset)是一个数据的集合,通常以表格形式出现。每一列代表一个特定变量。每一行都对应于某一成员的数据集的问题。它列出的价值观为每一个变量,如身高和体重的一个物体或价值的随机数。每个数值被称为数据资料。对应于行数,该数据集的数据可能包括一个或多个成员。
【2020新书】实战R语言4,323页pdf
专知会员服务
98+阅读 · 2020年7月1日
【硬核书】不完全信息决策理论,467页pdf
专知会员服务
336+阅读 · 2020年6月24日
干净的数据:数据清洗入门与实践,204页pdf
专知会员服务
160+阅读 · 2020年5月14日
【电子书】大数据挖掘,Mining of Massive Datasets,附513页PDF
专知会员服务
101+阅读 · 2020年3月22日
【资源】100+本免费数据科学书
专知会员服务
105+阅读 · 2020年3月17日
【2020新书】数据科学:十大Python项目,247页pdf
专知会员服务
211+阅读 · 2020年2月21日
最新版本开源情报工具和资源手册(一)
黑白之道
9+阅读 · 2019年6月23日
20个安全可靠的免费数据源,各领域数据任你挑
机器学习算法与Python学习
12+阅读 · 2019年5月9日
秘籍 | 机器学习数据集网址大全
AI100
6+阅读 · 2019年1月27日
资源 | 机器学习高质量数据集大合辑(附链接)
数据派THU
6+阅读 · 2018年11月25日
差分隐私保护:从入门到脱坑
FreeBuf
17+阅读 · 2018年9月10日
【资源】史上最全数据集汇总
七月在线实验室
18+阅读 · 2018年4月24日
资源|各领域公开数据集
七月在线实验室
5+阅读 · 2017年8月25日
Arxiv
34+阅读 · 2019年11月7日
Deep Learning for Deepfakes Creation and Detection
Arxiv
6+阅读 · 2019年9月25日
Few-shot Learning: A Survey
Arxiv
362+阅读 · 2019年4月10日
Deep Learning for Generic Object Detection: A Survey
Arxiv
13+阅读 · 2018年9月6日
Arxiv
6+阅读 · 2018年4月23日
VIP会员
相关VIP内容
【2020新书】实战R语言4,323页pdf
专知会员服务
98+阅读 · 2020年7月1日
【硬核书】不完全信息决策理论,467页pdf
专知会员服务
336+阅读 · 2020年6月24日
干净的数据:数据清洗入门与实践,204页pdf
专知会员服务
160+阅读 · 2020年5月14日
【电子书】大数据挖掘,Mining of Massive Datasets,附513页PDF
专知会员服务
101+阅读 · 2020年3月22日
【资源】100+本免费数据科学书
专知会员服务
105+阅读 · 2020年3月17日
【2020新书】数据科学:十大Python项目,247页pdf
专知会员服务
211+阅读 · 2020年2月21日
相关资讯
最新版本开源情报工具和资源手册(一)
黑白之道
9+阅读 · 2019年6月23日
20个安全可靠的免费数据源,各领域数据任你挑
机器学习算法与Python学习
12+阅读 · 2019年5月9日
秘籍 | 机器学习数据集网址大全
AI100
6+阅读 · 2019年1月27日
资源 | 机器学习高质量数据集大合辑(附链接)
数据派THU
6+阅读 · 2018年11月25日
差分隐私保护:从入门到脱坑
FreeBuf
17+阅读 · 2018年9月10日
【资源】史上最全数据集汇总
七月在线实验室
18+阅读 · 2018年4月24日
资源|各领域公开数据集
七月在线实验室
5+阅读 · 2017年8月25日
Top
微信扫码咨询专知VIP会员