2天时间,聊今年最热的 Agent、上下文工程、AI 产品创新等话题。2025 年最后一场~ 了解详情
写点什么

你的大数据项目使用的工具正确吗?

  • 2016-03-31
  • 本文字数:1185 字

    阅读完需:约 4 分钟

工具/产品/解决方案是数据科学家洞察数据的利器。 KDNuggets 网站对此观点进行了年度调查,来分析数据科学家在用哪些类型的工具,并提供了调查的匿名原始数据

通过主成分析(PCA)法进行降维分析

对所有的工具同时进行关系分析,常规来说,PCA 通过对大样本数据统计性质(eg, 协方差)的分析,试图用主要特征来解释关系。

分析结果:

当前分析的目标:通过一些主成分来分析 95 种工具之间的关系。最终决定以 PCA 的特征值来决定主成分的数目,这里选用了两种规则:一种是以特征值大于 1 的特征值数量来选择主成分数量;一种是画陡坡图(scree plot),通过 95 个特征值你会发现一个拐点的特征值。

特征点点陡坡图显示在第 13 和第 14 特征点时出现拐点,因此,这里选择的 13 个主成分来解释它们之间的关系,见下图。

(点击看大图)

工具分类

下面列出根据主成分析得出的 13 类工具(投票数大于 20):

  1. 大数据生态(Hadoop、Spark)和开源项目:Hadoop, HBase, Hive, Mahout, MLlib, Other Hadoop/HDFS-based tools, Pig, Scala, Spark, SQL on Hadoop tools
  2. 微软数据科学家工具:Microsoft Azure ML, Microsoft Power BI, Microsoft SQL Server, Revolution Analytics
  3. 基于 Python 的机器学习:Dataiku, H2O (0xdata), Python, scikit-learn, Theano, Vowpal Wabbit
  4. SAS 公司产品:JMP, SAS Base, SAS Enterprise Miner
  5. MATLAB、R 语言等统计工具:Gnu Octave, MATLAB, Orange, R, RapidMiner, Rattle, Weka
  6. IBM 公司产品:IBM Cognos, IBM SPSS Modeler, IBM SPSS Statistics, IBM Watson Analytics
  7. Linux 工具和 SQLang:Actian, C/C++, Perl, SQLang, Unix shell/awk/gawk
  8. 深度学习:Caffe, Pylearn2
  9. 商务智能软件:Pentaho and QlikView
  10. 数据分析平台:Datameer and Zementis
  11. Excel 和 Word 统计工具:XLSTAT for Excel
  12. 其它:Other Deep Learning tools, Other free analytics/data mining tools, Other Hadoop/HDF-based tools, Other paid analytics/data mining/data science software, Other programming languages
  13. 数据可视化:C4.5/C5.0/See5, Miner3D, Oracle Data Miner

总结

数据科学家在选择大数据、数据挖掘和数据分析工具时,更倾向于有一定生态基础的工具,这样各个工具间可以相互支持。

为了提高在大数据项目中成功的机会,选择正确的工具是非常重要的。没有一个孤立的工具能够做所有的数据分析,职业的数据专家趋向于使用不止一种相关的工具(分析中发现,数据专家平均使用 5 种数据分析工具)。你可以根据使用相关工具的数据专家来决定自己的选择。

另外一个观点是,要选择大厂的产品,比如,IBM、微软和 SAS,大品牌的产品更丰富,可以使得你的产品更容易扩展。


感谢杜小芳对本文的审校。

给InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ @丁晓昀),微信(微信号: InfoQChina )关注我们。

2016-03-31 19:002945
用户头像

发布了 43 篇内容, 共 31.2 次阅读, 收获喜欢 7 次。

关注

评论

发布
暂无评论
发现更多内容

征程 6EM 常见 QConfig 配置解读与示例

地平线开发者

自动驾驶 算法工具链 地平线征程6

基于 StarRocks + Iceberg,TRM Labs 构建 PB 级数据分析平台实践

StarRocks

postgres iceberg StarRocks TRM Labs 构建 BigQuery

鸿蒙仓颉语言开发教程:自定义弹窗

幽蓝计划

1688商品评论API接口攻略

tbapi

1688商品评论接口 1688评论API 1688评论数据采集

业务流程建模指南

俞凡

架构

别再堆MCP工具了!好用的AI Agent,始于一个“懂你”的System Prompt

RockBot

零代码抓取网页!产品经理3分钟学会MCP神器(附保姆教程)

阿星AI工作室

产品 AI 产品经理 大模型 MCP

Linux下版本控制器(SVN) -命令行客户端

刘大猫

人工智能 svn 算法 大模型 tortoiseSVN

战略实践:7 步改变未来

俞凡

战略

鸿蒙ArkTS | Badge 信息标记组件自学指南

李游Leo

鸿蒙 HarmonyOS

思维导图与头脑风暴 XMind Pro 永久许可证

Rose

免费好用的隐藏和显示菜单栏项:Ice for mac

Rose

达芬奇20新功能介绍 附DaVinci Resolve Studio中文安装教程

Rose

无损音乐播放器Audirvana for Mac中文版

Rose

跨平台的 AI 基准测试 Geekbench AI for mac

Rose

JetBrains IntelliJ IDEA 2025永久激活秘钥-mac/win

Rose

【HarmonyOS 5】鸿蒙中的UIAbility详解(一)

GeorgeGcs

Shiro简介及SpringBoot集成Shiro(狂神说视频简易版)

刘大猫

人工智能 算法 数据分析 权限控制 shiro

从源码角度分析Spring Boot中日志系统的配置

喝水不抬头

Spring Boot logback 自动配置 Configurator

基于YOLOv8的农业虫害检测102 类农业害虫识别项目|完整源码数据集+PyQt5界面+完整训练流程+开箱即用!

申公豹

yolov8

需求神器提示词

执于业务

Macs Fan Control Pro :控制风扇速度来保持 Mac 平稳运行

Rose

脚本是有“保质期”的,不可能用一辈子

程序员郭顺发

1688店铺订单接口指南攻略

tbapi

1688订单物流接口 1688店铺订单接口 1688店铺订单详情接口

【HarmonyOS 5】鸿蒙应用实现发票扫描、文档扫描输出PDF图片或者表格的功能

GeorgeGcs

鸿蒙 文档扫描 表格扫描

专业歌曲创作编辑和混音 Logic Pro X for mac中文直装版

Rose

高效拆分用户故事

俞凡

敏捷开发

详解鸿蒙开发如何上传三方库到ohpm仓库

幽蓝计划

华为云MaaS解锁DeepSeek-R1-0528超能推理开箱即用AI力!

YG科技

专业的视频后期制作:Final Cut Pro(fcpx)中文版安装包

Rose

Lightroom Classic 2025(LRC2025)中文安装包

Rose

你的大数据项目使用的工具正确吗?_语言 & 开发_侠天_InfoQ精选文章