NVIDIA 初创加速计划,免费加速您的创业启动 了解详情
写点什么

乔丹 Reddit 访谈实录:统计学和机器学习不能分开

  • 2014-10-11
  • 本文字数:1707 字

    阅读完需:约 6 分钟

乔丹(Michael I. Jordan)教授是机器学习领域神经网络的大牛,他对深度学习、神经网络有着很浓厚的兴趣。如今,在工业界解决不确定性问题的时候需要更加有效的结果和更多理论依据的结果,这两者之间总是会有分歧,这使得机器学习领域和统计学的工作的背景很相似,乔丹教授对两个领域未来的发展方向有很多看法。

首先乔丹提到,他个人并没有把统计学和机器学习区分开。他认为把理论和实际明确分开是没有很大用处的,它们的相互作用已经被证明了是很有用的,当越来越复杂的系统诞生时,它们也会互相促进并且提升。

设想一下建一座桥的工程,这是从物理界到人文界工程师都需要一起参与的工程链,建筑师需要设计桥梁,土木工程师需要保证桥梁不会在某些极端条件下塌陷等等。在这条链中几乎没有人不知道把“理论概念”和“工程实际”结合起来,这一点已经在几十年里都被证明过了。

类似的,Maxwell 方程为电子学提供了理论依据,但是感应匹配之类的想法也是在工程上开始建造电路和和流水线之后才进入人们的视线的,这些想法都是结合了理论和实际的。

我们有一个类似的挑战——我们应该怎样把核心推理出想法转化成系统工程,使之能够在我们所要求的条件下工作,例如时间效率、花费等等。这样才能够反映出我们的设想是否能够应用于这个领域,让我们更加好的做出决定和改动,并且做到与人类更好的交互。实际上,出于对桥梁建造者、火箭制造者等人的尊重,乔丹认为目前人类社会面临着更加复杂的领域。

乔丹教授所做的领域很多,他把这些统称叫做数据科学。实际上,我们所知道的大部分在统计学或者机器学习领域的人基本上都把他们自己理解成了这个综合领域的人。这些人不会说:“我对于数据集合的随机化,或者怎样归并数据,或者预测的不确定性、评估模型、可视化等等不感兴趣”。尽管他们仅仅在这个综合问题的子集上工作,但是他们对整个综合问题都是很清楚的。不同圈子里的人通常有着自己不同的应用领域,因此使得他们目前的工作看起来截然不同,但是这里并没有基础知识上的区别,很多看上去的分歧其实是历史的玩笑。

乔丹重点谈到了一位提问者所说的“仅在机器学习领域通用的算法”的问题。他不太清楚这个是指什么,从八九十年代来看,已经不知道有多少次在机器学习领域里研究的人意识到他们的想法已经在其他领域出现过了,比如:统计学、决策树、最近邻居、逻辑回归、PCA、典型相关、图模型、K-means 和还有判别分析。当然,统计学群体至今也没有一个很好的定义,像卡尔曼滤波、HMMs 还有因子分析之类的想法都来源于统计学群体之外,正是因为它们都是关于推断所以才被吸收进统计学。类似的,多层神经网络可以被看成是非参数的函数估计因子或者目标,从而能够从统计学中分析。

某种程度上,统计学是指一种分析形式,一个统计学家会很高兴地分析一个系统的表现。比如,一个逻辑系统,如果输入的数据是随机的,那么输出的数据也会被考虑成不确定的。一个统计方法中没有任何侥幸概率的成分。

当 Leo Breiman 发明了随机森林,他变成了一个统计学家或者机器学习家吗?当乔丹和他的同事发明了 LDA 模型,他们变成了统计学家或者机器学习家吗?难道因为 SVM 是一种机器学习的算法,逻辑回归是一种统计算法,它们就完全不同了吗?它们是以同样的效率解决了相同的优化问题,区别仅仅是在一点点缺失函数的形式上,为什么很多人总是认为这些是非常重要的区分呢?

乔丹教授说道,机器学习群体并没有发展很多新的推论原理,或者很多新的优化原理。但是这个群体正在创造性地从其他领域吸收已经存在了的想法,并且把它们混合并加以改造,以使得解决这个领域的难题。

但是,也绝对不能将机器学习应用和统计学优化理论混淆起来。统计学群体往往非常收到欢迎,这仅仅是历史原因,因为他们的工作往往集中在科学、医学和政策方面而不是工程。机器学习社区的出现极大地有助于放大应用统计推断的范围,它已经开始打破工程思维的一些障碍,例如,计算机系统思维和推理思维。当然,它也遇到了新的理论问题。


感谢郭蕾对本文的审校。

给InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ )或者腾讯微博( @InfoQ )关注我们,并与我们的编辑和其他读者朋友交流。

公众号推荐:

跳进 AI 的奇妙世界,一起探索未来工作的新风貌!想要深入了解 AI 如何成为产业创新的新引擎?好奇哪些城市正成为 AI 人才的新磁场?《中国生成式 AI 开发者洞察 2024》由 InfoQ 研究中心精心打造,为你深度解锁生成式 AI 领域的最新开发者动态。无论你是资深研发者,还是对生成式 AI 充满好奇的新手,这份报告都是你不可错过的知识宝典。欢迎大家扫码关注「AI前线」公众号,回复「开发者洞察」领取。

2014-10-11 09:552025
用户头像

发布了 268 篇内容, 共 118.2 次阅读, 收获喜欢 24 次。

关注

评论

发布
暂无评论
发现更多内容

从ChatGPT到AIGC,是一次技术革命也是一次创业浪潮 | 社区征文

打工人!

人工智能 AIGC AI绘画 ChatGPT New Bing

Databend v1.0 Release 正式发布

Databend

浅谈对JavaScript 中的执行上下文和执行栈的理解

梁木由

架构误区系列14:纯代码视角的复用

agnostic

复用

DawnSql在数据治理中的优势

陈飞

微服务架构 分布式数据库 架构设计 数据治理 分布式缓存

构建微服务的基建——事件总线

为自己带盐

RabbitMQ CAP 事件总线

一文盘点即将上线的Nautilus Chain六大优势

股市老人

Nautilus Chain即将上线,一文盘点其六大优势

威廉META

Matlab实现彩色图像的转换 平滑 锐化与分割

timerring

数字图像处理

软件测试 | 结合Allure生成测试报告

测吧(北京)科技有限公司

测试

大专毕业,0基础转行C++程序员一个月后,我后悔了

程序员晚枫

程序员 转行 C++ STL

软件测试 | Pytest测试框架之fixture进阶

测吧(北京)科技有限公司

测试

架构误区系列15:生造的业务概念

agnostic

服务设计

什么是数字产品?

涛哥 数字产品和业务架构

数字化转型 数字产品

mysql锁及数据一致性总结

阿呆

MySQL innodb 数据一致性 事务/行级锁 脏读

新增 – 使用基于用户的许可证模式在 Amazon EC2 上运行 Visual Studio 软件

亚马逊云科技 (Amazon Web Services)

What's new in dubbo-go-pixiu v0.6.0

apache/dubbo-go

dubbo dubbo-go dubbogo

架构实战营 - 模块四作业

🐢先生

架构实战营

Camtasia2023最新版下载使用教程

茶色酒

Camtasia2023

在文心一言出生地,百度悄悄燃烧AI小宇宙

脑极体

百度 文心一言

Nautilus Chain即将上线,一文盘点其六大优势

西柚子

Adapter基础讲解

智趣匠

mvc Adapter arrayadapter

【git】将本地代码推送到远程git仓库

石臻臻的杂货铺

git

数据库“啃”不动?CnosDB带你轻松阅读十万行源码!

CnosDB

IoT 时序数据库 开源社区 CnosDB

写给 go 开发者的 gRPC 教程 - 错误处理

凉凉的知识库

Go 微服务 gRPC RPC RPC框架

一座海上营业厅,一个女孩独自守望的十九年

脑极体

5G 智慧农业

FL Studio21.0.0水果中文版发布更新下载

茶色酒

FL Studio21.0.0

Nautilus Chain即将上线,一文盘点其六大优势

鳄鱼视界

一文盘点即将上线的Nautilus Chain六大优势

EOSdreamer111

软件测试 | Pytest测试框架之插件开发

测吧(北京)科技有限公司

测试

为什么 MyBatis 源码中,没有我那种 if···else

程序知音

乔丹Reddit访谈实录:统计学和机器学习不能分开_语言 & 开发_张天雷_InfoQ精选文章