【ArchSummit】如何通过AIOps推动可量化的业务价值增长和效率提升?>>> 了解详情
写点什么

语义搜索数据处理,统计重要,模型重要?

  • 2012-08-26
  • 本文字数:1558 字

    阅读完需:约 5 分钟

在 InfoQ 前不久主办的 ArchSummit 全球架构师峰会上,搜狗搜索事业部总经理茹立云做了关于“深层网络搜索核心技术研讨”的演讲,期望解决数据量百倍于表层网络的深层网络(暗网)搜索问题。而昨天,他的一篇旧微博在被多次转发后,又引发了大量讨论,大家就数据处理方式应该重统计还是重模型各抒己见。这条微博的内容是:

语义搜索时代的到来:谷歌推出知识图谱功能,百度结合框计算和百科数据挖掘也正在构建庞大的知识库,预计也会很快推出,而搜狗的本体库也在构建中。搜索将能直接给出解答而不是一段摘要,同时大规模知识库的构建和使用,让搜索行业的门槛越来越高。

搜狗的高级经理张阔指出:

记得我读博士的前两年研究方向就是语义网,但我在第三年转回了传统 ir,因为当时的主要矛盾还在传统的关键词匹配或基于统计的语义搜索上。很多年过去后,当传统 ir 越来越成熟、也逐渐出现瓶颈后,语义网已经可以作为一个不容忽视的补充了。

齐泉–自由的遛遛提到:

基于各种形态 / 各种表述能力的知识的提出,积累是支撑信息理解能力前进的基础。各个公司,各方的研究人员都在这个方向上前进。

中囯中文信息学会常务理事白硕指出:

半结构化的标注数据目前只能通过人肉获得。大公司也罢乌合之众也罢都只能如此。大公司的好处是执行力强,逮住一个标准就死命走下去。乌合之众想就标准达成一致,必须有个 linus 那样神一样的核心人物,否则一定会作鸟兽散。如果 NLP 能上个台阶,让这事儿可以用机器做,就好玩了。

WIKI 是给人看的,人能看懂就行,不需要对标准太在意。但是如果是给机器看的,就必须严格规定标准。但是标准背后是模型,是对知识表示的理解。模型是有高下之分的。

这个问题,不可能过于理想,也不能过于拘泥于现在看得到的资源动员能力。认准一个有价值的领域,认准一个能力有限但应用有效的模型,就可以干下去,更别说现在又有众包这样大规模动员人肉资源的能力了。

模型是有高下之分的。现在让统计来一统天下,简直是恶梦。

清华大学计算机系教授马少平认为:

MIT 的几位大佬认为统计是 AI 误入歧途,不过我并不赞同这个观点。统计至少是途径之一,而且现在看来是有效的。

而白硕的回复是:

我也不认为是误入歧途,而是在简单的问题空间停留时间太长了。统计之所以有效恰恰是因为问题空间简单。只要把目光转向复杂一点的问题空间,统计立马暴露出能力不足。

工具的背后一定有个知识表示的框架模型,这个模型的高下,决定未来的成败。模型之间可否互相转换,决定了未来有没有世界大同。

他又延伸道:

很多搞规则的人不懂得分层近似。萝卜快了不洗泥的一级近似也是大锤。大锤对样本的覆盖程度,有的也可以做到事后追究有概率垫底,但大锤本身未必一定包含概率统计内容。这是不同的两件事。事后用概率解释和当场算概率,是不同的。现在有点狭隘地带着前者的帽子强推后者。这不是必然的。

自然语言文本作为知识库,最要害的问题不在于知识的检索,而在于知识的应用。比如我忘了某个公式,检索它其实是想套用它;我忘了某部文学作品的作者是谁,检索它是为了能在自己的文章里正确地引用它。这些东西活了,网络才真正成为知识库。

IBM 中国研究院的专家潘越提出:

但另一方面规则和逻辑的方法没有大规模的成功。套用 @梁斌 penny 的围棋比喻,还是要看谁在占大场,然后才比局部。

梁斌是清华的博士,他这样阐述他的围棋比喻:

统计粗且糙,乃大锤。规则细而精,乃小锤。先大场后细棋。

机器学习方面的专家张栋提供了一篇参考文档:

“Semantic Search & Knowledge Graph” 是搜索引擎面临的挑战之一:Google 收购 Metaweb 公司,获得了其庞大的数据库,其汇集了各种各样的事物,属性,以及之间的关系等 … 一篇 Semantic Search 的 Survey 在 http://t.cn/zWmHzYy

目前,这篇微博已经有 397 次转发,55 次评论,如果希望了解最新讨论动态,读者不妨直接到相关页面查看。

公众号推荐:

跳进 AI 的奇妙世界,一起探索未来工作的新风貌!想要深入了解 AI 如何成为产业创新的新引擎?好奇哪些城市正成为 AI 人才的新磁场?《中国生成式 AI 开发者洞察 2024》由 InfoQ 研究中心精心打造,为你深度解锁生成式 AI 领域的最新开发者动态。无论你是资深研发者,还是对生成式 AI 充满好奇的新手,这份报告都是你不可错过的知识宝典。欢迎大家扫码关注「AI前线」公众号,回复「开发者洞察」领取。

2012-08-26 21:002196
用户头像

发布了 479 篇内容, 共 152.6 次阅读, 收获喜欢 47 次。

关注

评论

发布
暂无评论
发现更多内容

一图看懂软件缺陷检查涉及的内容

Tom(⊙o⊙)

软件安全 静态代码检查

『新华报』一分飞艇怎么操作的[手机乐乎]

天马行空

一分飞艇怎么操作的

『新华报』秒速飞艇开奖结果官网[手机乐乎]

天马行空

秒速飞艇开奖结果官网

『新华报』不建议强制上岸[手机乐乎]

天马行空

不建议强制上岸

Prometheus Exporter (十五)PostgreSQL Server Exporter

耳东@Erdong

Prometheus postgres 28天写作 exporter 12月日更

复制流动改变世界

mtfelix

28天写作

请清晰沟通选题-从策略层面定义技术演讲

将军-技术演讲力教练

『新华报』重庆试试彩官方平台[手机乐乎]

天马行空

重庆试试彩官方平台

Prometheus Exporter (十六)Microsoft SQL Server Exporter

耳东@Erdong

microsoft Prometheus 28天写作 exporter 12月日更

不懂这五项权力,做什么项目经理

Ian哥

项目管理 28天写作 五项权力

现实扭曲力场引论

Justin

群体心理学 28天写作 玄学

架构实战营 - 毕业总结

en

#架构实战营

举重若轻流水行云,前端纯CSS3实现质感非凡的图片Logo鼠标悬停(hover)光泽一闪而过的光影特效

刘悦的技术博客

CSS html css3 LOGO HTML5, CSS3

『新华报』飞艇开奖结果官网[手机乐乎]

天马行空

飞艇开奖结果官网

用错误的动作,让正确的事情发生(3/28)

赵新龙

28天写作

『新华报』北京飞艇赛车微信群[手机乐乎]

天马行空

北京飞艇赛车微信群

『新华报』赛车飞艇群[手机乐乎]

天马行空

赛车飞艇群

2.《重学JAVA》--初探JAVA

杨鹏Geek

「Java 25周年」 28天写作 12月日更

趣谈“链路追踪组件” Skywalking 和 PinPoint

悟空聊架构

链路追踪 Skywalking 28天写作 悟空聊架构 12月日更

新知识的地图绘制

Nydia

DDD领域驱动设计落地实践系列:工程结构分层

慕枫技术笔记

后端 架构师 签约计划第二季

在线蚂蚁文,菊花文生成工具

入门小站

工具

Java应用线上事故排查实战

JavaEdge

内容合集 签约计划第二季

聊聊 Kafka: Kafka 的基础架构

老周聊架构

签约计划第二季

『新华报』回血上岸导师[手机乐乎]

天马行空

回血上岸导师

『新华报』秒速飞艇开奖[手机乐乎]

天马行空

秒速飞艇开奖

《深入理解JVM虚拟机》第三章 垃圾收集器与内存分配策略

Joseph295

圣迪

架构实战营 - 毕业设计

en

#架构实战营

linux重要的目录之proc和dev目录

入门小站

Linux

『新华报』飞艇分析工具[手机乐乎]

天马行空

飞艇分析工具

语义搜索数据处理,统计重要,模型重要?_架构_郑柯_InfoQ精选文章