写点什么

ArchSummit 讲师专访:百度主任架构师廖若雪谈搜索新时代

  • 2012 年 7 月 06 日
  • 本文字数:1655 字

    阅读完需:约 5 分钟

编者按:由 InfoQ 中文站主办的首届 International ArchSummit 架构师峰会即将召开。我们也对一些专题的讲师进行了采访,谈谈他们要讲的议题。

廖若雪,百度主任架构师,现在主要负责推荐。在百度之前做了很长时间跟搜索架构、图形分析相关工作。

InfoQ:您在百度内负责了哪些与搜索相关的技术和架构?

廖若雪:我最早进百度就是开始做检索架构,后来就逐渐扩展到跟 ranking 相关的,比如说排序、相关性,逐渐扩展到用户行为分析,后来又做了一段下一代搜索架构相关工作。

InfoQ:您认为搜索目前面临哪些问题?有哪些地方可以改进?

廖若雪:现在搜索引擎本身是从满足用户需求角度出发的,然后扩展到一些新问题,包括时效性、权威性、相关性,以及这两年新出来的一些东西,比如我们推出一些满足用户真正潜在需求的功能。尽管有绝大部分用户需求我们已经满足的不错了。但是还有相当一部分用户需求我们满足得不好,我们可以看到很多。举个例子,用户,尤其中国用户的自然语言表达成分越来越多,这对于搜索是巨大的挑战。在很多国家,或者一些高端用户,他们在查询的时候,他会写一些独立的、用空格隔开的词。在中国,很多用户一上来就直接输入问题。比如可能有人输入:一篇描写春天的作文,五百字左右,然后空格,快一点。这是一个很有意思的概念,用户使用搜索引擎,是把你当成一个万事通。如何去满足这样的需求呢,我们用了很多方法。从语义角度,从用户行为分析的角度,去解决这样的问题。我们解决了一部分,但还有很大一部分问题没有解决,这是一个方面。

第二个比较大的挑战:很多时候,现在用户在使用搜索引擎时,他的需求是隐藏的,我们称之为潜在需求,流行一点,就是个性化需求。这种潜在需求是和他的个性化有关的。举个最简单的例子,用户搜索天气,这个个性化产生在什么地方呢?在于他的位置,在北京,北京的天气,在深圳,深圳的天气。这是跟地理相关的。比如说他搜苹果,对于很多人来说,可能是吃的苹果;最近新闻上面也有一些跟跟吃的苹果相关的新闻。还有很多人是对于苹果电脑、苹果公司和 WWDC 大会的新闻。这就需要我们把这个人搜索时的上下文,对他所处的环境,融入搜索结果中。

InfoQ:这次“搜索新时代”专题中目前有这几个演讲:百度陈竞凯的“网页搜索新技术探讨”、搜狗茹立云的“深层网络搜索核心技术探讨”、一淘网曲琳的“购物搜索引擎架构的变与不变”。对于这几个演讲,您有什么期望?

廖若雪:这些议题都是我们现在搜索中随时面临的一些主要问题。实际上百度对这些问题或多或少有自己的研究,或者很多自己的方法,也希望看到很多同行有没有新的方案,新的思路,或者说比我们做得更好的,我们可以借荐的地方。

InfoQ:除 Google、Bing 之外,国外还有一些其他搜索引擎,比如像 DuckDuckgo、WolframAlpha 等等,但是他们并不像 Google 和 Bing 这么成功,您觉得原因何在?

廖若雪:这些搜索引擎是在某一方面产生了突破,比如说在处理自然语言方面,或者说处理一些更复杂的结构化数据上面,会更加得力。但是我们知道:搜索引擎,现在已经不是一个小众的、或者能满足用户一部分就能做起来的产品。首先要满足用户大量的需求,如果对于比较通用的需求满足不好,只在某一方面有突破,其实没有办法作为用户日常使用的搜索引擎存在。

InfoQ:请您对参加“搜索新时代”和 ArchSummit 架构师峰会的参会者说几句话。

廖若雪:希望这个架构峰会办好,真正能使得做架构的同仁们在里面学到知识,真正解决问题,让大家一起讨论得比较开心,能够交到真正的朋友。

相关信息


给 InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ )或者腾讯微博( @InfoQ )关注我们,并与我们的编辑和其他读者朋友交流。

2012 年 7 月 06 日 00:401783
用户头像

发布了 479 篇内容, 共 136.9 次阅读, 收获喜欢 39 次。

关注

评论

发布
暂无评论
发现更多内容

机会,是不会让你准备好的

Winann

学习 生活 知识管理 机会

11 万字的字节码编程系列合集放送(ASM、Javassist、Byte-buddy、Javaagent)

小傅哥

Java asm bytebuddy 《字节码编程》

键入网址后,其间发生了什么?

小林coding

TCP 计算机网络 网络协议 IP HTTP

笔记:《如何系统思考》之如何应用系统思考

wiflish

思维方式

Collaboration on SaaS

zhenglei

SaaS Collaboration Cisco Webex

Java如何处理异常情况

Rayjun

Java 异常

发布Maven包的正确姿势

廖雪峰

maven 开源

《零基础学 Java》 FAQ 之 8-Java方法调用是传值还是传引用

臧萌

Java

如何用一套引擎搞定机器学习全流程?

Apache Flink

大数据 flink 流计算 实时计算

Design Sprint 教你五天完成产品迭代

Yanel 说敏捷产品

产品 敏捷 设计 产品设计 团队

EasyExcel最权威教程

知春秋

Java Excel EasyExcel

Kotlin协程实践之进程、线程、协程

陈吉米

Java kotlin 协程 Coroutine

JAVA内存模型与线程

颇风

Java 内存模型 JVM

回“疫”录(19):都什么时候了,还在搞“填表抗疫”

小天同学

疫情 回忆录 现实纪录 纪实 形式主义

【高级进阶】写给大忙人看的JDK14新特性

知春秋

Java java 14 java 14 新特性

都前后端分离了,咱就别做页面跳转了!统统 JSON 交互

江南一点雨

spring Spring Boot spring security

有问必答(2020-05-09):如何督促自己做好一件事情?

冯夷

生活

从零到部署:用 Vue 和 Express 实现迷你全栈电商应用(一)

图雀社区

node.js vue.js Vue

走进Golang之编译器原理

何磊

编译原理 Go 语言

从连续两届图灵奖(2018-2019)看GPU发展史

GPU

人工智能 gpu 计算机基础 计算机图形学 计算机体系结构

Docker 镜像制作教程:针对不同语言的精简策略

米开朗基杨

Docker Dockerfile

游戏夜读 | Scikit-learn迎来0.21版本

game1night

写作对我的意义

Neco.W

总结 思考 写作 感悟

如何搞定Kafka重复消费?

奈学教育

kafka kafka配置

比AtomicLong更优秀的LongAdder确定不来了解一下吗?

一枝花算不算浪漫

并发编程 jdk源码

微服务为什么要有服务发现与注册?

攀鱼飞岩

微服务

少说废话,先干起来

大辉辉

学习 个人成长 自律

DevOps生命周期,你想知道的全都在这里了!

禅道项目管理

DevOps 测试 持续集成

一种练好英语口语的方法

董一凡

学习

2020年比以往任何时候更想做成的使命感

乐少

2020第一篇技术博客

java劝退师首席大弟子

生活

ArchSummit讲师专访:百度主任架构师廖若雪谈搜索新时代_百度_郑柯_InfoQ精选文章