最新发布《数智时代的AI人才粮仓模型解读白皮书(2024版)》,立即领取! 了解详情
写点什么

ArchSummit 讲师专访:百度主任架构师廖若雪谈搜索新时代

  • 2012-07-06
  • 本文字数:1655 字

    阅读完需:约 5 分钟

编者按:由 InfoQ 中文站主办的首届 International ArchSummit 架构师峰会即将召开。我们也对一些专题的讲师进行了采访,谈谈他们要讲的议题。

廖若雪,百度主任架构师,现在主要负责推荐。在百度之前做了很长时间跟搜索架构、图形分析相关工作。

InfoQ:您在百度内负责了哪些与搜索相关的技术和架构?

廖若雪:我最早进百度就是开始做检索架构,后来就逐渐扩展到跟 ranking 相关的,比如说排序、相关性,逐渐扩展到用户行为分析,后来又做了一段下一代搜索架构相关工作。

InfoQ:您认为搜索目前面临哪些问题?有哪些地方可以改进?

廖若雪:现在搜索引擎本身是从满足用户需求角度出发的,然后扩展到一些新问题,包括时效性、权威性、相关性,以及这两年新出来的一些东西,比如我们推出一些满足用户真正潜在需求的功能。尽管有绝大部分用户需求我们已经满足的不错了。但是还有相当一部分用户需求我们满足得不好,我们可以看到很多。举个例子,用户,尤其中国用户的自然语言表达成分越来越多,这对于搜索是巨大的挑战。在很多国家,或者一些高端用户,他们在查询的时候,他会写一些独立的、用空格隔开的词。在中国,很多用户一上来就直接输入问题。比如可能有人输入:一篇描写春天的作文,五百字左右,然后空格,快一点。这是一个很有意思的概念,用户使用搜索引擎,是把你当成一个万事通。如何去满足这样的需求呢,我们用了很多方法。从语义角度,从用户行为分析的角度,去解决这样的问题。我们解决了一部分,但还有很大一部分问题没有解决,这是一个方面。

第二个比较大的挑战:很多时候,现在用户在使用搜索引擎时,他的需求是隐藏的,我们称之为潜在需求,流行一点,就是个性化需求。这种潜在需求是和他的个性化有关的。举个最简单的例子,用户搜索天气,这个个性化产生在什么地方呢?在于他的位置,在北京,北京的天气,在深圳,深圳的天气。这是跟地理相关的。比如说他搜苹果,对于很多人来说,可能是吃的苹果;最近新闻上面也有一些跟跟吃的苹果相关的新闻。还有很多人是对于苹果电脑、苹果公司和 WWDC 大会的新闻。这就需要我们把这个人搜索时的上下文,对他所处的环境,融入搜索结果中。

InfoQ:这次“搜索新时代”专题中目前有这几个演讲:百度陈竞凯的“网页搜索新技术探讨”、搜狗茹立云的“深层网络搜索核心技术探讨”、一淘网曲琳的“购物搜索引擎架构的变与不变”。对于这几个演讲,您有什么期望?

廖若雪:这些议题都是我们现在搜索中随时面临的一些主要问题。实际上百度对这些问题或多或少有自己的研究,或者很多自己的方法,也希望看到很多同行有没有新的方案,新的思路,或者说比我们做得更好的,我们可以借荐的地方。

InfoQ:除 Google、Bing 之外,国外还有一些其他搜索引擎,比如像 DuckDuckgo、WolframAlpha 等等,但是他们并不像 Google 和 Bing 这么成功,您觉得原因何在?

廖若雪:这些搜索引擎是在某一方面产生了突破,比如说在处理自然语言方面,或者说处理一些更复杂的结构化数据上面,会更加得力。但是我们知道:搜索引擎,现在已经不是一个小众的、或者能满足用户一部分就能做起来的产品。首先要满足用户大量的需求,如果对于比较通用的需求满足不好,只在某一方面有突破,其实没有办法作为用户日常使用的搜索引擎存在。

InfoQ:请您对参加“搜索新时代”和 ArchSummit 架构师峰会的参会者说几句话。

廖若雪:希望这个架构峰会办好,真正能使得做架构的同仁们在里面学到知识,真正解决问题,让大家一起讨论得比较开心,能够交到真正的朋友。

相关信息


给 InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ )或者腾讯微博( @InfoQ )关注我们,并与我们的编辑和其他读者朋友交流。

2012-07-06 00:402025
用户头像

发布了 479 篇内容, 共 152.4 次阅读, 收获喜欢 47 次。

关注

评论

发布
暂无评论
发现更多内容

中企出海要做什么?

用友BIP

中企出海

汇聚各界力量 推动智能出行领域深度发展|2023开放原子全球开源峰会CARSMOS开源智能出行生态年会圆满举行

开放原子开源基金会

开源 开放原子全球开源峰会 开放原子 CARSMOS

以指标驱动,企业数智化迈向新阶段

Kyligence

数字化转型 指标驱动

重磅活动 | 腾讯云智能推出首期《人工智能集训营》

牵着蜗牛去散步

人工智能 腾讯云 腾讯 教育 AI集训营

如何在 Linux 上使用 `find` 和 `locate` 进行文件搜索?

wljslmz

6 月 优质更文活动

原点安全入选“数据安全推进计划 ”成员单位

原点安全

安全可信 | 首批!天翼云边缘安全加速平台AccessOne通过信通院“软件自研创新能力”专项评估

天翼云开发者社区

云计算 云服务

浅谈HPC中的Lustre

天翼云开发者社区

Linux 架构 存储

业务在线,从数智平台连接开始!

用友BIP

数智底座 Pass平台

逾百位开发者到场,超 2 万人线上观看!龙蜥社区开发者服务 devFree MeetUp 精彩回顾来啦

OpenAnolis小助手

开源 Meetup 龙蜥社区 龙蜥大讲堂 开发者服务

如何有效管理爬虫流量?

天翼云开发者社区

网络安全 爬虫

全球企业KVM贡献榜公布,腾讯云再添1项核心突破

说山水

DevChat 上线 VSCode 插件!国内免费用 ChatGPT(GPT-4)编程,做不被 AI 取代的新程序员!

思码逸研发效能

程序员 AI 研发效能 ChatGPT DevChat

理论+实践:从原型链到继承模式,掌握 Object 的精髓(一)

控心つcrazy

模糊测试不“模糊”,高效发掘未知漏洞与 0day 攻击

极狐GitLab

DevOps 安全 DevSecOps 黑盒测试 模糊测试

华秋亮相汽车电子研讨会,展出智能座舱方案、高可靠PCB板

华秋电子

PDCA循环——快速提升软件质量的必备工具

敏捷开发

Scrum 敏捷开发 精益管理 PDCA循环

HMI和SCADA的定义 两者有什么不同

2D3D前端可视化开发

组态软件 工业自动化 SCADA 工业组态 HMI

SMT和DIP生产过程中的虚焊原因

华秋电子

一文读懂火山引擎A/B测试的实验类型(1)——编程实验

字节跳动数据平台

A/B 测试

走难而正确的路!AI时代,传统产业数字化建设必须更高、更快、更强

爱倒腾的程序员

涛思数据 时序数据库 ​TDengine

一文带你读懂稳压器(内含厂商 3PEAK 新品推荐!)

华秋电子

软件测试/测试开发丨Pytest结合数据驱动-yaml

测试人

程序员 软件测试 yaml 数据驱动 pytest

视频编码耗时长、编码帧发送失败…DVPP视频编码问题典型案例分析

华为云开发者联盟

人工智能 华为云 华为云开发者联盟 企业号 6 月 PK 榜

为什么连接集成在企业的数智平台里是“刚需”?

用友BIP

数智底座 Pass平台

可观测性最佳实践|怎样让运维和开发协同保障系统稳定性

观测云

可观测性 观测云 云原生可观测 可观测性用观测云

2023年三个最佳的免费PostgreSQL GUI工具

wljslmz

6 月 优质更文活动

TS中, Array.reduce提示没有与此调用匹配的重载?

林十二XII

ArchSummit讲师专访:百度主任架构师廖若雪谈搜索新时代_百度_郑柯_InfoQ精选文章