限时领|《AI 百问百答》专栏课+实体书(包邮)! 了解详情
写点什么

阿里妈妈开源曲率空间学习框架、联邦学习解决方案,大幅提升数据的保护和使用效率

  • 2021-09-15
  • 本文字数:2117 字

    阅读完需:约 7 分钟

阿里妈妈开源曲率空间学习框架、联邦学习解决方案,大幅提升数据的保护和使用效率

9 月 15 日,阿里妈妈宣布同时开源两项 AI 技术:曲率空间学习框架和联邦学习解决方案。


这两项最新技术成果的开源,将助力业界提高数据隐私保护能力,预计可降低 80%的存储消耗量和提升 15%的用户请求匹配精准度,上述技术也可应用于互联网行业之外的各个科研计算领域。

 

据了解,曲率空间学习框架(Curvature Learning Framework,简称 CLF)是中国首个经过工业级场景验证的曲率空间深度学习框架;联邦学习解决方案(Elastic Federated Learning Solution,简称 EFLS),是百亿级工业场景跨企业合作的联邦学习解决方案。

 

用户即日起可在全球最大开源网站 GitHub 搜索“Curvature-Learning-Framework”,9 月 30 日以后搜索“Elastic-Federated-Learning-Solution”,查看两个项目的开源文件。

 

“AI 技术是新一代生产力。在基于庞大的工业级场景应用成熟后,我们选择向社会开放这些技术能力,以最大化共享 AI 技术红利,共同进步。”阿里妈妈 CTO 郑波表示。



曲率空间学习框架开源:AI 换轨,坐上曲率飞船

 

曲率是一个衡量空间弯曲程度的量,曲率越接近零,空间越平坦。在科幻小说《三体》中,人类正是利用空间曲率的变化建造出曲率飞船。

 

AI 所需的海量数据与计算往往基于曲率为零的欧氏空间,这潜在制约了表达能力。阿里妈妈技术团队发现,曲率空间能更精准的建模图数据结构,此次开源的曲率空间学习框架,包含流形、算子、模型及黎曼优化器整套深度学习流程,用户可便捷的将模型迁移到曲率空间中,从而给 AI 的发展打开一条新通路。

 

想象一下,使用曲率空间建模就像“吹起一个气球”。假设一个干瘪的气球表面上有十亿个节点,这会是非常致密的状态。随着气球逐渐充气变大,气球表面越来越“弯曲”,节点之间就分的越开,构成的形状也越立体,我们就能越好的观察这些节点并进行区分。

 

曲率空间正如一个膨胀的气球表面,相对于同样大小的欧氏空间,它能容纳的数据更多,而且对树、环等几何特性展现的更全面精准。基于图数据 Cora 的实验证明,替换欧氏空间为曲率空间,模型能提升约 8%的预测精度。

 

阿里妈妈技术人士表示,该技术已经在阿里妈妈业务中展现出很高的应用潜力。基于淘宝搜索广告场景,曲率空间能精准建模十亿级商家与用户的交互行为,利用空间曲率变化实现数据的“定向放大”与“精准分割”。系统全量上线后,存储消耗量降低 80%,用户侧请求匹配精准度相对提升 15%。

 

该技术有望广泛应用到其他行业,引领新一轮的 AI 落地浪潮。业内专家表示,曲率空间可以建模地球表面的云层运动轨迹,航空航海路线等,也能表征物流运输图、资源流动图等。从更及时的天气预报、更精准的地图导航,到更高效的物流运输、更公平的社会资源分配,此项新技术能切实改善人们的生活。

 

联邦学习解决方案开源:兼收并蓄,开放共建

 

联邦学习是 2016 年由谷歌提出,在保护终端隐私的前提下进行机器学习,帮助广告主实现跨公司多端投放的解决方案。通俗一点讲,联邦学习就像几位老师傅共同训练一个徒弟,老师傅们各有所长,却互相防备不能共享,而徒弟则兼收并蓄,融会贯通,集合各家所长,终学有所成。

 

据了解,阿里妈妈此次开源的联邦学习解决方案,更加关注隐私保护和加密计算,并在此基础上建立 APP 孤岛的信息链接,构建机器学习模型,在高并发、加密性、易用性和产品化等方面提供更好支持,方便多方在超大规模稀疏场景下进行联邦学习的合作与实践。

 

具体而言,联邦学习解决方案具备以下特点:


  • 大规模高可用:


云原生实现方案支持百亿规模数据求交;多种验证方式保证最终结果的完整性和正确性;精简的训练交互协议与高效的底层实现,保证分布式训练的高吞吐;精细的状态恢复与模型校验,确保分布式容灾的正确性。 


  • 加密保护隐私:


通过数据安全与计算安全两种手段以保障用户隐私,支持多种隐私保护方案以提供安全和性能的最佳平衡。


  • 更强大更便捷:


首次开源了基于水平聚合、层次聚合的两种模型,并通过可视化 web 界面方便任务流程的开发、配对、调度和管理,极大地提升迭代效率。

 

依托于联邦学习解决方案,阿里妈妈 Unidesk 产品已助力珀莱雅、卡姿兰、薇诺娜、花西子、修正等多个企业实现品牌和业务双丰收。据了解,花西子采用 Unidesk 产品以后,经营效果提升明显,短短 2 个月时间,品牌 ROI 提升 15%,且放量也在逐步提高。

 

未来,该技术可以扩展到金融、医疗共建等场景,普适性较高。

 

将开源进行到底

 

此次开源,延续了阿里妈妈“将开源进行到底”的一贯做法。从 2015 年开始,阿里妈妈技术团队将大规模深度学习、图学习、强化学习等多项 AI 技术深度应用到业务,引领了 AI 在互联网广告领域的探索和大规模应用,并沉淀出多个业内领先的 AI 工程系统。

 


2018 年 11 月,阿里妈妈对外开源了业界首个面向高维稀疏场景的大规模工业级训练引擎 XDL,并同时开源包含深度兴趣网络(DIN)、深度兴趣进化网络(DIEN)、深度树匹配(TDM)在内的多个工业级创新算法。在 GitHub 上,XDL 项目开源一个月内所获星赞数超过 1000 个,到现在已有 4000 多星赞,近 1000 次复制使用。

 

2019 年 1 月,阿里妈妈的大规模图深度学习框架 Euler 正式对外开源,在工业界引起巨大反响的同时,也引起学术界关注。2021 年 4 月,Euler2.0 发布,通用性和灵活性得到进一步提升。在 GitHub 网站上,Euler 项目现在已经有超过 2500 个星赞和 500 次复制使用。

 

2021-09-15 16:413171
用户头像
刘燕 InfoQ高级技术编辑

发布了 1112 篇内容, 共 572.4 次阅读, 收获喜欢 1980 次。

关注

评论

发布
暂无评论
发现更多内容

企业数字化转型该如何做?三个融合、三个转换

小炮

低代码分析盘点:银行业低代码应用需要规避两大误区

易观分析

代码 银行

SphereEx 正式开源面向 Database Mesh 的解决方案 Pisanix

SphereEx

开源 SphereEx 云上数据库 Database Mesh Pisanix

八连冠!浪潮云连续8年蝉联中国政务云市场第一位

云计算

跨平台多媒体渲染引擎OPR简介

阿里巴巴文娱技术

音视频 弹幕 渲染

技术干货 | Linkis实践:新引擎实现流程解析

康月牙

Apache 开源社区 WeDataSphere Linkis 使用实践

基于模板配置的数据可视化平台

百度Geek说

后端适用,Apifox接口文档设计和调试教程【工具篇】

Liam

Java 后端 Postman 后端开发 API文档

defi存币生息理财dapp系统开发逻辑

开发微hkkf5566

数据安全刻不容缓,国产智能化厂商首获SOC 2鉴证报告有何意义?

王吉伟频道

RPA 数据安全 机器人流程自动化 智能自动化 SOC 2

资深OpenStacker - 彭博、Vexxhost升级为OpenInfra基金会黄金成员

极客天地

从 0 到 1,探究百亿流量验证下的 MVVM 框架设计

图灵教育

百度 MVVM 全栈设计

中原银行统一日志平台

中原银行

海量数据 中原银行 日志平台

工资管理系统该如何使用?

低代码小观

企业管理 工资 管理系统

秒云云原生信创全兼容解决方案,推动信创产业加速落地

MIAOYUN

云原生 信创 信创云

小程序启动性能优化实践

百度Geek说

5年“研究”3年“实战” 之后的满分答卷

青藤云安全

网络安全 容器安全 安全服务 云原生安全

快来极狐GitLab SaaS 学习全球顶级的开源项目吧

极狐GitLab

开源

直播预告 | 社交新纪元,共探元宇宙社交新体验

ZEGO即构

技术干货 | Linkis1.0.2安装及使用指南

康月牙

开源社区 微众银行 WeDataSphere Linkis 使用实践

InfoQ 极客传媒 15 周年庆征文|在Flutter中自定义应用程序内键盘

坚果

InfoQ极客传媒15周年庆

大数据生态安全框架的实现原理与最佳实践(上篇)

明哥的IT随笔

大数据 hadoop hive 数据安全

细说腾讯如何做到直播延时降低90%以上方案

C++后台开发

WebRTC CDN 音视频开发 视频直播 直播低延迟

InfoQ 极客传媒 15 周年庆征文|手把手教你使用Python实现一键抠图,照片换背景|so easy!

迷彩

Python AI 前端 6月月更 InfoQ极客传媒15周年庆

大数据培训Flink高频面试题

@零度

flink 大数据开发

flutter系列之:Material主题的基础-MaterialApp

程序那些事

flutter 程序那些事 6月月更 widget

数据产品学习-实时计算平台

第519区

实时计算 数据产品 数据开发 大数据平台

618 大促来袭,浅谈如何做好大促备战

阿里巴巴云原生

阿里云 微服务 高可用 云原生

CREMB Pro 后台子管理员 403 问题分析

CRMEB

音频 3A 处理实践,让你的应用更「动听」

融云 RongCloud

ARM64 上的性能怪兽:API 网关 Apache APISIX 在 AWS Graviton3 上的安装和性能测试

API7.ai 技术团队

AWS 网关 arm APISIX

阿里妈妈开源曲率空间学习框架、联邦学习解决方案,大幅提升数据的保护和使用效率_AI&大模型_阿里妈妈技术团队_InfoQ精选文章