写点什么

小红书 FinOps 实践:云成本优化与资源效率提升之道 |QCon 北京

  • 2025-03-31
    北京
  • 本文字数:1426 字

    阅读完需:约 5 分钟

大小:764.90K时长:04:21
小红书 FinOps 实践:云成本优化与资源效率提升之道 |QCon北京

2025 年 4 月 10 - 12 日,QCon 全球软件开发大会将汇聚全球 140+ 技术先行者及创新实践者,直击行业痛点,解锁可复制的经验与模式。这不仅是一场会议,更是一次对技术演进的集体探索。无论你是资深开发者,还是技术管理者,都能在这里有所收获,为下一步的技术决策提供方向。


小红书混合云资源管理负责人梁啟成已确认出席并发表题为《小红书 FinOps 实践:云成本优化与资源效率提升之道》的主题分享。眼下,云计算已成为众多互联网企业支撑业务运行的关键基础设施,然而云计算的便利性和灵活性也带来了一系列资源成本管理挑战,包括成本增速过快、成本归属不清晰、缺乏有效成本控制手段、对云厂商高度依赖等。本次分享将重点介绍小红书的 FinOps 实践经验,并通过技术优化手段提升资源使用效率,每年节省数亿成本。


梁啟成多年 IT 资源管理与成本优化经验,曾深度参与头部互联网企业上云、大规模在离线业务混部,并持续推进业财一体化以及精细化的混合云资源成本管理,2024 年参与了信通院《IT 基础设施资源运营成熟度模型》标准制定,是 FinOps 文化的践行者。他在本次会议的详细演讲内容如下:


演讲提纲

1. 小红书用云概述

2. 成本优化面临的问题与挑战

  • 分摊云成本与实际资源用量存在偏差

  • 资源规模不断增长但利用效率持续低下

  • 大模型的部署与运行成本高昂

3. 成本洞察与优化实践

  • 技术商品化实现内外账分离

  • 大 Node 小 Pod 策略下的在线业务混部

  • 工作负载性能瓶颈分析

  • 机型收敛与 RightSizing

  • 内容大模型的降本增效

  • 多维并行提升训练效率

  • 量化蒸馏压缩模型大小

  • 算子优化提升推理速度

4. 总结与展望


这样的技术在实践过程中有哪些痛点?

  • 常规按比例分账方法能帮助测算出各业务部门的资源成本费用,但不一定能解释清楚其背后的量价对应关系,进而影响了技术优化方向判断

  • 云厂商硬件经过虚拟化后,不同规格大小虚拟机会存在跨 numa、共用一个 Socket 产生干扰,进而表现出内存性能差、业务 CPU 使用率明显分层、服务 RT 抖动明显等问题,云上客户不得不开通更多资源降低容量水位来保证在线服务不受损,最终造成了成本浪费

  • 高昂的训练和推理成本、高硬件需求、资源利用效率低下,这些问题限制了内容大模型的广泛应用和普及,需要通过技术创新和优化策略来解决


演讲亮点

  • 重点聚焦于建立清晰、透明的成本洞察机制以及配套系统能力建设,尝试分别从买卖家视角梳理清楚各自团队的资源用量、技术成本支出以及收入情况

  • 看清、看准、分析出系统关键性能瓶颈,通过机型迭代、内核优化等措施确保各业务具备将 CPU 跑高的能力,进而执行缩容退机操作达到降低成本的目标

  • 分别从数据、训练、压缩、推理等方面介绍小红书对于内容大模型的降本增效实践

听众收益

  • 可以帮助相关从业人员了解或学习云成本优化的主要技术方案,并在日常工作中进行运用


除此之外,本次大会还策划了多模态大模型及应用AI 驱动的工程生产力面向 AI 的研发基础设施不被 AI 取代的工程师大模型赋能 AIOps云成本优化Lakehouse 架构演进越挫越勇的大前端等专题,届时将有来自不同行业、不同领域、不同企业的 100+资深专家在 QCon 北京现场带来前沿技术洞察和一线实践经验。

目前,所有大会演讲嘉宾已结集完毕,了解更多报名和详情信息可扫码或联系票务经理 18514549229 咨询。



为确保大会顺利举行,现诚邀志愿者加入,时长 3.5 天。可与大咖交流、获极客时间 VIP 月卡、大会演讲视频资源和证书。主办方提供午餐和交通支持。时间:4 月 9 日 13:00-4 月 12 日 18:00,地点:北京万达嘉华酒店,报名链接:https://www.infoq.cn/form/?id=2088

2025-03-31 14:004476

评论

发布
暂无评论

如何选择比较靠谱的数据培训班?

小谷哥

如何在 ACK 中使用 MSE Ingress

阿里巴巴中间件

阿里云 容器 微服务 云原生 ingress

python os模块

zxhtom

9月月更

OneFlow源码解析:Tensor类型体系与Local Tensor

OneFlow

深度学习 源码解析 算子

Android技术分享| Activity 过渡动画 — 让切换更加炫酷

anyRTC开发者

android 音视频 动画 移动开发 Activity

微服务治理热门技术揭秘:动态读写分离

阿里巴巴中间件

数据库 阿里云 微服务 云原生

elasticsearch的字符串动态映射

程序员欣宸

elasticsearch 9月月更

5 分钟比较理解 require() vs import()

掘金安东尼

前端 9月月更

Baklib|FAQ常见问题对产品推广的重要性

Baklib

产品 FAQ

太牛了,这是我见过把微服务讲的最全最好的SpringCloud架构进阶

程序知音

Java 架构 微服务 SpringCloud 后端技术

干货 | 企业数字化转型过程中,传统IT和数字型IT能否严格区分?

嘉为蓝鲸

运维 转型 IT 数字化 研发

什么是数据质量管理?企业怎样做好数据质量管理?

雨果

数据质量

Linux vim的使用和配置

挚爱光小胖

Linux vim教程

OpenHarmony Camera源码分析

OpenHarmony开发者

OpenHarmony

Java培训学习技术需要具备哪些能力

小谷哥

知识管理对企业的作用不容小觑

Baklib

知识管理 企业

Linux系统安装配置Tomcat

Linux Tomccat 9月月更

零信任态势评估:安全控制自动化

权说安全

零信任 动态评估

TiFlash 源码解读(八)TiFlash 表达式的实现与设计

PingCAP

源码阅读 TiDB TiDB 源码解读

干货 | 如何实现软件自动化部署?

嘉为蓝鲸

运维 IT 应用发布 应用部署

设计模式的艺术 第十四章享元设计模式练习(开发一个多功能文档编辑器,在文本文档中可以插入图片、动画、视频等多媒体资料。为了节省系统资源,相同的图片、动画和视频在同一个文档中只需保存一份,但是可以多次重复出现,而且它们每次出现时位置和大小均可不同)

代廉洁

设计模式的艺术

写出优秀的产品手册文档的技巧

Baklib

文档 产品手册

Java开发培训的就业方向有哪些?

小谷哥

大规模数据如何实现数据的高效追溯

华为云开发者联盟

大数据 后端 华为云 企业号九月金秋榜

软件测试 | 测试开发 | Jenkins 踩坑(四)|基于接口自动化测试完成 Jenkins+GitHub+Allure 的结合

测吧(北京)科技有限公司

测试

访问控制系统的质量评价

权说安全

网络安全 零信任 访问控制

Spring源码解析(十一)Spring扩展接口InstantiationAwareBeanPostProcessor解析

石臻臻的杂货铺

spring 9月月更

怎么来选择大数据培训课程

小谷哥

学员在web前端培训机构应该怎么学习

小谷哥

贝斯的圆桌趴 |科技公司内部 SaaS 工具大公开

Bytebase

画一个 “月饼” 陪我过中秋,使用 ESP32-C3 制作炫彩月饼

矜辰所致

电路设计 ESP32-C3 9月月更

小红书 FinOps 实践:云成本优化与资源效率提升之道 |QCon北京_云计算_QCon全球软件开发大会_InfoQ精选文章