【ArchSummit】如何通过AIOps推动可量化的业务价值增长和效率提升?>>> 了解详情
写点什么

JEP 192(String Deduplication in G1)简介

  • 2014-03-25
  • 本文字数:1841 字

    阅读完需:约 6 分钟

JEP,即 JDK Enhancement Proposals,指的是为增强 JDK 而引入的一些提案,比如 Nashorn JavaScript 引擎就是在 JEP 174 中提出的。2013 年 11 月 22 日,来自 Oracle 的 Per Liden 创建了 JEP 192(String Deduplication in G1),意在增强 G1 垃圾收集器,去掉堆中重复的 String 对象,从而减少堆内存的占用。该文档近日又有更新,Per Liden 也提交了相应代码实现,目前还处于审校和讨论中。

应该注意的是该特性只针对 G1 垃圾收集器,不适用于其他收集器。

很多大规模 Java 应用都受限于内存瓶颈,测量表明,这类应用中,String 对象大概占了 Java 堆中活数据集的 25%。而这些 String 对象中,又大约有一半是重复的,这里的重复是指,对两个字符串 string1 和 string2 而言,string1.equals(string2) 为 true。存在重复的 String 对象本质上是对内存的浪费。JEP 192 打算在 G1 收集器中实现自动和连续的 String 去重操作,以避免内存浪费,进而减少总的内存占用量。

目前 String 类有两个字段:

private final char[] value;

private int hash;

使用旧版本 Java 的读者可能有点诧异,其实早期版本中的 count、offset 等实例字段已经去掉了,InfoQ 之前也曾报道过。

value 字段是特定于实现的,在 String 类之外看不到。因为 String 类不会修改该数组的内容,也不会将其用于同步,所以我们可以安全且透明地将其在多个 String 对象之间共享。也就是说我们可以将一个 String 对象的 value 指向另一个 String 对象的 value。尽管该字段是 final 的,但因为去重操作是在虚拟机内部实现的,所以这不是问题。有兴趣的读者可以查看一下 java.lang.System 类的实现,其中的

public final static InputStream in = null;

一句,就是先将 final 字段 in 设置为 null,然后在 native 代码中重新赋值的。

这里需要注意的是,实现并没有真的去掉重复的 String 对象,去掉的只是对象中的 char 数组。这样对应用才是透明的。去掉实际的 String 对象并不安全,因为应用可能将该对象用于同步等操作。这种实现不需要修改 JDK 类库或其他任何现有的 Java 代码。

Per Liden 对大量大大小小的 Java 应用进行了测量,发现了下列结果:

  • String 对象平均占活数据的 25%
  • 重复的 String 对象平均占活数据的 13.5%
  • String 的平均长度为 45 个字符

经过分析计算,通过去重、复用 char 数组,平均大概能减少 10% 的堆内存占用。

JEP 192 文档中介绍了实现思路。垃圾收集执行时会访问堆上的活对象,在访问对象时可以判断一下该对象是否可以作为字符串去重的候选。如果是,将其插入一个队列。有一个负责去重的线程在后台运行,处理该队列。使用一个哈希表来记录 String 对象使用的所有唯一的 char 数组(即 value)。在处理候选的 String 对象时,先查找哈希表,看是不是存在和当前处理对象内容相同的 char 数组。如果存在,则更新当前对象的 value 值,使其指向在哈希表中找到的 char 数组,这样垃圾收集器就可以在某个时间把当前对象原来的 char 数组回收掉了。如果不存在,则将当前对象的 char 数组插到哈希表中,供以后处理。对于哈希表中的某个 char 数组,如果引用它的所有对象都已经不可达了,即可将其移除。该哈希表会根据当前表项的数目动态调整,使用链表处理冲突。

这里有一个重要的参数:去重年龄阈值。对象的存活时间长短不一。对于存活时间很短的对象,执行去重操作其实是浪费资源。为避免这种情况,可以设置一个年龄阈值。在 String 对象的年龄等于该阈值时,才考虑对其进行去重操作,大于该阈值则是已经处理过的。该阈值应该提供一个合理的默认值,同时支持通过虚拟机选项来配置。

实际的去重操作在去重线程中完成。它会等待 String 对象引用出现在去重队列中,然后一个一个地将其从队列中去掉。在去掉时进行处理,计算字符串的哈希值,在哈希表中查找,如果可能的话执行去重操作。去重线程负责维护一些统计信息(已检查的候选对象数,去重的字符串数等),这些信息可以打印到 GC 日志中。

需要提供新的虚拟机命令行选项:

  • UseStringDeduplication (bool) ——支持字符串去重
  • PrintStringDeduplicationStatistics (bool) ——打印详细的去重统计信息
  • StringDeduplicationAgeThreshold (uintx) ——设置 String 对象的年龄阈值

文档中还对比评价了其他方案存在的一些问题,感兴趣的读者可以参考。


感谢张龙对本文的审校。

给InfoQ 中文站投稿或者参与内容翻译工作,请邮件至 editors@cn.infoq.com 。也欢迎大家通过新浪微博( @InfoQ )或者腾讯微博( @InfoQ )关注我们,并与我们的编辑和其他读者朋友交流。

2014-03-25 23:332083
用户头像
臧秀涛 略懂技术的运营同学。

发布了 300 篇内容, 共 130.3 次阅读, 收获喜欢 34 次。

关注

评论

发布
暂无评论
发现更多内容

又拿奖了!腾讯云原生数据库TDSQL-C斩获2021PostgreSQL中国最佳数据库产品奖

腾讯云数据库

tdsql 国产数据库

重装上阵——Graviton2提升Aurora性价比

亚马逊云科技 (Amazon Web Services)

Data

java开发之SSM开发框架

@零度

Java ssm

盘点2021 | 技术十年-记录十年技术经历

高性能架构探索

技术人 工作经历 经历分享 盘点2021

利用极狐GitLab DevSecOps 功能检测 log4j 的多种方式

极狐GitLab

​使用 Amazon Neptune 通过数据仓库构建知识图谱,借此补充商务智能体系

亚马逊云科技 (Amazon Web Services)

Data

内核干货不容错过,龙蜥内核的Load Averages剖析直播回顾上线了

OpenAnolis小助手

Linux Kenel 内核 龙蜥社区

蓝格赛(中国)用TDengine落地聚合查询场景,效果如何?

TDengine

数据库 tdengine 后端

(转)前端开发之MySQL分区表中的性能BUG

@零度

MySQL 前端

JDK ThreadPoolExecutor核心原理与实践

vivo互联网技术

jdk ThreadPoolExecutor Java 开发

webpack打包过程如何调试?

Jerry Wang

前端 前端开发 webpack 28天写作 12月日更

「山东城商行联盟」数据库准实时数据采集系统上线,DataPipeline助力城市商业银行加快数字化转型

DataPipeline数见科技

数据库 中间件 数据同步 数据融合 数据管理

轻松驾驭EB级千万QPS集群,TDSQL新敏态引擎元数据管控与集群调度的演进之路

腾讯云数据库

tdsql 国产数据库

发布你的开源软件到 Ubuntu PPA

hedzr

#Ubuntu Debian packaging ppa

MySQL 中 blob 和 text 数据类型详解

Simon

MySQL

DM 分库分表 DDL “悲观协调” 模式介绍丨TiDB 工具分享

PingCAP

Go编译原理系列2(词法分析&语法分析基础)

书旅

Go 后端 编译原理

鲲鹏HCIA认证之初识鲲鹏

桥哥技术之路

鲲鹏

元宇宙地产:品牌和投资者的大好机会?

devpoint

以太坊 NFT 元宇宙 12月日更

跟着动画学Go数据结构之堆排序

宇宙之一粟

golang 数据结构 排序算法 Go 语言 12月日更

前沿干货!深度揭秘TDSQL新敏态引擎Online DDL技术原理

腾讯云数据库

tdsql 国产数据库

盘点 2021|不忘初心,扬风起航

小鲍侃java

盘点2021

孩子,你为什么要上学?

Tiger

28天写作

XEngine:深度学习模型推理优化

华为云开发者联盟

深度学习 模型推理 显存优化 计算优化 XEngine

一文详解TDSQL PG版Oracle兼容性实践

腾讯云数据库

tdsql 国产数据库

如何将Amazon RDS与Amazon Aurora数据库迁移至Graviton2?

亚马逊云科技 (Amazon Web Services)

Data

一个简单的单体服务流量标记demo

zuozewei

Java 性能测试 全链路压测 12月日更

云图说|初识数据库和应用迁移UGO

华为云开发者联盟

数据库 华为云 UGO 异构迁移

一文带你梳理Clang编译步骤及命令

华为云开发者联盟

编译 LLVM Clang编译 Clang 编译命令

解析Redis操作五大数据类型常用命令

华为云开发者联盟

数据库 redis string 数据类型 getset

喜提双奖 | 旺链科技彰显综合硬实力!

旺链科技

区块链 产业区块链 供应链

JEP 192(String Deduplication in G1)简介_Java_臧秀涛_InfoQ精选文章