Cloudflare 近日详细描述了其内部统一数据平台Town Lake,并报告称计费类工作负载占平台查询的 53%。该系统与一个名为 Skipper 的 AI 驱动分析智能体一同构建,旨在统一此前分散在不同系统中的运维、计费、安全与业务数据访问。
Cloudflare 表示,其全球网络在 120 个国家的 330 多个城市每秒处理超过 10 亿条的事件。随着时间的推移,数据散落在 Postgres 数据库、ClickHouse 集群、Kafka 流、BigQuery 数据集与对象存储中,这些数据的发现与分析变得愈加复杂。于是,他们引入了 Town Lake,以提供一个统一的 SQL 接口,实现跨这些系统的查询,同时保留治理与访问控制的能力。
该平台基于 lakehouse 架构构建,采用 Apache Trino、Apache Iceberg、Cloudflare R2 对象存储与用于元数据管理的 DataHub。Cloudflare 表示,单条查询可以在不移动数据的情况下连接 Postgres、ClickHouse 与 Iceberg 表。支持服务处理数据摄取、转换、访问控制与个人身份信息(PII)的检测。

Town Lake 平台的架构(来源:Cloudflare博客)
其中,关键一项设计是默认的封闭治理模型:新加入的数据集在自动扫描与人工审查完成之前默认是不可访问的。Cloudflare 使用内部服务 Skimmer 将自动分类与基于 AI 的分析相结合以检测敏感数据,随后由人工复核者验证或调整分类并授予访问权限。
在 Town Lake 之上,Cloudflare 构建了 Skipper,提供对企业数据的自然语言访问。该智能体使用元数据、模式定义、转换谱系(transformation lineage)、文档与运行时检查来将用户请求翻译为经过验证的查询,从而提高准确性。它被用于计费分析、客户支持调查、业务智能与安全工作流。Cloudflare 将此系统描述为一个统一的访问层:Town Lake 提供公司范围的数据单一 SQL 接口,而 Skipper 使人们能用自然语言发起可审计的查询并获取结果。
Cloudflare 企业工程负责人Dmitry Alexeenko这样表示:
每一次的 Cloudflare 请求背后都有大量的数据。我们的团队构建了 Town Lake(统一数据平台)和 Skipper(AI 数据智能体),能在几秒内将简单的英文问题变成实际的洞察力。
Cloudflare 表示,以前需要复杂 SQL 或人工调查才能完成的任务,现在可以通过其统一数据平台与 AI 智能体在几秒内完成。在测量期间,计费工作负载在 Town Lake 的使用中占多数:324 名员工发起了 91760 条与计费相关的查询,涵盖计费分析、支持调查与运营报告。公司还报告称,简化 AI 智能体的提示词提高了准确度,而合并重叠工具减少了错误选择。将 SQL 转换逻辑与数据谱系纳入智能体上下文,进一步提升了智能体对业务语义的理解,超越了仅靠模式元数据的能力。
Rippletide的CEO Patrick Joubert 对该架构发表了评论:
在统一分析平台之上放置内部的 AI 智能体,正是基础设施团队开始感到控制问题的地方。如果智能体可以跨运维数据进行推理,则执行过程中的强制执行必须靠近执行点。分布式确定性检查能让智能体在不将数据平台变为不受控的动作时安全地开展行动。
展望未来,Cloudflare 计划将 Skipper 与内部聊天、工单和开发工作流做更深度的整合。公司还在扩展其 Transformer 流水线,使团队能够使用 SQL 与元数据文件定义策划数据集,这些数据集将被自动部署、监控、编目,并通过 DataHub 与 Skipper 展示。随着系统不断成熟,Cloudflare 预计还会将更多 Town Lake 的工作负载迁移到 R2 SQL 上运行。
查看英文原文:Cloudflare Details Unified Data Platform Where Billing Workloads Account for 53% of Queries





