标签

腾讯云AI DLC发布会解读:融合Spark与Ray打造面向Agent的智能数据底座

发布时间:2026-08-04 14:27阅读:2

导读当AI Agent从"能对话"迈入"能执行任务"的生产阶段,企业数据平台所面对的已不仅是新增一种应用形态,而是数据形态、计算资源、训练范式与开发方式的同步变革。7月25日,DataFun Agentic AI Summit超级智能体系统架构峰会·深圳站腾讯云大数据专场,围绕"AI Native数据湖:让企业Agent拥有统一的智能数据底座"展开讨论。两个多小时的议程中,腾讯云正式推出智能数据湖计算AI DLC,并由产品与研发团队深度拆解TCRay、Xpark、Meson三大核心引擎,博世中国与腾讯WorkBuddy团队则分别分享了混合算力调度、智驾训练数据生产及AI Native数据实践。

1. 数据不再仅仅是记录,数据底座开始为Agent提供可靠的上下文

2.AI DLC发布:四项升级将数据、算力与Agent闭环纳入同一底座

3.三大核心引擎:分别补齐AI计算、多模态处理及结构化性能

4. 博世两项实践:统一算力底座与模型驱动的数据生产飞轮

5. WorkBuddy实践:把数据处理、后训练与权限治理串联成闭环

6. 从产品发布到生产实践,数据平台服务的对象变成了"持续进化链路"

出品社区|DataFun

01

数据不再仅仅是记录,数据底座开始为Agent提供可信上下文

图:腾讯云大数据基础产品总经理 程彬

腾讯云大数据基础产品总经理程彬以智能汽车与AI原生导购应用为例,阐释数据角色正在发生转变。传统汽车的功能在交付时基本固化,智能汽车则通过持续采集、云端连接和OTA升级不断演进;传统导购APP主要记录浏览、加购与订单,AI原生导购还需要理解用户意图,结合对话、图片、商品、库存及历史偏好主动完成任务。

在这一转变中,数据不再只是供人查询和复盘的运营记录,而成为Agent获取上下文、形成判断和持续学习的"认知燃料"。现场提出的数据底座新任务是,确保每一轮智能决策都能获得可追溯、可解释、可即时调用的上下文,并使模型训练、运行反馈与持续优化形成闭环。

对应到架构上,底层需要构建统一的Context平面,集中管理业务数据、知识、特征、模型、服务及Agent轨迹和记忆;中间层需要同时承载检索、SQL、模型训练、推理、代码执行、上下文构建和评测反思等多种计算;上层则承载能够持续优化并自主完成复杂工作的Agent应用。数据湖的目标也由"存好、算好结构化数据",转向持续为智能系统提供可靠上下文。

图1:AI时代的数据底座要保证每一轮智能决策获得可追溯、可解释、可即时调用的上下文(现场演讲PPT)

02

AI DLC发布:四项升级将数据、算力与Agent闭环纳入同一底座

图:腾讯云大数据DLC产品负责人 孟硕

腾讯云大数据DLC产品负责人孟硕在发布环节提出,AI/Agent时代的变化同时发生在四个维度:数据从结构化走向多模态,资源从CPU走向CPU + GPU异构分布式,企业训练重点从预训练转向基于私有数据的后训练,数据工程也从追求"一次写对"的确定性流程,转向依靠轨迹、反馈和评估不断迭代的系统。

基于这些变化,AI DLC按照支持异构、AI原生开发、数据算力同底座、面向Agent进化四条设计思路完成升级。产品层面对应为四项能力:以Ray×Spark升级计算范式;以Xpark、Ray Libraries和Meson补齐多模态处理、训练推理与结构化高性能计算;以TCLake建立Data + AI统一元数据和全流程血缘;以Open Engine、MCP、Skills、SDK与Open API让平台既能承载Agent,也能被外部Agent调用。

在这套架构中,Spark负责大规模数据加工、特征工程和结构化分析,Ray承载多模态处理、模型后训练、在线推理与Agent运行时;二者共享统一的资源池、数据与元数据底座。数据对象与AI对象也被放入同一治理链路:从表、文件和Topic,到特征、模型、Checkpoint、服务端点及Agent轨迹和记忆,都可被统一纳管与追溯。

图2:从数据湖计算DLC到智能数据湖计算AI DLC的四项升级(现场演讲PPT)

03

三大核心引擎:分别补齐AI计算、多模态处理与结构化性能

图:腾讯云大数据AI计算平台研发负责人 祝森林

腾讯云大数据AI计算平台研发负责人祝森林介绍,TCRay将开源Ray的分布式运行时转化为可供多团队长期使用的生产级平台。它在AI DLC中连接数据湖与智能应用,覆盖多模态处理、模型训练、强化学习、在线推理和GenAI应用。现场披露的建设进展显示,TCRay已完成3000节点、10万Actors的规模化测试;GCS稳态内存下降40%,Idle Worker内存下降90%。在一项12小时、包含1339万Events的历史作业场景中,History Server加载耗时由分钟级降至秒级,加载耗时下降98%,峰值内存下降99%。平台侧还补充了多租户、资源队列、弹性伸缩、流量控制、高可用与统一运维可观测能力。

图3:TCRay的规模化、历史可观测与生产平台能力建设进展(现场演讲PPT)

图:腾讯云大数据Xpark研发负责人 蔡晓帆

腾讯云大数据Xpark研发负责人蔡晓帆则聚焦多模态数据处理这一AI落地的前置瓶颈。 Xpark:面向多模态数据处理的自研引擎,基于TCRay提供Xpark Dataset、DataFrame与AI Function,内置50余种图片、文本、音频、视频及LLM算子,并支持UDF迁移已有业务逻辑。现场测试中,在CLIP图文匹配场景下,Xpark推理吞吐相较开源Data-Juicer提升3倍,GPU利用率长期接近100%;Exact Substring Dedup相较开源Text-dedup单机算子快47.8倍。通过模型级联和判别式算子,部分场景可减少70%的大模型请求,注意这里指调用次数,而非直接等同于总成本下降70%。

图4:Xpark通过内置多模态算子降低开发门槛,并用模型级联减少大模型请求(现场演讲PPT)

图:腾讯云大数据专家工程师 黄海升

腾讯云大数据专家工程师黄海升带来的Meson引擎专注结构化数据高性能计算。

Meson:面向结构化数据的高性能向量化引擎,核心能力包括向量化算子、Pipeline执行模型、高性能IO与自适应优化。腾讯云现场披露的1TB TPC-DS测试显示,Meson相较社区Spark整体性能提升3.6倍,部分计算密集型查询提升5倍;CPU使用率由80%降至40%,集群IO吞吐由12Gbps提升至20Gbps,瓶颈由CPU转向IO。产品同时保持对Spark API、SQL、UDF与生态组件的兼容,便于存量作业迁移。

图5:Meson在1TB TPC-DS测试中的性能、CPU使用率与IO吞吐对比(现场演讲PPT)

04

博世两项实践:统一算力底座与模型驱动的数据生产飞轮

博世中国数据平台技术专家 王磊

博世中国数据平台技术专家王磊围绕Ray on TKE混合计算调度实践,介绍了在线推理、数据处理与模型训练对统一算力底座的共同需求。传统资源按组或业务线切分,容易出现资源孤岛、峰谷错配与多人共享冲突;统一平台则通过TKE资源池、KubeRay与API接入,将Ray Job、Ray Serve、Spark与自定义Pod纳入统一调度。现场PPT将两个关键收益概括为"开发即产线"与"排队与抢占":开发环境、训练环境和推理环境保持一致,任务可按优先级使用异构资源,避免各团队分别建设和维护集群。

在具体链路中,Ray Serve通过流水线并行与单卡多实例提升GPU利用率,Ray Data将海量预处理拆分为可独立重试的分片,避免中间失败导致整条长链路重跑;训练侧则统一调度不同类型的GPU/DCU集群,使从开发环境申请、训练任务发起、推理部署到业务交付形成完整闭环。

图6:博世Ray混合计算实践将资源申请、训练、推理与业务交付连接为统一闭环(现场演讲PPT)

博世中国智驾数据产品专家陈立贤

博世中国智驾数据产品专家陈立贤进一步分享了以Lance作为数据中心、Ray作为任务中心的智驾训练数据实践。Lance统一管理图像、视频、点云等Dense数据与标签、元数据、模型输出等Sparse数据,使它们共享同一数据集身份、版本与血缘;Ray则统一管理任务提交、资源、状态和结果聚合,让本地验证完成的任务可以使用同一任务模型扩展到集群。

这套架构把数据生产组织为模型问题驱动的闭环:模型问题转化为数据需求,随后完成数据挖掘、自动标注、人工修复、可训练数据集版本化交付,再进入训练与在线评测。与过去"湖仓交付后仍需多次统计、对齐和搬运"不同,新的交付对象本身就是可直接被训练与评测消费的数据集。

05

WorkBuddy实践:把数据处理、后训练与权限治理串联成闭环

腾讯CodeBuddy/WorkBuddy Infra负责人 张凯

腾讯CodeBuddy/WorkBuddy Infra负责人张凯以WorkBuddy数据实践为例,介绍了业务增长后集中出现的三类问题:数据处理任务与体量快速增加,对话、长文档等超大字段给常规读取与解析带来压力,同时算法、模型训练、BI、风控、运营和数据科学等多个团队需要在严格权限边界内使用同一批数据。

接入AI DLC后,业务数据、对话文档与行为日志先进入对象存储与TCLake,再由Serverless Spark × Ray和Xpark完成数据准备、多模态处理、后训练与推理。存储与算力可以独立扩展,Spark与Ray共享数据底座,MCP与Open API则让底座能够被Agent编排调用。针对超大字段,方案通过列式读取、冷热分离与Xpark多模态算子减少无效扫描,并在峰值任务中按需扩容。

现场PPT给出的WorkBuddy同数据集实测口径显示,数据处理耗时从5小时降至1小时,吞吐提升5倍,按同等负载换算CPU使用率下降80%;通过API串联Agent轨迹入湖、Xpark特征提取、Ray Train后训练与评估回流后,数据到训练的交付周期缩短70%,人工搬运减少90%。这些数据在PPT中注明以内部报告口径为准。

除性能外,TCLake还把数据加工、特征工程、模型训练、模型服务以及Agent轨迹和记忆纳入同一血缘体系;权限中心支持库、表、行、列级授权,并对操作过程全程留痕。对于需要持续后训练的Agent应用,这意味着数据处理效率、训练闭环与跨团队治理可以在同一平台内协同完成。

图7:WorkBuddy通过API串联轨迹入湖、数据处理、Ray Train后训练与评估回流(现场演讲PPT)

06

从产品发布到生产实践,数据平台服务的对象变成了"持续进化链路"

从当天六场分享可以看到,AI Native数据湖并非在传统数据平台旁边再增加一组AI功能,而是重新组织数据处理、模型训练、在线推理与Agent运行之间的关系。Spark与Ray负责不同类型的工作负载,TCLake统一管理数据和AI元数据,TCRay、Xpark、Meson分别解决生产级AI计算、多模态处理与结构化性能问题,轨迹、记忆与评估结果则回流到数据与训练链路中。

这也是本次专场最重要的技术变化:平台不再仅优化某一次ETL、查询或训练任务,而是优化从数据进入、加工、训练、部署、反馈到再次训练的整体周转效率。腾讯云在现场提出,TCRay后续将围绕"多、快、好、省"继续演进;AI DLC在2026年下半年也将持续推进产品迭代、客户共建验证、数据核心资产价值探索与开放生态建设。

当Agent真正进入企业生产环境,数据底座的竞争不再只是谁能存更多数据、跑更快SQL,而是谁能让多模态数据、异构算力、模型与Agent反馈在一套受治理的基础设施上持续循环。AI DLC的发布以及博世、WorkBuddy的现场实践,给出了腾讯云在这一方向上的阶段性答案。

点个在看你最好看

SPRING HAS ARRIVED