登录

百度百舸Meetup:推理基础设施如何助力Agent规模落地?


速读:C114讯 9月22日,百度智能云联合SGLang社区举办“Agent时代的推理基础设施:百度百舸 × SGLang生产级实践”Meetup,围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题。 2026年09月23日11:00C114通信网C114讯9月22日,百度智能云联合SGLang社区举办“Agent时代的推理基础设施:百度百舸×SGLang生产级实践”Meetup,围绕多芯适配、上下文缓存、KVCache优化、显存优化、MoE专家压缩和推理服务治理等议题,探讨Agent走向生产环境所需要的推理底座。 基于推理基础设施的部署与优化,让Agent用起来,跑得更快、更省、更稳。
2026年09月23日 11:0

C114讯 9月22日,百度智能云联合SGLang社区举办“Agent时代的推理基础设施:百度百舸 × SGLang生产级实践”Meetup,围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE专家压缩和推理服务治理等议题,探讨Agent走向生产环境所需要的推理底座。

可以看到,本场活动关注的重心,指向了Agent的落地价值:对于用户的问题,不在于“答的多快”,在于“是否满意”。基于推理基础设施的部署与优化,让Agent用起来,跑得更快、更省、更稳。

从多芯适配到上下文复用 让Agent更快地跑起来

当前,Agent不再只是生成一次回答,而是需要理解目标、拆解任务、调用工具,并在多轮交互中持续推进。上下文能否复用、超大模型能否高效部署、复杂请求能否稳定调度,都将影响Agent的任务完成效率和规模化应用成本。

一次真实的Agent任务,往往包含多轮推理和工具调用。随着任务推进,输入上下文持续增长,不同轮次之间也存在大量重复内容。如果每轮交互都从头计算,响应速度和推理成本都会受到影响。

公开基准数据显示,在393条真实Agentic Coding任务轨迹中,输入输出比中位数达到213∶1,极端情况下输入序列长度可达67.5万Token。Agent工作负载正在呈现长输入、多轮次、强复用的特征。

因此,Agent时代的推理基础设施不能只关注模型一次“答得多快”,还要关注一项任务能否连续、稳定、低成本地完成。要实现这一目标,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。

在多芯适配方面,sglang-kunlun插件打通SGLang与昆仑芯,降低模型迁移和适配门槛。百度百舸还推动SGLang社区建立硬件可插拔插件机制,并从芯片算子、任务下发和通信等层面进行优化。

在上下文缓存方面,SGLang社区分享了从RadixAttention到Unified Radix Cache的技术演进。通过统一缓存管理体系,不同类型的KV Cache可以实现高效复用。在现场分享的实践数据中,FULL与SWA混合模型在多轮HiCache场景下命中率达到96.8%,平均首字时延为1.23秒。

不止模型跑得快 也要让 整套服务稳定可控

面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩,释放更多显存空间,为长上下文和高并发任务提供资源支撑。

在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值可达到原来的2.23倍。对Agent而言,这不仅意味着节省显存,也意味着相同算力资源可以承载更多任务。

当Agent进入生产环境,仅仅提高模型速度还不够。百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和KV Cache无感热迁移,让请求进入更加合适的推理实例。

同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节,提升复杂负载下的服务稳定性。

主题:任务|上下文|百度百舸|推理基础设施|MoE专家压缩