北京商报讯(记者 魏蔚)9月23日,北京商报记者获悉,百度智能云联合SGLang社区围绕多芯适配、上下文缓存、KV Cache优化、显存优化、MoE(混合专家模型)专家压缩和推理服务治理等话题,梳理出Agent(智能体)走向生产环境所需要的推理底座。
Agent时代,推理基础设施需要从底层硬件适配、计算效率优化到上下文管理进行系统性升级。要实现这一目标,面对超大模型部署,百度百舸通过权重零冗余分布式部署、显存占用优化和MoE专家压缩。在相关测试中,MoE专家压缩50%后,长输出和高并发场景下的输出吞吐峰值是原来的2.23倍。此外,百度百舸从流量、负载和集群缓存三个层面进行服务治理,通过动态调度、变长行为感知分桶和KV Cache无感热迁移,让请求进入更加合适的推理实例。同时,百度百舸构建多级缓存体系,并通过全链路命中率漏斗定位缓存损失环节。
本网站所有内容属北京商报社有限公司,未经许可不得转载。 商报总机:010-64101978 版权合作:010-64101871
商报地址:北京市朝阳区和平里西街21号 邮编:100013 法律顾问:北京市中同律师事务所(010-82011988)
![]()
网上有害信息举报 违法和不良信息举报电话:010-84276691 举报邮箱:bjsb@bbtnews.com.cn
ICP备案编号:京ICP备08003726号-1
京公网安备11010502045556号 互联网新闻信息服务许可证11120220001号