模型部署优化
为应对 DeepSeek-V4-Pro 模型在长上下文、高并发推理场景下的性能瓶颈,我们启动了 H20 集群推理服务优化项目。原单机部署方案在解码阶段依赖 DSpark 投机解码(num_speculative_tokens=3)进行加速,但在实际业务流量(高峰约 100 req/min)下,KV Cache 显存占用成为主要限制,导致请求承载能力仅约 10% 的流量比例,大量请求因资源不足被拒绝或排队,严重影响服务可用性和用户体验。
本次项目旨在通过架构升级,将部署规模从单机扩展至双 H20 集群,并引入 LMCache KVCache Pool 池化技术,实现 KV Cache 跨实例复用,显著降低长上下文场景下重复 Prefill 计算开销,最终目标是将业务承载能力提升至 25% 以上,保障高峰流量下的服务稳定性与低延迟响应。
人工智能