一机多模,SSD 缓存两层归一 | 泛联 UbiPower 18000 升级 KV Cache 加速特性 📅 2026/8/25 13:51:24 大模型推理正加速走向超长上下文、高并发与复杂智能体场景KV Cache 作为推理核心中间数据直接影响推理时延、业务体验与集群建设成本。为缓解显存压力、避免盲目堆叠 GPU 带来的算力浪费行业采用 G3、G3.5、G4 分层存储架构分担 KV Cache 负载。G3 借助服务器本地 NVMe SSD 扩容降本但仅支持单机访问无法跨节点共享G3.5 虽实现 Pod 级缓存共享却需要配套专用硬件推高采购与运维成本。行业的重要演进方向是通过一套存储同时实现本地NVMe SSD 级低时延与全域跨节点共享能力完成 G3、G3.5 两层缓存能力归一。该模式既可破解显存受限、KV Cache 卸载时延偏高的痛点也消除分层硬件的重复投入降低推理集群 TCO。泛联 UbiPower 18000 全新升级的 KV Cache 推理加速特性正是这一架构演进路线的创新实践。UbiPower 18000 KV Cache加速特性正式发布面向大模型推理行业普遍存在的性能瓶颈与高成本痛点泛联UbiPower 18000全新升级高性能KV Cache加速特性。产品基于AI原生分布式存储架构全链路深度优化对GPU端KV Cache数据实现高速远程卸载、共享复用与超大容量弹性扩展将GPU工作内存无缝外延至全闪存共享存储池从底层打破GPU HBM显存容量受限桎梏。UbiPower 18000 基于独有的一机多模创新架构单套存储池可同时承载模型训练、推理 KV Cache 卸载两大业务。POSIX 文件系统承接训练数据集与 Checkpoint专属 KV Cache 域承接推理缓存卸载。训推资源可动态切换简化规划运维。在推理场景实现SSD 缓存两层归一承接 KV Cache 分层架构中 G3、G3.5 KV Cache 缓存能力替代分立多层存储硬件。精简后的架构相较原有多层 KV 缓存首 Token 时延TTFT 大幅降低98%、推理吞吐量TPS 提升最高可达65倍。UbiPower 18000 以“一机多模SSD缓存两层归一”为核心优势为生产级大模型业务打造极致性能、极简架构的分布式全闪存储综合底座。极致性能提升推理体验极简架构降整体TCOUbiPower 18000 KV Cache 特性摒弃传统通用存储适配逻辑针对大模型推理“读多写少、低时延敏感、高并发吞吐”业务特征依托自研 GDR 零拷贝传输模块与精细化 RDMA 并发调度机制完成全栈深度优化。该方案全面兼容 Dynamo、LMCache、MoonCake 等主流开源框架企业无需改造现有业务链路即可快速落地部署。为客户带来可量化、高落地价值的业务收益。l性能跨越式提升重塑推理交互体验基于 GDR 零拷贝直连实现推理性能跨越式提升。 在长文本多轮对话与复杂 Agent 工作流的实际测试中相较于传统 HBM 缓存驱逐后全量 重算模式TTFT 降低98%显著优化用户首字符等待体验在高并发 Prefill 场景下系统 整体吞吐量 TPS 最高提升65倍大幅优化终端交互流畅度与业务承载上限。同等 GPU 硬件 可承载更多并发会话减少算力闲置浪费无需额外堆叠高端 GPU 即可支撑大规模推理业 务有效控制算力采购开销。l一机多模训推共池规划运维双重减负采用创新的一机多模架构,实现单套存储兼顾 AI 训练、推理双核心业务适配企业训推业务动态变化。训推资源弹性互通、按需调度可简化企业初期规划减半企业硬件采购、机柜部署、运维管理成本。在简化企业 AI 基础设施规划运维的同时大幅压低整体 AI 基础设施 TCO。l精简推理存储架构削减分层硬件投入提供独有的 KV Cache SSD 缓存两层归一能力单存储池覆盖 G3、G3.5 两层缓存替代分层部署的本地 SSD 集群与 CMX 专用存储。海量 KV Cache 数据可从 GPU HBM 卸载至弹性扩展的全闪存共享存储池解除 GPU 显存容量限制。实测经过架构精简后可进一步降低 TTFT、提升 TPS。l多冗余策略灵活选配平衡推理成本与可靠性原生支持单副本、多副本、EC 纠删码三种冗余模式不同策略无性能损耗可提供几乎相同的 KV Cache 读带宽和读时延能力。企业可按需匹配不同场景的成本与可靠性需求灵活配置。实测验证性能跃升重塑推理体验在第三方权威认证测试中对比原生 vLLM将 KV Cache 卸载到 UbiPower 18000TTFT 和 TPS 实测性能实现大幅跃升其中总体吞吐量 TPS 最高提升达65倍在同类 KV Cache 卸载存储方案中处于行业领先地位。l测试环境:GPU:8xNVIDIA H20-3e141GB HBM/GPU推理框架vLLM测试模型DeepSeek-R1l测试结果TTFT 降低94%~98%;TPS 提升19-65倍行业领先TTFT 大幅降低意味着用户提问后不用长时间等待对话交互更加流畅系统吞吐量 TPS 提升则代表现有算力服务器通过卸载KV Cache提升 GPU 效率能够同时服务更多用户。泛联 UbiPower 18000 全新 KV Cache 特性落地依托一机多模架构单套存储可同时承载模型训练 Checkpoint 存储、推理 KV Cache 卸载双业务KV Cache SSD 缓存两层归一大幅简化传统分立推理存储架构。双重核心能力加持为企业大模型推理打造超高推理性能、全链路降本增效的专属加速方案全面赋能长文本对话、复杂智能体等业务规模化落地。后续泛联将发布 ODCC 权威第三方实测报告以客观专业的实测数据展现产品实力敬请持续关注