CXL 内存池化厂商对比:MemVerge、Liqid、Panmnesia 怎么选?

📅 2026/7/21 14:34:06
CXL 内存池化厂商对比:MemVerge、Liqid、Panmnesia 怎么选?
发布时间2026-07-21适合读者正在评估 CXL 内存扩展、CXL memory pooling、AI/HPC 大内存架构和私有 AI 集群的基础设施团队开篇结论MemVerge、Liqid、Panmnesia 都和 CXL 内存池化有关但它们不是同一种厂商。| 厂商 | 最像什么 | 最适合谁 ||---|---|---|| MemVerge | 应用感知的 CXL 内存软件层 | 想做 DRAMCXL 分层、应用热/冷内存分析、QoS、checkpoint、AI/HPC 作业恢复的企业 || Liqid | 数据中心级可组合内存资源池 | 想把 CXL DRAM 像资源池一样动态分配给服务器、做裸金属 composable infrastructure 的企业 || Panmnesia | CXL 芯片/IP/fabric 技术供应商 | OEM、系统厂商、芯片团队、AI 集群架构团队关注 CXL controller、switch、GPU memory expansion |如果只记一句话MemVerge 解决“应用怎么用好 CXL 内存”Liqid 解决“内存资源怎么动态组合”Panmnesia 解决“CXL 底层链路和设备怎么做”。为什么 CXL 内存池化会成为 2026 年选型热点传统服务器架构把 CPU 和内存强绑定在一台机器里。结果很典型有的节点 DRAM 闲置有的节点内存不足有的 AI/HPC 作业因为峰值内存不够而 OOM有的数据库为了高峰期过配了大量昂贵内存GPU 集群里GPU 算力和显存/主存容量也经常不匹配。CXL 的意义在于它提供了一个开放、cache-coherent 的高速互联标准让 CPU、内存扩展设备和加速器之间可以共享更一致的内存语义。CXL Consortium 对 CXL 的定义强调 cache-coherent interconnect、memory expansion 和 acceleratorsCXL 4.0 规格已经在 2025 年 11 月公开带宽从 64GT/s 提升到 128GT/s并增强了 memory RAS 等能力。但是CXL 不是插上设备就自动变成生产级内存池。真正的难点在软件层哪些应用适合放到 CXL 内存上哪些页面应该留在 DRAM哪些可以迁移到 CXL多台服务器如何共享内存容量而不破坏隔离CXL switch、host、Type 3 设备、NUMA、BIOS、内核和驱动如何协同AI/HPC 长作业失败后如何恢复池化带来的成本收益能否覆盖硬件和运维复杂度这正是 MemVerge、Liqid、Panmnesia 三类厂商差异化的地方。对比总览| 维度 | MemVerge | Liqid | Panmnesia ||---|---|---|---|| 核心定位 | CXL 内存软件、QoS 分层、应用洞察、checkpoint/AI 基础设施 | CXL composable memory、裸金属资源池化 | CXL controller IP、switch、fabric、GPU memory expansion || 主要产品 | Memory Machine X、Memory Machine Cloud/AI | LIQID Matrix、Composable Memory、SmartStack/UltraStack | Link Controller IP、PanSwitch、PanEndpoint、PanFabric、Total AI Solution || 关注层级 | 应用运行时 内存管理 checkpoint | 资源编排 CXL 内存硬件资源池 | 芯片/IP CXL fabric 系统集成 || 典型用户 | AI/HPC/EDA/生信平台团队数据中心软件团队 | 私有云、HPC、AI 数据中心、裸金属平台团队 | OEM、硬件厂商、芯片团队、AI 集群架构方 || 最大优势 | 应用感知、热/冷内存分析、QoS、恢复能力 | 动态内存分配、资源池化、UI/CLI/API 管理 | 底层 CXL 技术、低延迟 controller、未来互联路线 || 主要风险 | 需要结合 workload 做 PoC公开价格不透明 | 更偏基础设施资源层应用状态能力较弱 | 对普通企业不是开箱即用软件落地依赖系统集成 |MemVerge适合应用感知的 CXL 分层和大内存作业恢复MemVerge 的 Memory Machine X 面向 CXL 环境重点不是“我有一堆 CXL 内存”而是“应用到底该如何使用这些内存”。官方文档显示Memory Machine 可以展示 CPU、DRAM、CXL memory devices 的系统拓扑提供 CPU、内存使用、内存吞吐 telemetry并分析运行中应用的 memory usage 和 hot working set size。它的 QoS Memory Engine 是选型时最值得看的能力。MemVerge 把 DRAM 与 CXL Type 3 memory expander 视为异构内存架构并提供两类策略Latency policy根据内存页访问频率做冷热判断把 hot pages 放在 DRAM把 cold pages 放到 CXL 内存。Bandwidth policy通过用户可选的 DRAM:CXL 比例让应用利用 DRAM 与 CXL 的组合带宽同时在带宽与延迟之间取平衡。MMX 1.5.x Release Notes 还显示MemVerge 强化了 latency optimized tiering、bandwidth optimized policy、多 CXL device per CPU socket、NVIDIA GPU telemetry、多节点 UI 管理、CXL health info、NUMA 检测和 HTTPS/UI authentication。也就是说它正在从单机 CXL 观测和分层走向多节点、GPU-aware、运维可管理的 CXL 软件层。MemVerge 的另一个差异在 checkpoint。Memory Machine Cloud 文档显示MMCloud 的 AppCapsule 会保存应用实例的内存状态和相关文件用于 workload mobility 和 workload continuity。对于 Spot 实例、长时间 HPC/EDA 作业、AI 训练/推理任务来说这意味着失败后可以从 checkpoint 恢复而不是完全重跑。适合选择 MemVerge 的情况你想知道应用热工作集到底多大而不是盲目加内存。你要把 DRAM 和 CXL 内存做冷热分层。你关心 p99 延迟、吞吐、GPU utilization 和内存成本的平衡。你有 AI/HPC/EDA/生信等长作业失败重跑成本很高。你需要 checkpoint、hot restart、云上 Spot/Preemptible 恢复等能力。不适合只选 MemVerge 的情况你只要最底层 CXL controller IP 或 switch 芯片。你主要想采购一个完整硬件资源池化平台并由硬件 fabric 统一管理。你没有明确 workload也没有 CXL 服务器或 CXL 设备环境。Liqid适合数据中心级 composable memoryLiqid 的关键词是 composable。它的 LIQID Composable Memory 基于 CXL 2.0通过 LIQID Matrix 软件把外部 DRAM 动态分配给服务器。公开资料显示Liqid 支持通过 UI、CLI 或 API 把 DRAM 按需 provision 到服务器官方页面提到可为单一 workload 提供 5TB 到 100TB也可把容量共享给最多 32 台服务器。Liqid 更像把“内存”纳入可组合基础设施。它不是先从某个应用进程的热/冷页出发而是从数据中心资源池出发服务器需要多少内存就从共享 CXL 内存池里 compose 给它不用时再释放回池里。对于私有云、HPC 集群、AI 数据中心、内存数据库高峰扩容、VDI 和 Dev/Test/CI这个模型非常直观。适合选择 Liqid 的情况你已经在建设 bare-metal composable infrastructure。你想减少 stranded DRAM 和内存过配。你需要按 workload 动态扩展服务器内存容量。你希望通过 UI/CLI/API 把 CXL 内存纳入基础设施自动化。你的主要目标是资源利用率、容量弹性和硬件池化。不适合只选 Liqid 的情况你的核心问题是应用级 checkpoint/restore。你需要深入到进程热/冷页和 DRAM:CXL 页面迁移策略。你更关心 AI agent memory、云上作业迁移或应用状态恢复。Panmnesia适合 CXL 底层 IP、switch 和 GPU memory expansionPanmnesia 与 MemVerge、Liqid 的层级不同。它更偏 CXL 底层技术与半导体方向。其 Link Controller IP 页面显示产品面向 PCIe 7.0/CXL 4.0支持 CXL.io、CXL.mem、CXL.cache覆盖 Type 1/2/3 device、MLD、MHD、Fabric-Attached Memory并宣称 roundtrip latency 小于 100ns。它的产品导航还包括 PanSwitch、PanRetimer、PanEndpoint、PanFabric 和 Total AI Solution。这说明 Panmnesia 更适合那些要设计 CXL device、CXL switch、GPU memory expansion 或 AI cluster fabric 的团队。它的价值不是让企业应用团队马上把某个 Java/Python/C workload 跑在 CXL 内存上而是帮助硬件和系统厂商构建下一代 CXL 基础设施。适合选择 Panmnesia 的情况你是 OEM、服务器厂商、芯片团队或 AI 基础设施系统集成商。你关心 CXL controller、CXL switch、retimer、endpoint、fabric 的底层能力。你要做 GPU memory expansion 或异构加速器互联。你正在设计下一代 AI/HPC 集群而不是只采购上层软件。不适合只选 Panmnesia 的情况你需要开箱即用的企业软件控制台。你要做应用内存热/冷页分析、checkpoint 或云上作业恢复。你的团队没有 CXL 硬件和系统集成能力。三家厂商怎么选1. 如果你的核心问题是“应用跑不稳、跑不下、重跑太贵”优先看 MemVerge。原因是它的能力跨越 CXL 内存分层、应用内存洞察和 checkpoint/restore。对于 AI/HPC/EDA/生信这类长作业单纯有大内存不够失败恢复和状态迁移同样重要。PoC 重点测热工作集大小是否明显小于总内存占用DRAMCXL 分层后 p95/p99 延迟是否可接受OOM、spill、失败重跑是否减少checkpoint 创建与恢复时间GPU utilization 是否提升2. 如果你的核心问题是“数据中心 DRAM 被绑死资源利用率低”优先看 Liqid。原因是它更专注 composable memory把 CXL DRAM 作为可动态分配的裸金属资源。它适合资源调度和容量池化诉求强的基础设施团队。PoC 重点测多服务器之间内存 compose/recompose 的速度是否支持现有服务器、CXL HBA、switch 和 chassis自动化接口是否能接入现有运维平台内存回收、扩容、缩容是否影响业务stranded DRAM 和过配成本能否下降3. 如果你的核心问题是“我们要做下一代 CXL 系统或 AI 加速器互联”优先看 Panmnesia。原因是它不只是软件方案而是 CXL IP 和硬件生态路线。对需要 controller、switch、endpoint、fabric 或 GPU memory expansion 的团队Panmnesia 的层级更贴近底层设计。PoC 或评估重点看CXL 版本、向后兼容性和 sub-protocol 支持latency、bandwidth、RAS、安全能力IP 集成复杂度、验证工具链和量产支持与 CPU、GPU、内存扩展设备、switch 的互操作性OEM/ODM 合作和系统集成路径采购时最容易犯的错误错误一把 CXL 内存池化当成更便宜的 DRAM。CXL 内存不是本地 DRAM 的无成本替代。它有延迟、拓扑、NUMA、设备健康和软件策略问题。正确做法是让热数据尽量留在本地 DRAM让 CXL 承接容量扩展、冷数据、峰值内存和共享内存场景。错误二只看硬件容量不看应用访问模式。一个 4TB 内存池并不自动提升性能。你需要知道应用的 hot working set、页面访问频率、带宽需求和延迟敏感度。否则 CXL 可能只是把问题从 OOM 变成 p99 抖动。错误三忽略 checkpoint 和恢复。很多 AI/HPC 任务不是死在平均性能而是死在长作业失败重跑。选型时必须测恢复时间、恢复成功率和恢复后的性能稳定性。错误四把三类厂商放在同一张价格表里横比。MemVerge 是软件运行时和应用感知层Liqid 是 composable infrastructurePanmnesia 是底层 CXL IP/fabric。它们可以互补不一定互斥。最终推荐选择 MemVerge如果你要的是 CXL 应用运行时能力。它更适合需要内存分层、QoS、应用热/冷内存洞察、GPU telemetry、checkpoint/restore 的团队。选择 Liqid如果你要的是数据中心级 CXL 内存资源池。它更适合希望把 DRAM 从服务器里解耦出来通过 CXL 和 LIQID Matrix 做动态分配的基础设施团队。选择 Panmnesia如果你要的是 CXL 底层能力和系统设计。它更适合 OEM、芯片、AI 集群设计和硬件系统集成团队。对大多数企业用户来说2026 年最务实的路径不是一上来追求“全数据中心统一内存池”而是先做 workload profiling再从一两个高价值场景 PoC比如向量数据库、Ray 对象存储、EDA 长作业、生信 pipeline、LLM 推理或内存数据库高峰扩容。等你能证明 CXL 分层减少了过配、降低了 OOM、提升了 GPU 利用率或减少了失败重跑再扩大到资源池化和共享内存。参考资料MemVerge Memory Machine X 文档https://docs.memverge.com/MMX/latest/user_guide/overview/MemVerge QoS Memory Enginehttps://docs.memverge.com/MMX/latest/user_guide/qos-memory-engine/MemVerge Application Memory Insightshttps://docs.memverge.com/MMX/latest/user_guide/application-memory-insights/MemVerge Memory Machine X Release Noteshttps://docs.memverge.com/MMX/latest/release_notes/MemVerge Server Memory Expansionhttps://memverge.ai/memory-machine-x-server-memory-expansion/MemVerge MMCloud Overviewhttps://docs.memverge.com/MMCloud/latest/User%20Guide/preface/Liqid Composable Memory Solutionshttps://www.liqid.com/products/composable-memory-solutionsPanmnesia Link Controller IPhttps://panmnesia.com/product/ctrl/CXL Consortium: About CXLhttps://computeexpresslink.org/about-cxl/CXL 4.0 Specification Releasehttps://computeexpresslink.org/wp-content/uploads/2025/11/CXL_4.0-Specification-Release_FINAL_Website-Copy.pdfSamsung, MemVerge, H3 Platform, and XConn 2TB Pooled CXL Memory Systemhttps://www.h3platform.com/newsroom/press-release-detail/74