算力平权的破局者:芯展速跳出堆料内卷,用存储重构中小企业AI落地路径

📅 2026/7/24 12:20:51
算力平权的破局者:芯展速跳出堆料内卷,用存储重构中小企业AI落地路径
2026世界人工智能大会WAIC上存储是一条绝对的主线几乎所有硬件厂商都在反复传递同一个行业共识存算协同是决定大模型推理上限的核心变量。资本持续向存储赛道倾斜技术迭代的速度肉眼可见但热闹喧嚣背后一道难以弥合的行业鸿沟正在不断拉大。过去二十年GPU算力实现了近60000倍的跨越式提升可配套显存容量仅仅增长16倍算力与存储的增速严重失衡催生了行业无法回避的“内存墙”难题。不管是消费级RTX显卡还是数据中心顶配H200、A100服务器芯片算力利用率常年卡在30%60%区间昂贵的计算单元只能长时间等待数据调度持续空转。而随着多轮对话、长文档分析、代码智能体等应用普及长上下文推理成为用户日益迫切的需求而长上下文推理阶段的KV Cache会呈指数级膨胀进一步放大显存容量不足的矛盾。行业给出的解决方案却自带天然门槛头部云厂商的标准缓存集群起步就要部署三四台服务器整套硬件投入动辄上百万即便开源社区有零散的KV Cache卸载工具也需要专业技术团队长期运维调优中小企业、高校实验室、初创研发团队根本无力承担硬件与人力的双重成本。一边是全行业加速拥抱大模型的时代浪潮一边是算力资源高度集中、中小从业者“买不起、跑不动、用不好”的现实困境。整个市场都在等待一套轻量化、低成本、可快速落地的普惠存算方案。今年WAIC成立仅三年的国产存储厂商芯展速交出了自己的答案——自研AI90 FaaS存算协同架构联合威尔创新、思腾合力两家服务器厂商完成全链路实机验证仅凭消费级RTX 5090显卡就跑出对标企业级高端服务器的推理性能引来了我们的关注。展会间隙我们与芯展速产品副总裁许玮、高级FAE总监杨泽宏展开深度对话试图读懂这家由行业老兵组建的新锐企业如何跳出行业堆料内卷用一套朴素务实的技术路线打通中小企业使用AI的最后一道门槛。三年新锐二十载积淀一家不走寻常路的全栈存储厂商当下市场里的AI硬件玩家大多有着清晰的业务边界很少有厂商能同时打通存储介质、连接芯片、AI调度软件三条技术链路芯展速是国内为数不多的“存-连-管”全栈厂商。2023年才成立的时间节点很容易让人误以为芯展速是跟风入局的创业团队但深挖团队背景便能发现这家年轻公司的内核是一群深耕存储、服务器行业二十年的老兵经历了多代PCIe接口、企业级SSD产品的迭代周期常年扎根数据中心与边缘工作站一线亲眼见证了算力资源分配失衡带来的行业痛点。杨泽宏坦言大厂成熟的KV Cache分层方案技术上完全可行但从诞生之初就注定与中小客户无缘。“一套标准缓存集群至少需要三四台服务器搭配使用硬件采购、机房部署、专人运维整套成本压下来初创公司、高校实验室根本没有落地的条件。芯展速最核心的初衷就是把大型数据中心成熟的分层缓存技术压缩到单台工作站中让普通团队也能用上。”不同于市面上单纯售卖硬件的厂商芯展速从底层实现全链路自研企业级SSD主控、固件、PCIe Retimer/Redriver信号连接芯片全部自主开发本次配套AI90方案亮相的PT200Z AI SSD采用自研pSLC存储介质颗粒分测、模组设计环节完全自主把控仅硬件组装交由代工厂完成从根源上摆脱了对外媒、进口芯片的依赖。许玮补充道芯展速从成立之初就定下了差异化的市场路线避开行业扎堆争夺的万卡级大型数据中心赛道将核心目标客群锁定中小企业研发团队、私有化部署机构、高校实验室。产品矩阵也依照客户需求分层规划当下主力AI90面向中小B端多卡工作站集群后续会推出适配AI PC、个人本地大模型的轻量化AI30针对超大型算力中心的AI100、AI200系列则延后布局先解决市场最迫切的普惠算力需求从小场景积累落地经验再逐步向上拓展大客户市场。更独特的一点是芯展速的行业定位他们不生产GPU、不自研服务器整机只输出存储硬件与调度中间件以底层技术底座的身份和整机厂商形成互补共生的生态关系这也是本次WAIC能够同步携手威尔创新、思腾合力联合布展、同步完成实机演示的核心原因。解码AI90重构存算底层逻辑破解困住行业的“内存墙”瓶颈本届WAIC世博展览馆的主题演讲台上许玮正式对外发布AI90 FaaS for AI软硬一体化推理加速架构这也是芯展速针对算存失衡痛点打磨出的系统性解决方案。在他的分享中AI90的核心思路跳出了行业“单纯扩容高端显存”的惯性思维用分层存储的思路重新分配算力与缓存负载从系统层面彻底释放GPU闲置算力。整套方案的核心架构分为两大支撑板块一是KV Cache分层卸载体系二是自研智能P2P互联技术二者相辅相成补齐了当前AI推理领域两大难以解决的短板。传统大模型推理流程中一旦GPU显存被KV缓存占满操作系统vLLM会启动通用内存淘汰机制清理数据被清理的对话、文档上下文只能重新计算在一个长上下文或是多租户的推理环境下动辄带来数十乃至成百上千秒的响应延迟。而AI90自研管理中间件开辟了独立于系统内存调度的专属数据通道将低频、长期留存的KV Cache自动分层卸载至PT200Z高速AI SSD搭建起HBMDRAMSSD三级虚拟存储池TB级的扩展容量可以持续承接缓存数据避免重复计算带来的性能损耗。承载这套分层架构的PT200Z SSD是专为AI高频读写场景定制的硬件底座。它采用pSLC存储级介质最高可达100DWPD耐久度对比普通TLC SSD 1-3的DWPD数值耐久能力形成碾压级优势45微秒的读取延迟、字节级寻址特性完美适配KV Cache碎片化、反复擦写的工作负载能够支撑7×24小时不间断推理五年运行周期内不会出现明显性能衰减。杨泽宏也解释了选用pSLC介质的考量“短期采购成本确实高于普通闪存但放到全生命周期测算它的磨损损耗、替换成本大幅降低从写入寿命和维护成本乃至性能收益来看对于预算有限的中小企业来说长期使用反而更划算。”智能P2P互联则瞄准消费级显卡与生俱来的通信短板。原厂RTX系列显卡会屏蔽GPU直连通道多卡并行推理时数据必须经过CPU中转传输延迟高达10微秒以上严重损耗集群并行算力。AI90通过驱动层重定向技术无需修改显卡BIOS、不影响硬件质保就能实现GPU之间数据直连将传输延迟压缩至数百纳秒到1微秒区间8卡5090集群实测推理性能提升5.8倍彻底打通消费级多卡集群的扩展瓶颈。目前方案已完整兼容3090、4090、5090全系NVIDIA显卡完成AMD 7900系列适配后续还会持续推进国产算力卡的兼容开发。整套技术架构的价值在WAIC现场两台合作厂商的工作站上得到了直观验证。4卡RTX 5090集群运行Llama 3 70B大模型搭载AI90前后的数据对比极具冲击力Token吞吐量从120 tk/s飙升至610 tk/s整体性能提升5.1倍64K超长上下文首Token延迟从27.99秒骤降至0.564 秒响应速度提升近50倍GPU显存利用率从原本30%-40%提升至 85%95%长期存在的算力空转问题得到根治。同时方案具备“越长・越优”的特性输入文本、对话上下文越长加速效果越突出完美适配长文档解析、代码生成、多轮历史对话等复杂场景原生支持128K以上超长上下文窗口。相较于市面上同类缓存卸载方案AI90最鲜明的差异化优势在于它极致的普惠属性。无需更换价格高昂的HBM企业级服务器企业现有的消费级RTX工作站就能直接改造标准硬件环境下一天内就能完成驱动安装、推理框架适配、模型完整跑通不用配备专业存储运维团队同时原生兼容vLLM、TensorRT-LLM等主流推理框架客户无需修改业务代码开箱即可投入使用PT200Z SSD支持按需叠加扩容虚拟显存容量可随业务增长弹性拓展不会造成硬件资源浪费。许玮这样总结AI90的设计内核“行业长久以来陷入比拼单卡显存容量的内卷我们换了一条更务实的工程路径用分层存储稀释HBM显存带来的高昂成本让每一块GPU算力都能产出更多Token这才是真正贴合中小企业真实需求的解决方案。”生态共生携手整机伙伴共建普惠算力小方案撬动广阔市场本次WAIC展会上芯展速同步落地威尔创新、思腾合力两大合作展台两套差异化的整机合作模式完整勾勒出芯展速的生态共建思路也印证了这家存储厂商“不单打独斗联合全产业推平算力门槛”的长期规划。威尔创新是深耕AI定制服务器领域的高新技术企业自研4U空间容纳8张计算卡的高密度GPU整机产品广泛落地政企、国央企、传统行业私有化算力项目。双方将AI90存算协同底座、智能调度软件深度嵌入威尔创新液冷GPU工作站面向对稳定性、硬件密度有高要求的政企客户交付软硬件一体化整机方案实打实验证消费级硬件承接企业级业务的可行性。另一边的思腾合力稳居IDC中国加速服务器榜单TOP 8是NVIDIA精英级合作伙伴、华为昇腾APN钻石伙伴拥有千卡级AI算力集群的完整交付经验。双方的合作聚焦互联网初创团队、AI研发工作室、中小算力租赁厂商针对多卡集群推理、LoRA模型微调、日常模型开发场景完成全链路调优打通AI90缓存调度系统与思腾合力自研集群调度平台为中小算力服务商提供低成本、高吞吐的集群加速方案。选择与整机厂商深度合作背后是芯展速清晰的分工逻辑。芯展速专注存储硬件、调度中间件的底层研发服务器厂商深耕整机制造、渠道交付、行业客户触达双方能力互补不用投入巨额资金搭建整机产线、拓展线下渠道。杨泽宏用一个很形象的比喻概括这种合作关系“我们不会自己下场做服务器整机专业的事交给专业的合作伙伴我们输出存算协同的核心技术能力为整机厂商赋能。”放眼长期生态布局芯展速采取分层推进的合作策略。短期持续拓展服务器 ODM、OEM 厂商完成更多品牌整机的适配调试中期联动PC、AI PC整机品牌推出面向个人开发者的轻量化AI30方案长期对接国产算力芯片厂商、各大高校科研机构搭建完整的国产化普惠算力生态。许玮透露后续团队会逐步开放标准化适配工具链简化硬件厂商接入AI90方案的流程让分层存算架构成为行业通用的低成本落地路径。算力平权藏在芯展速朴素的产业理想里当行业头部企业扎堆堆砌HBM高端硬件争先恐后抢夺大型数据中心客户时芯展速主动选择了一条更朴素、更贴近市场底层需求的赛道。他们看见被行业主流方案忽略的中小企业摒弃高价堆料的捷径依靠成熟、轻量化、低成本的分层存储技术一点点消解高端算力构筑的资源壁垒。许玮在采访中提出了一个极具行业参考价值的判断AI产业发展已经走过“单纯比拼算力规模”的阶段正式迈入“以效能为核心”的全新周期。一味堆叠高端GPU只能持续抬高行业落地成本无法从根源上解决中小企业的算力困境存算协同才是实现算力普惠的核心抓手。芯展速打造AI90、搭建产业生态的终极目标从来不是推出一款单项性能顶尖的硬件单品而是打破算力资源的垄断格局让每一家中小企业、每一位独立开发者、每一所高校实验室不用承担天价硬件采购成本仅凭手边现有的消费级显卡就能流畅运行大模型、搭建高并发超长上下文推理服务让“算力平权”不再是一句空洞的行业口号。杨泽宏在访谈尾声聊起了团队的底层理想。印刷术实现了知识的普及互联网打通了信息传递的边界而AI是解放人类创造力的下一代基础设施。算力资源的高度集中就像贵族垄断图书馆只会阻断各行各业的创新活力芯展速所有的技术研发、生态合作最终都落脚于降低AI使用门槛让各行各业的从业者不必被高昂硬件成本束缚依托平价硬件释放AI的产业价值。这条立足真实客户痛点、拒绝盲目堆料内卷的朴素路线或许会重新定义国产AI存储厂商的发展路径也为整个行业提供了一条兼顾技术创新与产业普惠的全新思路。