DisCEdge: Distributed Context Management for Large Language Models at the Edge

📅 2026/8/13 22:25:42
DisCEdge: Distributed Context Management for Large Language Models at the Edge
DisCEdge 论文总结与核心部分翻译一、主要内容总结本文聚焦于大语言模型(LLM)在边缘节点部署时的上下文管理挑战,提出了分布式上下文管理系统 DisCEdge,核心内容如下:问题背景:LLM 具有无状态特性,在地理分布式边缘节点部署时,用户上下文(会话历史、偏好等)的一致性管理面临难题。现有客户端存储上下文的方案会增加网络延迟和带宽开销,而原生文本存储的服务端方案存在冗余计算问题。核心设计:DisCEdge 采用令牌化(tokenized)格式存储和复制用户上下文,而非原生文本。系统由上下文管理器、LLM 服务、分布式键值存储和客户端组成,通过轻量级客户端驱动一致性协议保障数据一致性,同时避免重复的文本-令牌转换计算。实验验证:在真实边缘环境(Nvidia Jetson TX2、Mac M2 边缘节点与 Raspberry Pi4 客户端)中进行测试,结果显示:相较于原生文本存储方案,DisCEdge 中位响应时间最多提升 14.46%,节点间同步开销降低 15%;相较于客户端存储方案,客户端请求大小中位数减少 90%,且能保证上下文一致性。适用场景:适用于对延迟敏感、注重隐私的移动应用场景,如救援无人机、自动驾驶汽车、智能手机等,同时可扩展至多模态基础模型的上下文管理。二、创新点令牌化上下文存储/