exo 分布式推理完整指南:用家里的设备组 AI 集群,本地跑起 235B 大模型

📅 2026/8/24 6:31:43
exo 分布式推理完整指南:用家里的设备组 AI 集群,本地跑起 235B 大模型
exo 分布式推理完整指南用家里的设备组 AI 集群本地跑起 235B 大模型【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo多数人以为给推理加机器一定更快。数据恰好相反用传统 TCP 方案llama.cppQwen3 235B 从单机的 20.4 t/s掉到 4 节点集群的 15.2 t/s。exo 是一个本地 AI 集群框架专门解决这类问题——它用雷电总线上的 RDMA 网络把大模型自动切分到多台设备机器越多整体越快。为什么加机器集群反而更慢多数人第一次做多机推理体验都不太好。瓶颈在网络TCP 链路把大量时间花在等待数据在机器之间搬运机器越多搬运越多。以 Qwen3 235B8-bit为例llama.cpp 单机 20.4 t/s2 节点 17.2 t/s4 节点 15.2 t/s加机器反而越来越慢。还有第二个问题即“放得下吗”235B 参数的模型单台设备的内存根本装不下出路似乎只剩买更大的机器。exo 做了什么把多台设备连成一个集群说白了就是把你手头的设备连成一个 AI 集群并且加机器真的会加速。exo 自带设备自动发现每台运行它的设备会自己找到对方不需要手动配置它做拓扑感知自动并行根据实时设备内存和每根链路的带宽自动决定模型怎么切还支持张量并行官方数据是 2 台设备最高 1.8 倍加速4 台最高 3.2 倍。API 兼容 OpenAI Chat Completions、Claude Messages、Ollama 等格式现有工具可以直接接入。硬件门槛最低与推荐配置最低配置任意一台 Apple Silicon Mac 就能跑单机体验macOS 客户端要求 macOS Tahoe 26.2 及以上终端一行brew install --cask exo装好。内存取决于模型Llama-3.2-1B 几 GB 就够DeepSeek 671B8-bit则需要 4 台 × 512GB 统一内存。推荐配置2-4 台带雷电 5 的机器M3 Ultra / M4 Max Mac Studio、M4 Pro Mac Mini、M4 Max MacBook Pro每台 128GB 以上统一内存用 TB5 线缆两两直连。踩坑提醒Mac Studio 上紧挨网口的那个雷电 5 口不能用于 RDMALinux 目前只跑 CPUGPU 支持还在路线图上。从安装到第一次对话的 10 分钟先装。macOS 上打开终端一行命令brew install --cask exo想从源码跑的话先克隆仓库https://gitcode.com/GitHub_Trending/exo8/exo然后cd exo/dashboard npm install npm run build构建仪表盘再uv run exo。浏览器会自动打开 http://localhost:52415 的仪表盘和 API。然后等。同一网络下的设备会自动互相发现不用填 IP。仪表盘实时显示每个节点的内存和状态从列表挑一个模型exo 会自动列出所有可行的切分方案选一个它负责下载权重、加载并进入就绪。最后聊。用内置聊天框或把任何 OpenAI 兼容客户端的 base URL 指到 localhost:52415。下面这张 4 机环形拓扑就是 exo 自动算好的切分结果。实测表现三组多节点生成速度数据场景长文档问答。Qwen3 235B8-bit4 × M3 Ultra Mac Studio张量并行 RDMA跑出 31.9 t/s比单机 19.5 t/s 快 63.6%同样 4 台机器走 TCP 方案只有 15.2 t/s。场景旗舰模型体验。DeepSeek V3.1 671B8-bit单机 21.1 t/s2 节点 27.8 t/s4 节点 32.5 t/s每加一台机器整体继续上升和 TCP 方案正好相反。场景推理模型。Kimi K2 Thinking 1T4-bit单机装不下2 节点 21.6 t/s4 节点 28.3 t/s提升 31%。想自己复测可以用内置的 bench/exo_bench.py 测不同切分方案下的 prefill 和生成速度。四个高频问题与解法两台机器互相发现不了→ 先确认在同一局域网如果要走 RDMA所有设备的系统版本必须完全一致连 beta 版本号都要一样否则 RDMA 端口之间发现不了。RDMA 开了但没提速→ 检查两点每台设备是否和其余每台都有物理直连全网格线缆是否确实是 TB5 规格。想开 RDMA 不知道怎么开→ 关机后长按电源键进恢复模式终端执行rdma_ctl enable重启即可剩下的 exo 自己处理。该功能要求 macOS 26.2。模型显存/内存装不下→ 换低比特量化版或者加一台机器放置预览接口见 docs/api.md可以在下载前就告诉你放不放得下。今晚就能做的最小实验⚡ 找一台 Mac有两台更好。打开终端执行brew install --cask exo给应用网络权限浏览器打开 http://localhost:52415挑 Llama-3.2-1B-Instruct-4bit 这类小模型加载发一句“介绍一下你自己”。看到拓扑图里出现机器、回复开始流式输出你的第一个 AI 集群就成了——下一步只需要再接入第三台机器。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考