手头的闲置设备能拼出多快的 AI 推理集群? 📅 发布时间:2026/8/31 8:20:58 👁 浏览次数: 手头的闲置设备能拼出多快的 AI 推理集群【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo云推理账单越开越贵家里的 Mac 和 Linux 盒子大半时间却闲置着。exo 是一款开源的 AI 集群工具把你已有的设备自动发现、自动组网把一个大模型切分到多台机器上推理接口直接开在本地。 它是怎么把设备连成一体的先放下分布式理论只讲原理。想象几个人在一间厨房合做一桌菜每人负责一道工序半成品按顺序传递大家共用一张谁做到哪一步的清单。exo 对设备做的事与此相同每台机器承担模型的一部分计算中间结果沿链路传递。自动发现任何一台跑起 exo 的设备都会在同网段找到同伴无需手动配置。拓扑感知自动并行它查看每台机器的资源以及每条链路的时延和带宽再决定模型的哪部分放到哪台机器。RDMA 通道Apple 设备之间走 RDMA over Thunderbolt加机器时模型反而跑得更快。exo 内置仪表板4 节点 Mac Studio 集群同时运行两个大模型右侧面板可直接拉起新实例 从零到第一次出字接下来是最实际的部分怎么看到第一个 token。环境准备拉取代码git clone https://gitcode.com/GitHub_Trending/exo8/exo按 README.md 里的清单装好前置依赖Xcode提供 Metal 工具链、brew、uv、node、rust。已装 Nix 的话直接运行nix run .#exo否则按 README 从源码构建。启动后设备自动互相发现每台机器在 http://localhost:52415 提供内置仪表板。在模型列表里选一个权重会从 HuggingFace 自动下载并缓存点击拉起实例等状态变为就绪在对话里输入第一个问题。Mac 侧的推理走 MLX 引擎是针对 Apple 芯片优化的后端。⏱️ 实测表现到了看真实数字的环节它到底快多少。场景是4 节点 M3 Ultra Mac Studio集群跑Qwen3 235B8-bit。RDMA 路径下解码速度达到31.9 t/s同一集群走 TCP 路径时这个速度有超过 100% 的差距。4 节点 Mac Studio 集群上exo 的 RDMA 路径跑 Qwen3 235B 达到 31.9 t/s领先 TCP 对比项 扩容与调优能跑通之后下一个问题是机器不够用了怎么办。先说混合节点集群不只有 Mac带NVIDIA GPU的 Linux 机器同样可以加入。下面这张拓扑是 3 台 Linux GPU 机器加 1 台 MacBook Pro 组成的 5 节点集群。exo 控制台拓扑视图3 台 Linux NVIDIA GPU 机器与 1 台 MacBook Pro 加入同一个 AI 推理集群混合节点扩容顺序先把 MacBook 单节点跑稳再逐台加入更多 Mac最后接入 Linux GPU 机器每加一台就在仪表板确认链路。分配是自动的模型怎么切分由放置策略按节点性能和链路质量计算实现逻辑见 placement.py。参考文档把智能故障转移列为日常策略之一节点掉线时任务会转移到其他节点不需要人工重新分配。exo 集群拓扑图每个节点的内存占用、温度与功耗实时可见便于核对负载是否分布均匀对外接口方面docs/api.md 列出了兼容的 API 格式你现有的客户端基本不用改。先从手边两台机器开始clone 仓库把第一个模型在 exo 上跑起来。exo 是一个本地 AI 推理集群工具让前沿模型跑在你自己拥有的设备上。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考