如何用多台Mac搭建本地AI集群:exo大模型推理完整上手

如何用多台Mac搭建本地AI集群:exo大模型推理完整上手 如何用多台Mac搭建本地AI集群exo大模型推理完整上手【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exoexo 把多台 Mac 和服务器组成一个本地AI集群让你能跑下单台设备内存装不下的模型并且节点越多推理越快。适合手里有几台 Apple Silicon 设备、想在本地跑大模型的个人和开发者。235B参数模型跑在本地从一个真实痛点说起一个 235B 参数量的大模型权重文件动辄几十 GB任何一台 MacBook 的统一内存都装不下。常规选择是买更高配的单台机器或者付钱用云端 API前者贵后者数据要出内网。exo 针对的场景是你手上已经有 2~4 台 Apple Silicon 设备Mac Studio、MacBook Pro、Mac mini它们各自内存有限但合起来足够大。exo 把这些设备拼成一台大机器模型按块切分后分布在多台设备上推理结果直接通过本地 API 提供。仓库截图4 台 512GB 的 M3 Ultra Mac Studio 同时运行 DeepSeek v3.18-bit与 Kimi-K2-Thinking4-bit。一分钟看懂exo把设备拼成一台大电脑工作原理类似存储池化模型不是在某一台机器上完整加载而是被切成分片每块放到某台设备上生成 token 时数据沿设备链路接力传递。区别在于 exo 的切分是自动的——它会先感知网络拓扑哪两台设备之间延迟低、带宽高再决定用流水线并行还是张量并行把模型放在该在的地方。每台运行 exo 的设备自动互相发现不需要手工配置 IP 或端口每台都暴露一个 API 和仪表板默认 http://localhost:52415从任意一台都能操作整个集群。3条命令跑起来从安装到打开仪表板macOS 上最省事的路径是官方 App需 macOS Tahoe 26.2 及以上brew install --cask exo。从源码运行关键步骤只有三步需先装好 uv、node、rustgit clone https://gitcode.com/GitHub_Trending/exo8/exo cd exo/dashboard npm install npm run build uv run exo第三条命令执行后仪表板和 API 就开在 http://localhost:52415/在界面上选模型、下载、对话。Linux 上步骤相同但注意当前只在 CPU 上跑。核心实现拆解发现、拓扑、放置三件事设备发现基于 libp2p 的 Rust 网络层rust/networking/让同网段设备自动组群可用EXO_LIBP2P_NAMESPACE隔离多个集群避免误加入别人的。放置决策src/exo/master/placement.py 根据实时拓扑、各节点内存余量和链路带宽计算模型的所有可行切分方案流水线/张量、节点组合。/instance/previews接口会列出全部方案和每台节点的内存占用增量让你先预览再部署。MLX 推理引擎src/exo/worker/engines/mlx/ 是真正执行推理的部分基于 MLX 做张量并行与分布式通信auto_parallel.py负责在多卡/多机间切分模型权重。实测数据张量并行比单节点快多少仓库给出的核心性能数字对比单机基线张量并行2 台设备最高提速 1.8 倍4 台设备最高提速 3.2 倍——加机器是变快不只是变大。RDMA over Thunderbolt 5设备间延迟降低 99%这是 macOS 26.2 新能力exo 首发支持。4 台 M3 Ultra Mac Studio每台 512GB上集群以张量并行 RDMA 方式运行了 Qwen3-235B8-bit、DeepSeek v3.1 671B8-bit和 Kimi K2 Thinking4-bit三个模型测试截图收录在 docs/benchmarks/。仓库自带基准工具 bench/exo_bench.py测量方法写在 bench/METHODOLOGY.md默认关闭 KV 前缀缓存保证冷启动测量、禁用 EOS token 保证生成长度一致、TPS 由服务端逐 token 打点计算同时以 1Hz 采样 GPU 利用率、温度与整机功耗数字可复现。进阶与生态基准工具、API 兼容和模型管理推理基准与评估除 exo-bench 外还有 bench/prefill_decode_bench.py 专门测 prefill/decode 分离部署以及 exo_eval 跑工具调用等质量评估。API 兼容src/exo/api/ 提供 OpenAI Chat Completions、Claude Messages、OpenAI Responses、Ollama 四种接口现有客户端和 OpenWebUI 之类的工具可以直接指向本地端口使用。模型管理模型默认从 HuggingFace 下载缓存支持通过/models/add加载自定义模型卡EXO_OFFLINEtrue可离线运行EXO_MODELS_DIRS可以把模型放到外置 SSD。接口细节见 docs/api.md。边界与适用性谁不适合硬件门槛在哪先说清楚不行的地方Linux 目前只跑 CPUGPU 支持还在开发中想用 NVIDIA GPU 服务器的话现阶段只能观望。RDMA 加速有硬性门槛设备必须带 Thunderbolt 5M4 Pro Mac mini、M4 Max Mac Studio/MacBook Pro、M3 Ultra Mac Studio、系统必须 macOS 26.2、集群内设备要两两直连且线缆支持 TB5、所有设备系统版本必须完全一致连 beta 号都要相同。模型以 mlx-community 的 MLX 格式为主不是所有模型都有现成权重。如果你只是单机跑 7B 以下的小模型组集群纯属浪费——exo 的价值在单台放不下的场景。结尾选型建议如果你有多台 Apple Silicon 设备且目标是本地跑 70B 以上的大模型exo 目前是门槛最低的方案装 App、插 TB5 线、开仪表板不用写部署脚本。如果主力平台是 Linux GPU 服务器建议等 GPU 支持落地后再评估小模型单机场景则无需引入集群复杂度。【免费下载链接】exoRun frontier AI locally.项目地址: https://gitcode.com/GitHub_Trending/exo8/exo创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考