分散式推論 MLX 引擎 RDMA over Thunderbolt 開源

🖥️ exo 安裝教學——把你的 Mac 接成一台 AI 叢集

L2 全景導覽提到 local.ai 的 benchmark 數據由 Exo Labs 提供——這頁是 L3 分析閱讀:挑這一個子題徹底讀通,讀完能自己動手裝。

緣起

L2 全景導覽掃過 local.ai 六大分區時,發現 benchmark 數據的產出者是 exo,但沒細講它是什麼、怎麼裝。

點我看詳細 →

目標

讀完這頁,能自己在 Mac 上把 exo 裝起來、跑起來,看懂它怎麼把多台裝置接成一個 AI 叢集。

點我看詳細 →

相關討論

exo、LocalAI(localai.io)、Ollama 常被搞混——這三個是完全不同的專案,先釐清再裝。

點我看詳細 →

證據承諾

內容以 github.com/exo-explore/exo 官方 README 為準,2026-08-15 WebFetch 核實,非憑記憶轉述。

點我看詳細 →
の字序:中下#1 → 順時針推完 #8。8 格填滿才准查漏。
#4 左上📥

安裝步驟

4 行指令,從 clone 到跑起來
怎麼裝
#5 中上🚀

啟動與存取

dashboard 在 localhost:52415
怎麼用
#6 右上🔌

支援哪些 API

OpenAI/Claude/Ollama 相容
相容性
#3 左中🧰

前置需求

Xcode/uv/node/rust/macmon
裝之前

🖥️ exo 安裝教學

L3 分析閱讀 · 點此回頁頂

深入子頁
#7 右中⚠️

常見限制

多機加速要 Thunderbolt 5
先知道
#2 左下🤔

為什麼需要它

一台裝置的 VRAM 不夠時的解法
動機
#1 中下🧩

這是什麼

把你的裝置接成一個 AI 叢集
定義
#8 右下➡️

下一步

裝完回 L2/L4 看它在硬體評比中的位置
接下來

👈 #1 這是什麼

一句話:exo 是開源的分散式 AI 推論框架,官方原話「exo connects all your devices into an AI cluster」——把你手上多台裝置接成一個 AI 叢集。

技術上用 MLX(Apple 的機器學習框架)當推論引擎,裝置之間用 MLX distributed 通訊。

👉 證據 / 驗證

  • 官方 repo:github.com/exo-explore/exo
  • README 首句原話已核實
證據:github.com/exo-explore/exo README,2026-08-15 WebFetch 核實。

👈 #2 為什麼需要它

一句話:一台 Mac 的記憶體不夠跑大模型時,exo 讓你把多台裝置的記憶體與算力接在一起用,不用買一台更貴的機器。

這正好接上 L4「多方怎麼看」的爭議一:EXO Labs 自己實測過把 DGX Spark 跟 Mac Studio 混合使用(Spark 做 prefill、Mac 做 decode),8B 模型測到 2.8 倍加速——exo 的分散式能力就是這類混合方案的底層引擎。

👉 證據 / 驗證

  • 自動探索:裝置開 exo 會自動互相發現,不用手動設定
  • Topology-aware placement:自動決定模型怎麼切、放哪
證據:github.com/exo-explore/exo README「Devices running exo automatically discover each other」;EXO Labs 混合實測部落格,2026-08-15。

👈 #3 前置需求

macOS:Xcode、uv、node、rust(nightly 版)、macmon

Linux:uv、node(v18 以上)、rust(nightly 版)

硬體:裝置要有足夠 VRAM/統一記憶體;若要用 RDMA 加速多機通訊,需要 Thunderbolt 5(M4 Pro Mac mini 或更新的機種才有)。

👉 證據 / 驗證

  • 裝之前先確認這 5 個工具都有
  • 不確定有沒有 Thunderbolt 5:查你的 Mac 型號規格頁
證據:github.com/exo-explore/exo README「Prerequisites」段落,2026-08-15 WebFetch 核實。

👈 #4 安裝步驟

官方 README 的原始指令(macOS,從原始碼裝):

git clone https://github.com/exo-explore/exo
cd exo/dashboard && npm install && npm run build && cd ..
uv run exo

三行做完三件事:抓原始碼 → 建 dashboard 前端 → 用 uv 直接跑起來(不用另外裝 python 虛擬環境,uv 會處理)。

👉 證據 / 驗證

  • 跑完 uv run exo 不報錯即算成功
  • 前置需求(#3)沒裝齊,這步會卡
證據:github.com/exo-explore/exo README「Installation」逐字擷取,2026-08-15 WebFetch 核實。

👈 #5 啟動與存取

跑起來後:dashboard 開在 http://localhost:52415/,用瀏覽器打開就能看到裝置狀態、模型載入情形。

API 端點也在同一個服務上——不用另外設定,跑起來就同時是 dashboard 也是 API server。

👉 證據 / 驗證

  • 瀏覽器開 localhost:52415 看得到畫面=跑成功
證據:github.com/exo-explore/exo README「Dashboard runs at http://localhost:52415/」,2026-08-15。

👈 #6 支援哪些 API

相容三種常見介面:OpenAI Chat Completions、Claude Messages、Ollama API。

意思是:如果你原本的程式是打這三家的 API 格式,改個 base URL 指到你自己的 exo 服務,程式碼幾乎不用改。

👉 證據 / 驗證

  • OpenAI Chat Completions ✓
  • Claude Messages ✓
  • Ollama API ✓
證據:github.com/exo-explore/exo README「API Access」段落,2026-08-15 WebFetch 核實。

👈 #7 常見限制

單機沒問題,多機加速要看硬體:exo 用 RDMA over Thunderbolt 把多裝置間的延遲砍掉 99%,但這需要 Thunderbolt 5——只有 M4 Pro Mac mini 或更新的機種才有。舊機種仍可組叢集,只是通訊速度沒有 RDMA 加成。

這跟 L3 硬體評比頁講的「Thunderbolt 5」是同一件事,選硬體時可以互相對照。

👉 證據 / 驗證

  • RDMA:99% 延遲下降(官方數字)
  • 門檻:Thunderbolt 5,即 M4 Pro Mac mini 以上
證據:github.com/exo-explore/exo README「RDMA over Thunderbolt」段落,2026-08-15 WebFetch 核實。

👈 #8 下一步

裝完之後:

  • L4 多方怎麼看,看 exo 混合方案在「Mac vs DGX Spark」爭議裡扮演什麼角色
  • L3 硬體評比,確認你的裝置有沒有 Thunderbolt 5(決定要不要走 RDMA 加速)
  • L3 量化教學,了解怎麼選模型量化等級,讓單機也能塞下更大模型

👉 證據 / 驗證

  • 本頁內容全部來自 exo-explore/exo 官方 README
  • 抓取日期:2026-08-15
證據:github.com/exo-explore/exo,2026-08-15 WebFetch 核實。
📋 行動計畫 · 可勾選追蹤:0/0 ↺ 重置
ai.nqio.dev · exo 安裝教學(L3 深入子頁)· 數據來源:github.com/exo-explore/exo