🎯 跑 AI 划不划算,它先幫你測好
local.ai 不是排行榜,是幫你判斷「在家/自己電腦跑 AI 划不划算」的獨立實測站。 本站用 PK8 敘事式八格,從「一句話定位」講到「下一步」,把 local.ai 一次看懂。
緣起
我想在家跑 AI,但模型、硬體、設定六件事一次搞懂太難——於是找到 local.ai。
點我看詳細 →
目標
搞懂「跑 AI 划不划算」:它是什麼、誰做的、怎麼測、跟你有什麼關係。
點我看詳細 →
相關討論
它跟 Hugging Face、開源專案 exo、LocalAI 之間到底是什麼關係?
點我看詳細 →
證據承諾
本站內容以 local.ai 官方資料 + exo GitHub repo 為準,每格附證據。
點我看詳細 →
測三件事:品質、速度、成本
測完整組合,不是單一部件
Exo Labs 產出,中立不業配
不用自己一個一個試
🧭 跑 AI 划不划算,它先幫你測好
8 格填滿 → 檢查有沒有漏 · 點此回頁頂
PK8 敘事
你已經註冊了 wishia
六件事,一次搞懂太難
跑 AI 划不划算,它先幫你測好
先懂全貌,再深挖
👈 #1 一句話定位
一句話:local.ai 是一個「獨立的本機 AI 基準測試網站」,官方標語是 Independent local-AI benchmarks。
它做的事情很簡單:把「本機跑 AI」這件事,從一堆看不懂的 tok/s 數字,變成「哪台硬體 + 哪個模型 + 哪種量化,跑我的工作最快、最划算、最省電」的實測答案。
它不是雲端服務,也不是模型——它是一個比對工具,目前還在 early access。
👉 證據 / 驗證
- 官網首頁標題 = Independent local-AI benchmarks
- 導覽列含 Hardware / Models / Energy / Wall / Referrals
- About 頁:比較「完整組合」Model×Harness×硬體×引擎×量化
- 早期階段:Early access、可認領名字
👈 #2 需求由來
六件事,一次搞懂太難。想在自家電腦跑 AI,不是下載一個模型就好——你要同時決定:模型、硬體、代理框架、推理引擎、量化、運行時設定。
模型要挑哪顆?硬體跑得動嗎?量化要吃多少記憶體?同一顆模型在不同機器的表現完全不同——一般人不可能一次搞懂。
這就是 local.ai 存在的理由:它把「組合」當成一個整體來實測,不用你自己一個一個試。
👉 證據 / 驗證
- About 頁:比較完整組合 Model×Harness×硬體×引擎×設定×量化
- 六維度同時決定 → 決策複雜度高
- 同一模型多量化變體(Q4_K_M、IQ3_XXS…)
- 需要第三者幫你實測組合
👈 #3 核心利益
不用自己一個一個試,直接看數據選。local.ai 把「模型+硬體+設定」整套組合實測好,你只要看結果挑。
Models 頁把本機可跑的模型按「智慧度」排行:目前榜首 Step 3.7 Flash(78.8%),其次 DeepSeek V4 Flash 0731(77.5%)、Qwen3.6 27B(76.5%)。
每個模型有多個量化變體,榜單標示智慧、GAIA、GDPval 分數——數據齊全,照選即可。
👉 證據 / 驗證
- Models 頁 44 模型 · 224 量化變體
- Top:Step 3.7 Flash 78.8% / DeepSeek V4 Flash 0731 77.5%
- 分數 = 10% τ² + 35% GAIA + 55% GDPval
- 直接看數據選,不用自己試
👈 #4 怎麼運作
測三件事:品質、速度、成本。local.ai 用真實任務量三個指標:品質(Quality,實際工作負載)、速度(Speed,端到端任務時間)、成本(Cost)——不是只看單一模型跑分。
它算出 Intelligence Index(品質加權)、Tasks per hour(端到端速度)、Value Index = Intelligence/Joule(電費效率)。
同一台硬體上,會測多種模型×量化變體,例如 DGX Spark 上 Step 3.7 Flash 有 9 種量化可比較。
👉 證據 / 驗證
- Intelligence = 10% τ²-bench + 35% GAIA + 55% GDPval
- Decode/Prefill 在 cold 32k context 量測
- 任務時間 = prefill+decode 端到端,非單一 tok/s
- DGX Spark 上 Step 3.7 Flash 有 9 量化可比較
👈 #5 差異化 USP
測的是完整組合,不是單一部件。local.ai 同時比較 Model × Harness × 硬體 × 推論引擎 × 設定 × 量化 六個維度——跟一般只測「模型本身」的排行榜不同。
一般排行榜只回答「哪個模型最聰明」;local.ai 回答的是「這個模型在你這台機器、這種設定下,跑起來划不划算」。
品質、速度、成本三個維度同時看,才是真正能拿來做決策的數據。
👉 證據 / 驗證
- 六維度完整組合,非單一部件
- 同模型多量化變體(Q4_K_M、IQ3_XXS、NVFP4…)
- 硬體×模型×設定全排列實測
- 來源圖:dgx-spark.png(官方硬體示意)
👈 #6 可信度
Authority(誰背書):資料由 Exo Labs 產出。About 頁明說「The underlying speed and evaluation data are produced by Exo Labs.」——benchmark 數字都是 Exo Labs 實測的。
Exo Labs 的開源專案 exo(GitHub exo-explore/exo)是「在本機硬體跑 frontier AI」的知名工具,約 47,000 顆星、Apache-2.0。
中立不是業配:官方聲明與被測硬體/模型商無商業關係,Exo Labs 同時是開源 exo 的維護者,立場與「賣硬體/賣模型」的廠商不同。
👉 證據 / 驗證
- About 頁聲明數據來自 Exo Labs
- GitHub exo-explore/exo:~46.8k★、Apache-2.0
- 官方聲明與被測硬體/模型商無商業關係
- Social proof:46.8k★ 開源社群採用
👈 #7 跟你的關係
重點:我(夏哥)在 local.ai 註冊了 wishia 名字(2026-08 認領),用 Hugging Face 帳號登入。
我的個人頁 local.ai/wishia 顯示我的機器:MacBook Air M3 ×2(16GB),然後幫我推薦該跑哪個模型。
推薦結果:Best fit = GPT-OSS 20B(13.8GB);更聰明 = Qwen3.5 9B;更快 = Gemma 4 E4B IT(174 tasks/hr)。
👉 證據 / 驗證
- local.ai/wishia 頁存在,2026-08 認領
- 帳號連 Hugging Face @wishia
- 機器:MacBook Air M3 ×2(16GB each)
- 推薦:GPT-OSS 20B / Qwen3.5 9B / Gemma 4 E4B
👈 #8 下一步
重點:搞懂之後,可以做三件事。
- 照建議跑模型:依 wishia 推薦(GPT-OSS 20B)在 MacBook 上實際跑看看。
- 追蹤排行榜:models 頁會持續加新模型/量化,數據會變。
- 參與社群:Referrals 推薦碼、Wall 留言、認領名字。
本站 L2/L3 層會再把每一格深入展開(例如 exo 怎麼裝、量化是什麼)。
👉 證據 / 驗證
- Referral 榜:V2EX 2017 領先、NVIDIA 贊助 DGX Spark
- Wall 頁:early access 留言牆
- 硬體圖:m4-pro-mac-mini.png(官方)
- L2/L3 待建:obsidian note 已列三層結構
在深入任何一塊之前,先掃過 local.ai 這整個領域有哪幾塊、彼此怎麼接——這是 Adler《How to Read a Book》講的「檢視閱讀」:不深究,先建地圖。
🧩 local.ai 官方六大分區
- Hardware——硬體選項與相容性比較(DGX Spark/Mac 系列/RTX 系列等)· → 本站 L3 硬體評比深入頁
- Models——模型排行榜,可依廠商(DeepSeek/Qwen/Google...)篩選,Intelligence/τ²/GAIA/GDPval 分數 · → 本站 L3 量化教學深入頁
- Energy——能源效率數據,跑一個任務實際耗多少電
- Wall——社群留言牆,early access 用戶的實測回饋
- Referrals——推薦榜(V2EX、NVIDIA 贊助 DGX Spark 等已在榜上)
- About——測量方法論說明(本頁引用的六維框架就出自這裡)
local.ai 背後的引擎:→ exo 安裝教學(本站 L3 深入頁)——benchmark 數據由開源框架 exo 產出,這頁教你怎麼自己裝起來。
📐 測量框架:6 維度 → 3 結果 → 3 指數
測什麼組合:Model × Harness × Hardware × Inference Engine × Configuration × Model Variation(六個維度一起測,不是只測模型本身)
量出三個結果:Quality(真實工作負載評測)/Speed(端到端任務時間)/Cost(硬體+電費)
算成三個指數:Intelligence Index/Tasks per Hour/Value Index——這三個指數就是 Models 排行榜實際排序依據
只讀一個來源,被問「那 X 怎麼說」就答不出來。這一格比對多個獨立來源對同一爭議的講法,抓共識與分歧,下獨立判斷——不是複誦單一觀點。
🖥️ 爭議一:本機該買 Mac 還是 DGX Spark?
挺 Mac 的說法:2026 年 M4 Max Mac Studio 約 $1,999,頻寬是 DGX Spark 兩倍、更便宜也更省電;DGX Spark 官方 MSRP $3,999,現貨因記憶體缺貨已漲到近 $4,699。
挺 DGX Spark 的說法:它的溢價只在你真的需要 CUDA 生態、prefill 密集工作、或 70B+ 模型持續本機迭代(空氣隔離/法遵場景)時才划算——這些是 Mac 做不到的。
第三條路(混合):EXO Labs 實測把 Spark 拿來做 prefill、Mac Studio 做 decode,8B 模型上量到 2.8 倍加速——但 70B+ 的混合數據還沒公開。
👉 夏哥的判斷(示範,非定論)
兩派其實在吵不同的事:Mac 陣營談「大多數人的性價比」,DGX Spark 陣營談「特定場景的不可取代性」。對「我只是想在家跑模型試試看」的小白,Mac 系列(M4 Pro Mac mini/M4 Max Studio)是預設答案;只有明確踩到 CUDA 專屬工具鏈或 70B+ 持續迭代這兩個條件,才該考慮 DGX Spark。
💰 爭議二:本機跑真的比雲端划算嗎?
挺本機的說法:雲端月花超過 $500–700 且用量穩定,本機通常 18–24 個月回本,損益兩平約在每天 5–15M tokens;一張二手 RTX 3090(約 $800)可抵掉每月 $50–500 的 API 費用,2 週到 5 個月回本。
挺雲端的說法:對 GPT-4o-mini/Gemini Flash 這類便宜模型,低用量時雲端更划算,硬體成本永遠回不了本;別忘了硬體+維護+電費+架設時間都是真成本——花 20 小時架本機環境,以時薪 $100 算就是 $2,000 隱藏成本,還沒開始省錢就先虧了。
👉 夏哥的判斷(示範,非定論)
這不是二選一的問題,是路由問題:高量、重複性任務走本機;少數真的需要頂級模型品質的 prompt 保留雲端額度。「划算」取決於你的用量穩不穩定、值不值 20 小時的架設時間——local.ai 存在的意義,正是把這筆帳算清楚給你看,而不是讓你憑感覺猜。