🔢 量化教學——為什麼 14GB 的模型能塞進 3.5GB
L1 開場白提過「量化」是搞懂 local.ai 要一次弄懂的六件事之一——這頁 L3 分析閱讀把它徹底講通。
緣起
local.ai 的 Models 排行榜上每個模型都標了量化等級(Q4/Q5/Q8...),不懂這代表什麼就沒法選。
點我看詳細 →目標
讀完能自己判斷:這台機器該選哪個量化等級,知道自己在拿什麼換什麼。
點我看詳細 →相關討論
GGUF、GPTQ、AWQ 常被混著講——本頁只深入 GGUF(local.ai 生態最常見),其他兩種留待之後有真需求再展開。
點我看詳細 →證據承諾
數字(GB/perplexity)來自公開量化技術文獻整理,非官方原始論文逐字核對,帶不確定性標註。
點我看詳細 →量化等級對照
K-quants 混合精度
怎麼選
GGUF 格式是什麼
🔢 量化教學
L3 分析閱讀 · 點此回頁頂
深入子頁速度怎麼算
為什麼需要量化
這是什麼
下一步
👈 #1 這是什麼
一句話:量化(quantization)把模型權重壓縮成更小的數字型態,減少儲存和運算所需的記憶體。
一個 7B 模型用 F16(全精度)存,70 億個數字每個佔 2 bytes,總共約 14GB。量化到 Q4 之後,同樣 70 億個數字每個只佔約 0.5 bytes,總共約 3.5GB。
👉 證據 / 驗證
- 7B F16 ≈ 14GB
- 7B Q4 ≈ 3.5GB(縮小約 75%)
👈 #2 為什麼需要量化
一句話:你的機器記憶體/VRAM 有限,全精度模型往往裝不下——量化讓同一個模型能塞進更小的機器。
這跟 L3 硬體評比頁講的容量直接相關:Mac mini M4 Pro 64GB 統一記憶體,裝一個 F16 的 70B 模型(約 140GB)絕對裝不下,但量化到 Q4(約 35GB)就有機會。
👉 證據 / 驗證
- 量化是「用機器裝得下的模型」的關鍵手段
- 跟硬體選擇是同一個決策的兩面
👈 #3 GGUF 格式是什麼
一句話:GGUF(GPT-Generated Unified Format)是量化模型的標準檔案格式,取代舊的 GGML 格式,被 llama.cpp 和 Ollama 這類工具廣泛使用。
一個 GGUF 檔案把模型權重、tokenizer、metadata 全部打包成一個檔——下載一個檔就能跑,不用另外湊齊零件。
👉 證據 / 驗證
- GGUF = 目前 local LLM 生態的標準格式
- 取代 GGML(舊格式)
👈 #4 量化等級對照(以 7B 模型為例)
| 等級 | 約略大小 | 相對 F16 損失 |
|---|---|---|
| Q4_K_M | ≈3.8GB | +0.0535 perplexity(可感知但小) |
| Q5_K_M | ≈4.45GB | +0.0142 perplexity(較小) |
| Q6_K | ≈5.15GB | +0.0044 perplexity(近乎無損) |
| Q8_0 | ≈6.7GB | +0.0004 perplexity(實質無損) |
perplexity 是模型「預測下一個字準不準」的指標,數字越小代表量化造成的品質損失越小。
👉 證據 / 驗證
- 數字為業界常見估算彙整,非單一原始論文逐字引用
- 不同模型/量化實作會有差異,此表僅供量級參考
👈 #5 K-quants 混合精度
一句話:「K」代表混合精度——模型不同層用不同的位元深度,比全部統一用同一種精度更聰明。
例如:比較重要的 attention 層可能用 6-bit,比較不敏感的 feedforward 層用 4-bit。這種智慧分配就是為什麼 GGUF 的 K-quants(如 Q4_K_M)能做到「每一位元換到更多品質」,比單純無腦 4-bit 量化更划算。
👉 證據 / 驗證
- K-quants = 不同層不同精度的混合分配
- 比同 bit 數的樸素量化品質更好
👈 #6 怎麼選
預設答案:Q4_K_M——體積砍掉約 75%,品質損失很小,是尺寸與品質的最佳平衡點,多數教學文章的預設建議。
機器有餘裕:選 Q5_K_M(品質更好一點)。要接近無損(關鍵應用):選 Q6_K。差異都不算大,先從 Q4_K_M 開始最實際。
👉 證據 / 驗證
- Q4_K_M:預設選擇
- Q5_K_M:VRAM 有餘裕時的升級選項
- Q6_K:近乎無損,用於關鍵應用
👈 #7 速度怎麼算
一句話:本機推論速度主要被「記憶體頻寬」卡住,不是算力——模型檔案越小,要搬動的資料越少,跑起來越快。
舉例:一個 8B 模型 Q8 版本約 8GB、Q4 版本約 4.5GB,在同一張顯卡上,Q4 版本大約快 1.7 倍——純粹因為要搬的資料量變少了。
👉 證據 / 驗證
- 瓶頸=記憶體頻寬,不是算力
- 檔案小 ≈ 速度快(近似正比)
👈 #8 下一步
懂了量化之後:
- 去 L3 硬體評比,用「記憶體頻寬」對照這頁的速度原理,選最適合你的機器
- 回 L2 全景導覽 的 Models 分區,看排行榜上每個模型標的量化等級
- 去 L3 exo 安裝教學,了解單機裝不下時的分散式方案
👉 證據 / 驗證
- 本頁數字為公開量化技術文獻彙整,非單一原始論文逐字引用
- 抓取日期:2026-08-15