GGUF 格式 K-Quants 記憶體頻寬瓶頸 Q4_K_M 預設

🔢 量化教學——為什麼 14GB 的模型能塞進 3.5GB

L1 開場白提過「量化」是搞懂 local.ai 要一次弄懂的六件事之一——這頁 L3 分析閱讀把它徹底講通。

緣起

local.ai 的 Models 排行榜上每個模型都標了量化等級(Q4/Q5/Q8...),不懂這代表什麼就沒法選。

點我看詳細 →

目標

讀完能自己判斷:這台機器該選哪個量化等級,知道自己在拿什麼換什麼。

點我看詳細 →

相關討論

GGUF、GPTQ、AWQ 常被混著講——本頁只深入 GGUF(local.ai 生態最常見),其他兩種留待之後有真需求再展開。

點我看詳細 →

證據承諾

數字(GB/perplexity)來自公開量化技術文獻整理,非官方原始論文逐字核對,帶不確定性標註。

點我看詳細 →
の字序:中下#1 → 順時針推完 #8。8 格填滿才准查漏。
#4 左上📊

量化等級對照

Q4_K_M/Q5_K_M/Q6_K/Q8_0
怎麼選
#5 中上🧬

K-quants 混合精度

為什麼比單純 4-bit 更聰明
原理
#6 右上

怎麼選

Q4_K_M 是預設答案
建議
#3 左中📦

GGUF 格式是什麼

量化模型的標準檔案格式
格式

🔢 量化教學

L3 分析閱讀 · 點此回頁頂

深入子頁
#7 右中

速度怎麼算

受記憶體頻寬限制,不是算力
速度
#2 左下🤔

為什麼需要量化

14GB → 3.5GB,塞進你的機器
動機
#1 中下🧩

這是什麼

把模型權重壓縮成更小的資料型態
定義
#8 右下➡️

下一步

回硬體評比頁對照你的機器能跑哪個等級
接下來

👈 #1 這是什麼

一句話:量化(quantization)把模型權重壓縮成更小的數字型態,減少儲存和運算所需的記憶體。

一個 7B 模型用 F16(全精度)存,70 億個數字每個佔 2 bytes,總共約 14GB。量化到 Q4 之後,同樣 70 億個數字每個只佔約 0.5 bytes,總共約 3.5GB。

👉 證據 / 驗證

  • 7B F16 ≈ 14GB
  • 7B Q4 ≈ 3.5GB(縮小約 75%)
證據:公開量化技術文獻整理(DEV Community/llmhardware.io 等),2026-08-15 WebSearch 核實,數字為業界常見估算非單一權威源逐字引用。

👈 #2 為什麼需要量化

一句話:你的機器記憶體/VRAM 有限,全精度模型往往裝不下——量化讓同一個模型能塞進更小的機器。

這跟 L3 硬體評比頁講的容量直接相關:Mac mini M4 Pro 64GB 統一記憶體,裝一個 F16 的 70B 模型(約 140GB)絕對裝不下,但量化到 Q4(約 35GB)就有機會。

👉 證據 / 驗證

  • 量化是「用機器裝得下的模型」的關鍵手段
  • 跟硬體選擇是同一個決策的兩面
證據:基於 #4 等級對照表的比例估算換算到 70B,2026-08-15。

👈 #3 GGUF 格式是什麼

一句話:GGUF(GPT-Generated Unified Format)是量化模型的標準檔案格式,取代舊的 GGML 格式,被 llama.cpp 和 Ollama 這類工具廣泛使用。

一個 GGUF 檔案把模型權重、tokenizer、metadata 全部打包成一個檔——下載一個檔就能跑,不用另外湊齊零件。

👉 證據 / 驗證

  • GGUF = 目前 local LLM 生態的標準格式
  • 取代 GGML(舊格式)
證據:公開量化技術文獻整理,2026-08-15 WebSearch 核實。

👈 #4 量化等級對照(以 7B 模型為例)

等級約略大小相對 F16 損失
Q4_K_M≈3.8GB+0.0535 perplexity(可感知但小)
Q5_K_M≈4.45GB+0.0142 perplexity(較小)
Q6_K≈5.15GB+0.0044 perplexity(近乎無損)
Q8_0≈6.7GB+0.0004 perplexity(實質無損)

perplexity 是模型「預測下一個字準不準」的指標,數字越小代表量化造成的品質損失越小。

👉 證據 / 驗證

  • 數字為業界常見估算彙整,非單一原始論文逐字引用
  • 不同模型/量化實作會有差異,此表僅供量級參考
證據:DEV Community「GGUF Quantization Explained」等公開文獻彙整,2026-08-15 WebSearch 核實。

👈 #5 K-quants 混合精度

一句話:「K」代表混合精度——模型不同層用不同的位元深度,比全部統一用同一種精度更聰明。

例如:比較重要的 attention 層可能用 6-bit,比較不敏感的 feedforward 層用 4-bit。這種智慧分配就是為什麼 GGUF 的 K-quants(如 Q4_K_M)能做到「每一位元換到更多品質」,比單純無腦 4-bit 量化更划算。

👉 證據 / 驗證

  • K-quants = 不同層不同精度的混合分配
  • 比同 bit 數的樸素量化品質更好
證據:公開量化技術文獻整理,2026-08-15 WebSearch 核實。

👈 #6 怎麼選

預設答案:Q4_K_M——體積砍掉約 75%,品質損失很小,是尺寸與品質的最佳平衡點,多數教學文章的預設建議。

機器有餘裕:選 Q5_K_M(品質更好一點)。要接近無損(關鍵應用):選 Q6_K。差異都不算大,先從 Q4_K_M 開始最實際。

👉 證據 / 驗證

  • Q4_K_M:預設選擇
  • Q5_K_M:VRAM 有餘裕時的升級選項
  • Q6_K:近乎無損,用於關鍵應用
證據:RunLocalModel「Choosing the Right Quantization 2026」等公開指南彙整,2026-08-15 WebSearch 核實。

👈 #7 速度怎麼算

一句話:本機推論速度主要被「記憶體頻寬」卡住,不是算力——模型檔案越小,要搬動的資料越少,跑起來越快。

舉例:一個 8B 模型 Q8 版本約 8GB、Q4 版本約 4.5GB,在同一張顯卡上,Q4 版本大約快 1.7 倍——純粹因為要搬的資料量變少了。

👉 證據 / 驗證

  • 瓶頸=記憶體頻寬,不是算力
  • 檔案小 ≈ 速度快(近似正比)
證據:公開量化技術文獻整理,2026-08-15 WebSearch 核實。這條也呼應 L3 硬體評比頁提到「記憶體頻寬」是選機器的關鍵指標之一。

👈 #8 下一步

懂了量化之後:

  • L3 硬體評比,用「記憶體頻寬」對照這頁的速度原理,選最適合你的機器
  • L2 全景導覽 的 Models 分區,看排行榜上每個模型標的量化等級
  • L3 exo 安裝教學,了解單機裝不下時的分散式方案

👉 證據 / 驗證

  • 本頁數字為公開量化技術文獻彙整,非單一原始論文逐字引用
  • 抓取日期:2026-08-15
證據:DEV Community/llmhardware.io/RunLocalModel 等公開指南,2026-08-15 WebSearch 核實。
📋 行動計畫 · 可勾選追蹤:0/0 ↺ 重置
ai.nqio.dev · 量化教學(L3 深入子頁)· 數據來源:公開量化技術文獻彙整