經濟入門 AI 電腦
以合理預算踏入本地 AI 世界,適合第一次使用 Local LLM、AI 助手、文字生成、文件問答及輕量創作的用家。
這個方案是為誰而設?
這套方案的核心不是追求最大模型,而是在實際預算內建立一部真正可以長期使用的本地 AI 電腦。對剛開始接觸 Ollama、LM Studio、Open WebUI 或本地聊天模型的用家而言,8GB 級別顯示記憶體已能覆蓋大量 4B–8B 級量化模型;實際模型大小、Context、推理速度仍會受到 VRAM、RAM、CPU 及軟件設定影響。
支援的 AI 模型與工具方向
以下列出的模型及工具是「適用方向」而非代表任何一個固定配置可以無限制高速運行所有項目。實際可用性取決於模型版本、量化格式、VRAM、Context、解析度及工作流。
模型 / 平台
- Llama 3.1 8B
- Qwen3 8B
- Gemma 3 4B
- Mistral 7B
- Ollama / LM Studio
常見工作
- 本地 AI Chat / 問答
- 文件摘要、改寫、翻譯
- 簡單 RAG / 知識庫
- AI Coding 輔助
- 輕量圖片生成與 AI 工具測試
適合人群
第一次購買 AI PC、學生、自由工作者、一般辦公室用家、希望資料留在本機的人。
建議硬件方向
建議以 8GB VRAM 顯示卡作為入門基準;如果日後會使用更大模型、較長 Context 或圖像生成,建議預留升級至 12GB / 16GB 以上 VRAM 的空間。CPU 不需要盲目追求最高階,反而應把預算優先放在 GPU VRAM、RAM 與 SSD。
配置邏輯
Ollama / LM Studio → 選擇量化模型 → Local Chat → 文件整理 / Coding / RAG → 按需要加入 Open WebUI。若使用 Gemma 3 12B 或其他較大模型,應視 VRAM、量化方式及 CPU/RAM Offload 情況評估,不應把「支援」理解為所有設定都能高速運行。
模型容量與 VRAM:不要只看「幾 B」
模型大小 ≠ 實際所需顯存
模型參數量只是第一個指標。推理時還要考慮權重精度、量化格式、KV Cache、Context 長度、Batch Size、Framework 及其他 runtime 開銷。因此「14B / 32B / 70B」不能直接等同於一個固定 VRAM 數字。
量化與 Offload
4-bit、8-bit 等量化可以降低權重記憶體需求;CPU RAM Offload 則可以把部分資料放到系統記憶體,但通常會犧牲速度。多 GPU 亦需要從主機板 PCIe、電源及散熱整體規劃。
適合的實際工作流
| 工作流 | 建議方向 | 注意事項 |
|---|---|---|
| Local Chat | Ollama / LM Studio + 量化 LLM | VRAM 決定可載入模型的彈性;Context 越長,額外記憶體需求越高。 |
| RAG | Embedding + Vector DB + LLM | 資料庫規模、Embedding 模型及同時運行服務會增加 RAM / SSD 需求。 |
| AI Agent | LLM + Tool Calling + Browser / Files | 需要穩定長時間運行;Agent 工具本身未必是本地模型。 |
| 圖像 / 影片 | ComfyUI / Diffusion / Video Workflow | 解析度、模型、ControlNet、LoRA、幀數及 Upscale 都會影響 VRAM。 |
實際配機時,我們會看什麼?
① 先確認模型
先列出你真正會使用的模型、版本及量化格式,再估算權重、KV Cache、Context 與其他 Runtime 所需資源。這樣可以避免只按「8B、14B、32B」等參數量作錯誤判斷。
② 再確認工作流
同一張 GPU 用於 Local LLM、ComfyUI、AI Video、RAG 或 Agent,瓶頸可能完全不同。工作流會直接影響 VRAM、RAM、CPU、SSD、散熱及電源的比例。
③ 最後規劃升級
如果預計未來增加模型尺寸、加入 AI 圖像/影片、Fine-tuning 或 Agent,首次配置應預留 RAM、SSD、電源、機箱及 PCIe 擴充空間,避免短期內重新砌機。
直接告訴我們你想跑甚麼。
模型名稱 + 用途 + 預算,已經足夠作為第一次配機討論的起點。
