1227 字
6 分鐘

Strata 本機 AI:12GB 顯示卡夠嗎?先查 RAM、模型與完整任務

看到「12GB 顯示卡跑大模型」,先別只比對顯示卡容量。Strata 把模型的不同部分放在 GPU、系統 RAM 與磁碟;能啟動、能流暢回答短問題、能完成你的長文件或 coding 任務,需要分開驗收。

Strata 的主要文件針對 Windows/Linux、NVIDIA/AMD 的本機 Qwen3.8-Flash-Next 工作流程。本篇是硬體與模型選擇指南,查核日期為 2026-10-11;沒有在本次 macOS 環境安裝 Strata,也沒有取得本機推論數字。

12GB VRAM 之外,先看可用 RAM 與磁碟#

官方安裝文件把 12GB 以上 VRAM 列為主要硬體路徑,並另列較小容量與特殊 GPU 的限制。不要只用「也是 RTX」或總 VRAM 相同,就推論安裝引擎與驅動支援相同。

磁碟也要留餘裕:文件列出模型約 70–80GB、MTP layer 約 6GB,啟用圖片另加容量;部分 Q2_0/AVX-512 路徑還會建立約 40GB 的 experts 副本。只留「下載檔大小」的空間,可能在準備階段就不足。

建議先保存一份不含私人資料的環境紀錄:OS、GPU 型號與 VRAM、驅動、總 RAM 與啟動前可用 RAM、模型磁碟的剩餘空間。之後再加引擎版本、模型名稱、量化與上下文;這比只貼一張 tokens/s 截圖更容易定位問題。

RAM 小時,不只是在同一模型上換壓縮率#

官方 MODELS 文件對主要路徑的建議包括:32GB RAM 選 Coder、48GB 選 IQ2_XS 或 Q2_0、64GB 可考慮 IQ2_XS/IQ3_XXS/IQ3_S。這是選型起點,仍要確認 GPU、其他程式與上下文占用;低 RAM 加大 VRAM 的組合另有 mapped 模式。

Coder 刪除了部分 experts,不能把它當成只是檔案較小、行為完全相同的完整模型。官方文件特別指出非英文與中文等 CJK 任務的弱點。若主要需求是台灣繁體中文摘要,應先拿自己的無敏感範例驗證內容正確性;不能因 coding benchmark 接近,就直接拿來替代通用模型。

94 tokens/s 為什麼不是整個任務的時間#

官方 README的 94 tokens/s 是 RTX 5070 12GB、Ryzen 5 7600、64GB RAM、Q2_0 的輸出測量;該列引擎為 0.1.36,文件區分 4K 回答情境與 32K prompt 讀取測量。其他模型列可能使用不同引擎版本。

目前 release 頁列出 2026-10-10 的 v0.1.42,但新版號不會自動把舊測量變成新版、同硬體的結果。比較時保留當次版本與測量條件,不要把舊表格寫成自己的速度。

完整任務還包含啟動、讀入 prompt、思考/生成,以及 coding agent 的工具回合。短問題輸出很快,不能證明一次讀完整份 repository、跑測試、修正錯誤也同樣快。驗收時記錄「送出到第一段可用輸出」和「任務到通過檢查」,再搭配 Monitor 看瓶頸在哪一段。

用三個階段決定要不要接正式工作流#

以下是供讀者執行的驗收流程,本文尚未實際執行:

  1. 只驗收啟動。 從 Niko1221/Strata 取得專案,Windows 使用 START-HERE.bat,Linux 在專案目錄執行 ./setup.sh。先讀 setup 建議與額外安裝需求,保存版本、模型、context、vision 選項及啟動 log。可開啟頁面只算通過這一階段。
  2. 驗收短對話。 在本機 http://127.0.0.1:8080 用無敏感短問題確認回覆完整且符合預期,再換一題繁體中文需求。記錄可用記憶體、磁碟活動與首段輸出等待時間,不先追求最大 context。
  3. 驗收原本要做的任務。 使用同一份小型測試資料,比較短 prompt 與包含背景資料的版本。Coding 任務應要求一個可檢查的產物與測試結果,記錄完成時間和需要人工修正的地方。若長 prompt 卡住,先查 prompt、輸出上限及實際 context,再增加模型或上下文。

DETAILS 的 API 說明列出本機 /v1、模型列表與不同協定。先確認 /v1/models 的實際 id 和目前設定,再接 coding agent;「OpenAI-compatible」本身不能證明每個客戶端需要的工具、串流與狀態功能都已驗收。需要跨裝置存取時,另依官方文件處理綁定位址與 API key,不能把 localhost 範例直接改成對外開放。

官網安裝頁也列出 macOS/Desktop 路徑,但引擎的 README 與 INSTALL 主要描述 Windows/Linux。本文沒有核驗 Mac 推論後端,不能將 launcher 可建置推論為 Apple Silicon 能套用 RTX 測量。

如果你評估的是另一套本機產品,可對照 Laya 本機模型的選擇界線;若下一步是接 agent,則看 OpenClaw 與 Ollama 的模型名稱及連線檢查。產品、引擎與 provider 設定分開記錄,才知道下一次應該調整哪一層。

參考資料:

Strata:官方 repository 與測量條件

Strata:MODELS

Strata:INSTALL

Strata:DETAILS

Strata:Releases

Strata:官網安裝頁

Strata 本機 AI:12GB 顯示卡夠嗎?先查 RAM、模型與完整任務
https://laplusda.com/posts/strata-local-ai-hardware-model-checklist/
作者
Zero
發佈於
2026-10-11
許可協議
CC BY-NC-SA 4.0