Strata 本機 AI:12GB 顯示卡夠嗎?先查 RAM、模型與完整任務
看到「12GB 顯示卡跑大模型」,先別只比對顯示卡容量。Strata 把模型的不同部分放在 GPU、系統 RAM 與磁碟;能啟動、能流暢回答短問題、能完成你的長文件或 coding 任務,需要分開驗收。
Strata 的主要文件針對 Windows/Linux、NVIDIA/AMD 的本機 Qwen3.8-Flash-Next 工作流程。本篇是硬體與模型選擇指南,查核日期為 2026-10-11;沒有在本次 macOS 環境安裝 Strata,也沒有取得本機推論數字。
12GB VRAM 之外,先看可用 RAM 與磁碟
官方安裝文件把 12GB 以上 VRAM 列為主要硬體路徑,並另列較小容量與特殊 GPU 的限制。不要只用「也是 RTX」或總 VRAM 相同,就推論安裝引擎與驅動支援相同。
磁碟也要留餘裕:文件列出模型約 70–80GB、MTP layer 約 6GB,啟用圖片另加容量;部分 Q2_0/AVX-512 路徑還會建立約 40GB 的 experts 副本。只留「下載檔大小」的空間,可能在準備階段就不足。
建議先保存一份不含私人資料的環境紀錄:OS、GPU 型號與 VRAM、驅動、總 RAM 與啟動前可用 RAM、模型磁碟的剩餘空間。之後再加引擎版本、模型名稱、量化與上下文;這比只貼一張 tokens/s 截圖更容易定位問題。
RAM 小時,不只是在同一模型上換壓縮率
官方 MODELS 文件對主要路徑的建議包括:32GB RAM 選 Coder、48GB 選 IQ2_XS 或 Q2_0、64GB 可考慮 IQ2_XS/IQ3_XXS/IQ3_S。這是選型起點,仍要確認 GPU、其他程式與上下文占用;低 RAM 加大 VRAM 的組合另有 mapped 模式。
Coder 刪除了部分 experts,不能把它當成只是檔案較小、行為完全相同的完整模型。官方文件特別指出非英文與中文等 CJK 任務的弱點。若主要需求是台灣繁體中文摘要,應先拿自己的無敏感範例驗證內容正確性;不能因 coding benchmark 接近,就直接拿來替代通用模型。
94 tokens/s 為什麼不是整個任務的時間
官方 README的 94 tokens/s 是 RTX 5070 12GB、Ryzen 5 7600、64GB RAM、Q2_0 的輸出測量;該列引擎為 0.1.36,文件區分 4K 回答情境與 32K prompt 讀取測量。其他模型列可能使用不同引擎版本。
目前 release 頁列出 2026-10-10 的 v0.1.42,但新版號不會自動把舊測量變成新版、同硬體的結果。比較時保留當次版本與測量條件,不要把舊表格寫成自己的速度。
完整任務還包含啟動、讀入 prompt、思考/生成,以及 coding agent 的工具回合。短問題輸出很快,不能證明一次讀完整份 repository、跑測試、修正錯誤也同樣快。驗收時記錄「送出到第一段可用輸出」和「任務到通過檢查」,再搭配 Monitor 看瓶頸在哪一段。
用三個階段決定要不要接正式工作流
以下是供讀者執行的驗收流程,本文尚未實際執行:
- 只驗收啟動。 從 Niko1221/Strata 取得專案,Windows 使用
START-HERE.bat,Linux 在專案目錄執行./setup.sh。先讀 setup 建議與額外安裝需求,保存版本、模型、context、vision 選項及啟動 log。可開啟頁面只算通過這一階段。 - 驗收短對話。 在本機
http://127.0.0.1:8080用無敏感短問題確認回覆完整且符合預期,再換一題繁體中文需求。記錄可用記憶體、磁碟活動與首段輸出等待時間,不先追求最大 context。 - 驗收原本要做的任務。 使用同一份小型測試資料,比較短 prompt 與包含背景資料的版本。Coding 任務應要求一個可檢查的產物與測試結果,記錄完成時間和需要人工修正的地方。若長 prompt 卡住,先查 prompt、輸出上限及實際 context,再增加模型或上下文。
DETAILS 的 API 說明列出本機 /v1、模型列表與不同協定。先確認 /v1/models 的實際 id 和目前設定,再接 coding agent;「OpenAI-compatible」本身不能證明每個客戶端需要的工具、串流與狀態功能都已驗收。需要跨裝置存取時,另依官方文件處理綁定位址與 API key,不能把 localhost 範例直接改成對外開放。
官網安裝頁也列出 macOS/Desktop 路徑,但引擎的 README 與 INSTALL 主要描述 Windows/Linux。本文沒有核驗 Mac 推論後端,不能將 launcher 可建置推論為 Apple Silicon 能套用 RTX 測量。
如果你評估的是另一套本機產品,可對照 Laya 本機模型的選擇界線;若下一步是接 agent,則看 OpenClaw 與 Ollama 的模型名稱及連線檢查。產品、引擎與 provider 設定分開記錄,才知道下一次應該調整哪一層。
參考資料: