低階顯卡的本地端AI實驗
我在2026年7月中花了18,710購入一張RTX 5060 Ti 16GB VRAM來做本地端程式碼生成。想不到到了2026年8月,這張卡的價格已經來到 $25,590 !
在有充分提示、告知必要Table Schema的情境下,遵循力高,可以完成一定程度的邏輯重構、生成完整 C# Class/API 控制器、編寫前端元件、除錯與撰寫單元測試。他只使用約 9 GB ~ 11 GB,理論上剩餘顯存可留給 16k~32k 的 Context Window 長上下文與 KV Cache。但設定太長還是會導致記憶體溢出到本機記憶體,導致速度大幅下降。
前端網頁: Llama-3.1-8B-Instruct
qwen2.5-coder的缺點是前端網頁的能力很差,設計版面很不美觀。Llama-3.1-8B-Instruct則補足了這方面的缺點。選擇 Q5_K_M 模型,num_ctx 控制在 8192 ~ 16384 (8k~16k),就能同時兼顧高品質的連續對話與流暢的 VRAM 運作。 Llama-3.1產出的網頁現代感也較佳。不過線上模型背後是用數百萬張設計圖(Dribbble, Figma 檔案、現代 Web 截圖)搭配程式碼堆出來的。它們對 Tailwind CSS、CSS Grid 的掌握度非常可怕,截圖丟過去,吐出來的 HTML/CSS 常常還原度高達 80%~90%。地端模型還是無法比較的。真的要從零寫遊戲 / 視覺看圖切版,還是開瀏覽器找 Gemini / Claude,省下浪費電、折磨顯卡的時間吧。
行內自動補全:
Qwen2.5-Coder-7B-Instruct。
主要用來做多語言翻譯、文章潤飾、對話聊天
選 Gemma。
留言
張貼留言