低階顯卡的本地端AI實驗
2026年7月初,我花了台幣18,710購入一張RTX 5060 Ti ,配備16GB VRAM。我打算用它來做本地端程式碼生成。想不到到了2026年8月,這張卡的價格已經來到 $25,590 !錢都已經花了,自然必須好好的運用才行。 由於考慮到這張卡的VRAM並不多,搭配Ollama,我的測試心得如下: 開發ASP.net MVC後端:qwen2.5-coder:14b-instruct-q5_k_m 在有充分提示、告知必要Table Schema的情境下,遵循力高,可以完成一定程度的邏輯重構、生成完整 C# Class/API 控制器、編寫前端元件、除錯與撰寫單元測試。他只使用約 9 GB ~ 11 GB,理論上剩餘顯存可留給 16k~32k 的 Context Window 長上下文與 KV Cache。但設定太長還是會導致記憶體溢出到本機記憶體,導致速度大幅下降。 寫「有深度、需要邏輯嚴密」的程式碼時,記得開啟 think: True ,但速度會降低很多。 前端網頁: Llama-3.1-8B-Instruct qwen2.5-coder的缺點是前端網頁的能力很差,設計版面很不美觀。Llama-3.1-8B-Instruct則補足了這方面的缺點。選擇 Q5_K_M 模型,num_ctx 控制在 8192 ~ 16384 (8k~16k),就能同時兼顧高品質的連續對話與流暢的 VRAM 運作。 網頁現代感也"較佳"。 與線上模型相比,線上模型背後是用數百萬張設計圖(Dribbble, Figma 檔案、現代 Web 截圖)搭配程式碼堆出來的,而且保持更新。它們對 Tailwind CSS、CSS Grid 的掌握度非常可怕,截圖丟過去,吐出來的 HTML/CSS 常常還原度高達 80%~90%。地端模型還是無法比較的。真的要從零寫遊戲 / 視覺看圖切版,還是開瀏覽器找 Gemini / Claude,省下浪費電、折磨顯卡的時間吧。 行內自動補全: Qwen2.5-Coder-7B-Instruct 就能勝任。 用來做多語言翻譯、文章潤飾、對話聊天 搭配 gemma4:12b-it-q4_K_M 與 chromadb做RAG。 切片時設定 300 字一塊(一條),並保留 50 字重疊,也就是每行的末尾跟次一行的開頭會重複。最好斷句斷在標...