2026年10月6日 星期二

新桌機與各AI模型實測

這天還是來啦,只是比想像中的早了不少
玩本地AI模型到後來終究還是買了台新電腦
講真的,現在真不是買新機的好時機
因為記憶體與顯示卡價格在今年一路往上狂漲
所以之前一直在等等看,看何時可以往下

沒想到持續至今已經較過去平均價格溢價超過5成
如果要照我的需求,RTX5060 Ti 16GB顯示卡+32GB RAM條件
組個一台最低規格的桌機
現在10月份,金額已經來到6萬大關,還沒有包含螢幕、鍵盤與作業系統...
而這以前是能買台高階電腦的範圍耶
CPU、記憶體、SSD還是顯示卡,至少有一項有機會拉到很高的規格
如今這價位也只能勉強選個顯卡與RAM勘用的等級
那似乎再不買,未來一年左右只能是望新機而興嘆
可是真的要買嗎?

最後推了我一把的有兩件事,幾乎是一起發生
第一件事,剛好找到有5萬元左右的組可以滿足我的最低規格需求
第二件事,可說是實際的起爆劑,剛好看到印度Youtuber Codacus的影片


說12GB顯卡+32GB的RAM可以跑Qwen3.8-Flash-Next Q3版!!!
看完影片當下就決定買了
就這樣,決定購入了20年來不曾購買的新桌機
開始玩一些以前不能玩過的AI模型

正式開始前,先談新桌機花了5萬元帶來的硬體規格
新機就原價屋的這個組合



基本上就前面說的16GB VRAM與32GB RAM
有了這規格,不但過去大部分的模型可以跑得更快
號稱離線模型最強的Qwen3.8 27B也是在勉強跑得動的範圍內
只是時間來到10月,又貴了1900元,我買的時候是41800+8500的價格說
唉~~,該說萬幸還是真的太晚買了
再早一點說不定可以用低於5萬5的價位把RAM拉到64GB啊
早知道早知道,千金難買早知道

至於為什麼「12GB的顯卡就跑得動Qwen3.8-Flash-Next的Q3量化版」這件事
會是買桌機的起爆劑,這邊再解釋一下
回顧上一篇的預測,個人在猜測阿里巴巴放棄開源就是錯了
沒想到Qwen3.8 Max發表一陣子後,就發表了Qwen 3.8 27B這個強力的開源模型
而之後更展示了未來Qwen4的雛型,Qwen3.8-Flash-Next
是一個效能逼近線上閉源模型的本地大模型(125B)
https://qwen.ai/blog?id=qwen3.8-flash-next
能跑動得這個模型,象徵就是消費級硬體能跑出逼近高性能大模型的能力
尤其這模型能力對標的是Opus 4.6 Max,曾經是線上模型中的旗艦版
雖然現在Opus這模型已經到5.5版,性能又比這個4.6高出不少級
加上本地模型本身用上了Q3量化,能力肯定是再打個折
假設先打個7折好了
用一台5萬多元,比最新iphone 18 pro max還便宜的桌機
跑出百萬級,甚至千萬級伺服器跑出來模型能力的7折
那不是超划算的嗎?CP值爆表啊!
意識到這點的當下,只覺得管它是不是漲到6萬了,新電腦買啊
更不用說購入的花費還符合6月底時設下的5萬預算,規格還拉高了一點

而且在12GB顯卡的實際輸出速度再怎樣都有每秒20 tokens左右
對我來說,超過15 tk/s就是勘用等級,16GB顯示卡只會更快
就用影片中預填速度這張表來說


32GB的RAM只會落在雙位數的等級,也就是讀取偏慢
不過這模型最主要處理的,會是些大量思考的討論,基本上不會餵太大量的資料
那就是完全可用的程度了,更何況Q3實際能力以分數落差論,只會打個85折左右
有這等程度才有打平那電腦過貴售價的價值啊
更不用講寫這篇時又迸出神奇的東西,啊,這就留下一篇講了

總之在這個硬體下,買下時的規畫是這樣
Qwen3.8-Flash-Next對標Claude最高等級的Fable,用來產複雜的計畫用。
Qwen3.8-27B對標Claude目前的高階模型Opus,用來進行驗證用。
Qwen3.6-35B-A3B對標Claude速度與性能都還行的Sonnet,進行實際寫Code產出用
而實際測下去的速度嘛
不得不提Qwen3.6-35B加上MTP下去,開出的解碼速度可以達70 tk/s
那個產出真的是飛快啊!
以前在筆電上跑出的二十幾的速度就很感動的
現在這速度,只能說超級感動的,早該買下去的
不過非MOE的Qwen3.8-27B就沒這種鬼速度了
要在這硬體上跑得了,又要高上下文容量,一樣是只能選Q3量化等級
解碼速度只17 tk/s,Q4又更慢,不到15 tk/s,而且上下文容量被吃太多
有試過Q3開MTP下去,但MTP速度雖然可達25 tk/s,卻吃掉太多RAM
即便Q3也只能跑16k的上下文容量
對Coding Agent來說不夠用呢
不過因為模型可以全載入記憶體中,預填速度可達近千tk/s
安排這個模型的任務是驗證抓錯來說,還算不錯,17tk/s是慢些,但絕對勘用
真的要再加速,也無不可,我原本的筆電還有6GB可以用
從Codacus那邊還學到了RPC伺服器功能,可以讓兩台電腦靠網路把VRAM串起來

這樣加上MTP後,上下文也還可以保持65K以上,算是物盡其用的好辦法
只是預填速度會再降一些,也是破300的高速就是了
至於最強的Qwen3.8-Flash-Next,因為也是MOE類型的,激活參數更是只有6B
雖然RAM在32GB的預填速度實測是悲劇般的33~35 tk/s(預期內的只有2位數)
解碼速度可以來到24tk/s的程度,反而比Qwen3.8-27B好,就沒試著用MTP再加速了
然而,不得不說,測試是都做了,規畫的也頭頭是道,目前卻還是沒有接上Agent有任何產出
因為緊接著改玩本地ComfyUI

肖想可以這樣玩很久了
從Stable Diffusion時就苦於VRAM不足,一堆好玩的東西都不能玩
雖然後來租了Runpod跑了好幾輪,但還是有些東西不方便弄
現在有了夠強的硬體,嘿嘿~~
咳...先來做一般的驗證
首先,之前在runpod上跑的Qwen-Image-edit-2511 action工作流
主模型30GB其實會跑得很勉強,不過有unsloth的gguf量化
所以像這樣進入那個大節點裡替換為city96的gguf節點
就跑得出來圖了,以上次那位小姐轉2D化的圖,只花了33.97秒

然後接下來換混元3D 2.1
拿出上次產的那張圖
以最初預設參數跑出來的模型,也只花了51.08秒
完全是可以用的速度

然後接下來,換玩影片生成啦
記得去年玩FramePack,短短5秒花了一個小時產出
現在用上最新硬體加上最新模型MiniMaxH3的快速版https://docs.comfy.org/zh/tutorials/video/minimax/minimax-h3-fastvideo
簡單生個5秒的影片,只需要80~90秒左右,超棒的啊!
而且還有音樂與配音,太扯了。
玩著玩著就不靠runpod上的ComfyUI修圖了
速度上還行,當然就全拉回本體執行
也因為這樣傳統LLM那邊就跟停擺了差不多
偶爾有新東西測一下而已

總之玩了幾個禮拜下來真的是
相恨見晚啊
也好險懂一些Linux,所以最後用Ubuntu架系統,省了灌Windows的錢
當然目前用linux玩AI也不虧啦,差不多是新應用最新開發平台
最後只能說感謝有遇到Codacus這頻道讓我學習那麼多的技術
不然真的曾覺得本地模型就是不能用
現在有了新硬體與新模型,雖然還是離閉源線上那種大模型有一段差距
至少己是非常夠用了

沒有留言: