2026年7月26日 星期日

本地大型語言模型(LLM)使用一年心得

已經玩了超過一年的免費本地LLM
目前感受到整個發展其實已經差不多到一個穩定期了
雖然最近有幾次被驚嚇以為有什麼新突破
但實測下來都是令人失望的
加上Google主要競爭對手阿里巴巴差不多等同退出這領域
轉為閉源服務與開發超大參數(Qwen 3.8 2.4T參數最好本地跑得動啦)
然後Google也沒有再更新版次(連Gemini 3.5 Pro都快生不出來了)
應該就是進入一個穩定期了
就對這一整年,尤其是這半年玩起來的狀況寫個心得與小整理
(以下文章長,只有一張圖)

從去年到今年的本地LLM模型的表現,真的進步顯著
它從單純的文字接龍到有思考模式去自我驗證輸出的品質
確實讓產出更加地有用
雖然我使用上只是用在翻譯上居多
可是從翻譯的品質上就可以感受到明顯的差距
去年剛接觸Gemma3,以4B的能耐,Ohtani翻完可能還是Ohtani
然後叫它輸出繁體中文,文章一長可能還是會冒幾個簡體字
現在Gemma4,同樣是4B參數量
前者已經可以翻成"大谷"
後者的狀況也不會出簡體字了
更不用說一些基本的數理問題,回答的比Gemma3正確
唯一的缺點就漢文學還是不行,唐詩背的亂七八糟的
有名的靜夜思也可以東拚西湊
這應該算外國人不懂,沒有認真校正,而不單純是模型的錯
漢文學這方面,Qwen系列不虧是中國訓練的,就沒這情況
只是Qwen3時,只要提到中文,輸出還是以簡字為主,叫它產全繁體字有困難
印象是一直到Qwen 3.5之後才改善,我算是Qwen 3.5後才開始用
但用得不多,畢竟Qwen 3.5 4B跑起來與Gemma4 E4B都是4B級差異不大
9B性能是更強,吃記憶體也更兇,跑起來更慢
在品質只提升一點,速度卻大幅下降的情況下,真的稱不上多好用
也在這玩LLM的期間多次感受到,自己電腦硬體跟不上的情況
尤其是在Gemma4一開始只有E2B與E4B後就跳26B與31B
後面的Qwen 3.6發行後,更是極積地只留一個27B,一個35B
玩到這裡是覺得,終究是要朝大參數靠了
參數大的優勢太明顯了
以我觀察到的現象,就算有了思考模式
參數小會很容易陷入無限迴圈一直在找它參數裡沒有的答案
而同樣的問題問大參數模型,同樣的思路卻比較會有正確的解答
那就沒辦法,只能靠參數的多寡來提升品質了

稍微有點例外的,只剩下翻譯專用型
剛剛介紹漏掉個模型,translategemma
以同樣4B的參數,經由固定的樣板命令
它可以翻出與原本gemma3 12B差不多,甚至更好的品質
在今年Gemma4出來前的翻譯,我是幾乎就靠它了
但Gemma4也只是因為資料較新,加上有思考功能而有了更多專有名詞的準確度
單就佔用的空間與跑動速度來說translategemma其實還是有相當優勢
尤其是用在公司裡硬體比較弱的公用筆電上
而兩個月前出的Hy-MT2更進步了,1.8B的參數量,翻Ohtani也是大谷了
簡直是超絕進化的一個模型
雖然要穩定一點,還是要靠7B更大的模型
因為1.8B在專有名詞上還是很常以原文顯示
曾有拿一篇世足盃球星推薦讓它翻譯,結果有時有翻梅西,有時就直接原文Messi
但可以在1.8B參數量還不會吐簡體中文出來給我
光這點明顯贏上Gemma3不少
這邊看得出翻譯專用上,仍可以在小參數上有還不錯的表現

但就算如此,Hy-MT2仍有一個30B-A3B的MOE模型
所以上一段也只敢講"稍微有點例外"
以這為例,在越來越大的參數下,像這種使用了MOE技術的模型
可說就是目前本地LLM模型的最佳選擇了
畢竟因為執行參數小,而且配合特定參數將模型層數卸載到一般記憶體
硬體的需求就稍稍被削弱,甚至6GB記憶體的顯示卡也跑得動了
以Qwen3.6 35B-A3B的Q4量化為例
如果不開啟MOE參數,用傳統模式將部分運算分給CPU與一般記憶體
我電腦大概只能跑每秒7~8 tokesn
同樣硬體,開MOE卸載功能,可以跑到20 tokens以上
對我來說就是開啟後從不能用變成能用的魔法
這技術太重要了
至於其它驚嚇到我的技術發展
也不是不重要,但在參數量就是王道的狀態下
那個號稱拿了Fable5的推理能力的9B模型,表現的感覺就還是個9B模型
思考時參數量不足,繼續鬼打牆
那個號稱極限壓縮的也沒真聰明到跟原本27B相同
一樣也有思考時鬼打牆狀態過
真正實用的MTP與DFlash這些提速技術,都需要更多的VRAM,我沒有
頂多拿來給小參數跑翻譯時可以再加速

以上三段再精簡一下
就是我的主要三點心得整理
1、進步巨大,不過同技術等級再怎麼樣都是更大參數量的更好用
2、只有專用特化的功能有機會在小參數上表現亮眼
3、MOE技術是硬體的救贖,其它技術對本地模型都是添花而已

再多講一下MOE技術,它真的是硬體的救贖,而不只用在本地LLM上
其實官方數據也顯示,參數量也不是決定能力的一切
27B這種緊密(Dense)模型的能力,其實比35B的MOE模型來得好

然而,27B的Dense模型光要能順順跑,在消費級的硬體上就很困難了
用Q4量化時,27B的VRAM需求就會超過16GB, 那變成只有24GB以上的顯卡才跑得起來
然而假設這硬體夠強,可以讓27B跑得很快
相較35B大部分只跑3B級的運算,那35B的速度就會是神速,而35B性能也不到差
所以其實不只有本地模型,最新的Qwen3.8 2.4T的模型,也是用MOE架構https://www.aitop100.cn/infomation/details/34293.html
應該就是看準了這種硬體建置花費可以更少的,速度卻可以維持,甚至更快的特性
所以這應該不只是本地模型的可用主流
可能也是低價高效能模型的一個長遠的發展
所以我在這邊再多提一下

最後還是要聊一下玩了這麼久,本地LLM的功用
以功能面來說,本地LLM還是完全比不上線上的服務
不論是寫文本,還是搞翻譯
尤其在寫程式碼這方面,效率差太多了
有寫程式碼這方面需求的,還是乖乖花錢比較好,詳細的成本計算就不討論了

所以本地LLM的絕對優勢還是在保有隱私隱密性這點上
尤其在寫文本與搞翻譯上
如果有大量機密存在時,與其花大量時間將這些機密去識別化,再丟到線上處理
還不如就直接丟入本地模型來得方便
而且雖然成品精度一定下降,但文本的精度下降跟程式碼精度下降是兩回事
前者通常語意不會變,只是專有名詞或用詞再潤一下就好
後者可能就是根本不能用,甚至錯誤產出造成嚴重問題
目前的AI產出,趨向穩定,但還是要檢查
它只是個工具,還是要人去做掌控

心得與整理大概就這樣
期待未來有更好玩的新技術之外
還有收入可以買新電腦來玩 XD

沒有留言: