2026年10月7日 星期三

本地模型應用的超新星-Strata

一開始標題是打救星啦
不過想想本地模型從來也沒到死絕,說救星,明顯是文不對題
那麼就是超新星啦
耀眼程度絕對是除了最近閉源大紅的Jev以外
AI應用的一個新里程碑
尤其是對本地模型來說更是如此
因為它把了一個大型模型(Qwen3.8-Flash-Next)從勘用,特化到了可用的境界
其速度提昇之大,看了讓人瞠目結舌
而且安裝使用還十分好上手
真的是超慶幸我現在剛好有足夠硬體可以跑

速度有多誇張呢?
同樣的硬體,預填速度從2位拉到3位數,解碼更是驚人的40 tk/s
然後上下文可達128K
而它跑的是125B等級的大模型

這就是Strata
https://github.com/Niko1221/Strata

2026年10月6日 星期二

新桌機與各AI模型實測

這天還是來啦,只是比想像中的早了不少
玩本地AI模型到後來終究還是買了台新電腦
講真的,現在真不是買新機的好時機
因為記憶體與顯示卡價格在今年一路往上狂漲
所以之前一直在等等看,看何時可以往下

沒想到持續至今已經較過去平均價格溢價超過5成
如果要照我的需求,RTX5060 Ti 16GB顯示卡+32GB RAM條件
組個一台最低規格的桌機
現在10月份,金額已經來到6萬大關,還沒有包含螢幕、鍵盤與作業系統...
而這以前是能買台高階電腦的範圍耶
CPU、記憶體、SSD還是顯示卡,至少有一項有機會拉到很高的規格
如今這價位也只能勉強選個顯卡與RAM勘用的等級
那似乎再不買,未來一年左右只能是望新機而興嘆
可是真的要買嗎?

最後推了我一把的有兩件事,幾乎是一起發生
第一件事,剛好找到有5萬元左右的組可以滿足我的最低規格需求
第二件事,可說是實際的起爆劑,剛好看到印度Youtuber Codacus的影片


說12GB顯卡+32GB的RAM可以跑Qwen3.8-Flash-Next Q3版!!!
看完影片當下就決定買了
就這樣,決定購入了20年來不曾購買的新桌機
開始玩一些以前不能玩過的AI模型

2026年8月22日 星期六

租用Runpod算力跑ComfyUI產出3D模型

如去年那篇提到,家中電腦的GPU實在不夠力
所以ConmfyUI就只有去年體驗了一下下後就停了
直到最近有需求,幾經評估
就決定花點小錢來租用雲端算力服務,完成這個需求
不然買台看得上眼的新的電腦實在太貴太貴太貴了

當然,要讓ComfyUI跑得順不只有租算力平台的選項
還有官方營運平台ComfyCloud可以申請使用
那...之所以不考慮官方
圖的當然是更自由的應用,也就是想偶爾跑跑現在最新的LLM模型看看
只是這選項實現的佔比跟零差不多就是......
總之註冊與繳錢後,就斷斷續續在上面進行測試好一段時間
最近終於做出想要的成品的雛型
當然還要再修過,就在這裡留個設定上的記錄

2026年7月26日 星期日

本地大型語言模型(LLM)使用一年心得

已經玩了超過一年的免費本地LLM
目前感受到整個發展其實已經差不多到一個穩定期了
雖然最近有幾次被驚嚇以為有什麼新突破
但實測下來都是令人失望的
加上Google主要競爭對手阿里巴巴差不多等同退出這領域
轉為閉源服務與開發超大參數(Qwen 3.8 2.4T參數最好本地跑得動啦)
然後Google也沒有再更新版次(連Gemini 3.5 Pro都快生不出來了)
應該就是進入一個穩定期了
就對這一整年,尤其是這半年玩起來的狀況寫個心得與小整理
(以下文章長,只有一張圖)

2026年6月29日 星期一

Claude code搭配llama.cpp跑本地模型

上一篇挑戰相關議題的文章是3月份寫的這一篇
那時的情況是,小參數21B以下就是不行
中等參數30B以上的,家裡最強電腦上慢得像龜一樣
跑的太勉強(5~7 tokens/秒),也是跟沒用差不多
沒想到技術發展之快,5月初得知MOE有特殊用法時[1]
Claude Code搭配MOE模型就來到能用的範圍了
目前這篇寫的大部分設定都是那時候搞定的
不過對於我工作用的電腦沒屁用
因為MOE技術要卸載無法上VRAM的模型到一般記憶體中
只有16GB RAM的工作電腦辦不到這件事
家裡那台可以,但沒必要
在家跑Claude Code時,除了個人隱私外,都是沒機密性的東西
乾脆用Claude code直接連Opus或是Sonnet還比較好用
加上5月忙到6月中,就沒有更進一步寫成blog留存了

直到最近工作暫告一段落,又想回頭來測試這一塊
測了一下4月底發表,最近官方自己壓縮的Gemma4-E4B QAT模型發現算是可以跑了
讓我一開始開心了一下,也開啟這篇文章的撰寫
只是嚴格說來這算假象,小參數模型進步算非常大,但工具調用仍然不穩定
即便克服了工具問題了,以產出程式碼品質來說,它的上限仍然不到及格線
測到這裡,因為沒達成預期用Gemma4-E4B跑的目標,本來想把這篇給廢了
後來想想寫都寫了,其實上一篇也是失敗的記錄,還是繼續測下去
繼續測試後,要稱得上穩定可用,還是得更多參數的Gemma4-12B這種等級
可是工作用電腦其實跑不太動
有再降階換Qwen3.5-9B測試,不過程式碼產出的表現依然不穩定
看來就這樣了
就把資料整理整理,重改一下文章內容後推出
而之前也確實沒記錄Claude Code怎麼搭配llama.cpp(llama-server)
也趁這篇寫一下記錄
以下就是詳細的失敗記錄與Claude Code如何搭配llama-server的設定說明
還有後續不死心測試的補充

2026年5月17日 星期日

Legend BB 第一彈 飛驅鳥大將軍

終於還是入手Legend BB這個系列啦
這次購入的是萬代PB商店中的特規品
天宮之國繼新世大將軍後,年輕一代的新大將軍
Legend BB 第一彈 飛驅鳥大將軍!


2026年4月30日 星期四

漫畫翻譯軟體Koharu的LLM使用補充說明

從月初的0.41版開始使用
現在已經一口氣改版到0.55版了
基本的操作介面並沒有什麼大改
所以上一篇操作說明的部分就不改動
但是關於LLM的部分算是一路大修到現在
所以這篇算是LLM功能的補充攻略