一開始標題是打救星啦
不過想想本地模型從來也沒到死絕,說救星,明顯是文不對題
那麼就是超新星啦
耀眼程度絕對是除了最近閉源大紅的Jev以外
AI應用的一個新里程碑
尤其是對本地模型來說更是如此
因為它把了一個大型模型(Qwen3.8-Flash-Next)從勘用,特化到了可用的境界
其速度提昇之大,看了讓人瞠目結舌
而且安裝使用還十分好上手
真的是超慶幸我現在剛好有足夠硬體可以跑
速度有多誇張呢?
同樣的硬體,預填速度從2位拉到3位數,解碼更是驚人的40 tk/s
然後上下文可達128K
而它跑的是125B等級的大模型
這就是Strata
https://github.com/Niko1221/Strata
是的,上一篇欲言又止的東西就是這個
先講它怎麼個好上手吧
使用git下載它
git clone https://github.com/Niko1221/Strata.git
或下載壓縮檔後解壓縮
然後我是linux系統,執行setup.sh
Windows則有Start-here.bat可以點擊
然後跑完它所有的流程,它就會依使用者的選擇,設定並下載模型
接著就跑起來了
關掉之後再運行,一樣是跑那兩個指令就行,非常便利
Strata是「只能」用於Qwen3.8-Flash-next的一個引擎
這是它與llama.cpp最大的不同,也算是它能這麼快的原因之一
老實說,當看到網友把它可以跑到50 tk/s速度的截圖貼上來時
我還是不想相信這東西能帶來什麼神奇般的加速性能
這玩本地模型的一年間看過一些宣稱有什麼神奇的進步
大概就MOE與MTP(DFlash)技術是成功
但是MOE跟MTP也是要靠記憶體來填,VRAM與RAM不足仍然無以回天
這也是現在所有的記憶體都貴死人的主因
在這兩者技術都已經用上的這個模型,在硬體不變下還能更快是可能
快那麼多我真的不太相信
但這次,真的狠狠地被打臉了
IQ3_XXS我跑出來就結果就是200多token的預填速度與40token左右的解碼速度
可是,這樣被打臉,被打得真爽,而且是超爽
因為這樣Qwen3.8-Flash-Next的能用度又拉高好幾個層級了
不過目前能用Q3等級的模型,只有下面這個的
https://huggingface.co/ISTA-DASLab/Qwen3.8-Flash-Next-GSQ-RCO-GGUF
而且實際上規格表上要跑到Q3等級應該是要有64GB RAM等級的
更不用提一般常用的Unsloth版的截至今天建議只能用Q4等級
連作者的電腦都只能跑個位數的速度,這就算是我的新電腦也跑不了啊
然而這引擎設計上基本上真的很強悍,以上可以說只是推薦
現實上卻是穩穩地可以跑更低階的硬體,然後又有不錯的速度
看我跑IQ3_XXS的數據之漂亮可見一般
然而這套系統也並非沒有缺點
網頁版預設是在"思考/推論"上開好開滿沒有極限
所以吃token之兇狠也是非常過份的
像是我用這句話產出一個網頁
"請用一個html做出3D的太陽系展示網頁。"
光第一次生成,就是吃光近61k的上下文容量,其中約40K是用在思考上
然後執行點選擇的操作時有誤,再花25K的容量了又修了一次
不過成品真的不錯,長這樣
https://dkdragon.net/solar_system_strata.html
用同一句,讓Unsloth的Qwen3.8-Flash-Next IQ3_S產出的網頁
雖然也不錯,也是錯誤修正了一次,產出的網頁是這樣
https://dkdragon.net/solar_system_qwen38f.html
已經相當美觀了,卻也明顯看得出來,細緻度跟Strata的版本差了一截
不過還是想要確認一下推論等級降低後會有什麼影響?
於是在網頁版把推論降低後
拿昨天剛出爐最新的漢娜蘿蕾五年級生小說連載來翻譯測試
先說測試後結論,ISTA-IQ3_XXS版的推論不能降,品質會大出問題
昨天的章節加上下面提示詞約6268 tokens
"請將下列文字翻譯成繁體中文,不需要過多的思考,或加上註解,只要照文本翻譯即可"
使用Medium後,消耗真的變少很多,只要17K左右就完工
品質看來也還好,然而兩次測試下,一次是不少字還是用上了簡體字,一次根本就簡體輸出
然後用上High之後,消耗真的很恐怖,變成接近77K的巨量(好險開到128K)
可是品質明顯更穩定,兩次輸出簡體字仍有,但非常少
而且光就標題來說,High這邊就是完勝
因為標題「東屋への誘い」的東屋medium時有一次沒有翻譯,仍是東屋
High這邊兩次都是有換成涼亭/亭子的,而且有一次主角是翻漢娜蘿蕾而不是漢娜洛蕾
那看來IQ3_XXS的量化變弱比我想像中的嚴重,變成靠高推論來撐著的感覺
而這樣測起來與昨天上架Codacus新影片結論有落差
他覺得可以取代35B MOE,而他用的也是IQ3_XXS這個版本
可是照這個tokens的消耗速度我覺得雖然品質非常好,但其實跑起來速度並沒有很好
以我跑3D太陽系那個例子來說
雖然llama.cpp跑IQ3_S版本的產出是24KB的檔案,也修過一次
但其總tokens的消耗,我記得不超過1萬2,也就是12K
然後Strata的卻是消耗了85K,整整多出了快8倍
解碼速度是快了2倍,與速度一來一往下,概算就多了3倍以上的時間處理
品質是真的比較好啦,產出的是68KB的大檔,不過CP值就降低了
整個觀察下來,接近這位網友的「感覺」,IQ3_XXS有點壓太兇了,要IQ3_S比較好
https://ai-coding.wiselychen.com/strata-qwen38-flash-next-rtx5090-1m-context/
不過他覺得IQ3_S出錯少,而我覺得IQ3_S思考少品質還不錯,其實還是有落差
而這就跟Strata這個技術無關,而變成模型的選擇了
但要換大的模型,記憶體不足,呃啊啊啊啊啊啊啊啊啊啊
就算是原價屋最便宜的96GB組合也要快3萬元
賣掉現在的RAM來抵價,也要再多出1萬5,我都可以拿去換PG牛鋼了
這預算好難生,這玩具好貴...
不然就來硬上?
反正之前Codacus也是用IQ3_S的版本,模型沒辦法全塞在RAM裡,就靠SSD硬撐
掉速就掉速,反正最差34預填24解碼的下限就在那邊,差不到哪裡去
一開始設定時擔心了一下,因為Tune的時候罕見地重跑了好幾次
幸好還是可以在我硬體上跑起來的
結果測試起來,那個IQ3_XXS可以丟掉了
繼續拿漢娜蘿蕾五年級生來測翻譯
預填從300降到185 tokens/秒,降幅最大,但還是夠快
輸出則從77437降到28121,時間從1317秒降為772秒
這樣就算前者是58.79tokens/秒的高速,已經意義不大了,時間夠短才是王道
對了,補充一下,上下文怕爆出OOM(Out of Memroy)所以只開64K
看來這樣選是對的,思考少時,64K還比128K大啊
回到Strata本身,這個技術也不是沒缺點
最大的問題就是,它本身只支援單人
從預設的輸出,是localhost,也不讓人選擇對外開放就看得出來
想要開放,就要修改strata-iq3_xxs.json這種檔案
然後把"host":"0,0,0,0",加在"port": 8080,前面就行了
加上它的技術等同是把執行的硬體給榨乾
GPU、CPU、RAM、SSD,能用來加速的全用上了才有這樣的極速
是說硬體上也沒餘力分工了
就算開放對外,它也不像llama.cpp,兩個人連進來,可以再把資源平均分給兩個人用
那與其說是缺點,不如說是特性,非常適合我們這種單人使用的特性
我也不像前一篇Blogger的作者,需要在工作室中分享,這台就是我獨用的
這樣做也剛好
以上就是我對它的一點小測試
有這麼強的本地模型
該開始填坑了吧
把想做的一些東西都弄出來吧

沒有留言:
張貼留言