DFlash團隊進軍Mac,27B模型跑到144Token/s
BlockBeats 律動財經
動察 Beating AI 快訊,Inco AI 開源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 隨即接入,0.4.25 版本已經可以直接使用。
Inco 此前做出的 DFlash 已經進入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也給自家模型配了 DFlash 加速小模型。DFlash 會先讓小模型並行猜出多個 Token,再交給大模型批量驗證,減少逐 Token 生成的計算。
Splash 把這種優化擴到了整個本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每個模型都單獨配了 GPU kernel、內存方案和 DFlash 2 小模型。覆蓋的模型少,但換來了更激進的性能優化。
144 Token/s 是 M5 Max 上的最高演示值。換到 Inco 用來做橫向測試的 48GB M5 Pro,Qwen3.8-27B 單路短上下文達到 74 Token/s;4 路並發時總吞吐達到 170 Token/s,是第二名的 3.9 倍。這也是 Splash 更適合 Agent 場景的地方。一個 Agent 同時拉起多個子任務時,並發總吞吐往往比單條對話速度更重要。
Splash 本身開源,不綁定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 統一內存。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 買幣要選交易所!優惠盡在鉅亨買幣
- 掌握全球財經資訊點我下載APP
延伸閱讀
- 比特幣又被Fed嚇跌!8萬美元屢攻不破 連四日走低
- 比特幣多頭夢醒?非農強勁引爆Fed升息警報 才站回8萬美元又被打下來
- 橋水達里歐改口建議持有比特幣!分析:想靠它避險恐怕「錯了」
- 比特幣為何突然暴漲?能否突破8萬美元需觀察這「三項指標」
- 講座
- 公告
上一篇
下一篇