‌
‌
‌
‌
‌
快訊

DFlash團隊進軍Mac,27B模型跑到144Token/s

BlockBeats 律動財經

動察 Beating AI 快訊,Inco AI 開源本地推理引擎 Splash,把 Qwen3.8-27B 在 M5 Max MacBook Pro 上跑到了最高 144 Token/s。LM Studio 隨即接入,0.4.25 版本已經可以直接使用。


Inco 此前做出的 DFlash 已經進入 SGLang、vLLM、TensorRT-LLM 和 llama.cpp。Meta、NVIDIA、小米、Poolside 等也給自家模型配了 DFlash 加速小模型。DFlash 會先讓小模型並行猜出多個 Token,再交給大模型批量驗證,減少逐 Token 生成的計算。

‌


Splash 把這種優化擴到了整個本地推理引擎。它目前只支持 Qwen3.8-27B 和 Qwen3.6-35B-A3B,每個模型都單獨配了 GPU kernel、內存方案和 DFlash 2 小模型。覆蓋的模型少,但換來了更激進的性能優化。


‌

144 Token/s 是 M5 Max 上的最高演示值。換到 Inco 用來做橫向測試的 48GB M5 Pro,Qwen3.8-27B 單路短上下文達到 74 Token/s;4 路並發時總吞吐達到 170 Token/s,是第二名的 3.9 倍。這也是 Splash 更適合 Agent 場景的地方。一個 Agent 同時拉起多個子任務時,並發總吞吐往往比單條對話速度更重要。


Splash 本身開源,不綁定 LM Studio。目前需要 M3 或更新的 Mac、macOS 26.4 以上、至少 36GB 統一內存。

原文連結

發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。

暢行幣圈交易全攻略,專家駐群實戰交流

▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!

▶ 前往鉅亨買幣找交易所優惠

‌
section icon

鉅亨講座

看更多
  • 講座
  • 公告
    ‌
    Empty
    Empty
    ‌