DeepSeek推出NSA,用於超快速的長上下文訓練和推理
BlockBeats 律動財經 2025-02-18 17:30
BlockBeats 訊息,2 月 18 日,DeepSeek 宣布推出 NSA,這是一種與硬體一致且本機可訓練的稀疏注意力機制,用於超快速的長上下文訓練和推理。
透過針對現代硬體的最佳化設計,NSA 加快了推理速度,同時降低了預訓練成本,而不會影響效能。在一般基準測試、長上下文任務和基於指令的推理上,它的表現與完全注意力模型相當甚至更好。 (金十)
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與虛擬貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
- 掌握全球財經資訊點我下載APP
文章標籤
上一篇
下一篇