2兆參數模型
大陸政經
DeepSeek執行長梁文鋒近日向投資人透露,公司正積極訓練一款參數規模達2兆的模型,後續更計畫開發8兆參數模型。若計畫順利推進,DeepSeek新模型的參數規模將遠超現有主流大型語言模型。據《ChainCatcher》報導,DeepSeek目前旗艦模型V4-Pro總參數量為1.6兆個,每個Token啟用49億個參數。
2026-09-22
大陸政經
DeepSeek執行長梁文鋒近日向投資人透露,公司正積極訓練一款參數規模達2兆的模型,後續更計畫開發8兆參數模型。若計畫順利推進,DeepSeek新模型的參數規模將遠超現有主流大型語言模型。據《ChainCatcher》報導,DeepSeek目前旗艦模型V4-Pro總參數量為1.6兆個,每個Token啟用49億個參數。