BlockBeats 律動財經
動察 Beating AI 快訊,小米 MiMo 負責人羅福莉在 MiMo-V2.6 發布後進一步解釋了這輪強化學習。她稱,自己曾參與 DeepSeek R1,而 MiMo-V2.6 背後的研究創新和工程挑戰,在她看來已經超過 R1。
她還解釋了 MiMo 為什麼同時使用 MixRL 和 MOPD。MixRL 是把代碼、通用 Agent、視覺和網絡安全等可驗證任務混在同一輪強化學習裡一起訓練;MOPD 則負責處理超長、難驗證或獎勵較主觀的任務,先單獨訓練,再把這些能力整合回主模型。
遊戲、3D 這類任務一次運行時間太長,而且不好自動判斷對錯。如果和代碼等任務放在同一輪 RL 裡,會明顯拖慢訓練。MiMo 因此把這類任務單獨訓練,再通過 MOPD 把學到的能力合回主模型。
發佈者對本文章的內容承擔全部責任
在投資加密貨幣前,請務必深入研究,理解相關風險,並謹慎評估自己的風險承受能力。不要因為短期高回報的誘惑而忽視潛在的重大損失。
暢行幣圈交易全攻略,專家駐群實戰交流
▌立即加入鉅亨買幣實戰交流 LINE 社群(點此入群)
不管是新手發問,還是老手交流,只要你想參與加密貨幣現貨交易、合約跟單、合約網格、量化交易、理財產品的投資,都歡迎入群討論學習!
上一篇
下一篇