PANews 9月22日消息,小米MiMo團隊成員羅福莉發文表示,MiMo-V2.6按算力規模計,可能是迄今開源模型團隊開展的最大規模單次強化學習訓練之一。團隊在算力緊缺的情況下,投入數十人並持續較長時間推進強化學習擴展,模型能力在中期訓練階段形成,並通過大規模強化學習進一步釋放。她稱,團隊針對代碼等可驗證的中等難度任務採用MixRL訓練,對難以驗證、超長週期或複雜度過高的任務則單獨訓練,再通過MOPD合併能力。為推動智能體強化學習研究,團隊還發布了一個由MiMo強化學習軌跡蒸餾而來的Qwen模型、7000個多樣化環境以及完整的強化學習訓練框架。羅福莉表示,MiMo-V2.6只是起點,團隊將繼續投入時間、算力與研發資源推進可持續自我改進的智能系統。
羅福莉:MiMo-V2.6或完成開源模型領域規模最大的單次強化學習訓練之一
分享至:
作者:PA一线
本內容只為提供市場資訊,不構成投資建議。
關注PANews官方賬號,一起穿越牛熊
推薦閱讀
PANews APP
24小時追蹤區塊鏈行業資訊,行業深度文章解析。



