PANews 9月22日の報道によると、小米MiMoチームメンバーの羅福莉氏は、MiMo-V2.6は計算能力の規模で見ると、これまでオープンソースモデルチームが実施した最大規模の単一強化学習トレーニングの一つである可能性があると投稿した。チームは計算能力が逼迫する中、数十人を投入し、長期間にわたって強化学習のスケーリングを推進。モデル能力は中期トレーニング段階で形成され、大規模強化学習によってさらに引き出された。彼女によると、チームはコードなど検証可能な中程度の難易度のタスクにはMixRLトレーニングを採用し、検証が困難、超長期サイクル、または複雑度が高すぎるタスクには個別にトレーニングを行い、その後MOPDで能力を統合したという。エージェント強化学習の研究を推進するため、チームはMiMo強化学習の軌跡から蒸留したQwenモデル、7000の多様な環境、そして完全な強化学習トレーニングフレームワークも公開した。羅福莉氏は、MiMo-V2.6はあくまで出発点に過ぎず、チームは持続可能な自己改善型インテリジェントシステムの推進に向けて、時間、計算能力、研究開発リソースを引き続き投入していくと述べた。
羅福莉:MiMo-V2.6はオープンソースモデル分野で最大規模の単一強化学習トレーニングの一つを完了した可能性
共有先:
著者:PA一线
この内容は市場情報の提供のみを目的としており、投資助言を構成しません。
PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
おすすめ記事
関連トピック
PANewsアプリ
24時間ブロックチェーン業界情報を追跡し、深掘り記事を解析。



