뤄푸리: MiMo-V2.6, 오픈소스 모델 분야에서 역대 최대 규모의 단일 강화학습 훈련 중 하나를 완료했을 수도

PANews 9월 22일 소식, 샤오미 MiMo 팀 멤버 뤄푸리가 글을 올려 MiMo-V2.6이 연산 규모 기준으로, 지금까지 오픈소스 모델 팀이 수행한 최대 규모의 단일 강화학습 훈련 중 하나일 수 있다고 밝혔다. 팀은 연산 자원이 부족한 상황에서 수십 명을 투입하고 오랜 시간에 걸쳐 강화학습 확장을 추진했으며, 모델 능력은 중기 훈련 단계에서 형성되고 대규모 강화학습을 통해 더욱 발현되었다고 전했다. 그녀는 팀이 코드 등 검증 가능한 중간 난이도 작업에는 MixRL 훈련을 적용하고, 검증이 어렵거나 초장기 주기 또는 복잡도가 지나치게 높은 작업은 별도로 훈련한 뒤 MOPD로 능력을 통합했다고 밝혔다. 에이전트 강화학습 연구를 추진하기 위해 팀은 MiMo 강화학습 궤적에서 증류한 Qwen 모델, 7000개의 다양한 환경, 그리고 완전한 강화학습 훈련 프레임워크도 공개했다. 뤄푸리는 MiMo-V2.6은 시작점에 불과하며, 팀은 지속 가능한 자기 개선형 지능 시스템을 추진하기 위해 시간, 연산 자원, 연구개발 자원을 계속 투입할 것이라고 밝혔다.

공유하기:

작성자: PA一线

이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
유럽중앙은행, 스테이블코인 준비금의 은행 예금 강제 보유에 반대
PANews 속보