KimiがPerceptionBench視覚知覚ベンチマークをオープンソース化、GPT-5.6-Solが精度トップも60%突破モデルなし

PANews 7月29日報道、Kimiはマルチモーダル大規模モデルの視覚知覚評価ベンチマーク「PerceptionBench」をオープンソース化したと発表した。これは視覚知覚能力を10項目の原子的能力に分解し、独立して評価することを目的としており、視覚関係、計数、属性、深度と3D、位置特定、比較、細粒度認識、文脈統合、OCR、幻覚識別などの次元をカバーしている。このベンチマークは、42の既存評価セットにおけるモデルの失敗事例に基づいて構築され、人手で検証された合計3000問の問題で構成されており、各問題は単一の視覚能力のみを考察し、推論や外部知識を必要としない。

評価結果によると、16種類の最先端マルチモーダル大規模モデルのうち、全体の精度が60%を超えたモデルは存在しなかった。GPT-5.6-Solが59.7%の精度で1位となり、Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)、GPT-5.5(55.8%)がトップ5に入った。報告書は、視覚的幻覚(Hallucination)が依然として各モデルで最も弱い能力であり、全体的な知覚能力には依然として大幅な向上の余地があると指摘している。

共有先:

著者:PA一线

この内容は市場情報の提供のみを目的としており、投資助言を構成しません。

PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
PANews APP
分析:ビットコインが主要サポート割れで10日ぶり安値、AIセクターの売りが暗号資産市場に波及
PANews 速報