PANews 7月29日消息,Kimi宣布開源多模態大模型視覺感知評測基準PerceptionBench,旨在將視覺感知能力拆解為10項原子級能力進行獨立評估,涵蓋視覺關係、計數、屬性、深度與3D、定位、比較、細粒度識別、上下文整合、OCR及幻覺識別等維度。該基準基於42個現有評測集中的模型失敗案例構建,共包含3000道經人工驗證的問題,每題僅考察單一視覺能力,無需推理或外部知識。
評測結果顯示,在16款前沿多模態大模型中,沒有任何模型整體準確率超過60%。GPT-5.6-Sol以59.7%的準確率排名第一,Kimi K3(58.5%)、Claude-Fable-5(57.2%)、Gemini-3.1-Pro(56.2%)和GPT-5.5(55.8%)位列前五。報告指出,視覺幻覺(Hallucination)仍是各模型表現最弱的能力,整體感知能力仍存在顯著提升空間。


