Kimi, PerceptionBench 시각 인식 벤치마크 오픈소스화, GPT-5.6-Sol 정확도 1위이나 60% 돌파 모델 없음

PANews 7월 29일 소식, Kimi가 멀티모달 대형 모델의 시각 인식 평가 벤치마크 PerceptionBench를 오픈소스로 공개한다고 밝혔다. 이 벤치마크는 시각 인식 능력을 10가지 원자적 수준의 능력으로 세분화하여 독립적으로 평가하는 것을 목표로 하며, 시각 관계, 계수, 속성, 깊이 및 3D, 위치 지정, 비교, 세밀한 식별, 맥락 통합, OCR 및 환각 인식 등의 차원을 포괄한다. 해당 벤치마크는 기존 평가 세트 42개의 모델 실패 사례를 기반으로 구축되었으며, 총 3,000개의 수작업 검증 문제로 구성되어 있다. 각 문항은 오직 하나의 시각 능력만을 평가하며 추론이나 외부 지식을 필요로 하지 않는다.

평가 결과, 16개의 선도적인 멀티모달 대형 모델 중 전체 정확도가 60%를 넘는 모델은 단 하나도 없었다. GPT-5.6-Sol이 59.7%의 정확도로 1위를 차지했으며, Kimi K3(58.5%), Claude-Fable-5(57.2%), Gemini-3.1-Pro(56.2%), GPT-5.5(55.8%)가 상위 5위에 올랐다. 보고서는 시각적 환각(Hallucination)이 여전히 각 모델에서 가장 취약한 능력이며, 전반적인 인식 능력에는 여전히 상당한 개선 여지가 존재한다고 지적했다.

공유하기:

작성자: PA一线

이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
분석: 비트코인 주요 지지선 붕괴로 10일 신저가 기록, AI 섹터 매도세 암호화폐 시장으로 확산
PANews 속보