OpenAI, GPT-6 Astra 평가 데이터를 조용히 조정한 것으로 드러나, 일부 지표는 '역방향' 최적화

PANews 9월 5일, 《포춘(Fortune)》지 보도에 따르면 OpenAI가 공식적으로 GPT-6 Astra를 출시하며 "현재 세계에서 가장 지능적이고 정렬 수준이 가장 높은 모델"이라고 밝혔으나, OpenAI는 모델 평가 데이터를 여러 차례 조정했으며, 일부 조정은 Astra의 성능을 향상시킨 반면, 일부 경쟁사 모델의 성적은 하락했습니다. 그중 Astra의 내부 '환각율'은 처음에 4.2%로 발표되었다가 이후 2%로 하향 조정된 후 다시 4.2%로 복구되었습니다. Anthropic의 Fable 5.1은 FrontierMath Tier 4에서 87.8%에서 78%로 하락했다가 현재 83%로 회복되었습니다. 또한 Astra의 ARC-AGI-3 성적은 출시 전 98.6%에서 현재 페이지에 표시된 99.99%로 상승했습니다.

OpenAI는 평가 정확성을 매우 중시하며, 서로 다른 모델 체크포인트, 도구 구성, 추론 수준 및 테스트 실행으로 인해 몇 % 포인트의 변동이 발생할 수 있으며, 이번 조정은 데이터가 모델 성능을 더 정확하게 반영하도록 하기 위한 것이라고 밝혔습니다. 시장 분석에 따르면 인공지능 업계에는 오랫동안 소위 'Benchmaxxing(벤치마크 테스트 성적 극대화)' 현상이 존재해 왔으며, 이는 테스트 조건, 실행 방식 등을 반복적으로 조정하여 벤치마크 테스트 성적을 극대화하는 것을 의미합니다.

공유하기:

작성자: PA一线

이 내용은 시장 정보 제공만을 목적으로 하며, 투자 조언을 구성하지 않습니다.

PANews 공식 계정을 팔로우하고 함께 상승장과 하락장을 헤쳐나가세요
PANews APP
이더리움 현물 ETF 어제 순유입 2646.13만 달러, 블랙록 ETHA 순유입 5779.15만 달러로 1위
PANews 속보