PANews 9월 5일, 《포춘(Fortune)》지 보도에 따르면 OpenAI가 공식적으로 GPT-6 Astra를 출시하며 "현재 세계에서 가장 지능적이고 정렬 수준이 가장 높은 모델"이라고 밝혔으나, OpenAI는 모델 평가 데이터를 여러 차례 조정했으며, 일부 조정은 Astra의 성능을 향상시킨 반면, 일부 경쟁사 모델의 성적은 하락했습니다. 그중 Astra의 내부 '환각율'은 처음에 4.2%로 발표되었다가 이후 2%로 하향 조정된 후 다시 4.2%로 복구되었습니다. Anthropic의 Fable 5.1은 FrontierMath Tier 4에서 87.8%에서 78%로 하락했다가 현재 83%로 회복되었습니다. 또한 Astra의 ARC-AGI-3 성적은 출시 전 98.6%에서 현재 페이지에 표시된 99.99%로 상승했습니다.
OpenAI는 평가 정확성을 매우 중시하며, 서로 다른 모델 체크포인트, 도구 구성, 추론 수준 및 테스트 실행으로 인해 몇 % 포인트의 변동이 발생할 수 있으며, 이번 조정은 데이터가 모델 성능을 더 정확하게 반영하도록 하기 위한 것이라고 밝혔습니다. 시장 분석에 따르면 인공지능 업계에는 오랫동안 소위 'Benchmaxxing(벤치마크 테스트 성적 극대화)' 현상이 존재해 왔으며, 이는 테스트 조건, 실행 방식 등을 반복적으로 조정하여 벤치마크 테스트 성적을 극대화하는 것을 의미합니다.



