PANews 9月5日、『フォーチュン』の報道によると、OpenAIは正式にGPT-6 Astraを発表し、「現在世界で最も知的で、かつ最も整合性の高いモデル」と称した。ただし、OpenAIはモデルの評価データを複数回調整しており、一部の調整によりAstraのパフォーマンスが向上した一方、競合他社のモデルのスコアが低下した。Astraの内部「幻覚率」は当初4.2%と発表されたが、後に2%に引き下げられ、その後再び4.2%に戻された。AnthropicのFable 5.1のFrontierMath Tier 4におけるスコアも87.8%から78%に低下した後、現在は83%に回復している。さらに、AstraのARC-AGI-3スコアは発表前の98.6%から、現在のページ表示では99.99%に向上している。
OpenAIはこれに対し、評価の正確性を非常に重視する方針を示し、異なるモデルのチェックポイント、ツール設定、推論レベル、テスト実行などによって数パーセントポイントの変動が生じる可能性があると説明。今回の調整は、データがモデルのパフォーマンスをより正確に反映することを確実にするためのものだと述べた。市場分析によれば、人工知能業界では長年にわたり、テスト条件や実行方法などを繰り返し調整してベンチマークスコアを最大化する、いわゆる「Benchmaxxing」現象が存在している。



