PANews 9月5日,據《財富》報導,OpenAI已正式發布GPT-6 Astra,並稱其為「目前全球最智能、且對齊程度最高的模型」,不過OpenAI已多次調整模型評測數據,部分調整使Astra表現更佳,同時部分競爭對手模型的成績出現下降。其中,Astra的內部「幻覺率」最初公布為4.2%,後曾被下調至2%,隨後又恢復至4.2%;Anthropic的Fable 5.1在FrontierMath Tier 4中的成績也曾從87.8%降至78%,目前已恢復至83%。此外,Astra的ARC-AGI-3成績則從發布前的98.6%提升至當前頁面顯示的99.99%。
OpenAI回應稱,將高度重視評測準確性,不同模型檢查點、工具配置、推理等級及測試運行均可能造成幾個百分點的波動,此次調整是為了確保數據能夠更準確反映模型性能。市場分析指出,人工智慧行業內長期存在所謂「Benchmaxxing」現象,即通過反覆調整測試條件、運行方式等來最大化基準測試成績。



