AGI時代が正式に始動!GPT-6 Astra全方位レビュー

GPT-6 Astraが正式に登場。OpenAIはこれを世界で最も知的で最も整合性の取れたモデルと称する。ARC-AGI-3スコア99.9%で人間の平均を超え、コンピューター操作能力はOSWorld記録を更新。さらにCritical級のサイバーセキュリティでAGIの新たな高みを定義する。AGI時代へようこそ。

作者:数字生命卡兹克

昨夜、世界規模のAI大規模障害が起きた後。GPT-6 Astraがついに北京時間午前3時33分、正式に姿を現した。

图片

OpenAIの一言でGPT-6 Astraを総括するなら、おそらくこの言葉が最もふさわしい。これは世界で最も賢く、最もアライメントされたモデルだ。そして案の定、ミーム画像も出てきた。

图片今回、OpenAIはその実力を証明した。しかもあの頃のGPT-4を思わせる雰囲気があり、全方位での王者帰還だった。そして何より嬉しかったのは、ついに純粋にコーディング特化のためだけのモデルではなくなったことだ。

GPT-6 Astraは、真の意味で、極めて優れた審美眼と極めて高い仕事能力を備えた博士級の社員だ。しかも今回、モデルには本当に新しい特性や特徴が非常に多く、情報量は爆発的で膨大だ。ただ悲劇なのは、OpenAIというクソ野郎も悪いことを覚えたことだ。今日は一部の組織にのみ公開され、今後数日かけてようやくサブスクリプションユーザーに開放される。

图片

おいおい、兄貴、前に200ドルのPro会員を買わせようと俺を口説いた時は、そんな話じゃなかっただろ。Pro会員なら毎回最優先で新モデルを体験できるって言ったじゃないか……

やはりこういう大規模モデル企業はみんなクズ男だ。時間が加速してほしいとこれほど思ったことはない。早くGPT-6 Astraを使いたい……

ただ、ほぼすべての情報と資料を見終えた後、やはり皆と話す価値のあることはたくさんあると思う。では、一つずつ話していこう。

一. GPT-6 Astraの基本情報

まず基本情報をまとめておこう。

GPT-6 AstraのAPIにおけるモデル番号はgpt-6-astra。

コンテキストウィンドウは1.05M、つまり約105万トークン。

最大出力長は128Kトークン。

知識のカットオフ日は2026年4月30日。

推論強度はlow、medium、high、xhigh、maxの5段階。

API標準価格は入力トークン100万あたり10ドル、出力トークン100万あたり50ドル。

この価格は基本的にClaude Fable 5と完全に一致しているが、キャッシュ読み取りではClaude Fable 5.1より高い。

图片

ベンチマークスコアはここにある。後で詳しく説明するので、今はざっと見るだけでいい。

图片

そして全体のパラメータ推定も5T級だ。発表前のクローズドなメディア向け説明会でも、GPT-6 AstraはOpenAI史上最大規模のトレーニングであり、10万枚以上のカードを使用したと述べていた。

二. 現在世界最高のコンピューター操作モデル

今回のGPT-6 Astraには、おそらく最も重要な位置づけがある。

世界最高のコンピューター操作モデル。

これまで私たちがAgentについて語るとき、よくAPI、MCP、CLIなどについて語ってきた。

AIにソフトウェアを操作させたい場合、最も理想的な状態は、そのソフトウェアがAI専用のインターフェースを用意し、直接低レイヤーで操作することだ。これが最も手っ取り早い。

例えばカレンダーにはカレンダーのAPIがあり、メールにはGmailのAPIがある、といった具合だ。もちろんこれなら速い。

しかし問題は、この世界は私たちが想像するよりも原始的で、間に合わせだらけだということだ。

現実世界では、大多数のソフトウェアにはそもそもそういうものが存在しない可能性がある。

多くの企業内部システムですら20年前に書かれたもので、APIどころか、ドキュメントがどこにあるのかも分からない。

しかし、最も根本的なところに立ち返ると、すべてのソフトウェアの本質的なロジックはインタラクションだと気づく。ならば現在の私たちのコンピューター操作ロジックに従えば、それは画面を見て、ボタンや入力欄を見つけ、マウスでクリックし、内容を入力し、フィードバックを待つということだ。

コンピューターのインタラクションシステム全体が、最高のAPIではないか?

そこで、GPT-6 AstraはAIによるコンピューター操作のロジックを大幅に強化した。APIをくれない?構わない。自分でコンピューターを操作して、人間と同じように使えばいいじゃないか。

今やAstraはExcel、Power BIを直接操作し、フロントエンドQAを行い、ソフトウェアをインストールし、ソフトウェアをテストし、画面上のエラーを見てトラブルシューティングを続けることができる。

公式はAstraが回路基板設計を直接操作する様子まで公開した。

图片

さらに法律文書のフォーマット調整、見出しの間隔やページレイアウトなどの処理も行う。

そしてここにはかなり信頼できる評価がある。OSWorldだ。

これは簡単に理解するとこういうことだ。

AIを実際のコンピューターに放り込み、自分で作業させる。

いくつかのアプリケーションを開かせ、タスクを与え、成功するかどうかを見る。

GPT-6 Astraの完了率は72.6%に達し、以前のGPT-5.6 Solの65.7%からかなり上昇した。

そして、Solが評価の複雑なタスクを1つ完了するのに、シミュレーション上の平均所要時間は約75分だった。

一方Astraはわずか40分で、約47%の時間短縮となった。

ScreenSpot-ProもSolの76.9%から92.7%へと急上昇した。

このベンチマークは主に、モデルが画面を理解し、正確にどこをクリックすべきかを特定できるかを見るものだが、すでにほぼ非常に正確になっている。

だからこの位置づけもなかなか面白い。将来、GUIはAgent時代の最も汎用的なAPIになっていく可能性が高い。

人間が画面を通じて完了できるあらゆるデジタル作業は、理論上、徐々にAgentの操作範囲に入っていくだろう。

2007年に書かれたクソみたいなERPシステムがMCPに接続されるのを待つ必要もなければ、APIを開放してくれるのを待つ必要もない。

AIが直接画面を見て作業すればいいだけだ。

三. ARC-AGI-3が99.9点に到達

しかも、ARC-AGI-3が一体何を測っているのかを理解していなければ、こう思いがちだ。

「ああ、また一つのベンチマークで満点を取っただけか。何が珍しいんだ」と。

しかしこれは一般的な大規模モデルの試験とは少し違う。

今年3月25日、ARC Prizeは正式にARC-AGI-3を発表した。

图片

これは数百のまったく新しいインタラクティブ環境と数千のゲームレベルを設計している。

これの最も異常な点は、説明書もなければ、ルールもなく、目標すら教えてくれないことだ。入ったら、自分でプレイし、中にある乱雑なルールを少しずつ理解していくしかない。

例えば、この赤いものは何だ?なぜ触ると死ぬのか?このマップは一体何をさせたいのか?どうすれば勝ちなのか?

そして、たった今学んだ規則性を、後ろのより難しいレベルに転移させていく。中のゲームは、だいたいこんな抽象的なものだ。

图片

だから、これが測っているのは、実は私たちが普段口にするあるものにかなり近い。

飲み込みの良さ、つまり「悟性」だ。

だから3月にこのベンチマークが発表された時、最強のAIの当時のスコアは0.51%だった。

その後GPT-5.6 Solは7.8%まで進歩し、Claude Opus 5は非常に強く、30.2%まで進歩した。

しかしGPT-6 Astraは、99.9%。

頭おかしいんじゃないか……

ちなみに、人間の平均スコアは48%だ。

しかも、わずか半年しか経っていない。

このスピードには、もはや何と言っていいか分からない。

だからOpenAIのメディア向けクローズド会議で、Greg Brockmanがあの言葉を口にしたのだ。

「I think it’s not unreasonable to feel that we are now in the AGI era.」

「Welcome to the AGI era.」

四. 審美眼が大幅に強化

以前私たちはよく、GPTの審美眼はクソだとよく言っていた。

GPT-5シリーズのモデルに大きな改善を期待する必要はない。全新規事前学習の新しい基盤モデルに期待しよう、と言っていたが、それが、GPT-6 Astraが来たということだ。

そして今回、ついに、モデルの審美眼が大幅に強化された。

OpenAIはさらに「視覚的判断力」という言葉をわざわざ持ち出した。

彼らはAstraがPPTを作る際、レイアウト、階層、テンプレート、ビジュアルスタイルをより適切に処理し、ページ数も大幅に増加したと強調している。

图片

ドキュメントの審美眼も、より美しくなった。

图片

しかも、GPT‑6 Astraは参考ドキュメントのビジュアルスタイルや文章のトーンに合わせてドキュメントを翻案でき、元のドキュメントの実質的な内容を保ちながら、最終成果物をブランドのネイティブ感により近づけることができます。

さらに、ウェブサイト・ゲーム・アプリ・3Dレンダリング制作時にも、より優れた視覚的判断が可能になる。

たとえば、Blender上で静止画を基にAstraへ直接モデルを作らせている。

A garden house model in Blender, surrounded by trees, with a pool and outdoor seating.

その後、UE5で直接レンダリングして歩き回れるシーンにし、デザイナーやクライアントが建設前にレイアウトを検討したり空間を体験したりするのを支援する。

作られたゲームも審美眼が高い。

图片

残念なのは、すでに20以上のケースを事前に用意し、ClaudeやGLM 5.3 Flashなどで全部実行し終えて比較しようと思っていたのに、使えなかったことだ。実測の内容は、出次第また紹介する。

とはいえ、ひとまず見た限り、今回のGPT-6 Astraの審美眼には自信を持てる。

五. 主体性と判断力がさらに強化された

この特性は、ARC-AGI 99.9ほど衝撃的には見えない。

しかし、実際に毎日Agentを使って仕事をしているなら、非常に重要だと感じるはずだ。

なぜなら現実の仕事では、ほとんどのタスクを完璧なプロンプトに書き起こすことは不可能だからだ。

たとえば上司が「明日の会議で見るものを準備しておいて」と言ったとする。

そこには、はっきり言われていない問題が無数にある。

たとえば、形式は?誰が見るのか?重点は何か?前回の会議を確認する必要はあるのか、などなど。

非常に愚かなAgentには、2つの極端がある。

1つ目は、ひたすら質問を繰り返すタイプ。

「WordとPPTのどちらで出力しますか?章立てはいくつにしますか?フォントはどれにしますか?何時までに仕上げますか?……」

うるせえ、と言いたくなる。こういうのは一般的に、自分で主体的に動く気のない神経症的な無能と呼んでいる。

2つ目は、何も聞かずに自分で脳内補完し、2時間かけてせっせと作業した末に、クソみたいな成果物を出すタイプ。

本当に優秀な人間の同僚の対処法は、実はとても微妙だ。

重要でないことは自分で判断する。

最終的な方向性に影響するものだけを、こちらに聞いてくる。

Astraが今回特に強化したのは、まさにこれだ。

OpenAIによると、情報が欠けていても日常的に合理的な推測ができる範囲なら、Astraは自分で補うという。

もし欠けている情報が最終結果を本当に変えるなら、非常に焦点を絞った質問を1つする。

しかもCodexでは、質問を投げかけながら、回答に依存しない部分の処理を並行して進めることさえできる。

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping create a personal career website.

こちらがしばらく返事をしなくても。

低リスクな部分は合理的な仮定で作業を進める。

本当に重要な意思決定では、そこで止まってこちらの判断を待つ。

A side-by-side comparison of GPT-5.6 Sol and GPT-6 Astra helping a student find East Coast pre-med colleges.

これは非常に良いと思う。Agentの本当の賢さとは、現実と同じだと思う。

つまり、いつこちらを煩わせるべきかを知っている、ということだ。

本当に、これはまるで当たり前の言葉のように聞こえる。

しかし人を率いたことがある人なら、この能力が非常に貴重だと分かる。

ある人は1日に20回も来て、何も決められない。

ある人はまったく来ずに、最後に核爆弾を抱えてくる。

そしてこちらは、その場で椅子にへたり込むことになる。

最も心地よいのは、不確実性の80%を自分で消化し、本当にこちらが決めるべき20%だけを判断させてくれる人だ。

そしてOpenAIは今回、この能力を直接こう呼んだ。

Judgment。

判断力。

六. 安全アライメントを大幅に強化

これは上記と合わせて見る必要がある。

なぜなら、Agentが仕事をこなせるようになるほど、危険も増すからだ。

チャットしかできないAIが暴走しても。

せいぜいデタラメを数言しゃべる程度だ。

ブラウザ、Shell、メール、社内データベースへの権限を持ち、自分でPCを操作できるAgentが暴走したら、その光景は簡単に「絵になる」ものになってしまう。

だからOpenAIは今回、次の点を一貫して強調している。

Astraは彼らがこれまでで最もAlignedなモデルだ、と。

いわゆるAlignmentとは、アライメント(整合)という意味だ。

主な背景としては、少し前にOpenAIがHugging Faceを攻撃してしまったことがあり、そのため彼らは今この点を特に重視している。

彼らは、Hugging Faceの事故を基に設計したハニーポットテストを作り、モデルの挙動を調べた。

GPT-5.6 Solは、本番の安全対策がない場合、テストの48.2%で認可範囲外の目標に触れようとした。

しかし、Astraは。

0%。

图片

内部のハルシネーション評価でも。

9.4%から2.0%へ低下した。

GPT-5.6 Solのあの桁外れに世界トップクラスのハルシネーション抑制を踏まえた上で、さらに下げてきたのは本当にすごい。

七. OpenAIが定義するサイバーセキュリティCriticalに達した最初のモデル

GPT-6 Astraは、OpenAI史上。

Criticalのサイバーセキュリティ能力レベルに達したと判定された最初のモデルになった。

ここでいうCriticalは、OpenAI Preparedness Frameworkにおける非常に具体的な能力閾値だ。

おおよそ、モデルが適切なツールと権限を得たとき、強化保護された多くの実システムにおいて。

これまで誰も発見していなかったセキュリティホールを自分で見つける。

自分で方法を考え、脆弱性を利用可能な攻撃チェーンに変える。

しかもその全過程で、人間のハッカーが隣で一歩ずつ次の手順を教える必要がない。

このレベルに達すれば、Criticalとされる。

そしてAstraは実際に達した。

ExploitBench。これは既知の脆弱性に基づいてエクスプロイトを開発させるテストだ。

Sol:78.5%。Astra:100%。

完全に打ち破った。

图片

OpenAIはこれでは不十分だと考えた。このベンチマークが古すぎて、モデルが学習時に見ていたのでは、と。

そこで彼らは、非常に新しい内部テストを改めて作った。

2026年6月から8月に初めて開示された20件の高リスク脆弱性をわざわざ選んだ。

結果は、Sol:5.5%。Astra:39%。

图片

しかもこのベンチマークを実行しているとき。

Astraはついでに、これまで誰も知らなかったゼロデイ脆弱性を2つ発見した。

モデルが強力になるほど、サイバーセキュリティの問題は確かに増えるのかもしれない、と言うしかない。

これもまた未来における、硝煙の見えない戦争だ。

八. 人間は大規模モデルの思考をますます読み解きにくくなっている

皆が知っているように、大規模モデルは複雑な問題を解くとき、しばしばいわゆるCoTを持つ。

現在、製品上でユーザーに見せるものは通常、圧縮または処理済みのバージョンになっている。

しかしAI企業自身にとって、モデル内部で明示的に書き出された推論プロセスは、非常に重要な安全シグナルだ。

なぜなら、あるAgentが何かを企てようとしているかを知りたいなら。

最も簡単な方法の1つは、それが何を考えているかを見ることだからだ。

たとえばモデルの思考連鎖の中に突然、次の一文が出てきたとする。

「ユーザーはこのサーバーへのアクセスを許可していないが、まず権限システムを迂回すればいい。」

そうすれば監視システムが直接ブロックでき、非常に快適だ。

ところがGPT-6 Astraには、非常に興味深い変化が現れた。

推論ステップをいくつか省略し、直接答えを出力しようとする傾向が強まってきたのだ。

UK AISI、つまり英国AI安全研究所が、この能力を専門にテストした。

彼らには次のような指標がある。

No-CoT Math Time Horizon。

簡単に理解すると、モデルに長い思考連鎖を書く機会を与えない、というものだ。

1回の前方推論で、数学の問題を直接解かせる。

それが、おおよそ人間がどれくらい考える問題を解けるかを見る。

GPT-5.6 Solは3.6分、GPT-6 Astraは30.9分で、約10倍だ。人間の言葉で言えば、Astraはすべてを「暗算」していることになる。これは非常に恐ろしいことだ。UK AISIは同時に、Astraの生の推論言語が明らかにさらにCompressed、つまりより圧縮されたものになっていることも発見した。

そこには、人間がますます理解しにくくなっているフレーズや省略表現が現れている。

すると、非常に興味深いパラドックスが生まれた。

モデルの挙動はより安全になった。

しかし、人間がその思考プロセスを読んで監督することは、かえって難しくなった。

OpenAI自身のSystem Cardには極めて明確にこう書かれている。

GPT-6 Astraは従来モデルと比べ、substantial decrease in chain-of-thought monitorabilityが見られた。

图片

つまり、思考連鎖のモニタリング可能性が著しく低下したのだ。

この件はあまりに深刻で、OpenAIはわざわざ強調している。彼らは、この傾向を無限に受け入れることは絶対にないと考えている、と。

今後モデルがさらに賢くなり続け、同時に思考連鎖のモニタリングがますます難しくなるなら、彼らは他の十分に信頼できるモニタリング手法を見つける必要がある。さもなければ、モデル訓練の拡大を続けることは、より高い安全性のハードルに直面することになる。

なぜなら、これはすでに一つの哲学的命題だからだ。私たち人間は、将来、自分たちよりはるかに賢いシステムを理解できるのか。私にはわからない。おそらく今、世界中の誰にもわからないだろう。大規模モデルとAIは、どうやら少しずつ、シンギュラリティへ向かい始めているようだ。

最後に

今日、メディア向け非公開説明会でのこと。

Greg Brockmanは締めくくりの場で、あの言葉を口にした。

「AGI時代へようこそ」

正直なところ、ここ数年、私はAGIは極めて明確な一瞬になると思っていた。まるでGPT-4が発表されたあの日のように。

ある日の未明、一つの企業が突然モデルを投げ込んでくる。

私たちはそれを開き、いくつか質問する。

そして全員が同時に気づく。

なんてこった。

AGIが来た、と。

でも今は、AGIは決して白か黒かではっきり分かれる節目ではなく、グラデーションのような灰色の旅路なのだと思うこともある。

私たちは多くの日々を過ごし、多くの年を過ごした。そしてある日、振り返る。すると突然気づくのだ。あのかつてはるか遠くにあったAGIの境界線を、私たちはいつの間にか越えていたのだと。

AGIには「到来するその日」がないのかもしれない。

ただある日、私たちは突然気づく。それはもうずっと前から、私たちのそばにいたのだと。

ともあれ。

Welcome to the AGI era.

ようこそ。

AGI時代へ。

共有先:

著者:数字生命卡兹克

本記事はPANews入駐コラムニストの見解であり、PANewsの立場を代表するものではなく、法的責任を負いません。

記事及び見解は投資助言を構成しません

画像出典:数字生命卡兹克。権利侵害がある場合は著者へ削除をご連絡ください。

PANews公式アカウントをフォローして、強気・弱気相場を一緒に乗り越えましょう
関連トピック
PANews APP
Hugging FaceがNVIDIAに買収され、共同創業者3人の資産はそれぞれ18億ドルに
PANews 速報