作者:数字生命卡兹克
もう頭がおかしくなりそうだ。数日前まではみんな「モデルはスローダウンする」って言ってなかったか。なんでこのモデル、タダみたいにバンバン投げてくるんだよ。昨日のGrok 4.7対MiMo v2.6は、今日のこの二大巨頭の前座ってわけか。今日未明、OpenAIのGPT-6 SolとGPT-6 Luna、そしてAnthropicのClaude Opus 5.5が、正式にリリースされた。
本当に聞きたいんだが、毎日毎日「スローダウン」って言ってるけど、どこがスローダウンなんだよ。みんなクズ男じゃないか。しかもこの展開、なんか妙に見覚えがあるなと思って、過去記事を掘り返してみた。
前回は、GPT-5.3 CodexがClaude Opus 4.6と殴り合った。今日はまさに歴史の再現だ。。。ただ、Claude Opus 4.6が、Claude Opus 5.5に変わっただけ。
GPT-5.3 Codexは、GPT-6 Solに変わった。
会社は相変わらずこの二社、相変わらずの負けず嫌いな宿敵同士。
ひとつずつ話していこう。
一. Claude Opus 5.5
まずはClaudeから。
率直に言って、俺がどれだけAnthropicを嫌っていようと、どれだけこの会社をクソだと思っていようと、どれだけ俺のアカウントをBANしようと、客観的に言えば、Claudeは今でも俺の心の中で最高で、最もオールラウンドなモデルだ。
今でもClaude Fable 5を使ったときの衝撃を覚えている。
そして今回のClaude Opus 5.5は、Anthropicの新しいClaude 5.5シリーズの最初のモデルだ。しかも俺の記憶では、Claudeが一度にここまでバージョン番号を飛ばすことはめったにない。
さらに自分で一時的に試してみたところ(なんでBANされたのに使えるのか聞くなよ、使い捨てアカウントを直接買ったんだ、2時間も使えばBANされるやつだ。。。)、Opus 5.5はコミュニケーション全体で、Opus 4.6に戻ったような感覚があって、人間らしさがとても強い。
彼らがこれに与えた位置づけは、実はClaudeシリーズのコスパモデルなんだが、確かに昔の「白月光」を思い出させるものがあった。
基本情報をまとめると、だいたいこんな感じだ:
| モデル名 | claude-opus-5-5 |
|---|---|
| コンテキスト | 1M Token |
| 最大出力 | 128K Token |
| 信頼できる知識のカットオフ | 2026年6月 |
| 思考 | Adaptive Thinking、常時オン |
| デフォルト努力レベル | medium |
| 入力価格 | 4ドル / 100万Token |
| 出力価格 | 20ドル / 100万Token |
| キャッシュ読み取り | 0.2ドル / 100万Token |
| 5分キャッシュ書き込み | 5ドル / 100万Token |
| 1時間キャッシュ書き込み | 8ドル / 100万Token |
前世代のOpus 5と比べて、全体の作業コストは直接40%下げられる。
同時に、出力速度はOpus 5より30%以上速くなっている。
現在、一部の非大型の作業では、Opus 5.5はすでにFable 5.1レベルのパフォーマンスを出せるようになっており、大型で高難度の作業は、依然としてFable級モデルの出番が必要だ。
Codingタスクでは、基本的に今のSOTAだ。
例えばTerminal-Bench 4.0のような、実際のターミナル環境で複雑で多段階のタスクをこなす能力を反映するものでは、Opus 5.5は最高スコア66.4%を更新した。
Codingに関わるものは、基本的に全部SOTAだ。最初にOpus 5が出たとき、Codingの実行でFable 5を全面的に超えたのとよく似ている。
ただ、二つだけ違うものがある。Terminal-Bench-Scienceというタスクは研究寄りのタスクで、Opus 5.5は58.7%、ここではAstraのほうがむしろ高く、64.6%だ。
AutomationBenchも同じで、このタスクは実はソフトウェアをまたぐ作業で、Opus 5.5は40.0%、GPT-6 Astraは41.4%だ。
あとあのComputer Use、GPT-6 Astraにはスコアがないが、これが悪いはずがないことは誰もが知っている。絶対的なSOTAだ。
こうしたところからも、AnthropicとOpenAIという二社が競い合う差別化された発展方向が見えてくる。AnthropicはCoding能力寄りで、同時に審美眼が極めて強く、CodingこそがAGIへの道の礎だと信じている。一方OpenAIがより注力しているのは全面的なAgent能力で、推論、ソフトウェア操作、研究などを含む。
ただ率直に言って、単純に特定の次元の評価セットだけを見ても、モデルの本当の質を評価することはまったくできないと思う。
ご存知の通り、製品開発ですら、もっと核心的なものがある。それは最初の段階の企画とアーキテクチャ設計能力だ。これはFableが神なんだ。大きなパラメータに依存し、世界知識に依存し、知能の創発に依存している。
Opus 5.5が確かに特定の実行面でFableを超えると言っても、全体としてOpus 5.5がFableより強いと言うのか?それなら俺が秦の始皇帝だと信じたほうがマシだ。
全体としてClaude Opus 5.5は、基本的にFable 5.1の自社公式蒸留モデルだ。
多くの垂直なシーンではより強いかもしれないし、パラメータ数がより小さく、速度がより速く、より安い。しかし同時にTokenの浪費ももたらす。ここは実は罠で、ひとたび高難度タスクになると、一部の非フラッグシップモデルは逆に延々と狂ったように考え続け、狂ったように試し続けるが、抜け出せずにずっと問題を解決できず、むしろフラッグシップモデルより金がかかる。
Opus 5.5は確かに強いが、タスクごとの出力Token数が直接爆発している。だから実はその知能の多くは超長い推論で買ってきたもので、この弊害は、ひとたび行き詰まると、その場で爆発するということだ。
だからAnthropicもそう注意喚起している。
結果が重要なときは、必ず最高級のモデルを使え。
それからXで猛者たちが走らせたClaude Opus 5.5のケースを見てみよう。なかなか見事だ。特に審美眼とディテールで、大幅に強化されている。
@notjaziiによるGPT-6 AstraとClaude Opus 5.5の比較テストでは、一部のシーンでGPT-6 Astraよりもさらに精緻だ:
ただ代償として、GPT-6 Astraと比べて、より遅く、より高い。
ただOpus 5.5にとって、GPT-6 Astraと比較されること自体が、すでに一種の賛辞だ。
Opus 5.5は今回、コミュニケーションも強化した。
Anthropicによると、Opus 5で最も多く寄せられたフィードバックの一つが、ときに文章が回りくどく、専門用語が多く、表現が直接的でないということだった。
5.5は最も重要な情報を前に置き、変な言い回しや不要な説明を減らす。
同時に創作面でも、Claude 4.6の感覚が戻ってきた。
というわけで、まとめると、Claude Opus 5.5は俺がとても素晴らしいと思うモデルだ。
Anthropicは、これまでフラッグシップモデルにしかできなかった仕事の多くを、ようやく常駐して使える価格帯に下ろしてきた。おそらくこれまでのOpenAIからのプレッシャーが大きすぎたのだろう。
彼ら自身のコストガイドは直接こう勧めている:
日常的に張り付いてやるFeature、Debug、Code Reviewは、Opus 5.5を使え。
本当に結果がToken価格より重要で、長時間の無人監視、あるいはOpus 5.5が連続で失敗する場合は、Fable 5.1に切り替えろ。
Fableはますます専門家級のコンサルタントのようになってきた。
Opus 5.5は主力社員に近い。
これがClaudeの今日の新モデルだ。
二. GPT-6 SolとLuna
ようやく俺が普通に使えるものにたどり着いた。
GPT-6 SolとLuna。
Claudeがいくら良くても、俺にとっては使い捨てで、常時使えるものじゃないから、意味がないんだよ。
だから仕方なく、主力は依然としてGPT-6だ。
ちょうどいいことに、俺が数日前にGPT-6 Pro+MCPの記事を書いたとき、わざわざこう書いた:
「GPT-6 Solはおそらくすぐに出る。出たら実行面は、俺はたぶん何も考えずGPT-6 Solに切り替える。高難度タスクだけGPT-6 Astraに切り替える。」
そして、ついに来た。
現在、Codexにすでに登場しており、直接使える。
これまでGPT-6 Astraが最も批判されてきたのは高すぎることで、クォータがまったく足りなかった。
今回は、GPT-6 SolとLunaは、直接コスト削減を狙ってきた。
Astraは依然としてOpenAI最強のモデルだ。
最も困難で、最も重要で、一切の妥協をしたくない仕事は、引き続きAstraを使う。
しかし現実世界の仕事には、異なる規模、リズム、予算がある。
だからGPT-6 SolとLunaが存在する意味は、Fable 5.1とClaude Opus 5.5の関係と同じだ:
Astraという世代の訓練手法がもたらした能力を、より速く、より安いモデルに下ろすこと。
Claudeとほぼ同じ日に、同じことを語っている。
誰がより少ない金で、より多くの知能を買えるか。
これがパレートフロンティアだ。
価格面では、新世代の価格設定は以下の通り。
SolとLunaは、GPT-5.6の同型モデルより、さらに50%安い。
最もありえないのはこのLunaで、入力と出力価格だけを見ると、実はすでにDeepseekよりも安い。
もちろん、本当の大物はキャッシュだということはみんな知っている。うん、このキャッシュの価格はDeepseekより3倍ほど高いのが見て取れる。
ただLunaが最も適したシーンは、俺の考えでは、実は各種アプリの背後にある自動化タスクだ。俺のAIHOTの背後にぶら下がっている十数個の大規模モデルを必要とする情報処理タスクのように、毎日リクエストが万単位だ。
こうしたシーンでは、実はキャッシュのヒット率がそれほど高くないことがあり、総合的に見て30%に届けば上出来だ。そう考えると、Lunaの優位性はかなり明確になる。
その他の基本情報は以下の通り。
これらの知識のカットオフ日付がまさか全部違うとは。
Lunaが最新で、5月18日まで。
それからみんなが最も気にするGPT-6 Solだ。率直に言って、能力面では俺の予想より少し劣るが、コストの下げ幅では、俺の予想より少し強い。
見ての通り、AAではGPT-5.6 Solより少し強いだけだが、Opus 5.5は、直接断崖式に1位を取った。
AAのベンチマークは今では多くの人に批判されることもあり、多くのディテールでそれほど正確ではないが、大きな方向性はそれほど外れない。
だからGPT-6 Solは、どちらかというと新モデル・新アーキテクチャに基づいて、GPT-5.6 Solより少し良い状態をできるだけ保ちつつ、大幅にコストを削減するものだ。
例えばこのAutomationBench、上でClaudeの話をしたときにClaude側より強いと言ったあのベンチマークだ。このBenchmarkが測るのは、Agentが47種類のツールをまたいで、営業、マーケティング、運営、カスタマーサポート、財務、HRといった実際の業務プロセスを実行することだ。
GPT-6 Sol xhigh:
33.2%。
タスクあたりの平均コスト:
0.27ドル。
GPT-6 Astra lowは30.3%だが、タスクコストはSolの3.9倍だ。
Fable 5.1にOpus 5 fallbackを加えたものは31.4%で、コストは少なくともSolの8.9倍だ。
ここで比較しているのがまだClaude Opus 5であることに注意してほしい。Opus 5.5はGPT-6 Solとほぼ同時にリリースされたため、OpenAIの図には間に合わず入れられなかった。入れても、実はあまり見栄えが良くなく、OpenAIにとってあまり有利ではない。
しかしこの図は、Solの位置づけを非常にはっきり説明している。
ただGPTの強さは、そのToken効率が本当にありえないほどで、節約と言えば、本当に節約できるところだ。
しかも今回は以前と比べて、俺がとても良いと思う更新ポイントがある。それはやはり事実誤り率だ。俺はずっと言っているが、GPTはもう俺のファクトチェッカーになりかけている。本当にほとんど幻覚がない。この点はやはり強すぎる。これまでずっと5.6はもうかなり良いと思っていたが、今回はさらに大幅に最適化され、基本的にGPT-6 Astraのレベルに達している。ここで実は推論レベルも見える。軽度か中度にしていると、多くの場合事実誤りを犯す。だから俺が日常で高を推奨している理由だ。Lunaなら、最高にしなければならない。
それから自分でも実測してみたが、審美眼といくつかのディテールでは、明らかにダウングレードしている。
例えばBlenderを操作してバイクを作る、これを見ると、ディテールの完成度がかなりかけ離れているのがわかる。
これがGPT-6 Astraの天壇だ。
そしてこれが、GPT-6 Solの天壇だ。多くのディテールに問題があり、門は直接バグった。
ただコストは、だいたい70%下がったので、全体としては許容できるだろう。
俺が原稿を書いているとき、GPT-6 SolとGPT-6 LunaはすでにChatGPT WorkとCodexでプッシュされ始めていた。
ただ気まずいのは、OpenAIがこれらのモデルはまだChatでは提供されていないと言ったことだ。つまり、チャットモードでは、みんなに提供されているのは依然としてGPT-5.6 Solだということだ。
ここは俺が少し理解できないところだ。コストはすでに大幅に下がっているのに、なぜチャットでもみんなにもっと低コストのモデルに切り替えないのか?
最後に
みんながここまで読んで、最後にやはり一つの質問をするのはわかっている。
じゃあ結局、俺はどう選べばいいのか?
今はモデルが本当に多すぎる多すぎる多すぎる多すぎる。毎日新しいモデルが出て、本当に疲れる。
俺にできるのは、できるだけ俺の選択をみんなに説明することだけだ。
1. もしClaudeを購読できて、BANされないなら。
情理から言えば、俺は本当にAnthropicというXX会社が嫌いだ。しかしユーザー体験の観点から言えば、もしClaudeを購読できて、BANされず、長く使えるなら、俺はやはりClaudeの購読を勧める。
複雑な企画と計画はClaude Fable 5.1で行い、タスク実行はOpus 5.5を使う。これはおそらく現時点で確かに最高の組み合わせだ。
2. もしClaudeにBANされたが、海外モデルを購読できるなら。
ならば何も考えずChatGPTを購読しろ。GPTはモデルレベルでは、率直に言って、Claudeよりまだ少し劣る。創作でも、認知の洞察でも、codingでも。
しかしそれはほぼ最高のC向け体験を持ち、無制限クォータのチャットモードがあり、最も使いやすいクライアントCodexがあり、そしてGPT-6はこの世界で依然としてT0レベルの強さだ。
複雑な企画と計画はGPT-6 Astraか邪道のGPT-6 Proで行い、GPT-6 Astra highかGPT-6 Sol xhighで実行し、GPT-6 lunaで大規模なバッチ自動化タスクを回す。これは非常に快適だ。
3. もし国産モデルしか購読できないなら。
率直に言って、Qwen、Kimi、GLM、MiMo、DeepSeekのこの数社は、断代的な差があるというほどではない。使い慣れたところを使えばいい。唯一面倒なのは、モデルの階層がその二社ほど強くないことだ。Kimi K3とQwen 3.8 Maxは企画とプランにより適しており、GLM-5.3とMimo v2.6 Pro、DeepSeek V4.1 Flashは実行により適している。
ただ肝に銘じてほしいのは、常に1ヶ月だけ購読することだ。長すぎるのはダメだ。せいぜい季カードを買う程度で、絶対に年カードを買ってはいけない。
OpenAIとAnthropicはやはり成熟しすぎている。今の環境は以前とは少し違う。
以前は、この二社が最先端の知能のリリースを担当していた。言い換えれば、ハイエンドをやっていた。
そして、国産モデルがミドルレンジとコスパをやっていた。
しかし今は、相手のサプライチェーンがより成熟したようで、Appleのように、全域を食い尽くし始めた。お前のミドルレンジも、超ローエンドですら、全部いただく。
ただ、すべてのユーザーにとって、これは良いことでもあるだろう。
なぜなら今の知能は、ようやくどんどん安くなってきたように見えるからだ。
過去、同等のAI性能のコストは、ほぼ四半期ごとに47%下がっていた。知能は、あと数ヶ月から半年もすれば、本当に石炭・水道・電気のように、誰もが使える資産になるかもしれない。
そのときこそ、本当の、大繁栄の時代かもしれない。



