著者:朱雪莹
ここ数日、少し異例なAIモデルが突然タイムラインを席巻した。
その名は「Jev」。
チャットもせず、コードも書かず、ChatGPTのように長い回答を生成することすらない。やることはただ一つ、判断することだけだ。
しかし、そんな「能力が半分以上削がれた」ように見えるモデルが、突然デベロッパー界隈で話題になった。
ある人はこれを使って40秒で724件のリアルタイム広告を分析し、合計8724回の判断を行った。ある人はこれをClaude Codeに組み込み、不要なコンテキストの整理に使った。また、AIエージェントの「審判」として、タスクが本当に完了したかをチェックさせる人もいる。LangChainもすでに、Jevをエージェント評価器としてテストし始めている。
さらに驚くのは速度と価格だ。
TypeSafeが公開したテストでは、Jevは最大で約193.6倍の高速化を実現し、コストは最大で444.6分の1に削減された。入力は100万トークンあたりわずか0.042ドルで、出力トークンはなんと無料だ。
能力が少なく見えるAIが、なぜ逆に人気になったのか?
それは、エージェント時代のAIに本当に必要なのは「熟考」だけではなく、大量・高速・安価な判断かもしれないからだ。次に何をするか、どのツールを呼び出すか、タスクは本当に完了したか。さらに重要なのは、こうした判断は将来、AI自身がバックグラウンドで行う必要があり、人間がずっと画面の前に張り付いて見張る必要がなくなるということだ。Jevが狙っているのは、まさにこうした毎日数百万回発生しうる小さな決定なのだ。
さらに興味深いのは、Jevモデルの創業者Diogo Almeidaが、まさにRLHFに関わった人物であり、今そのRLHFを反省し始めていることだ。ChatGPTを使いやすくしたこの訓練手法は、AIが本当に自動化へ向かうには適していないかもしれない、というのだ。
1か月余り前、Almeidaはある講演を行った。今振り返ると、その講演はほぼJevの「思想の説明書」だった。
AIは高等数学まで解けるのに、なぜカスタマーサポートすら満足にできないのか?
Diogo Almeidaの経歴は非常に特殊だ。
彼はかつてOpenAIに在籍し、GPT-4、ChatGPT、そしてInstructGPT/RLHF関連の仕事に参加した人物である。つまり、今日の大規模モデルにとって最も重要なポストトレーニングのパラダイムの一つを、自らの手で構築した当事者なのだ。
しかしその講演で、彼はいきなり自分を「OpenAI内部で数少ない、公然とChatGPTを『ディスる』人間の一人」と自虐した。
講演のテーマはさらに直接的だった。What's Next After RLHF?
Diogoはまず、一見矛盾した問いを投げかけた。
今日の大規模モデルは、非常に難しい数学の問題に挑めるようになり、コード、推論、各種ベンチマークは右肩上がりに伸びている。
ところが、多くの企業が本当に自動化したい業務では、人間を外せないままだ。
たとえばカスタマーサポート。
AIに資料を調べさせ、文書を要約させ、返信の下書きをさせても問題はない。
しかし、AI自身に「このお金を返金すべきか?このユーザーに補償すべきか?」を決めさせようとすると、企業は一気に慎重になる。
こうしたことは高等数学よりずっと簡単に見えるのに、なぜAIに任せられないのか?
Diogoの答えはシンプルだ。Today's AI is incredible at assistance, not automation.
今日のAIは仕事を手伝うのは非常に得意だが、仕事を最後まで自分でやり遂げるのはまだあまり得意ではない。
この二つはほんの少ししか違わないように見えて、実際はまったく別物だ。
Claude Codeがどれほど優れていても、あなたはたいていコンピュータの前に座っている。コードを書けばあなたが見て、ファイルを変更すればあなたがチェックし、間違えればあなたが直させる。
だからDiogoの見方では、Claude Codeは依然としてChatGPTが切り開いた「支援の時代」に属する。
本当の自動化とは何か?
人間がそもそもその場にいないことだ。
AIがバックグラウンドで自ら判断し、自ら実行する。1日に数十万回、数百万回も動くかもしれず、あなたはそれが何をしたのか永遠に見ることもない。
そこで問題が出てくる。今日のAIはこれほど賢いのに、なぜ人間から離れられないのか?
Diogoは矛先を、自分が非常によく知るもの——RLHF——に向けた。
私たちはAIを訓練するとき、人間をループの中に組み込んでしまった
これはいくぶん皮肉な話だ。
なぜならRLHFこそ、Diogoがかつて推進に関わった技術路線の一つだからだ。
RLHFの基本ロジックは実は複雑ではない。人間の好みを収集し、モデルをどんどん人間の好みに合うようにしていく。
だからDiogoは講演で、非常に率直な説明をした。なぜ今日の大規模モデルは常に人間がループの中にいる必要があるのか?
それは、訓練するときに、私たちが文字どおり人間をそのループの中に組み込んでしまったからだ。
モデルは最初から学んでいる。「どんな回答なら、人間はより好むのか?」と。
これは、大規模モデルの私たちがすでに非常によく知る特徴も説明している——たとえ知らなくても、しばしばいかにもそれらしく話せてしまう、という特徴だ。
Diogoは会場で、かなり意地の悪い例を挙げた。
ある人がChatGPTに、おならの録音を送り、「これは自分が作曲した音楽です。『誠実に、率直に』評価してください」と伝えた。
するとChatGPTは真面目くさって褒め始め、これは陰鬱で不気味な雰囲気のアンビエントミュージックだと評した。
Diogoは一言でまとめた。「Overpromising is a feature.」
過剰な約束はバグではなく、feature(仕様)なのだ。
チャット製品にとっては、これは必ずしも致命的ではない。ユーザーはまだ画面の前にいて、間違えれば訂正できる。
しかし、本当の自動化システムはまったく別だ。
機械はあなたの回答が心地よいかどうかなど気にしない。必要なのは二つだけだ。いったいどうすべきか、そして、いったいどれだけの確信があるのか。
これが、1か月余り後に発表されたJevが、あれほど異例に見える理由を説明している。
だから、JevはAIに「話させる」のをやめた
通常の大規模モデルは、最終的に「AかBか」と答えるだけの場合でも、往々にしてトークンを生成するプロセスを経る。
Jevはこの部分をばっさり切り捨てた。
現在、主に三つのことを行う。
- Noul:YesかNoで答える。
- Choice:いくつかの選択肢から一つを選ぶ。
- Score:基準に従って採点する。
そして、判断と確率を直接返す。
小論文を書いてもくれないし、雑談にも付き合ってくれない。
公式発表のエンドツーエンドのレイテンシは70〜500ミリ秒と低く、最先端モデルより20〜200倍速く、価格は40〜400分の1だ。
しかし本当に重要なのは、実は「速さ」ではなく、その後の「確率」の方だ。
そのためにTypeSafeは、新しい訓練手法を打ち出した。RLCD、Reinforcement Learning for Calibrated Decisions(較正された意思決定のための強化学習)だ。
それが解決しようとする問題は非常に現実的だ。AIが「ある事柄が80%の確率で起こる」と言ったとき、その80%は本当に信頼できるのか?
理想的なケースでは、モデルが80%の確率だと判断した事柄の集団は、最終的に実際に約80%が起こるはずだ。
これは自動化システムにおいて非常に重要だ。
99%の確信があれば、直接実行できる。
51%の確信なら、より強力で高価な大規模モデルに投げるか、人間に回せばいい。
本当に厄介なのは、AIが知らないことではなく、AIが「自分が知らないことを知らない」ことだ。
だからJevが本当に変えたいのは、AIの出力の「宛先」だ。
これまでChatGPTが生成した回答は、主に人間が見るためのものだった。Jevが出す判断と確率は、そのままソフトウェアに渡して使うためのものだ。
エージェント時代に必要なのは、より大きな頭脳ではないかもしれない
これは、Jevがなぜ今になって人気になったのかも説明している。
なぜなら、エージェントが実際に動き始めると、膨大な数の小さな判断が生まれるからだ。
次にどのツールを呼び出すか?このウェブページのどのボタンをクリックすべきか?この情報はまだ役に立つか?タスクは本当に完了したか?結果を再チェックすべきか?
こうした問題は一つひとつ見れば難しくないが、エージェントは1日に数十万回、数百万回の判断を必要とするかもしれない。
そのたびに最強の大規模モデルを呼び、数秒かけて「熟考」させ、大量のトークンを吐き出させていたら、コストとレイテンシはすぐに跳ね上がる。
Jevが奪おうとしているのは、まさにこの層だ。
大量の高頻度な小さな決定はJevに任せ、本当に複雑な推論が必要なタスクは大規模モデルに任せる。
これが、TypeSafeがJevを「System One Model」と呼ぶ理由でもある。
この概念はダニエル・カーネマンの「システム1」と「システム2」に由来する。一つは高速で直感的な判断を担い、もう一つは低速で複雑な思考を担う。
Jevという名前すら「ジェボンズのパラドックス」に由来している。
ある資源がどんどん安くなると、人々は必ずしも使う量を減らすとは限らず、むしろもっと使うようになるかもしれない。
AIを1回呼び出すのが高ければ、最も重要な場面でしか使わないだろう。
しかし、AIの判断1回が無視できるほど安くなったらどうなるか?
一通のメール、一行のログ、一回のツール呼び出し、一つのウェブボタン、エージェントの実行の各ステップに、AIの判断が加わるかもしれない。
もちろん、Jevが次世代AIを代表すると言うのはまだ早すぎる。
いわゆる「ゼロハルシネーション」は、決められた回答タイプから外れてでたらめを言わないという意味が大きく、間違った選択をしないという意味ではない。193.6倍、444.6倍といった極端な数字も、主にTypeSafe自身のテストによるものだ。
しかし、今回のJevのバズりで本当に注目すべきなのは、それがGPTやClaudeに挑戦できるかどうかではないだろう。
ChatGPTを作り上げた当事者の一人が、より根源的な問いを改めて問い直していることだ。
ここ数年、業界全体が考えてきたのは、どうすればAIにもっと長く考えさせ、もっと多く語らせられるかだった。
しかし、もし未来に本当に必要なのが数十億回の機械同士の判断だとしたら、AIはなぜ毎回まず「ひとこと話す」必要があるのか?
ChatGPTは機械に、人間との話し方を教えた。
そしてJevが賭ける次の一歩はこうだ。人間がもはや画面の前に座っていないとき、機械は自分で決断できるのか?

