PANews 9月11日、OpenAIはAPIにおいてGPT-Live-1全二重音声モデルを発表した。このモデルは音声の聞き取りと生成を同時に行うことができ、割り込み、間、背景雑音、長時間の会話に対する処理が改善され、電話シナリオもサポートする。開発者はシステムプロンプトを通じてトーン、話速、会話スタイルを制御でき、深層推論やツール呼び出しをGPT-6 Astraなどのバックエンドテキストモデルやサードパーティモデルに委任することも可能である。
OpenAIによると、GPT-Live-1はFull Duplex BenchにおいてGPT-Realtime-2.1と比較して30パーセントポイントの性能向上を示した。言語学習プラットフォームSpeakの初期テストでは、このモデルによる学習者の思考中の間への誤割り込みが、従来のターン制システムと比較して約80%削減された。GPT-Live-1は現在APIが公開されており、フロントエンド音声層の価格は1分あたり0.05ドル、バックエンドモデルおよびエージェントフレームワークの費用は別途発生する。



