PANews 9月11日消息,OpenAI宣佈在API中推出GPT-Live-1全雙工語音模型,可同時聽取和生成語音,改善對打斷、停頓、背景噪音及長時間對話的處理,並支援電話場景。開發者可透過系統提示控制語氣、語速和對話風格,還可將深度推理與工具呼叫委託給GPT-6 Astra等後端文本模型或第三方模型。
OpenAI稱,GPT-Live-1在Full Duplex Bench上的表現較GPT-Realtime-2.1提高30個百分點;語言學習平台Speak的早期測試顯示,該模型對學習者思考停頓的誤打斷較傳統輪次系統減少近80%。GPT-Live-1現已開放API,前端語音層定價為每分鐘0.05美元,後端模型及智能體框架費用另計。



