OpenAI 7 月 24 日表示,已更新 ChatGPT 桌面應用,加入 ChatGPT Voice 支援。新功能讓使用者可以直接透過語音下達指令,控制 AI 代理在電腦上執行任務,而不再只是進行語音對話。
連結新一代語音模型
這項功能是基於 OpenAI 本月稍早推出的新語音模型系列 ChatGPT-Live。與先前主要面向手機端的語音互動不同,這次桌面端更新把語音輸入與任務執行結合起來,覆蓋範圍更大。
OpenAI 表示,ChatGPT Voice 可與 ChatGPT Work 和 Codex 搭配使用,也能呼叫電腦操作能力,存取網站和應用,完成尋找與執行類別任務。
桌面端可執行多步驟操作
根據 OpenAI 的說法,桌面版語音模式支援更複雜的指令。使用者可以一次口述多個步驟,隨後在系統需要確認或補充資訊時繼續互動。
- 支援一次下達多步驟命令
- 可在執行過程中向用戶追問訊息
- 可結合 Codex 處理開發相關任務
在示範影片中,一名開發者透過一條語音指令,要求 ChatGPT 新建討論執行緒、建立 pull request,並定位一個程式錯誤的根本原因。
macOS可讀取螢幕內容
在 macOS 上,OpenAI 也加入了 Appshots 功能。啟用後,應用程式可以讀取使用者螢幕上的內容,包括 alt-text 等訊息,以便更準確地理解當前介面並繼續執行任務。
OpenAI 同時提到,使用者也可以透過 iOS 應用程式遠端存取 Codex,使用 ChatGPT Voice 發起相關操作。
語音助理競爭持續升溫
先前推出的手機版 ChatGPT Voice 已支援更自然的對話和更好的打斷處理,但當時並不具備直接在手機上執行操作的能力。此次桌面端更新,意味著 OpenAI 正把語音模式從對話工具推進到可執行任務的代理入口。
Anthropic 最近也更新了 Claude 的語音模式。該功能可呼叫 Opus、Sonnet 和 Haiku 模型,在 Gmail、Calendar、Slack、Notion 和 Canva 等應用中完成任務,語音 AI 助理的產品競爭正在加快。











