ChatGPT語音登陸桌面,清聽聲學(xué)聚音屏技術(shù)賦能AI PC,搶先入局!
日期:2026-07-30 13:42:40 發(fā)布者:本站
近日,OpenAI正式將ChatGPT語音功能推進(jìn)桌面端,在Work與Codex場景中,用戶可直接用語音啟動任務(wù)、調(diào)度多個AI Agent、隨時打斷并調(diào)整方向,用戶只需動嘴,就能指揮AI完成復(fù)雜任務(wù)。OpenAI官方數(shù)據(jù)顯示,Codex加ChatGPT Work的周活已突破1000萬。

一個信號已經(jīng)明確:語音正從"輔助輸入"升級為AI交互的核心入口。
01. 從GUI到AUI,人機(jī)交互的第三次躍遷
過去四十年,人機(jī)交互經(jīng)歷了從命令行到圖形界面(GUI)的跨越。如今,隨著大模型理解能力的躍升和語音技術(shù)的成熟,交互范式正在發(fā)生第三次轉(zhuǎn)移——AUI(Audio User Interface,語音用戶界面)時代已經(jīng)來臨。

長期以來,人與AI的交互依賴點(diǎn)擊和鍵盤輸入,想法被拆解成一條條指令逐條輸入。語音輸入打破這種線性限制,用戶可直接開口,把前因后果、顧慮偏好一次性說完,哪怕表達(dá)零散,模型也能自行梳理。社區(qū)實(shí)測:語音吞吐約每分鐘240個詞,打字最多70-80個詞,效率相差三倍有余。
但AUI要真正走進(jìn)辦公場景,必須先解決一個現(xiàn)實(shí)問題:一是環(huán)境噪音下,AI能否精準(zhǔn)聽懂你的指令;二是AI的語音回復(fù),如何不打擾鄰座、不外泄信息?
02. 語音交互的兩道門檻:AI聽不清/旁人聽得見
語音交互在辦公場景落地,面臨兩道現(xiàn)實(shí)門檻。
① AI 聽不清
開放式辦公區(qū)鍵盤敲擊、同事交談、電話鈴聲等背景噪音持續(xù)存在,語音指令容易被環(huán)境音干擾,識別準(zhǔn)確率大打折扣。
② 旁人聽得見
AI語音回復(fù)通過普通揚(yáng)聲器外放,鄰座被迫旁聽;會議室里多臺AI終端同時發(fā)聲,聲音互相交疊,誰也聽不清自己的那一份。
語音交互要真正走進(jìn)辦公場景,靠的不是更靜謐的環(huán)境、更低的音量,而是讓聲音被精準(zhǔn)地收、定向地放。
03. 聚音屏AI PC:釋放全雙工交互價值
清聽聲學(xué)聯(lián)合聯(lián)想打造的全球首款聚音屏AI PC,將第三代定向聲技術(shù)與AI 終端深度融合,讓"聽得清"與"聽得私密"同時成立。

輸出端?
聚音屏技術(shù)讓屏幕本身成為發(fā)聲單元,聲音以15°夾角定向投射至用戶耳畔,形成專屬私密聲場;系統(tǒng)還可通過攝像頭實(shí)時感知用戶位置變化,動態(tài)調(diào)整聲波方向,聲音始終追隨用戶耳際。AI的語音回復(fù)只有你能聽見,鄰座同事不受干擾,敏感信息不會外泄。
輸入端?
在定向發(fā)聲之外,聚音屏AI PC可進(jìn)一步集成清聽聲學(xué)AI定向拾音,通過高靈敏度麥克風(fēng)陣列與智能算法,精準(zhǔn)鎖定用戶發(fā)聲方向,過濾鍵盤敲擊、同事交談等環(huán)境噪聲,無需刻意提高音量或俯身湊近,嘈雜的開放式辦公區(qū)AI也能清晰"聽見"你的每一句話。

輸出與輸入雙向協(xié)同,構(gòu)成全雙工語音交互,形成“聽-說”交互閉環(huán)。在聚音屏AI PC面前,用戶可直接開口向ChatGPT下達(dá)復(fù)雜指令,AI在后臺執(zhí)行,定向聲場將反饋私密送達(dá),開放式辦公空間里,你擁有了"只屬于自己的聲音結(jié)界"。
不止于此,當(dāng)一間辦公室同時運(yùn)行多臺Voice Agent時,聚音屏可以建立一個個相對獨(dú)立的聲音區(qū)域,提高單位空間內(nèi)可部署的智能工位數(shù)量。
當(dāng)AUI時代來臨,辦公場景將被重新設(shè)計:不必整天端坐敲擊鍵盤,隨口讓AI整理客戶資料/發(fā)出一封郵件;可以在開放式辦公區(qū)同時調(diào)度多個Agent處理不同任務(wù),而鄰座同事渾然不覺;多人協(xié)作時,各自與AI對話,聲音互不干擾。

當(dāng)大模型賦予AI"聽懂人話"的能力,聲學(xué)技術(shù)則決定了這場對話能否在真實(shí)世界里體面地發(fā)生。語音交互的下半場,比拼的不只是模型的智商,更是聲音能否被精準(zhǔn)地送達(dá)與拾取——這正是清聽聲學(xué)為AI時代提供的聲學(xué)解法。