宇樹掌門人潑冷水?具身智能的「ChatGPT時刻」究竟還有多久

一個越來越明顯的現象是:具身智能行業正在把此前遙遠的「通用機器人」時間表,壓縮到未來一個技術週期之內。

在人形機器人正處在最熱鬧的時候,A股「人形機器人第一股」掌門人似乎給行業潑了一盆冷水。

8月20日,在2026世界機器人大會上,宇樹科技創始人王興興在上市後的首場公開演講坦言,具身智能的ChatGPT 時刻還未到來,快則兩年到三年後,慢則將要五年或者十年之後。

過去兩年,人形機器人已成為最炙手可熱的科技「時尚單品」。在各大晚會的舞臺上、遊戲廠商的展會上,甚至商場和零售門店的入口處,人們越來越容易看到這些充滿未來感的機器人。它們或靈巧、或略顯笨拙地跳舞、行走、揮手,與觀眾握手互動,正在迅速從實驗室走進大眾視野。

但熱鬧的展示背後,這些機器人的實際能力,顯然與人們對「未來機器人」的想像還相去甚遠。至少在更普遍的期待中,機器人不應該只是登臺表演或者承擔營銷任務,而應該真正進入工廠和家庭,搬運、整理、操作工具,或承擔部分家務和護理工作。大眾的問題一直具體而直接:機器人什麼時候才能真正會幹活?

在大語言模型領域,ChatGPT曾經提供過一個極具象徵意義的答案。它並不是第一款語言模型,卻第一次讓大量普通用戶直觀意識到,AI已經跨過了某個能力臨界點。類似的時刻什麼時候會發生在具身智能領域,也逐漸成為機器人行業最受關注的問題之一。

機器人走進千家萬戶,關鍵還在泛化能力

在8月20日舉行的世界機器人大會上,宇樹科技創始人王興興把具身智能當前最大的瓶頸指向了一個已經被行業反覆討論的問題——泛化能力。

在他看來,目前很多機器人模型在固定場景中,只要完成足夠的數據採集和訓練,任務成功率已經可以接近100%。但只要操作物體發生變化,或者環境稍微改變,機器人的成功率就可能明顯下降。

這也是機器人距離真正進入生活和家庭最重要的一道門檻。

王興興給出了一個相當具體的判斷標準:如果有一天,把一臺機器人帶到一個完全陌生的家庭或者環境,它僅通過語音或語言指令,就能夠完成大約80%的任務,那麼具身智能就差不多迎來了自己的「ChatGPT時刻」。在時間上,他認為快的話可能還需要2至3年,慢的話則可能需要5年甚至10年。

王興興尤其強調,真正困難的並不是讓機器人「大致知道該怎麼做」,而是最後幾釐米甚至幾毫米。

比如讓機器人拿起一個物體,模型可能已經正確規劃了整個動作,機械臂也已經移動到了物體附近,但最後一點位置誤差、觸覺反饋或者抓取力度沒有被正確修正,就可能讓整個任務失敗。

這也是機器人和大語言模型非常不同的地方。

語言模型的輸入和輸出始終發生在數字空間中,而機器人每一次感知和動作都必須與真實物理世界發生交互。傳感器存在噪聲,執行器存在誤差,物體的位置、材質和重量也不斷變化,這些誤差會隨著任務執行不斷累積。因此,對於具身智能而言,從「基本會做」走向「穩定做對」,可能比最初學會一個任務更加困難。

幾乎就在王興興發表上述判斷的同時,銀河通用創始人兼CTO王鶴也給出了一個更加明確的年份。王鶴表示,隨著數據持續積累和技術進一步突破,具身智能預計將在2028年迎來「ChatGPT時刻」。他將這個節點定義為:機器人在沒有針對某一項任務進行專項訓練的情況下,也能夠完成大約70%至80%的日常任務。

兩者的判斷實際上非常接近。王興興關注的是機器人進入陌生環境後的任務完成率,王鶴關注的則是基礎模型在沒有專項訓練情況下的直接泛化能力,但兩個人都把臨界點放在了大約70%至80%的未知任務成功率上。

這也意味著,他們口中的「ChatGPT時刻」並不是今天人形機器人展示出來的運動能力,也不是某個經過大量訓練的固定Demo可以做到99%以上成功率。真正的變化,應該發生在機器人開始擺脫對固定場景、固定物品和專項訓練的依賴之後。

機器人何時真正「開竅」,集體指向2至5年

就在一個月前的2026世界人工智能大會(WAIC)上,一場圓桌把同樣的問題拋給了六位具身智能領域的頭部創業者和研究者。

7月19日,在一場由智元機器人和覓蜂科技舉辦的「智啟具身論壇」活動中,在最後的圓桌環節,主持人要求六位嘉賓回答一個非常直接的問題:機器人的ChatGPT時刻,還有幾年?

結果出奇地集中。智元機器人合夥人、覓蜂科技董事長兼CEO姚卯青給出的答案是2年;Sunday Robotics聯合創始人兼CEO趙子豪(Tony Zhao)認為是3年以內;騰訊首席科學家、Robotics X實驗室主任張正友給出3至5年;Dyna Robotics聯合創始人兼首席科學家馬也騁認為大約需要4年;Physical Intelligence研究科學家任至意判斷需要4至5年;佐治亞理工學院教授徐丹飛的答案則是5年。

六個人來自完全不同的公司和研究機構,技術路線也各不相同,但最終給出的答案全部集中在未來2至5年。

其中,姚卯青是最為樂觀的一位。他的判斷主要建立在數據規模的增長之上。在姚卯青看來,當前制約物理AI進一步發展的關鍵,可以概括為「數據、表徵和閉環」三堵牆。相比互聯網世界中可以廉價獲得的海量文本和圖片,機器人真實交互數據不僅昂貴,而且受到機器人本體、任務和場景差異的限制。

真正能夠開箱即用的機器人,需要理解開放式自然語言指令,並在常見任務上達到大約70%至80%的基礎成功率。要實現這一點,具身智能需要規模遠超當前水平的數據。他甚至提出,未來可能需要達到億小時級別的數據規模。

也就是說,在姚卯青的判斷框架中,「ChatGPT時刻」很大程度上是一個Scaling問題:當真實世界數據、仿真數據、互聯網視頻、第一視角數據和機器人部署後回流的數據逐漸形成規模,模型能力也可能隨之跨過臨界點。

Sunday Robotics的趙子豪則把時間壓在3年以內。相比一味追求更加複雜的機器人本體,趙子豪更關注機器人「大腦」什麼時候能夠真正成熟。Sunday Robotics長期聚焦家庭機器人和基礎模型,其思路是,如果一個足夠強的機器人基礎模型能夠理解複雜環境和任務,即使機器人使用相對簡單、成本更低的夾爪,也可能首先解決大量實際問題。

張正友的態度要謹慎得多。他給出的答案是3至5年,但強調這個時間窗口並不意味著行業只需要等待一個更大的模型突然出現。大語言模型之所以能夠快速形成規模化能力,一個重要前提是Transformer逐漸成為較為統一的架構。但機器人智能目前還沒有形成這樣清晰的技術範式。

從高層認知、視覺感知和任務規劃,到實時運動控制、身體反饋和安全反應,一臺機器人需要同時處理不同時間尺度上的問題。因此,真正的突破可能需要數據採集、仿真、真實部署、失敗恢復、硬件和模型一起進步,而不是簡單複製大語言模型的Scaling Law。正因如此,張正友在給出判斷時,也特意強調行業仍需要「踏踏實實地做」。

Dyna Robotics的馬也騁給出的時間是4年左右。他的判斷更多來自商業部署。對於一個實驗室Demo來說,80%或者90%的成功率可能已經足以證明技術路線有效;但對一家真正購買機器人工作的工廠或者服務企業而言,這樣的可靠性往往遠遠不夠。因此,具身智能的「ChatGPT時刻」不僅意味著機器人能夠理解更多任務,還意味著它必須進一步提高到可以被真實商業環境接受的可靠程度。

Physical Intelligence的任至意則給出了4至5年。他表示自己在加入Physical Intelligence之前,一度認為這一過程可能需要10年,但隨著過去一年機器人基礎模型的發展,其預期已經明顯提前。

Physical Intelligence本身也是當前具有代表性的「機器人基礎模型」路線公司之一,其目標是通過跨本體、跨任務的數據訓練,讓同一個模型逐漸獲得更廣泛的操作能力。在這套邏輯中,真正重要的是機器人能力能否隨著模型和數據規模擴大而不斷湧現,並最終產生類似大語言模型零樣本遷移的效果。

佐治亞理工學院教授徐丹飛的答案最保守,但也只有5年。相比押注某種特定模型路線,他更關注三個更加基礎的指標:模型能不能真正從數據中學習,學習到的能力能不能泛化到新的環境和任務,以及推理速度能不能滿足機器人在真實世界中的實時操作要求。

我們把王興興的「最快2至3年」、王鶴的「2028年」,以及WAIC六位嘉賓的答案擺在一起,一個越來越明顯的現象是:具身智能行業正在把此前遙遠的「通用機器人」時間表,壓縮到未來一個技術週期之內。

清晰的歷史節點,還是逐步發生的過程?

不過,雖然這些創業者和研究者雖然對時間的預測越來越接近,但他們實際上並不是在用同一套標準討論「ChatGPT時刻」。

王鶴關注的是基礎模型本身的能力躍遷。在他的定義中,當機器人不再需要針對每一項新任務重新進行專項訓練,僅憑基礎模型就能夠完成70%至80%的日常任務,具身智能就跨過了一個類似ChatGPT的臨界點。這個標準首先衡量的是模型能否從針對特定任務的「專用智能」,走向具有較強遷移能力的通用智能。

王興興給出的標準則更接近機器人真正進入現實世界後的表現。他同樣將80%左右的任務完成率視為重要門檻,但強調的是機器人進入陌生環境以後,能否僅依靠語言指令完成大部分任務。在他看來,今天很多機器人已經能夠在經過充分訓練的固定環境中達到很高的成功率,真正困難的是環境、物體或者任務發生變化之後,模型還能不能繼續工作。

這兩種定義看起來相近,實際關注的層次並不完全相同。一個模型即使已經具備不錯的零樣本或者跨任務能力,也並不意味著一台搭載它的機器人已經成為可靠的生產工具。王興興在WRC上就提到,宇樹實際上已經在汽車工廠以及自己的工廠裡部署機器人,也能夠完成一些簡單的裝配任務,但目前仍沒有大規模推廣,其中一個重要原因就是機器人的效率仍然低於人類,同時面對新的任務往往還需要重新訓練。

星海圖CEO高繼揚對這一問題給出了一個頗有意思的雙重判斷。在本屆WRC展示的產業路線圖中,星海圖將2027年明確標注為技術層面的「GPT時刻」,認為Scaling Law推動基礎模型能力跨過拐點後,垂直場景應用將開始加速打開;但真正的「商業化拐點」則被放在2028年,隨後還要經歷2029年的深度滲透和2030年的廣泛部署。

但在談到具身智能是否會複製ChatGPT式的歷史節點時,高繼揚又明確表示,他認為「大概率不會有那樣一個時刻」。原因在於,具身智能不會通過一個面向所有人的軟體產品瞬間普及,而更可能從To B場景開始,一個個行業、一個個任務逐步解鎖。

而技術突破和公眾瞬間認知兩者難以同時發生。因為GPT的爆發依賴於每個人都能用手機或電腦親身體驗,而具身智能最先落地的場景是工廠、倉庫等生產端,普通公眾難以直觀感知。因此,行業拐點會以「潤物細無聲」的方式逐漸顯現,等到人們突然意識到時,它已經無處不在。

這兩種表述並不完全矛盾。高繼揚實際上區分了模型能力的技術拐點和產業擴散的社會拐點:前者可能在某一年相對清晰地出現,後者卻需要經過場景驗證、規模生產、成本下降和商業模式成熟,逐步傳導到現實世界。

這也是機器人與大語言模型最顯著的差異之一。2022年11月ChatGPT發布後,模型能力的變化幾乎可以在同一天傳遞給全球用戶。對於一款軟體產品而言,只要伺服器和算力能夠承受,新增一個用戶的成本相對有限,用戶打開網頁、輸入問題,就能夠立即感知模型能力的躍遷。因此,技術突破、產品發布和大規模用戶採用,在ChatGPT身上幾乎被壓縮到了同一個時間窗口。

機器人卻必須通過一個真實的身體進入物理世界。即使某個基礎模型在明天突然獲得明顯更強的泛化能力,這種能力仍需要通過晶片、感測器、關節、靈巧手和執行器轉化成現實動作,還要面對精度、穩定性、安全、壽命、維護和成本等一系列工程問題。

因此,具身智能最終可能很難複製2022年11月30日那樣清晰的歷史節點。它更可能表現為一系列逐步出現的臨界點。或許,未來即使人們回過頭來確認「具身智能的ChatGPT時刻」,也未必能夠為它找到一個所有人都認可的節點。

分享至:

作者:Zen

本文為PANews入駐專欄作者的觀點,不代表PANews立場,不承擔法律責任。

文章及觀點也不構成投資意見

圖片來源:Zen如有侵權,請聯絡作者刪除。

關注PANews官方賬號,一起穿越牛熊
PANews APP
“先定10個大目標”巨鯨空單加倉至2.18億美元,浮虧87.7萬美元
PANews 快訊