2026世界機器人大會王興興全文演講:具身智能的ChatGPT時刻最快兩三年就會到來

宇樹科技創始人王興興在2026世界機器人大會發表演講,回顧公司十年發展,並展望人形機器人未來。

  • 當前瓶頸:具身智能泛化能力不足,AI模型與真實世界存在偏差,導致任務成功率下降。
  • 他預測快則兩三年、慢則五到十年,行業有望迎來類似ChatGPT的產業臨界點,即機器人能在陌生環境僅靠語音完成約80%的任務。
  • 宇樹已推出G1、GD01、As2-W等產品,並演示了端到端AI動作生成、多模態交互和會議室整理等場景。
  • 未來方向是讓AI驅動機器人研發流程,實現自進化,通過編程、仿真、真機測試的閉環持續積累技能和數據。
總結

宇樹科技上市後第二天,其創辦人王興興在2026世界機器人大會發表題為《從展品到產品:人形機器人產業的下一個十年》主題演講。他認為,當前機器人產業正站在人工智慧加速發展的新起點,而現階段該領域最大的發展瓶頸仍然是具身智能的泛化能力不足。

「從發展週期來看,快則兩到三年,慢則五到十年,行業有望迎來關鍵突破。」關於具身智能迎來類似ChatGPT的產業臨界點的時間,王興興給出了相對樂觀的判斷。

而談及通用機器人何時真正走進家庭,王興興認為,全世界目前最大瓶頸還是泛化能力不夠。「如果哪一天大家能看到把一台機器人帶到一個任意的陌生環境,它基本可以實現80%左右的任務,我覺得就差不多已經實現了具身智能的ChatGPT時刻」。

以下為演講內容,由PANews整理:

回顧宇樹十年:從四足機器人到人形機器人

尊敬的各位領導、各位嘉賓,大家好。非常榮幸在這裡做分享。首先簡單回顧一下公司的情況。宇樹科技成立於2016年8月,到今年8月差不多整整10年。我們最早做的是四足機器人,最近幾年開始做人形機器人。

近幾年比較成功的一款產品,是我們2024年推出的G1。G1推出以後,基本成為了全球人形機器人領域比較有代表性的產品。現在大家看到的很多人形機器人產品,無論是整體形態還是設計思路,都和G1有一些相似之處。

今年年初比較有代表性的一個項目,是我們在春晚上表演的《武BOT》。這個節目融合了中國非常經典的傳統功夫和武術文化。我們提前採集了幾十個有代表性的中國功夫動作,再進行AI訓練,最後把比較精彩的動作放到整個舞台上。這個節目最大的亮點,是把當前比較前沿的人形機器人技術與中國傳統功夫、武術文化結合在一起。這個視頻在海外的傳播也非常好,可能有數百億次播放。我覺得這是一個科技和文化融合得比較好的例子。

2月份,我們還在天壇做了一次演示。當時現場大概有49台機器人進行全自動表演。天壇本身有幾百年的文化和歷史,機器人在這樣的場景裡表演,會形成一種非常強烈的穿越時空感——把中國過去幾百年的文化和當前最新的技術交融在一起,視覺和感受上都非常震撼。

過去幾年,我們也一直在推動機器人真正走進生活、走進工廠。2024年,我們就開始和汽車工廠合作做一些落地應用,也在自己的工廠裡部署機器人,做一些簡單的測試和應用。現在公司絕大部分AI團隊,都在圍繞機器人如何真正進入家庭或者工廠幹活做研發。

為什麼目前還沒有大規模推廣?最主要的原因,是機器人的效率和泛化能力還不夠。現在機器人已經能夠做一些簡單裝配,但效率和人相比仍然偏低;另外,每次遇到一個新的任務,往往還需要重新訓練,這會進一步降低整體效率。所以我們還是希望先把技術的泛化能力做得更好,再進行大規模推廣。這也是目前全球機器人行業共同面對的一個核心瓶頸。

今年4月份,我們還刷新了人形機器人奔跑速度紀錄。這款機器人是在我們2023年第一代人形機器人H1的基礎上改裝的。H1是宇樹第一款人形機器人,也是比較經典的一款產品。後續我們也在它的基礎上嘗試不同形態,比如增加輪式結構,讓機器人在一些場景下能夠更加靈活。

驅動機器人:AI、數據與真實場景

大家也知道,現在的機器人基本都是AI驅動,而AI本質上又是數據驅動。數據有多少,尤其是高品質數據有多少,很大程度上就決定了AI能力能做到什麼程度。所以我們一方面自己採集數據,另一方面也和第三方公司合作,希望獲得更多數據,既給行業使用,也給我們自己使用。

我個人認為,真正用於AI機器人訓練的數據,應該以大量真人數據或者互聯網數據作為主要的預訓練數據,再疊加一部分真機數據。這兩部分數據都是剛需。從數據規模上看,真人數據會更多,也更加重要;但真機數據同樣不可缺少,因為最終還是需要把機器人和真實物理世界匹配起來。

今年5月份,我們發布了全球首款量產級載人變形機甲GD01。這款機器人身高3米多,載人以後重量大概500公斤。大家可能會好奇這類機器有什麼應用。簡單做一個比喻,它有點像一輛「越野車」,並不是主要面向家庭或者城市裡的日常使用,而更適合戶外、複雜環境以及一些運輸場景。比如出去戶外徒步,或者在地形比較複雜的地方運輸物資,都可以考慮使用它。

GD01還有一個比較有意思的特點,就是可以變形成四足模式。切換到四足模式以後,穩定性會更好,越障能力也比較強。這也是我們為什麼願意把它真正拿出來預售的一個原因:在四足模式下,它已經具備相對比較好的穩定性和複雜地形通過能力。簡單來說,可以把它理解成機器人形態的「越野車」。

前幾個月,我們還演示過一個基於多模態模型的端到端AI動作生成系統。過去很多機器人動作演示,都是提前採集、提前訓練好的;而這套系統的動作可以根據實時語音指令生成。語音首先需要被識別,再上傳到雲端做AI動作生成,之後還要對動作進行驗證,確認沒有問題再下發給機器人,所以整個過程目前還會有幾秒鐘延遲。

我們希望未來機器人真正落地應用的時候,動作能夠完全實時生成,而不是依賴預先編程。現在這種自動生成方式還有一個特點:即使輸入完全相同的指令,每一次生成的動作也可能略有差異。也就是說,你今天和明天對機器人說同一句話,它做出來的動作可能不會完全一樣。

我們也在推動機器人真正進入會議室等日常場景幹活。比如公司裡的會議室有時候會比較亂,那麼會議室整理就是一個比較明確、也有實用價值的任務。我們的訓練目標是:把一個會議室任意打亂以後,機器人都能夠把它恢復到乾淨整潔的狀態。

這個任務目前是完全端到端實現的,所以機器人的運動效率還比較慢。但它不是單任務系統。在這個場景裡,我們大概設置了7到8個不同任務,用一個模型讓機器人在不同任務之間自動切換並直接執行,同時具備一定的抗干擾能力。因為AI需要實時識別、實時生成和持續推理,所以動作暫時還沒有那麼流暢,每走一步、每做一個動作都需要推理,這會影響整體「絲滑度」。不過演示視頻本身是一鏡到底,沒有做剪輯,也加入了環境干擾。

在此基礎上,我們又把語音驅動和多模態模型結合起來,讓機器人不僅能根據語音生成動作,還能夠真正完成交互和操作任務。現場演示中,機器人可以識別眼前物體的顏色、判斷不同藥盒的位置,再根據語言指令把指定物體拿出來。這種情況下,機器人執行的就不是一個預先設定好的固定動作,而是需要理解語言、識別環境,再完成操作。

前段時間,我們還發布了最新一代輪足四足機器人As2-W。這款機器人比較輕量化,帶電池重量大約25公斤,負載能力和續航能力都比較強,同時具備IP54防塵防水能力,可以覆蓋室內和室外場景。

我們把一些在人形機器人上積累的技術重新應用到了四足機器人上,希望進一步提升四足機器人的靈活性,同時把負載、續航和複雜環境適應能力做得更好。我們也希望這款機器人未來能夠真正用於戶外徒步、運輸以及一些工業場景。

與此同時,我們也持續升級R1這類輕量化人形機器人,讓它的運動和靈活性進一步提高。R1本身的性價比比較高,也已經可以通過京東、淘寶等渠道購買。

前段時間,我們還展示了一款新的機器人。這款機器人開發時間很短,到現在大約只用了三個多月,還不是正式發布版本。它的最高速度已經達到12.65米/秒,超過了人類歷史上最快運動員的峰值奔跑速度;按照目前的測試結果,它的跳躍高度也已經超過了人類歷史上的最高跳躍水平。2025年,我本人、公司的產品以及宇樹科技也都曾登上《時代》雜誌相關榜單。

具身智能的核心瓶頸:泛化能力與真實世界對齊

再回顧一下最近幾年具身智能AI模型的發展。目前比較主要的技術路線包括VLA模型和世界模型。今年大家聽到最多的,可能就是世界模型這個方向。

我們公司對AI模型一直投入很大,這也是目前資金和人力投入最大的方向之一。2020年初,我們就開始探索基於視頻生成的世界模型。當時到2020年底,效果還不是特別理想,所以中間擱置過一段時間;但是從去年開始,我們又重新加大了對視頻生成世界模型方向的投入。

很多人都會問:真正通用的機器人,無論是人形機器人還是半人形機器人,什麼時候才能真正走進生活、走進家庭?

我認為當前最大的瓶頸,仍然是具身智能的泛化能力不夠。現在很多AI模型在固定場景裡,只要做足夠的數據採集和訓練,成功率基本可以做到接近100%。但只要操作的物品稍微變化,或者環境發生一點變化,成功率就會明顯下降。

我希望未來快的话可能兩三年,慢的話五年甚至更長時間。如果有一天,把一臺機器人帶到一個它完全陌生的環境,比如一個它從來沒有見過的家庭,它僅僅通過語音或者語言指令,就能夠完成80%左右的任務,那麼我覺得就差不多到達了具身智能的「ChatGPT時刻」。這也會成為未來產業真正爆發的一個關鍵臨界點。

這個評價指標其實很簡單:機器人在大約80%的陌生場景裡,僅透過語音或語言指令,就能夠完成大約80%的任務。我覺得這是一個非常重要的臨界點。

為什麼現在還達不到這個水準?最大的瓶頸之一,是AI模型的輸入輸出和真實機器人、真實物理世界之間的對齊程度還不夠。

比如你讓機器人移動,或者讓它把兩個東西組裝在一起,或者把一個物體從一個地方搬到另一個地方,它的大方向往往沒有問題,基本上能夠理解你的任務,也大概知道應該怎麼執行。但真正影響最終成功率的,往往是最後幾公分甚至最後幾公釐。

機器人去抓一個東西的時候,看起來手已經快要拿住了,但最後一點觸覺回饋、最後一點位置誤差,它沒有辦法好好地修正。這個誤差如果沒有修正過來,最終就可能導致整個任務失敗,成功率會出現非常明顯的下降。

這是目前全世界具身智能面臨的一個非常核心的問題:AI模型的輸入輸出和真實世界之間存在偏差。

為什麼機器人上會有這個問題,而一般的語言模型或多模態模型沒有這麼明顯?語言模型處理的內容,本質上都是數位編碼。輸入是什麼、輸出是什麼,都被嚴格限制在一個數位空間或向量空間裡,因此誤差不會以同樣的方式不斷累積。

但機器人不同。機器人的每一次輸入和輸出都要進入真實物理世界,每執行一次動作,都會產生一定的偏差和損失。這些偏差會影響下一次感知和下一次動作,最終造成誤差累積。也正因為如此,目前機器人模型的泛化能力和實際任務成功率還沒有達到足夠高的水準。

我覺得這個問題在未來幾年一定能夠解決,但它確實還需要一些時間。

讓機器人自我進化:用AI重構機器人研發流程

這裡我再介紹一下我們最近正在推動的一件事情:直接讓實體AI機器人模型實現自我進化。

過去幾年,大家已經大量使用AI做程式設計和各種AI開發,但是對於AI本身在機器人研發流程中的使用,我覺得目前還相對欠缺。我們最近在推動的,就是嘗試用當前最前沿、最頂尖的大型模型來驅動機器人研發。

具體來說,我們可以先給AI設定一些規則、經驗、限制條件和工具,讓它自己到網路上搜尋最新論文、最好的研究成果以及各種開源方案。之後讓它自己撰寫程式,生成機器人的控制程式碼。

控制程式碼生成以後,可以先放到模擬環境裡執行和訓練,也可以進一步呼叫模型和控制系統,去驅動真實的實體機器人。

如果部署到實體機器人上,我們就可以做真實測試,然後對結果進行評價和評分。評價的一部分可以由機器人AI模型自己完成,另一部分也可以由人來參與。人的經驗仍然非常重要,因為很多時候,人能夠很容易判斷一個動作做得好還是不好。

如果這套邏輯真正形成體系並運行起來,整個機器人的開發效率會提高很多,迭代速度也會非常快。這個流程持續運行一段時間以後,就有機會真正形成機器人自我進化能力的提升。

這裡可以舉一個最簡單的例子。我們可以使用一個Coding智能體,讓它自己編寫機器人的控制程式碼。現在很多比較簡單的深度強化學習演算法,用Coding智能體自動撰寫程式,效果其實已經不錯。

程式碼生成以後,我們把它放到模擬環境裡面去做驗證和訓練;效果達到一定程度以後,再把它部署到實體機器人上做測試。測試之後,一方面由AI模型進行評價,另一方面也可以加入人工評分,判斷效果怎麼樣。再把這些結果回饋給程式編寫智能體,進入下一輪程式碼生成和最佳化,最終形成一個持續迭代的正向循環。

剛才說的只是一個最簡單的示例,真正使用的時候會複雜得多。但我覺得這是當下以及未來幾年全球機器人產業非常值得做的一件事情。

為什麼要這麼做?有幾個比較直接的原因。

第一,基礎模型的能力每個月、每年都在提升,那麼自我進化循環本身的能力也會隨之提升。也就是說,這套系統天生就能夠跟隨全球AI基礎能力的進步而不斷變強。

第二,它能夠更加充分地利用多元數據。過去依靠人工去處理和使用數據,整體效率比較低。如果形成自循環,我們就可以把各種訓練數據、真實世界數據以及人的數據都利用起來,而且數據利用效率會更高。

第三,它可以和更多真機部署形成閉環。隨著真實機器人部署越來越多,我們會不斷得到新的測試數據,也會獲得越來越多的評價指標。這樣一來,整個系統的數據利用率和數據增長速度都會得到保證。

第四,它能夠持續累積機器人的技能。我們可以每天、每個月不斷增加一些新的技能,而不是今天開發了一個技能,明天又把這個技能浪費掉,或者重新從頭做一遍。技能、數據、控制策略和評價結果都可以在這個系統中持續累積。

所以我覺得這是一件非常重要的事情:真正使用AI去大幅提升機器人的開發效率和進化效率。未來,這種方式很可能會成為實體AI機器人持續進化的一條重要路徑,也可能開啟一個新的階段。

我覺得未來這個方向會有越來越多人推動。

回過頭看,宇樹已經走過差不多10年。我們大概在2017、2018年就第一次參加世界機器人大會,這些年一路走下來,感受非常深。

站在今天這個新的階段,尤其是在AI快速發展、全球對機器人關注度非常高的背景下,整個機器人的進化速度已經明顯加快。未來機器人的發展速度,可能還會比我現在預估的更快。

我覺得,這是一個全新的起點,也是一個全新的開始。

由於時間關係,今天報告得比較簡單。謝謝大家,也請大家多多包涵。

分享至:

作者:Zen

本文為PANews入駐專欄作者的觀點,不代表PANews立場,不承擔法律責任。

文章及觀點也不構成投資意見

圖片來源:Zen如有侵權,請聯絡作者刪除。

關注PANews官方賬號,一起穿越牛熊
PANews APP
Meta Muse Video生成影片樣片曝光,單次AI最長生成10秒影片
PANews 快訊