DIGITIMES

Physical AI還缺什麼?機器人都會跳舞、跑酷、接棍子了

徐宏民
2026-10-06
AI語音摘要
00:35

9月底在美國匹茲堡參加機器人頂尖會議IROS 2026。一家機器人新創的攤位上,雙臂機器人在玩「接棍子」(falling sticks)遊戲,幾根棍子懸在上方隨機落下,手臂要在半空中瞬間抓住。這類遊戲原本用來測試人的反應速度。

這一年也看到不少機器人跳舞、跑酷(機器人障礙賽)、跑半馬的影片。這些表演代表什麼?機器人已經有完備的AI能力了嗎?

先看跳舞。中國一家人形機器人大廠2025年在春節晚會讓機器人跳舞。這類表演常見的做法是「動作追蹤」(motion tracking),錄下人類動作、對應到機器人骨架,在模擬器裡用強化學習訓練一個照著做又不跌倒的策略,再直接用到實體機器人上。硬體則靠高扭矩關節與3D光達定位。外媒報導指出,這是用真人舞者資料預先編排的表演。

跑酷多了一層判斷。2026年初,柏克萊加州大學、史丹佛大學、卡內基美隆大學等研究團隊,把多個跑酷技能蒸餾成一個以深度影像驅動的策略。機器人只靠深度相機與移動方向、速度的指令,自己決定障礙物要跨過、爬上還是撐越。但往哪裡去?為什麼去?仍由人決定。

把這三個例子放進機器人的控制架構來看。控制大致分成5層,往上愈慢、愈抽象,往下愈快、愈貼近實體動作。最上層由大型語言模型理解指令、拆解步驟,大約每秒1次或更少。往下是視覺語言動作模型(VLA),決定手要抓哪裡、怎麼移。再往下是負責移動與平衡的運動策略、協調手臂與腿部的全身控制,最底層的馬達電流控制大約每秒上萬次。

借用心理學家康納曼(Daniel Kahneman)《快思慢想》的說法,上兩層像需要專注推理的「系統二」,下三層像快速、直覺的「系統一」。跳舞、跑酷、接棍子,都落在系統一。

這幾層的分工目前還在調整。一家美國人形機器人新創把全身控制獨立出來,稱為「系統零」,用超過1,000小時的人類動作資料訓練成一個網路,業者表示取代10萬多行手寫程式。運動策略與全身控制兩層,看來正被學出來的控制器合併。

為什麼停在系統一?因為這幾層的資料較易取得。「照著人類動作做、不要跌倒」幾乎適用每個動作,成敗幾秒就知道。剛體與地面的接觸也容易模擬,GPU上可以同時跑幾千台虛擬機器人,走路策略很快就能訓練出來。上層剛好相反,「摺好衣服」「幫我微波午餐」很難寫成獎勵,手指與物件的細微接觸,模擬也不準。所以這些表演多半是模擬器裡用強化學習練出來的,機器人身上還缺一個有深度思考、推理能力的「大腦」。

這些表演證明的,是平衡、移動與全身動作已經成熟許多。北京的人形機器人半程馬拉松賽,2025年首屆多數隊伍跑不完,2026年已有隊伍50分鐘出頭完賽。資金也跟著進來,依市場研究機構統計,2025年全球實體AI(Physical AI)新創募資近400億美元,2026年上半已超過470億美元(統計範圍也包含自駕車、無人機等)。

缺的部分,從系統二到場域部署,我的觀察有6項:

第一是長時序任務。公開展示的自主任務,大多只有幾分鐘、數十個連續動作,離工廠一個班次的8小時還很遠,過程中也要能推理、確認自己有沒有做完。

第二是泛化,關鍵在資料。上層要的做完工作的資料,目前多半得在真實世界累積,遙控操作因此從機器人做不到時的補位,也成收集資料的方法。也有團隊讓模型從實際執行與人工修正中學習。

第三、第四是硬體與接觸。便宜的是身體,手、觸覺、電池與耐用度還沒跟上。2026年7月一家美國科技大廠發表的模型,讓人形機器人蹲下從地上撿東西,成功率還不到5成。

第五是安全。固定的機械手臂斷電後停在原地,需要主動維持平衡的機器人則可能倒下,針對這類機器人的國際安全標準,目前仍在草案階段。

第六是部署。依國際機器人聯合會(IFR)統計,2025年全球工業與專業用途的人形機器人約7,000台,不少是買來產生訓練資料,實際在場域使用的極少,流程怎麼改、投資報酬怎麼算,都還在摸索。

這幾年控制與硬體的能力、韌性持續進步。硬體價格往下、系統二的能力往上,兩條線交會之後,機器人投入場域才看得到投資報酬。如果場域部署的能力也跟著補上,未來幾年Physical AI agent對產業的影響,可能又會超乎我們的想像。

國立台灣大學資訊工程學系教授,曾任鴻海集團與Stellantis合資車用科技公司技術長暨副總經理,推動ADAS及智慧座艙系統產品進入全球車用市場。紐約哥倫比亞大學電機博士,專精於機器學習、電腦視覺、自駕車、機器人等領域。為訊連科技研發團隊創始成員,慧景科技(thingnario)共同創辦人,NVIDIA AI Lab計畫主持人;曾任IBM華生研究中心及美國微軟研究院客座研究員。擔任多家科技公司AI策略顧問,習慣從學術與產業雙重視角檢驗技術發展的機會與挑戰。
智慧應用 影音