上一篇談到,傳統SLAM將地圖交給路徑規劃,任務就差不多完成。對自主機器人來說,地圖建好之後,新的應用(與挑戰)才開始,包括搜尋、導航到指定的位置、記住看過什麼,以及留給模型(複雜情境)推理時讀取。實體AI(Physical AI)的記憶,和大型語言模型的記憶(memory)很不一樣,它往往得和3D位置綁在一起,而且可能因環境變化而過期。
先看導航與搜尋。
指令開始換成自然語言,例如「把二樓會議室的空紙箱收到回收區」,自主機器人得自己把任務標的對應到地圖上的位置。這類問題研究上稱為grounding,也就是把語言中的描述,對應到空間裡的物件或位置。做法是把視覺語言模型的特徵結合到地圖上,機器人不必事先學會識別那個箱子(現在的視覺語言模型多半具備zero-shot的辨識能力),也能找出「靠窗那排料架上白色的箱子」。3D幾何地圖還是基礎,只是現在加上豐富可操作的「語意」。
地圖也開始被當成記憶來用。半導體廠使用四足機器人沿固定路線讀取儀表、記錄管線與機台外觀。這些製造業用戶希望機器人在巡檢時隨時比對,看出環境有沒有差異。地圖因此要夠密、位置要夠準,機器人也得記得上一次看過什麼。
問題是,這些記憶需要隨時被更新。工廠、倉儲、賣場的環境常在變動,料架被移動、走道被暫時堆放、產線改造。所以不能只靠定期重建一次地圖,機器人得邊執行任務邊更新。
更新也不必一台包辦。上一篇談的車隊協同,搬到室內同樣適用,幾台機器人一起建圖,也一起更新「空間」記憶。只是規模不同,路上每天有大量車輛經過同一段路,廠區裡往往只有少數幾台機器人,每一次觀測都重要。協作時的座標一致性、更新頻寬、運算能力、以及觀測不一致時的調整等,各個技術環境都是一個全新挑戰。
還有一層干擾來自現場走動的人員與移動機具。多數SLAM假設場景是靜止的,這些移動中的人與機具會被劃進地圖,既干擾定位,也留下抹不掉的殘影。常見的做法是額外加上語意分割模型把它們挑出來,代價是畫面處理時多花幾秒,耽誤即時性。我們最近的研究換了個方向,使用追蹤器算過的訊號判斷哪些畫素在動,善用時序以及既有的結構訊號,降低繁重的深度學習運算,成本可以降低幾十倍,使用單一鏡頭攝影機,在單張消費級顯示卡上每秒可以超過20幀。
前面談的都是怎麼把環境記下來。再往前一步,地圖甚至開始直接進到模型的推理裡。模型讀取的脈絡(context)也不再只有文字token,開始出現帶有3D位置與視角資訊的空間token。2026年一項研究把單眼影片重建出的3D特徵與相機視角做成空間token,連同影像本身的視覺token一起餵給語言模型,顯示物件計數與路線規劃都跟著改善。這類做法目前多在室內場景驗證,搬到整座廠房、或是大範圍的場域還沒有定論。
如果機器人進去場域前連地圖都沒有,任務進行的難度更高。例如,緊急進到災後或結構受損的建物,樓板與樓梯可能已經變形,機器人得一邊走一邊把3D的圖建起來,還要記得剛剛看過什麼,才知道哪裡還沒去過、哪條路可以通行,萬一受困又該從哪裡撤出。推理的結果決定下一步往哪走,下一段地圖(記憶)也跟著長出來。這還在很早的階段,真實災場的煙塵、照明與通訊條件,都比實驗環境更惡劣。
這種按位置取記憶的需求,已經開始改變系統怎麼做快取。語言模型用鍵值快取(KV cache)把算過的留著避免重算,記憶體因此成為推論瓶頸之一。也有研究指出,模型連續推演影片畫面時,每一幀就要上千個token,1分鐘的推演累積到數十萬個,吞吐量大幅降低。一般做法是丟掉最舊的,但是在空間自主運作時,再回到同一個地方,先前看過的空間記憶就沒了。已經有做法把快取按相機位置分塊保存,回到同一個位置時再取回對應的那幾塊,不必重算。等於用位置而不是時間,決定什麼該留下。
地圖要能導航,也要能當作空間記憶,讓模型拿去推理。SLAM這個老題目,因此有了新的角色。所以Physical AI需要的,可能不只是更長的脈絡或更多記憶體,而是一套知道哪裡該記、什麼時候該更新、哪些東西可以忘掉的記憶系統。