讓VLA真正跑上機器人:北大團隊開源Jetson-PI,Jetson Orin控制頻率提升8.66倍-每日熱議
讓VLA真正跑上機器人:北大團隊開源Jetson-PI,JetsonOrin控制頻率提升
在搭載 RTX 4090 的工作站上運行 Vision-Language-Action(VLA)模型,已經不算一件特別困難的事。
但真正困難的是:如何讓幾億乃至數十億參數的 VLA 模型離開工作站,跑進機器人的機身里,并且保持足夠快的反應速度?
(資料圖)
對于移動機器人而言,依賴外接高端 GPU 并不是理想方案。一方面,高功耗計算設備會顯著壓縮電池續航,縮短機器人的工作時間,將機器人應用限制在實驗室 Demo 中;另一方面,機器人與計算設備之間的通信還會引入額外延遲,并限制機器人的活動范圍。
但如果直接把 π0、π0.5 這樣的 VLA 模型部署到機載計算設備(如 NVIDIA Jetson Orin)上,問題同樣明顯。π0.5 在 Jetson Orin 上完成一次推理大約需要 1.4 秒,對應控制頻率僅約 0.7 Hz。機器人不僅動作遲緩,還可能因為推理延遲,在連續動作塊之間出現明顯停頓。
圖 1 不同計算設備的功耗、機器人續航與 VLA 控制頻率對比。高端 GPU 能夠提供更低的推理延遲,但會顯著增加功耗;Jetson Orin 等端側設備功耗更低,卻面臨控制頻率不足的問題。
針對這一問題,來自北京大學、AIRS 與 PrimeBot Research Institute 的研究團隊提出了Jetson-PI:一套面向低功耗端側設備的 VLA 實時控制方案。
Jetson-PI 沒有簡單地繼續壓縮模型,而是同時從異步推理算法、模型調度和底層推理引擎三個層面入手。在 NVIDIA Jetson Orin 上,它在不損失模型準確率的前提下,將控制頻率從 0.70 Hz 提升至 6.06 Hz,相較原生 PyTorch 推理提升 8.66 倍。
這一突破或許意味著,具身智能正在經歷從實驗室 Demo 到工業級應用的關鍵躍遷:Jetson-PI 通過持續、實時且高效的端側推理,延長機器人的有效工作時間,讓 VLA 從「能夠演示」走向「能夠長期工作」。
- 論文標題:Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference
- 論文地址:https://arxiv.org/abs/2607.12659
- 異步推理代碼:https://github.com/PKU-SEC-Lab/Jetson-PI
- 端側推理引擎:https://github.com/PKU-SEC-Lab/Jetson-PI-Edge
端側 VLA 的難題,不只是「推理太慢」
在傳統的同步推理模式下,機器人必須等待模型生成完整動作塊,才能開始執行。端側設備的算力和內存帶寬有限,推理延遲會直接表現為機器人的長時間停頓。一種自然的解決辦法是異步推理:機器人執行當前動作塊的同時,模型并行預測下一個動作塊。
這樣雖然能隱藏一部分推理時間,卻會引入兩個新問題。
第一個問題是感知與執行錯位。模型預測下一個動作塊時,使用的是推理開始時采集的圖像。但當推理結束、動作真正開始執行時,機器人和外部環境早已發生變化。推理延遲越長,模型「看到的環境」和動作「發生的環境」之間的偏差越大。對于端側推理而言,錯位問題會更加嚴重。
第二個問題是反應時間過長。即使推理和動作執行實現了并行,機器人對環境變化的響應速度仍然受完整 VLA 推理延遲的限制。在 Jetson Orin 這類端側設備上,一次推理可能超過 1 秒,機器人很難及時應對復雜操作中的物體滑動或位置變化。
以往的異步推理方法嘗試在時間維度上融合新舊軌跡,從而提升軌跡的平滑度。然而,其動作預測過程仍然存在以上兩方面的問題。當部署于邊端的 VLA 模型執行疊衣服等復雜任務時,可能會因動作誤差而導致任務失敗。
Jetson-PI 因而選擇了一條不同的路線:不對新舊軌跡進行融合,而是直接預測未來的環境表征,從未來時刻開始預測動作。
圖 2 同步推理、樸素異步推理和 Jetson-PI 的執行方式對比。樸素異步推理雖然消除了動作塊之間的停頓,卻會產生預測—執行錯位;Jetson-PI 通過未來修正緩解這一問題。
不預測未來圖像,而是修正未來表征
Jetson-PI 的核心方法被稱為Foresight-Aligned Asynchronous Correction,即「前瞻對齊異步修正」。
研究團隊訓練了一個輕量級未來修正模塊。該模塊接收兩類輸入:當前時刻由 VLM 生成的環境表征,以及已經提交給機器人、即將執行的動作序列。在此基礎上,它預測這些動作執行完成后,環境在未來時刻對應的 VLM 環境表征。動作專家不再只依據過時的當前觀測來預測動作,而是能夠從預計的未來時間點開始生成動作序列。
這里有一個關鍵設計:Jetson-PI 沒有嘗試生成完整的未來圖像,也沒有逐層修正 VLM 的全部 KV Cache。前者計算成本過高,后者同樣會引入大量額外推理。Jetson-PI 只壓縮并預測 VLM 最后一層的環境表示,再把修正信息送入動作專家。整個未來修正模塊約有 40M 參數,僅占完整 VLA 模型參數量的約 1%,因此不會給端側設備帶來過大的額外負擔。
為了讓該模塊同時適應不同硬件和不同推理延遲,訓練過程中會隨機采樣未來時間跨度。無論模型部署在 Jetson Orin、Jetson Thor,還是性能更高的 GPU 上,同一套修正模塊都可以根據實際延遲調整預測的時間范圍。
圖 3 前瞻對齊異步修正框架。未來修正模塊根據當前壓縮環境表征與已提交動作,預測推理完成時的未來環境表征,再由動作專家生成與未來執行時刻對齊的動作。
預測動作,并不需要每次都運行整個模型
引入未來修正后,理論上,完成一次 VLM 環境觀測后,系統只需反復調用未來修正模塊和動作專家,就能持續生成后續動作。這樣可以避免每次生成動作時都重新執行耗時的視覺—語言推理,從而提高機器人的控制頻率。然而,由于未來修正模塊存在誤差,如果長期只依賴未來修正,誤差累積會導致動作預測錯誤。
研究團隊重新分析了 VLM 和動作專家在機器人控制中的分工:VLM 的主要作用是重新觀察當前環境,校正系統對外部世界的理解;動作專家則負責高頻生成動作。
Jetson-PI 因而提出了基于置信度的調度機制。在未來修正模塊預測未來環境表征的同時,也輸出預測表征的置信度。當未來修正模塊給出的置信度高于閾值時,系統跳過 VLM,直接使用修正后的環境信息調用動作專家。由于動作專家推理更快,機器人可以更頻繁地生成新動作。當置信度下降至閾值以下時,系統重新調用 VLM,讀取最新的攝像頭畫面,并刷新環境表征、KV Cache 和后續預測所需的狀態緩存。
實際測試案例顯示,在動作平穩、環境變化容易預測時,置信度通常保持較高;而在抓取、接觸和放置等關鍵步驟中,置信度會明顯下降,觸發 VLM 重新觀察環境。
這相當于讓機器人學會判斷:「什么時候可以憑借已有認知繼續行動,什么時候必須重新看一眼。」
圖 4 Jetson-PI 的置信度調度機制。當未來預測置信度較高時,系統跳過 VLM,直接調用動作專家;在抓取和放置等環境變化較難預測的階段,置信度下降并觸發 VLM 更新。
基于 llama.cpp,重做一套端側 VLA 推理引擎
算法解決了「何時調用模型」的問題,但要讓 π0、π0.5 真正達到端側實時控制要求,底層推理系統同樣需要優化。研究團隊基于 llama.cpp 開發了 Jetson-PI-Edge,并針對 VLA 的執行特點進行了三項核心優化。
1)計算圖復用。傳統語言模型的輸出長度會隨解碼過程不斷增長,計算圖形態會動態變化。VLA 推理則有所不同:當攝像頭數量、圖像分辨率和動作維度固定時,大部分輸入張量的尺寸也是固定的。語言指令雖然長度不同,但通常較短,可以通過 padding 統一到固定長度。Jetson-PI-Edge 因而在第一次推理時構建 CUDA Graph,之后直接復用,避免每輪控制都重復建圖。
2)常駐中間緩存。視覺編碼器、語言模型和動作專家之間需要傳遞視覺 embedding、KV Cache 等中間結果。通用推理框架會將這些結果寫回 CPU 內存,再由下一個模塊重新復制到 GPU。對于內存帶寬有限的端側設備,這類往返傳輸會產生明顯開銷。Jetson-PI-Edge 為固定尺寸的中間結果預留 GPU 緩沖區,使 ViT、LLM 和動作專家可以直接復用 GPU 上的數據。
3)Flow matching 展開。π 系列模型的動作專家需要執行多輪 flow matching 去噪。若每一步都單獨調用計算圖,會產生重復的調度和 kernel launch 開銷。Jetson-PI-Edge 將多輪去噪展開到統一的計算圖中。雖然第一次建圖的成本會增加,但之后可以持續復用,因此更適合機器人長時間運行的控制循環。
在計算圖復用、GPU 中間緩存和 flow matching 展開全部啟用后,π0.5 在 Jetson Orin 上的單次推理時間降至 412.9 ms,其中動作專家的推理時間從 536.8 ms 降至 123.1 ms。結合置信度調度后,系統反應時間進一步降至 165.1 ms,控制頻率達到 6.06 Hz,相較原生 PyTorch 框架提升 8.66 倍。
值得注意的是,系統加速并不是以量化或剪枝為前提。論文中的計算圖復用、緩存和展開優化沒有改變模型計算本身,理論上還可以與量化、剪枝等方法組合,進一步降低延遲。
圖 5 Jetson Orin 上不同優化階段的延遲、反應時間和控制頻率。Jetson-PI 在 Orin 上將控制頻率從 0.70 Hz 提升至 6.06 Hz。
延遲越長,未來環境修正越重要
在 LIBERO 的 Spatial、Object、Goal 和 LIBERO-10 四個子數據集上,團隊使用 π0.5 對 Jetson-PI、RTC 和 VLASH 進行了比較。在不同異步延遲設置下,Jetson-PI 相比 VLASH 的平均成功率高出 14.8 個百分點,相比 RTC 高出 3.9 個百分點。
隨著延遲增大,只預測未來機器人狀態的 VLASH 性能明顯下降。Jetson-PI 則通過預測未來環境表征,在較長延遲下保持了更加穩定的成功率。以延遲步數 Δ = 9 為例,Jetson-PI 在四個數據集上的平均成功率相較 VLASH 高出 45.6 個百分點,相較 RTC 高出 7.0 個百分點。
這組實驗說明,端側 VLA 的問題并不只是「把推理做快」。當推理延遲無法完全消除時,還需要讓模型理解:在這段延遲時間內,機器人執行的動作會怎樣改變未來環境。
圖 6 Jetson-PI、RTC 與 VLASH 在四個 LIBERO 子數據集及不同異步延遲下的成功率。隨著延遲增大,Jetson-PI 的性能更加穩定。
真實機器人完成衣物折疊
研究團隊還在 PrimeBot Research Institute 的 X2-W 機器人上進行了真實場景實驗。
機器人配備一個頭部攝像頭和兩個腕部攝像頭,圖像分辨率均為 224 × 224。團隊將包含衣物拾取、展開與折疊、整理存放的復雜任務拆分為三個子任務,并以 15 Hz 的頻率執行動作。
如圖所示,同步推理需要等待完整動作塊生成后再繼續執行,因此機器人會在動作塊之間出現明顯停頓,整體執行緩慢。簡單異步推理雖然將預測與執行并行起來,減少了停頓,卻沒有解決感知時刻與動作真正執行時刻之間的偏差,導致動作連續性較差。Real-time Chunking 進一步改善了動作塊之間的銜接,但仍然依據已經滯后的環境觀測生成動作。在衣物抓取、調整和折疊等對時機要求較高的階段,感知—執行錯位仍可能造成關鍵動作失敗。
相比之下,Jetson-PI 根據已提交動作預測未來環境表征,使新生成的動作與實際執行時刻對齊。圖中的機器人運動軌跡更加連續,衣物操作過程更加流暢,同時保持了更高的實時性。
視頻鏈接:https://mp.weixin.qq.com/s/ugr2S_Vuf1x9jpHA6IEDzw
圖 7 Jetson-PI 在 X2-W 機器人上執行衣物折疊任務。
Jetson-PI 的定位
Jetson-PI 所關注的,不是繼續把 VLA 模型的參數規模推向更高,而是解決一個更接近真實機器人落地的問題:當模型必須在功耗、帶寬和散熱都受限的機載設備上運行時,如何讓它依然具備足夠快的反應速度?
這項工作的答案由三個部分組成:用未來環境表征緩解異步推理中的感知—執行錯位;用置信度調度減少不必要的 VLM 調用;用面向 VLA 特性的系統優化壓縮端側執行開銷。對于強調功耗、續航、活動范圍和離線運行能力的移動機器人而言,這套方法提供了一條更加可行的路線:不必把整臺高端工作站搬上機器人,也能讓 VLA 控制逐步接近實時。
作者介紹
論文第一作者楊澤斌是北京大學人工智能研究院二年級博士生,導師為李萌教授。其主要研究方向為高效具身智能算法與系統、大語言模型高效推理及邊緣計算,聚焦算法—系統—硬件協同設計,致力于解決具身智能系統在實際部署中的能效與實時性瓶頸。
他在 NeurIPS、DAC、ICCAD 等 AI 與計算機體系結構頂會上發表多篇一作論文,相關一作工作包括:高效端側目標導航算法 EfficientNav、具身規劃記憶管理系統 KEEP、面向機器人操作的層跳過高效推理框架 DySL-VLA、面向邊端信息處理的輕量化語言模型部署系統 MCUBERT,以及面向端側實時機器人控制的異步推理框架 Jetson-PI 等。








營業執照公示信息