【
儀表網(wǎng) 研發(fā)快訊】視覺語言導航(Vision-and-Language Navigation,VLN)目標是讓機器人能夠理解人類自然語言指令,并結合視覺感知在復雜三維環(huán)境中自主導航,是具身智能實現(xiàn)自然人機交互和自主決策的重要基礎,在家庭服務、智能制造等領域具有廣闊應用前景。
近期,中國科學院沈陽自動化研究所科研團隊圍繞具身導航中的意圖推理與持續(xù)自主學習開展研究,分別提出了具有隱式指令推理能力的導航智能體ReasonWalker,以及具有持續(xù)知識積累與自主進化能力的終身導航智能體EverWalker,推動視覺語言導航機器人由“執(zhí)行明確指令”向“理解用戶意圖”,由“一次訓練固定使用”向“長期學習持續(xù)進化”發(fā)展。
現(xiàn)有視覺語言導航主要依賴明確、逐步指令,難以真正理解用戶高層意圖,針對這一問題,科研團隊提出了推理迭代導航新范式及ReasonWalker導航模型,將機器人導航由傳統(tǒng)的“路徑指令跟隨”進一步拓展為面向用戶需求的意圖理解與自主推理決策??蒲袌F隊構建了可持續(xù)更新的顯式場景記憶,將機器人在長期導航過程中獲得的空間結構、物體語義及區(qū)域關聯(lián)轉(zhuǎn)化為可復用的場景知識,并進一步借助預訓練大模型的能力,對用戶指令、實時視覺觀測與場景記憶進行統(tǒng)一建模和聯(lián)合推理,形成“意圖理解—場景關聯(lián)—目標推斷—動作決策”的完整認知閉環(huán),使導航機器人由聽懂怎么走邁向理解為什么走、判斷去哪里并自主決定怎么走。
面向機器人長期自主運行的核心問題,科研團隊探索導航智能體突破“一次訓練、能力固化”的傳統(tǒng)模式,實現(xiàn)知識不斷積累、能力持續(xù)增強的終身自主進化。他們提出了終身視覺語言導航新范式,并設計EverWalker終身導航智能體,讓機器人可以在動態(tài)變化的環(huán)境里不斷吸納全新經(jīng)驗,同時留存、重組過往習得知識。科研團隊構建了動態(tài)演化的原型化導航知識空間,把多場景下可遷移的導航經(jīng)驗凝練壓縮為知識原型,支持原型隨新場景自動擴展迭代,實現(xiàn)跨場景知識沉淀復用;通過原型條件超網(wǎng)絡,智能體依據(jù)實時觀測檢索、組合相關知識,動態(tài)生成適配當前場景與任務狀態(tài)的運行參數(shù),無需預先知曉任務類型,即可完成自適應調(diào)整。
ReasonWalker的相關研究以ReasonWalker: Reasoning Iterative Vision-and-Language Navigation with Implicit Instructions為題發(fā)表于國際期刊IEEE Transactions on Cybernetics。博士生王旭東為論文第一作者,韓志研究員為通訊作者。
EverWalker的相關研究以Evolving the Prototype Journey: Lifelong Vision-and-Language Navigation with Prototype Adaptation為題發(fā)表于國際期刊IEEE Transactions on Circuits and Systems for Video Technology,實習生李干和博士生王旭東為論文共同第一作者,韓志研究員為通訊作者。
科研團隊長期聚焦于機器人具身智能研究,致力于提升機器人在開放、動態(tài)和長期運行環(huán)境中的自主感知、推理、決策及持續(xù)學習能力,在機器人具身導航、具身操作等領域持續(xù)取得原創(chuàng)性成果,提出的Uni-Walker、AlldayWalker、SkillsCrafter算法已被 ICLR 2026、AAAI 2026 等國際學術會議錄用。相關研究得到國家重點研發(fā)計劃、國家自然科學基金、沈陽自動化所基礎研究計劃等項目的資助。(機器人學研究室)
所有評論僅代表網(wǎng)友意見,與本站立場無關。