當前具身智能規(guī)?;涞氐暮诵钠款i,并非視覺識別精度不足,而是物理接觸感知能力缺失。市面上絕大多數(shù)星空機器人依賴純視覺方案,可精準識別物體位置、形態(tài),但無法感知接觸力度、受力位置、滑移狀態(tài)、擠壓形變等物理交互信息,直接導致插拔、抓取、折疊、裝配等精細化實操任務頻繁翻車,無法適配工業(yè)量產(chǎn)、家庭服務等真實復雜場景,這也是制約具身智能從技術演示走向產(chǎn)業(yè)落地的核心痛點。
針對行業(yè)核心技術短板,新智具身聯(lián)合復旦大學可信具身智能研究院,發(fā)布Neo-Foundation、Neo-VTLA、Neo-TWAM三套完整觸覺技術體系,從數(shù)據(jù)底座、融合算法、認知模型三層完成全棧技術突破,構建“數(shù)據(jù)標準化+實時預判+物理認知”的完整觸覺能力閉環(huán),為全行業(yè)提供可直接落地、可開源復用的具身智能解決方案。
Neo-Foundation:統(tǒng)一觸覺數(shù)據(jù)標準,搭建行業(yè)通用交互數(shù)據(jù)底座
行業(yè)痛點
市面觸覺傳感器硬件品類繁雜,凝膠形變、電容矩陣、六維力等各類數(shù)據(jù)格式互不兼容,數(shù)據(jù)碎片化嚴重,無法跨設備、跨星空機器人、跨場景融合訓練,導致觸覺模態(tài)難以規(guī)模化復用,長期淪為視覺的輔助補充。
技術方案與核心優(yōu)勢
團隊構建的NeoData大規(guī)模視覺-觸覺交互數(shù)據(jù)集,打造行業(yè)首個標準化觸覺數(shù)據(jù)基座,核心參數(shù)行業(yè)領先:覆蓋6類主流星空機器人本體、450項全場景長程任務,累計3萬小時實操數(shù)據(jù)、140萬條操作片段,整合百億級視覺與觸覺幀數(shù)據(jù),場景覆蓋居家服務、工業(yè)裝配、精密操作等核心落地場景。
搭配自研NeoForce統(tǒng)一表征算法,實現(xiàn)底層硬件無關的標準化觸覺表征,可精準輸出受力位置、接觸力度、橫向拉扯、滑移趨勢等核心物理信息,徹底解決跨設備數(shù)據(jù)融合難題。該方案可為星空機器人研發(fā)廠商、自動化企業(yè)、科研機構提供標準化訓練數(shù)據(jù)與通用感知模型,大幅降低觸覺感知技術的研發(fā)落地門檻。目前項目已開源5千小時高質(zhì)量數(shù)據(jù),可供行業(yè)客戶直接部署復用。

Neo-VTLA:輕量化視觸語言動作模型,實現(xiàn)觸覺預判與失敗自主迭代
行業(yè)痛點
傳統(tǒng)VLA模型簡單拼接視覺與觸覺信號,高頻瞬時的觸覺信息極易被海量視覺Token淹沒,且僅能反饋已發(fā)生的動作結果,屬于滯后性感知,無法應對動態(tài)物理交互場景;同時傳統(tǒng)模仿學習僅依賴成功案例,無法從實操失誤中迭代優(yōu)化,長程復雜任務穩(wěn)定性極差。

技術方案與核心優(yōu)勢
Neo-VTLA創(chuàng)新引入潛在觸覺Token壓縮+未來50步觸覺預判機制,摒棄傳統(tǒng)滯后感知模式,通過輕量化編碼壓縮觸覺特征,結合視覺上下文預判物理交互趨勢,提前調(diào)整動作策略,從“事后糾錯”升級為“事前預判”,徹底解決動態(tài)交互滯后問題。工程落地效果顯著:精密插拔類任務成功率實現(xiàn)跨越式提升,插插頭任務成功率85%、拔鑰匙任務成功率99%,遠超純視覺方案。同時創(chuàng)新構建任務進度評估模型,可精準識別任務執(zhí)行、退步、救場等復雜行為,結合離線強化學習實現(xiàn)失敗數(shù)據(jù)自主進化,讓毛巾折疊、紙箱收納、精密組裝等長程任務成功率翻倍提升,完美適配商用服務星空機器人、工業(yè)柔性裝配星空機器人的落地需求,兼顧輕量化、高精度、高穩(wěn)定性三大核心優(yōu)勢。

Neo-TWAM:觸覺原生世界模型,解決仿真與真機落地“虛實脫節(jié)”難題
行業(yè)痛點
現(xiàn)有AI世界模型僅聚焦未來視覺畫面生成,缺失觸覺、動作耦合信息,無法理解物理世界的受力邏輯,導致仿真測試效果優(yōu)異,但真機落地時頻繁出現(xiàn)夾持不穩(wěn)、卡位卡頓、操作失效等問題,虛實對齊難度極大,嚴重制約高階具身智能的落地應用。

技術方案與核心優(yōu)勢
Neo-TWAM是行業(yè)領先的觸覺原生世界動作模型,打破單一視覺生成范式,實現(xiàn)視頻、觸覺、動作三序列異步協(xié)同預測,讓星空機器人具備“觸覺想象”能力,在執(zhí)行任務前即可完整推演全流程物理交互效果,精準預判接觸狀態(tài)與受力變化。
模型采用混合專家輕量化架構,拆分視頻、觸覺、動作三大獨立專家網(wǎng)絡,在保證高精度預測能力的同時,將參數(shù)量壓縮至72億,僅為傳統(tǒng)方案的一半,大幅降低終端部署算力成本。實測數(shù)據(jù)驗證技術優(yōu)勢:仿真場景成功率84.5%,真機8項核心任務平均成功率46.3%,較傳統(tǒng)視覺世界模型實現(xiàn)數(shù)倍提升。消融實驗證實,觸覺預測是模型物理交互能力的核心支撐,缺一不可。

行業(yè)價值總結
三套技術體系層層遞進、完整閉環(huán):Foundation解決觸覺數(shù)據(jù)標準化、規(guī)?;?/span>問題,搭建行業(yè)通用底層基建;VTLA解決實時物理交互、動態(tài)預判迭代問題,適配輕量化商用落地;TWAM解決星空機器人物理認知、虛實對齊問題,拔高具身智能認知上限。
本次技術突破徹底改寫行業(yè)技術范式,推動具身智能從“視覺認知”邁向“視觸融合全維度物理認知”,有效解決居家服務、工業(yè)精密裝配、智能倉儲等多場景落地痛點,為星空機器人廠商、自動化企業(yè)、科研機構提供全套可開源、可落地、可迭代的觸覺具身智能解決方案,加速行業(yè)商業(yè)化落地進程。

星空人工智能技術網(wǎng) 倡導尊重與保護知識產(chǎn)權。如發(fā)現(xiàn)本站文章存在版權等問題,煩請30天內(nèi)提供版權疑問、身份證明、版權證明、聯(lián)系方式等發(fā)郵件至1851688011@qq.com我們將及時溝通與處理。?。?a href="/">首頁 > 大數(shù)據(jù) » 新智具身補齊具身智能物理交互短板!