HomeBody VLM: A látás és a cselekvés köti össze a robotikus készségek általánosításához

HomeBody VLM A látás és a cselekvés köti össze a robotikus készségek általánosításához

HomeBody VLM: A látás és a cselekvés hídja

A HomeBody rendszer egy moduláris architektúrát mutat be, ahol egy vizuális-nyelvi modell szemantikus okokozási rétegként működik egy újrafelhasználható robotikus készségek könyvtárán felül. Ehelyett, hogy végpontok közötti házirendet tanítana minden új környezethez, a VLM a magas szintű utasításokat és a vizuális megfigyeléseket értelmezi, hogy kiválassza és paraméterezze a meglévő készségeket—mint például a navigációt, a ragadást vagy az objektum manipulációt—ezáltal lehetővé téve a nullás shot általánosítást még nem látott otthonokban.

Ez a beépülő módszer a VLM-et egy cserélhető kognitív modulként kezeli, elválasztva a perceptumot és a okokozást az alacsony szintű vezérlésről. A kutatók napjainkban egy hasonló paradigma bemutatását mutatták be, amikor egy hatékony VLM-et közvetlenül csatlakoztattak egy mobil manipulátorhoz, lehetővé téve számára, hogy tisztítson meg egy ismeretlen konyhát feladat-specifikus finomhangolás nélkül. A HomeBody ezt a fogalmat bővíti ki azzal, hogy formálizálja a készség interfészt, biztosítva, hogy a VLM kimenete megbízhatóan leképezzen ellenőrzött, biztonságos mozgásprimitívekhez. Ez a moduláris alap készen áll a következő részben leírt konkret fordítási folyamat megvalósítására.

Hogyan fordítja le a HomeBody a látást mozgássá

A folyamat akkor kezdődik, amikor a VLM egy magas szintű utasítást és az aktuális RGB-D megfigyelést kapja. Először kiválaszt egy megfelelő készséget a könyvtárból—navigációt, ragadást, elhelyezést vagy ablaknyitást—majd strukturált eszközhívást bocsát ki, amely megadja a készség által igényelt térbeli célokat. A navigáció esetén a cél egy 2D útvonalpont a foglaltsági térképen; a ragadás és elhelyezés esetén a VLM egy 3D objektum középpontját és egy közeledési vektort adja ki; az ablak articúlózás esetén a kezelő pozícióját és húzási irányt adja meg.

A 3D célok mélysége a Fast‑FoundationStereo által terméktelen mélységi adatokat előállító Intel RealSense D435i stereo pár futtatásából származik, valós idejű sebességgel. A perceptációs verem ezt a mélységet összeolvasztja az RGB szegmentálási maszkokkal, hogy pontos középpontokat és felületi normálokat számítson ki. Az analitikus ragadási tervező ezután felhasználja a cél geometriát, értékeli az antipodal ragadási jelölteket a helyi pontfelhőn, és kiválaszt egy ütközést mentes pozíciót, amely kielégíti a VLM által biztosított közeledési korlátokat.

Miután a készség és paraméterei rögzítve lettek, az alacsony szintű vezérlő végrehajtja a mozgásprimitívet—akár testteljes navigációs útvonalat, akár kartesián kar mozgást a ragadáshoz, akár hibrid erő-pozíció profilot az ablak húzásához—mig a VLM figyeli a haladást és kiadja a következő eszközhívást. Ez a elválasztás tartósan kevésbé teherbe vetíti a következtetési hurokot, és determinisztikusan végrehajtja a műveletet, lehetővé téve a rendszer számára, hogy megbízhatóan láncoljon több készséget még nem látott otthonokban. A kulcsfontosságú technikai pontosok lent találhatók összefoglalva.

Kulcsfontosságú tények

  • A HomeBody VLM szemantikus okokozási rétegként működik, amely a nullás shot általánosításra képes, még nem látott otthonokban a felhasználható robotikus készségek kijelölését és paraméterezését végzi.
  • A rendszer elválasztja a magas szintű vizuális-nyelvi okokozást az alacsony szintű vezérlésről, a VLM-et cserélhető kognitív modulként kezelve.
  • A Fast‑FoundationStereo az Intel RealSense D435i stereo párjait feldolgozza, hogy valós idejű sebességgel sűrű metrikás mélységet állítson elő a 3D célok becsléséhez.
  • Az analitikus ragadási tervező a helyi pontfelhőkön az antipodal jelölteket értékeli ki, hogy ütközést mentes pozíciókat állítson elő, amelyek a VLM által megadott közeledési vektorokhoz kötött korlátozásokkal kompatibilisek.
  • A készségek navigációt, ragadást, elhelyezést és ablak articúlózást tartalmaznak, mindegyik determinisztikus mozgásprimitívek végrehajtásával történik, amelyeket a VLM figyel.
  • Ez a moduláris architektúra tükrözi az utóbbi kutatásokat, amelyek a VLMs közvetlen csatlakoztatását mutatják be mobil manipulátorokhoz nyílt szókészletű feladat végrehajtásához feladat-specifikus finomhangolás nélkül.

Ezek a képességek kiterjedt gyakorlati következményekhez vezetnek és jövőbeli kutatás hopeful útvonalait jelzik.

Következmények és jövőbeli irányok

A HomeBody VLM által demonstrált beépülő VLM architektúra azt jelzi, hogy egy gyakorlati út vezet a általános mobil manipulátorok felé, amelyeket kognitív frissítéssel lehet fejlesztani anélkül, hogy át kellene tervezni a mozgási veremet. Mivel a vizuális-nyelvi modul csak strukturált eszközhívéseket bocsát ki, a kutatók cserélhetnek nagyobb vagy tartomány-speciális modelleket, miközben a ragadási tervező és a testteljes vezérlő stabil marad. Ez a elválasztás csökkenti a szimuláció-valós környezet közötti átmenet akadályát is: a szimulációban betanított politikákat ugyanazok az analitikus primitívek ellen érvényesíthetik elő a telepítés előtt.

A készségkönyvtár kiterjesztése a fiókokon túli artikulált objektumok manipulálásához—mint ajtók, háztartási gépek és deformálható anyagok—gazdagabb térbeli leírásokat igényel. A egyetlen nézetből azonnal 3D háló rekonstrukciót előállító technológiák, például a Tencent InstantMesh, biztosíthatják a kapcsolatok gazdag tervezéséhez szükséges részletes geometriát anélkül, hogy várakoznának a több nézetes fusiónra. A gyors hálógenerálás összekapcsolása a létező mélységi folyamatával a VLM-et teljesítményesebb scénáképessé teszi, lehetővé téve a zárlatok, tartalom és eszközhasználat okoskodását a zsúfolt otthonokban is.

Gyakran Ismételt Kérdések

Hogyan kezeli a HomeBody VLM a Fast‑FoundationStereo által előállított mélybecslési hibákat, amikor 3D célokat hoz létre?

A rendszer a Fast‑FoundationStereo által előállított sűrű metrikás mélységet fúziózza az RGB szegmentálási maszkokkal, majd megbízhatósági szűrőt alkalmaz a bizonytalanságos pontok eldobásához. Emellett egy helyi pontfelhő-simítási lépést is használ, mielőtt az objektum középpontjait és felületnormalvektorokat számolnám, ami csökkenti a zajt. Ha a maradék hiba túllépi a biztonsági küszöböt, a VLM újragát kéri vagy visszavonul egy konzervatív ragadási pozícióba.

Lehetséges-e a moduláris VLM-et egy másik vizuális-nyelvi modellre cserélni anélkül, hogy újratanítanánk a készségkönyvtárat, és milyen lépések szükségesek?

Igen, az architektúra a VLMet cserélhető kognitív modulként kezeli; csak az eszköz-hívási interfészt kell egyezni. A modell cseréjéhez a fejlesztőknek meg kell valósítaniuk ugyanazt a JSON-sémát a készségkijelöléshez és paraméterkimenethez, ellenőrizniük kell, hogy az új modell betartja-e a szükséges késleltetést, és integrációs teszteket kell futtatniuk a készség burkolókon. Az alap mozgásprimitívek vagy a készségkönyvtár újratanítása nem szükséges.

Milyen számítási igények vannak a HomeBody VLM és a Fast‑FoundationStereo valós idejű futtatásához egy mobil manipulátoron?

Egy tipikus telepítésben az NVIDIA Jetson AGX Orin vagy ekvivalens GPU-t használják a VLM konklúzióhoz, míg egy többmagos ARM CPU-t a Fast‑FoundationStereo feldolgozáshoz. A VLM konklúziója körülbelül 10–15 Hz-es sebességgel fut, míg a Fast‑FoundationStereo 30 Hz-es sebességgel szállítja a mélységet, így a teljes észlelés‑cselekvés körkép 100 ms alatt marad. A memóriaigény 8 GB alatti, lehetővé téve, hogy a verem fusson a legtöbb modern peremhálózati számítási platformon.

Laszlo Szabo / NowadAIs

Laszlo Szabo is an AI technology analyst with 6+ years covering artificial intelligence developments. Specializing in large language models, ML benchmarking, and Artificial Intelligence industry analysis

Categories

Follow us on Facebook!

OpenAI mesterséges intelligencia ügynökök hozzáfértek az USA kormány oldalaihoz, biztonsági aggályokat keltve
Previous Story

OpenAI mesterséges intelligencia ügynökök hozzáfértek az USA kormány oldalaihoz, biztonsági aggályokat keltve

Latest from Blog

Go toTop