Rycina wydała VLA Model Helx: instruktaż jednego zdania, humanoidalne roboty do współpracy w pracy domowej

Feb 27, 2025 Zostaw wiadomość

Niedawno Figury AI, innowacyjna firma w dziedzinie robotyki w Stanach Zjednoczonych, wydała główny przełom: model ogólnego zastosowania w języku wizualnym (VLA) o nazwie Helix. Po raz pierwszy model ten zdaje sobie sprawę z szybkiej ciągłej kontroli pełnej górnej części robota humanoidalnego i doskonale integruje percepcję, zrozumienie języka i kontrolę uczenia się.

 

Pojawienie się modelu Helix jest ważnym krokiem naprzód w elastyczności operacyjnej robotów humanoidalnych. Dzięki prostym poleceniom języka naturalnego robot może łatwo uchwycić prawie każdy mały obiekt gospodarstwa domowego, nawet te, które nigdy nie zostały dotknięte podczas szkolenia, bez wcześniejszej demonstracji lub niestandardowego programowania. Ta zdolność wynika z potężnej zdolności uogólnienia modelu helisy.

humanoid robot

Rysunek AI podkreślił, że model helisy utworzył szereg pierwszych branży. Po raz pierwszy umożliwia szybką ciągłą kontrolę całej górnej części robota humanoidalnego, w tym elastycznej kontroli nadgarstka, tułowia, głowy i każdego palca. Podczas testowania robot z powodzeniem przetworzył tysiące nowych przedmiotów, które zostały zaśmiecone dezorganizacją, od szklanych oprogramowania i zabawek po narzędzia i ubrania, bez uprzedniej demonstracji lub programowania.

 

Jeszcze bardziej niesamowite jest to, że model helisy ma również możliwości współpracy z wieloma robotami. W teście oba roboty mogły współpracować nad długoterminowymi, złożonymi zadaniami, współpracując na nigdy wcześniej nie widzianych przedmiotach, takich jak sortowanie nieznanych artykułów spożywczych. Ta zdolność otwiera więcej możliwości praktycznego zastosowania robotów w środowisku domowym.

 

Model Helix pokazuje również doskonałe zrozumienie sceny i semantyczne możliwości analizowania. Po wyświetlaniu wniosku o „odebranie obiektu pustynnego” robot jest nie tylko w stanie rozpoznać, że zabawkowy kaktus pasuje do tej abstrakcyjnej koncepcji, ale także wybiera najbliższą rękę i wykonuje precyzyjne chwytanie. Ta uniwersalna funkcja chwytania, od języka do ruchu, zapewnia większą wygodę w rozmieszczeniu robotów humanoidalnych w nieustrukturyzowanych środowiskach.

 

Model Helix był w stanie osiągnąć te przełom dzięki przełomowej architekturze podwójnego systemu. Architektura składa się z systemu 1 i systemu 2, które są odpowiedzialne za odpowiednio dokładną kontrolę, zrozumienie scen i semantyczne analizowanie. System 2 opiera się na VLM open source z parametrami 7b, który działa na częstotliwości 7-9 Hz, aby zapewnić uogólnienie w obiektach i scenariuszach. System 1 to 80 m wizualny model strategii motorycznej, który przekształca semantyczną reprezentację systemu 2 w instrukcje działania ciągłego działania przy częstotliwości 200 Hz w celu osiągnięcia odpowiedzi w czasie rzeczywistym na poziomie milisekundowym. Ta oddzielona architektura umożliwia dwóm systemom wykonywanie odpowiednich funkcji i współpracę w celu uzyskania wydajnej kontroli robota humanoidalnego.

 

Modele Helix wykorzystują bardzo niewiele zasobów podczas szkolenia. Korzystając tylko z około 500 godzin wysokiej jakości nadzorowanych danych, zespół był w stanie osiągnąć solidne uogólnienie obiektów. Dane te stanowią mniej niż 5% wielkości wcześniej zebranych zestawów danych VLA i nie opierają się na gromadzeniu jednostek wielopoziomowych lub szkolenia wieloetapowego. Osiągnięcie to nie tylko pokazuje wydajność modelu helisy, ale także zapewnia więcej możliwości rozwoju robotów humanoidalnych w przyszłości.