
Robot wyposażony w model sztucznej inteligencji Gemini Robotics może wrzucić koszykówkę do obręczy.
Kilka dni temu DeepMind Google zastosował do robotów wielki model języka (LLM). Dzięki modelu firma mówi, że roboty mogą wykonywać niektóre zadania bez konieczności obserwowania ruchów innych robotów. Na przykład „zanurz” mini koszykówkę do obręczy na stole.
DeepMind jest jedną z firm, która próbuje rozwijać boty ogólne za pomocą technologii chatbot. Biorąc jednak pod uwagę, że takie modele są skłonne do wywoływania błędów i szkodliwych wyników, ta techniczna ścieżka ma implikacje bezpieczeństwa.
Zespół badawczy ma nadzieję opracować maszynę intuicyjną do działania i może wykonywać różne zadania fizyczne bez nadzoru ludzkiego lub przedprogramy. Carolina Parada, szef zespołu robotyki w Deepmind, zauważyła, że łącząc model Gemini, programiści mogą poprawić zdolność robota do „zrozumienia języka naturalnego i postrzegania świata fizycznego na lepszym poziomie”.
Model, zatytułowany Gemini Robotics, został wydany 12 marca. Alexander Khazatsky, współzałożyciel i badacz AI w Collectexai, American Artificial Intelligence Company (AI), skomentował, że jest to „mały i namacalny krok” w kierunku celu uniwersalnych robotów.
Zespół DeepMind opiera się na najnowocześniejszym modelu wizji i języka, Gemini 2. 0, który jest szkolony przez analizę wzorców w ogromnych ilościach danych.
Zespół opracował dedykowaną wersję Gemini w celu poprawy możliwości zadań obejmujących fizykę 3D i rozumowanie przestrzenne, takie jak przewidywanie trajektorii obiektu lub identyfikacja tej samej części obiektu z obrazów wykonanych z różnych stron.
Ponadto naukowcy przeszkolili model z tysiącami praktycznych, zdalnie obsługiwanych danych demo robota. Pozwala to „mózgowi” robota wykonywać zadania w świecie rzeczywistym, podobnie jak LLM mogą powiązać następne słowo w zdaniu poprzez naukę.
Naukowcy przetestowali robotykę Gemini na robotach humanoidalnych i ramion robotycznych stosujących redukcje harmoniczne, obejmując zadania, które pojawiły się podczas szkolenia, a także nowe zadania, które nie zostały na nie narażone. Mówią, że robot z modelem przewyższa swoich konkurentów zarówno w znanych, jak i nowych zadaniach z dostosowanymi szczegółami.
W zadaniach wymagających delikatnej manipulacji, takich jak Origami lub zamykanie plecaka, robot ma wskaźnik sukcesu ponad 70% po obejrzeniu mniej niż 100 demonstracji. Roboty przy użyciu innych modeli prawie wszystkie nie powiodły się.
Khazatsky uważa, że zespół Google wykonał świetną robotę, wszczepiając zdrowy rozsądek w „mózgu” robota, ale zauważa, że prawdziwy skok będzie wynikał z nauki danych zebranych w „chaotycznym prawdziwym świecie”, a nie w środowisku laboratoryjnym.
Bezpieczeństwo staje się istotnym wyzwaniem przy stosowaniu takich modeli. Vikas Sindhwani, robotyka i badacz AI w Deepmind w Nowym Jorku w USA powiedział: „Początkowo roboty będą zachować bezpieczną odległość od ludzi. W przyszłości stopniowo wdrażamy bardziej interaktywne i współpracujące zadania”.
