VLA (Vision-Language-Action)
Model AI, który tłumaczy obrazy i język na polecenia ruchowe dla robota.
Architektura modelu AI, która łączy rozumienie wizualne (obrazy, strumienie wideo), rozumienie języka naturalnego oraz generowanie poleceń ruchowych w jednym sieci neuronowej bazowej. VLA przyjmuje na wejściu obrazy z kamer i polecenia werbalne, a na wyjściu generuje polecenia ruchu dla robota. Przykładem jest CLOiD od LG: wytrenowany na dziesiątkach tysięcy godzin danych z zadań domowych, tłumaczy wizję i mowę na gesty fizyczne.
Artykuły o „VLA (Vision-Language-Action)”
Powiązane terminy
Dołącz do dyskusji Wkrótce
Masz pytanie, inne zdanie albo doświadczenie z praktyki dotyczące tego terminu? Forum społeczności Botoide już wkrótce.
