VLA (Vision-Language-Action)
KI-Modell, das Bilder und Sprache in Motorikbefehle für einen Roboter übersetzt.
KI-Modellarchitektur, die visuelles Verständnis (Bilder, Videoströme), das Verständnis natürlicher Sprache und die Erzeugung motorischer Aktionen in einem einzigen neuronalen Foundation-Netzwerk zusammenführt. Ein VLA erhält als Eingabe Kamerabilder und verbale Anweisungen und liefert als Ausgabe Bewegungsbefehle für einen Roboter. CLOiD von LG ist ein Beispiel dafür: trainiert mit Zehntausenden Stunden an Daten zu Hausarbeiten, übersetzt es Sehen und Sprechen in physische Bewegungen.
Artikel über „VLA (Vision-Language-Action)“
Verwandte Begriffe
Mitreden Demnächst
Eine Frage, ein Widerspruch, Erfahrungen aus der Praxis zu diesem Begriff? Das Forum der Botoide-Community kommt in Kürze.
