Dienstag, 4. August 2026
botoïdes.com
FR·EN·DE·ES·IT·PT·NL·PL
Der unabhängige Ratgeber für Roboter zu Hause

VLA (Vision-Language-Action)

KI-Modell, das Bilder und Sprache in Motorikbefehle für einen Roboter übersetzt.

KI-Modellarchitektur, die visuelles Verständnis (Bilder, Videoströme), das Verständnis natürlicher Sprache und die Erzeugung motorischer Aktionen in einem einzigen neuronalen Foundation-Netzwerk zusammenführt. Ein VLA erhält als Eingabe Kamerabilder und verbale Anweisungen und liefert als Ausgabe Bewegungsbefehle für einen Roboter. CLOiD von LG ist ein Beispiel dafür: trainiert mit Zehntausenden Stunden an Daten zu Hausarbeiten, übersetzt es Sehen und Sprechen in physische Bewegungen.

Artikel über „VLA (Vision-Language-Action)“

Verwandte Begriffe

Mitreden Demnächst

Eine Frage, ein Widerspruch, Erfahrungen aus der Praxis zu diesem Begriff? Das Forum der Botoide-Community kommt in Kürze.

← Das gesamte Lexikon