VLA (Vision-Language-Action)
Modelo de IA que traduce imágenes y lenguaje en comandos motores para un robot.
Arquitectura de modelo de IA que fusiona la comprensión visual (imágenes, flujos de vídeo), la comprensión del lenguaje natural y la generación de acciones motoras en una única red neuronal fundamental. Un VLA recibe como entrada imágenes de cámaras e instrucciones verbales, y produce como salida comandos de movimiento para un robot. CLOiD de LG es un ejemplo: entrenado con decenas de miles de horas de datos de tareas domésticas, traduce la visión y el habla en gestos físicos.
Artículos que hablan de «VLA (Vision-Language-Action)»
Términos relacionados
Hablemos de ello Próximamente
¿Tienes una pregunta, un desacuerdo o experiencia sobre este término? El foro de la comunidad Botoide llegará pronto.
