General Motors (GM) ha presentado un enfoque innovador para abordar uno de los desafíos más complejos en el ámbito de la inteligencia artificial física: la conducción autónoma. La compañía automotriz está apostando por una estrategia de entrenamiento de sistemas de IA que opera a una velocidad asombrosa, 50.000 veces superior a la del mundo real. Este método, que combina simulaciones de alta fidelidad con entornos abstractos y técnicas de aprendizaje por refuerzo, busca resolver el escurridizo «long tail» de escenarios impredecibles, raros o ambiguos, que son cruciales para garantizar la seguridad y la fiabilidad a gran escala de los vehículos autónomos.
El principal desafío para GM, y para toda la industria automotriz que avanza hacia la conducción con los ojos cerrados y, eventualmente, la autonomía total, reside en la capacidad de los sistemas para interpretar un entorno caótico y en constante cambio. Esto implica no solo predecir comportamientos humanos, sino también operar de manera segura en una vasta gama de condiciones y casos límite. La premisa de GM es que, si bien la mayoría de los momentos al volante son predecibles, son los eventos raros, ambiguos e inesperados los que verdaderamente definen la seguridad y la idoneidad de un sistema autónomo para su implementación masiva.
El Desafío del ‘Long Tail’ en la Conducción Autónoma
Los escenarios de «long tail» en la conducción autónoma se manifiestan de diversas formas. Algunos son notables por su absoluta rareza: un colchón en la carretera, un hidrante rompiéndose, o incluso fallos eléctricos masivos que afectan la señalización urbana, como ocurrió en San Francisco. Estos eventos, especialmente en entornos urbanos densos, ilustran cómo los casos límite inesperados pueden generar cascadas de situaciones críticas. La capacidad de un sistema para navegar estas eventualidades, que serían imposibles de replicar o probar de forma segura en el mundo real, es un pilar fundamental para GM.
Sin embargo, los desafíos del «long tail» no se limitan a raridades extremas. También incluyen situaciones cotidianas que exigen cortesía o sentido común típicamente humano. ¿Cómo maniobrar para ocupar un lugar en un estacionamiento sin bloquear el tráfico? ¿O cómo gestionar una zona de construcción, obedeciendo las indicaciones de operarios y señales improvisadas? Estos escenarios, aunque sencillos para un conductor humano, requieren una ingeniería sofisticada para ser manejados impecablemente por una máquina. La curva de demanda de escenarios para la conducción autónoma evidencia esta complejidad creciente, pasando de eventos predecibles a situaciones cotidianas y finalmente a los raros eventos del «long tail».
IA Visual y de Lenguaje: Más Allá de la Percepción Básica
Para abordar estas situaciones matizadas, GM está desarrollando y desplegando modelos de Visión, Lenguaje y Acción (VLA, por sus siglas en inglés). Estos modelos parten de una base de Visión de Lenguaje (VL) estándar, que aprovecha el conocimiento a escala de internet para interpretar imágenes. GM refina estos modelos con cabezales de decodificación especializados para tareas de conducción. El resultado es un VLA capaz no solo de reconocer objetos, sino también de interpretar trayectorias de vehículos y detectar objetos en 3D, además de sus capacidades generales de reconocimiento de imágenes.
Estos modelos permiten que un vehículo comprenda que el gesto de un oficial de policía tiene prioridad sobre una luz roja, o que identifique el aspecto de una «zona de carga» en un concurrido terminal aeroportuario. Una ventaja adicional es que estos modelos pueden generar «rastros de razonamiento», lo que ayuda a ingenieros y operadores de seguridad a comprender el porqué de una maniobra. Esta transparencia es vital para la depuración, la validación y, sobre todo, para construir confianza en los sistemas autónomos.
Para superar la latencia inherente en las reacciones de conducción, que puede ser crítica, GM está desarrollando un «VLA de Doble Frecuencia». Este modelo a gran escala opera a baja frecuencia para tomar decisiones semánticas de alto nivel (por ejemplo, «¿es ese objeto en el camino una rama o un bloque de hormigón? «), mientras que un modelo más pequeño y eficiente se encarga del control espacial inmediato y de alta frecuencia (dirección y frenado). Este enfoque híbrido permite beneficiarse del razonamiento semántico profundo sin sacrificar los tiempos de reacción necesarios para una conducción segura.
La capacidad de reaccionar ante un caso límite de forma segura requiere que el modelo no solo entienda lo que está viendo, sino también cómo conducir a través del desafío identificado. Para ello, la experiencia es insustituible. Por eso, GM ejecuta millones de simulaciones de circuito cerrado de alta fidelidad cada día, equivalentes a decenas de miles de días de conducción humana, comprimidos en horas de simulación. Permiten reproducir eventos reales, modificar datos del mundo real para crear nuevos escenarios virtuales o diseñar otros completamente desde cero, probando así el sistema contra escenarios peligrosos que serían prácticamente imposibles de encontrar de forma segura en el mundo real.
Además de la simulación directa, la generación de datos sintéticos juega un papel crucial. La investigación de GM en «Seed-to-Seed Translation», por ejemplo, utiliza modelos de difusión para transformar datos del mundo real, permitiendo que una grabación de un día claro se convierta en una noche lluviosa o brumosa, preservando la geometría de la escena. Esto se conoce como un «cambio de dominio». El simulador basado en difusión «GM World» permite sintetizar escenarios de tráfico completamente nuevos usando lenguaje natural y cuadros delimitadores espaciales, añadiendo también elementos desafiantes como un vehículo cortando el paso.
La simulación fotorrealista es esencial para entrenar sistemas de percepción en condiciones variables. Sin embargo, cuando el objetivo es enseñar toma de decisiones y planificación táctica, los detalles computacionalmente costosos importan menos que las relaciones espaciales y la dinámica del tráfico. Aquí es donde entran en juego entornos abstractos como «Boxworld». El simulador de aprendizaje por refuerzo multiactor de GM, GM Gym, opera en este entorno abstracto, permitiendo simular miles de conductores por segundo. Este método puede operar 50.000 veces más rápido que el tiempo real, simulando 1.000 km de conducción por segundo de tiempo de GPU. Permite desarrollar modelos de conducción con resultados objetivos verificables, como seguridad y progreso, en lugar de simplemente imitar comportamientos humanos. Este enfoque acelerado es fundamental para la generación de modelos de conducción que superen las capacidades humanas en escenarios críticos, un paso clave para integrar la IA de manera efectiva en robots como los que NVIDIA está impulsando con sus World Action Models.
De la Política Abstracta a la Conducción en el Mundo Real
El camino del hogar a la oficina no pasa por Boxworld, sino por asfalto, sombras y clima. Para transferir esta pericia conceptual al mundo real, GM utiliza la «Destilación On Policy». En este proceso, el simulador opera simultáneamente en el modo abstracto de alta velocidad (Boxworld) y en el modo de sensor de alta fidelidad. El modelo de aprendizaje por refuerzo, que ha desarrollado una «política» de conducción perfecta en Boxworld, actúa como maestro guiando a un «estudiante», el modelo que operará en el coche. Esta transferencia de conocimiento es extremadamente eficiente; 30 minutos de destilación pueden equivaler a 12 horas de aprendizaje por refuerzo puro, permitiendo que el modelo del mundo real herede rápidamente los instintos de seguridad perfeccionados en simulación. Este tipo de transferencia de aprendizaje es fundamental para que la IA pueda operar en el mundo físico con la fiabilidad que se espera de los robots de hoy en día, como los que se investigan en la frontera de la Inteligencia Artificial General para robots físicos.
Diseñando Fallos Antes de que Ocurran
La simulación no solo entrena al modelo para conducir bien, sino también para fallar de manera controlada. Para poner a prueba rigurosamente el sistema, GM emplea un pipeline diferenciable llamado SHIFT3D. En lugar de solo recrear el mundo, SHIFT3D lo modifica activamente para crear objetos «adversarios» diseñados para engañar al sistema de percepción. El pipeline toma un objeto estándar, como un sedán, y deforma sutilmente su forma y pose hasta convertirlo en una versión desafiante y distorsionada, más difícil de detectar para la IA. La optimización de estos modos de fallo permite a los ingenieros descubrir de forma proactiva los riesgos de seguridad antes de que aparezcan en la carretera. El reentrenamiento iterativo del modelo con estos objetos «difíciles» generados ha demostrado reducir las colisiones cercanas en más de un 30%, cerrando la brecha de seguridad en casos límite que de otro modo podrían pasarse por alto.
Incluso con simulación avanzada y pruebas adversarias, un sistema verdaderamente robusto debe conocer sus propios límites. Para permitir la seguridad ante lo desconocido, los investigadores de GM añaden una «cabeza de incertidumbre epistémica» especializada a sus modelos. Esta adición arquitectónica permite a la IA distinguir entre ruido estándar y confusión genuina. Cuando el modelo se encuentra con un escenario que no comprende —un verdadero evento de «long tail»—, señala una alta incertidumbre epistémica. Esto actúa como un proxy principista para la minería de datos, marcando automáticamente los ejemplos más confusos y de mayor valor para que los ingenieros los analicen y los añadan al conjunto de entrenamiento. Este enfoque multifacético —desde la estrategia «Boxworld» hasta las pruebas de estrés adversarias— es el marco propuesto por General Motors para resolver el último 1% de la autonomía, sentando las bases para el desarrollo futuro y planteando nuevos desafíos de investigación.
La integración de la IA en la conducción autónoma es un campo que se asemeja a la necesidad de que los ingenieros sepan comunicar su trabajo, un desafío que a menudo se discute en el contexto de la traducción del lenguaje técnico. GM está construyendo las herramientas, la infraestructura y la cultura de investigación necesarias para abordar estas cuestiones a la escala requerida para vehículos, clientes y carreteras reales, avanzando así la frontera de la autonomía vehicular.







