Todo ingeniero de software dispone de un depurador. Se establece un punto de interrupción, se avanza paso a paso por la ejecución y se observa cómo cambia el estado instrucción a instrucción. Cuando algo falla, no se analiza desde un panel de control, sino que se reproduce el proceso.
La fabricación no cuenta con un depurador. Una fábrica genera una enorme cantidad de datos de telemetría: estados de las máquinas, transacciones de órdenes de trabajo, resultados de calidad y firmas de los operarios. Todo ello se plasma en forma de filas en tablas. Sin embargo, lo que realmente provocó el defecto —como una pieza de sujeción mal colocada, una pieza situada en el lado equivocado del banco de trabajo o una llave dinamométrica compartida entre tres puestos que no está disponible durante once minutos— ocurre en el intervalo entre las líneas del registro. La transacción indica que el paso se ha completado, pero no explica cómo. Ese intervalo es el que cubre Factory Playback.
En qué consiste «Factory Playback» y qué problema resuelve realmente
Factory Playback sincroniza el vídeo de las cámaras de la planta de producción con el flujo de eventos operativos capturado por Tulip en una única línea de tiempo. Al hacer clic en una prueba de fugas fallida en el registro, el vídeo se desplaza al segundo exacto en que ocurrió. Si solicita «muéstrame todas las veces que un técnico modificó el trazado del mazo de cables en la línea 2 la semana pasada», obtendrá los fragmentos de vídeo, no un informe.
El contexto es fundamental para cualquiera que desarrolle agentes de visión: no se trata de un problema de análisis de vídeo, sino de un problema de contextualización. Si se aplica un modelo de lenguaje de visión (VLM) a material de vídeo sin procesar de una fábrica, se obtienen descripciones genéricas como «una persona está trabajando en una mesa». El modelo no tiene ni idea del contexto operativo, como que la mesa es la estación 7, que la persona está ejecutando el paso 4 de la orden de trabajo 88213, que la especificación de par de apriete es de 42 Nm o que las tres últimas unidades que pasaron por esta estación no superaron la prueba final.
La visibilidad operativa resulta intrínsecamente difícil en estos entornos por tres razones estructurales:
Entornos físicos amplios y dinámicos. Múltiples puestos de trabajo, zonas de trabajo extensas y materiales, herramientas y accesorios que se desplazan constantemente. No existe una geometría fija a la que poder referirse.
Producción bajo pedido. El producto en una estación determinada puede ser único o estar muy personalizado. Un modelo entrenado para reconocer «cómo es una unidad correcta» pierde su precisión de forma inmediata.
El trabajo se desarrolla entre los acontecimientos. Los sistemas registran las transacciones. Sin embargo, falta el contexto físico que las explica.
Es precisamente aquí donde confluyen las plataformas tecnológicas de NVIDIA y Tulip. Los modelos y la capacidad de cálculo de NVIDIA aportan una capacidad acelerada de percepción y razonamiento; el flujo de eventos de Tulip aporta el contexto operativo que indica a dichos modelos qué momentos son relevantes y qué significan en el lenguaje de la fábrica.
¿Por qué utiliza NVIDIA « Tulip »?
NVIDIA lleva años desarrollando la capa de modelos y microservicios para la IA física: NVIDIA Cosmos para el razonamiento y la generación de mundos, NVIDIA Metropolis Blueprint para la búsqueda y el resumen de vídeos (VSS), NIM para la inferencia desplegable y Omniverse para la simulación. Se trata de una base deliberadamente general, diseñada para adaptarse a un ámbito concreto en lugar de presuponerlo. Adaptarla a las operaciones industriales requiere un insumo que es verdaderamente escaso: la realidad operativa etiquetada a gran escala. La generación de datos sintéticos, en la que Cosmos destaca especialmente, multiplica esa semilla, pero algo tiene que servir de base para ella, y esa base debe ser un registro fiel de cómo el personal cualificado realiza realmente un trabajo físico complejo. Ese no es un conjunto de datos que cualquiera pueda obtener mediante crowdsourcing. Solo existe allí donde el trabajo ya se está llevando a cabo mediante software.
Tulip lo tiene como resultado de su actividad principal. La plataforma opera en más de 1.000 fábricas repartidas por 45 países, con aproximadamente 19.000 millones de eventos al año que pasan por las aplicaciones de primera línea, y más de 41.000 aplicaciones activas que abarcan el montaje, la inspección, la preparación de kits y la ejecución de lotes. Cada uno de esos eventos es una afirmación, redactada por una persona y con marca de tiempo, sobre lo que se suponía que debía ocurrir y lo que realmente ocurrió.
Aquí se aprecia una bonita simetría que hemos empezado a denominar «kaizen» como «aprendizaje por refuerzo a partir de la retroalimentación humana» (RLHF). La mejora continua ya es, en sí misma, un ciclo de retroalimentación en el que las personas observan el trabajo, lo evalúan y lo corrigen. Una vez formalizado y con marca de tiempo, ese ciclo constituye una señal de preferencia. Es una referencia de referencia sobre cómo debe ser un buen trabajo físico, generada de forma continua por las personas que lo realizan.
Así pues, la división del trabajo está bien definida: NVIDIA se encarga de desarrollar el «cerebro». « Tulip » es el sistema nervioso y el entorno de ejecución que lo conecta con el trabajo real.
Cómo encaja todo en la pila
Factory Playback se basa en el modelo NVIDIA Metropolis VSS y utiliza NVIDIA Cosmos 3 como modelo de razonamiento (VLM), mientras que « Tulip » proporciona el índice operativo. El proceso se ejecuta en las propias instalaciones, por lo que las imágenes de las cámaras nunca salen del edificio, lo cual es un requisito imprescindible en entornos sujetos a la Ley de Seguridad de la Información de Defensa ( GxP), al Reglamento Internacional de Tráfico de Armas (ITAR) y a los comités de empresa.
Captura y detección. Las cámaras de las estaciones transmiten en directo a la ruta de captura del VSS en un servidor con GPU local, que actualmente cuenta con hardware de la gama NVIDIA RTX PRO 6000 en el perímetro. El vídeo se divide en fragmentos, y un modelo de detección de objetos implementado por NIM (YOLOX en la configuración actual) genera detecciones por fotograma con identificadores de seguimiento, de modo que los objetos persisten más allá de los límites de los fragmentos, en lugar de tener que volver a detectarse cada pocos segundos.
Razonamiento. Los fragmentos se envían a NVIDIA Cosmos 3 para la generación de subtítulos densos con marca de tiempo y el razonamiento espacio-temporal. La arquitectura «mixture-of-transformers» de Cosmos 3 combina un transformador de razonamiento con un transformador de generación experta, de modo que el modelo razona sobre las interacciones entre objetos, el movimiento y las relaciones espacio-temporales como una operación de primer orden, en lugar de inferirlas a partir de subtítulos a nivel de fotograma. En cuanto a la reproducción, lo que nos interesa es la precisión de las marcas de tiempo y la comprensión relacional: no «un componente está sujeto en un accesorio», sino «el accesorio permanece suelto desde el 00:03:47 hasta el 00:04:12 mientras la unidad espera». Ese intervalo es el hallazgo real.
Recuperación. Los subtítulos, los metadatos del CV y los eventos de « Tulip » se integran e indexan mediante la técnica de integración de texto y reordenación de NIM de NeMo, lo que permite realizar consultas en la línea temporal utilizando lenguaje natural, en lugar de hacerlo por cámara y reloj.
La parte de « Tulip ». La retransmisión del evento deTulip cumple tres funciones que ningún proceso de visión artificial puede realizar por sí mismo.
Proporciona el esquema: estación, orden de trabajo, operario, paso de la aplicación, estado de la máquina, resultado de calidad; un vocabulario que describe lo que es un momento, y no solo cómo se presenta.
Proporciona los desencadenantes: una prueba fallida o una solicitud Andon indican al sistema qué segundos de metraje merecen ser analizados, lo que marca la diferencia entre un presupuesto de inferencia manejable y una tarea titánica con el material de vídeo de múltiples cámaras las 24 horas del día, los 7 días de la semana.
Y proporciona la referencia temporal: una línea temporal de referencia con la que se sincronizan tanto el vídeo como la telemetría y la acción humana.
Esto último puede parecer trivial, pero ahí radica precisamente el secreto. Sin un reloj compartido, se dispone de dos archivos. Con él, se dispone de un registro. Posteriormente, esas mismas secuencias alineadas proporcionan a Omniverse un comportamiento operativo real que sirve de base para los gemelos digitales, de modo que la simulación se visualiza y se valida en función de lo que ocurre realmente en la planta, en lugar de basarse en las suposiciones de un ingeniero de procesos.
Cuánto vale
La forma más clara de apreciar las ventajas es analizar cuánto cuesta hoy en día una investigación. Cuando se remite un incidente desde el terreno, el equipo tiene que reconstruir manualmente lo sucedido a partir de lo que haya quedado: registros de las máquinas, informes exportados y los recuerdos de quienes estaban de turno. Ese trabajo puede llevar horas o días y suele requerir la participación de varias personas; además, el resultado sigue siendo una reconstrucción, más que un registro.
Lo que encarece el proceso no es la falta de conocimientos técnicos. Los equipos suelen conocer el punto de partida y el resultado final; lo que no tienen es una visión fiable de lo que ocurrió entre medias, por lo que la mayor parte del esfuerzo se dedica a recabar pruebas a posteriori. Cuando esas pruebas ya existen en forma de cronología reproducible, la investigación comienza más o menos donde antes solía terminar.
De ello se derivan cuatro categorías de valor, que se potencian a medida que la cobertura se extiende por toda la planta:
Rendimiento. La variación en el tiempo de ciclo entre las series de producción pasa a ser visible y cuantificable, en lugar de ser meramente anecdótica. Las pequeñas mejoras en el rendimiento, del orden de un solo dígito porcentual, resultan significativas en la producción discreta de alto valor, donde cada punto se traduce directamente en unidades vendidas.
Calidad y reelaboración. Al correlacionar los incidentes de calidad con el momento del vídeo en el que se produjeron, el análisis de defectos pasa de ser estadístico a ser causal. Los equipos dejan de debatir cuál de los cuatro mecanismos plausibles provocó un modo de fallo y se centran en el que realmente lo provocó.
Detección de anomalías. Un comportamiento de la máquina que se deteriora gradualmente —y que, por lo tanto, nunca supera un umbral— se pone de manifiesto cuando se puede reproducir la misma operación a lo largo de varias semanas y observar la deriva.
Seguridad y productividad. Los movimientos innecesarios, los tiempos de espera y las distribuciones poco funcionales de las estaciones de trabajo resultan evidentes en una línea temporal reproducible, pero son prácticamente imperceptibles en un registro de transacciones. Estos mismos datos respaldan el equilibrio de líneas de producción y el rediseño de las estaciones de trabajo.
En los ejercicios de modelización realizados en grandes centros de fabricación discreta, estas categorías han permitido estimar una oportunidad anual de siete cifras en una sola planta. Se trata de cifras modelizadas, no de resultados reales, y dependen en gran medida de la densidad del valor de producción; no obstante, la tendencia es constante en todas las implantaciones que hemos analizado.
Existe un beneficio de segundo orden que cobra mayor importancia con el paso del tiempo. Los vídeos y los eventos sincronizados se acumulan para formar un registro estructurado de cómo se desarrolla realmente el proceso, incluyendo los conocimientos prácticos que hoy en día residen en la mente de los trabajadores más experimentados de la planta y que se pierden cuando estos se jubilan. Al capturarse como datos de proceso, esa experiencia se puede transmitir a la siguiente persona contratada y se convierte en la base sobre la que se construya cualquier sistema de IA industrial. Se acumula como un subproducto del funcionamiento de la planta.
La conclusión general para cualquiera que desarrolle proyectos en Cosmos es la siguiente: los modelos ya no son el cuello de botella. Lo es la «grounding». Los equipos que obtengan un valor real de la IA física en entornos industriales serán aquellos que puedan proporcionar al modelo una descripción estructurada, redactada por personas, de cómo debía ser el trabajo y, a continuación, dejar que este razone sobre la diferencia entre eso y lo que realmente ocurrió. Las fábricas nunca han sido capaces de depurar la realidad. Ahora pueden analizarla paso a paso.
Contemple la arquitectura en directo
Todo lo anterior es la versión resumida. Si desea conocer la versión completa, Rony Kubat, cofundador y director de seguridad de la información (CISO) de Tulip, impartirá una sesión en directo en LinkedIn en la que explicará de principio a fin la arquitectura de Factory Playback: cómo se transmite el vídeo de la emisora a través de la ruta de ingesta de VSS en la GPU periférica, cómo el razonamiento de Cosmos 3 se delimita mediante los desencadenantes de eventos de Tulip en lugar de ejecutarse en cada fotograma, y cómo se indexan los eventos operativos en una línea temporal consultable, así como dónde se encontraban realmente los problemas técnicos más complejos. También responderá a preguntas, así que no dude en plantear aquellas que esta publicación no haya resuelto.
Inscríbase en el LinkedIn Live →
Miércoles, 30 de septiembre, a las 14:00 h (hora del Este) / 11:00 h (hora del Pacífico)
Participe de forma activa en Operations Calling
Únase a los fabricantes que ya están obteniendo beneficios gracias a la IA en Operations Calling. Cree una solución a partir de un procedimiento operativo estándar (SOP), trabaje con datos de máquinas conectadas y de vídeo, y transfiera dicha solución entre centros.