Tout ingénieur logiciel dispose d'un débogueur. Vous définissez un point d'arrêt, vous suivez l'exécution pas à pas et vous observez l'évolution de l'état instruction par instruction. Lorsqu'un problème survient, vous ne le résonnez pas à partir d'une Tableau de bord, vous le rejouez.
La production ne dispose pas de débogueur. Une usine génère d’énormes quantités de données télémétriques : états des machines, transactions d’ Ordre de travail , résultats qualité et validations des opérateurs. Tout cela se retrouve sous forme de lignes dans des tables. Mais ce qui a réellement causé le défaut, comme un gabarit mal positionné, une pièce placée du mauvais côté de l'établi, ou encore un outil de serrage partagé entre trois postes et indisponible pendant onze minutes, se produit dans l'intervalle entre les lignes du journal. La transaction indique que l'étape a été menée à bien. Elle ne précise pas comment. C'est cet intervalle que comble Factory Playback.
Qu'est-ce que « Factory Playback » et quel problème résout-il concrètement ?
Factory Playback synchronise les vidéos provenant des caméras installées dans l'atelier de production avec le flux d'événements opérationnels enregistré par Tulip sur une seule timeline. Cliquez sur un test d'étanchéité échoué dans l'enregistrement et la vidéo passe directement à la seconde où cela s'est produit. Demandez « Montrez-moi toutes les fois où un technicien a modifié le cheminement du faisceau de câbles sur la ligne 2 la semaine dernière » et vous obtiendrez les extraits vidéo, et non un rapport.
Le cadre de référence est essentiel pour quiconque développe des agents de vision : il ne s’agit pas d’un problème d’analyse vidéo, mais d’un problème d’ancrage. Si vous appliquez un modèle de langage de vision (VLM) à des séquences brutes tournées en usine, vous obtiendrez des descriptions génériques telles que « une personne travaille à une table ». Le modèle n’a aucune idée du contexte opérationnel : il ignore par exemple que cette table correspond au poste n° 7, que la personne exécute l’étape n° 4 de l’ Ordre de travail tion 88213, que le couple spécifié est de 42 Nm, ou encore que les trois dernières unités passées par ce poste ont échoué au test final.
La visibilité opérationnelle est intrinsèquement difficile dans ces environnements pour trois raisons structurelles :
Des environnements physiques vastes et dynamiques. De multiples postes de travail, de vastes zones d’intervention, ainsi que des matériaux, des outillages et des dispositifs de fixation en mouvement constant. Il n’existe aucune géométrie fixe à laquelle se référer.
Production sur commande. Le produit présent à un poste donné peut être unique ou hautement personnalisé. Un modèle entraîné à reconnaître « à quoi ressemble une unité conforme » perd immédiatement de sa précision.
Le travail se situe entre les événements. Les systèmes enregistrent les transactions. Il manque toutefois le contexte physique qui les explique.
C'est précisément là que les piles technologiques de NVIDIA et d'Tulipse rejoignent. Les modèles et la puissance de calcul de NVIDIA apportent des capacités accélérées de perception et de raisonnement ; le flux d'événements d'Tulip fournit le contexte opérationnel qui indique à ces modèles quels moments sont importants et ce qu'ils signifient dans le langage de l'usine.
Pourquoi « Tulip » utilise NVIDIA
NVIDIA a consacré des années à la mise au point de la couche de modèles et de microservices pour l’IA physique : NVIDIA Cosmos pour le raisonnement et la génération d’environnements, NVIDIA Metropolis Blueprint pour la recherche et la synthèse vidéo (VSS), NIM pour l’inférence déployable, et Omniverse pour la simulation. Il s’agit d’une base délibérément générale, conçue pour s’adapter à un domaine plutôt que d’en présupposer un. Son adaptation aux opérations industrielles nécessite un élément véritablement rare : une réalité opérationnelle étiquetée à grande échelle. La génération de données synthétiques, domaine dans lequel Cosmos excelle, multiplie cette graine, mais il faut bien quelque chose pour l’ensemencer, et cette graine doit constituer un enregistrement fidèle de la manière dont des professionnels accomplissent réellement des tâches physiques complexes. Il ne s’agit pas d’un ensemble de données que n’importe qui peut collecter par crowdsourcing. Il n’existe que là où le travail est déjà exécuté à l’aide de logiciels.
Tulip C'est un sous-produit de son activité principale. La plateforme est déployée dans plus de 1 000 usines réparties dans 45 pays ; elle traite environ 19 milliards d'événements par an via des applications de terrain, et compte plus de 41 000 applications actives couvrant l'assemblage, l'inspection, la constitution de kits et l'exécution de lots. Chacun de ces événements correspond à une affirmation, rédigée par un humain et horodatée, indiquant ce qui était censé se produire et ce qui s'est réellement produit.
Il y a ici une belle symétrie que nous avons commencé à appeler « kaizen », c'est-à-dire l'apprentissage par renforcement à partir du retour d'information humain (RLHF). L’ Amélioration continue e constitue déjà une boucle de rétroaction dans laquelle des humains observent un travail, l’évaluent et le corrigent. Formalisée et horodatée, cette boucle constitue un signal de préférence. Il s’agit d’une référence absolue permettant de définir à quoi ressemble un travail physique de qualité, générée en continu par les personnes qui l’effectuent.
La répartition des tâches est donc claire : NVIDIA développe le « cerveau ». « Tulip » constitue le système nerveux et le moteur d'exécution qui le relie aux tâches concrètes.
Comment s'articulent les différents éléments de la pile ?
Factory Playback s'appuie sur le blueprint NVIDIA Metropolis VSS et utilise NVIDIA Cosmos 3 comme modèle de raisonnement VLM, tandis que l'Tulip fournit l'index opérationnel. Le pipeline fonctionne sur site ; ainsi, les flux vidéo ne quittent jamais le bâtiment, ce qui constitue une exigence impérative dans les environnements soumis à l GxP, à l'ITAR et au comité d'entreprise.
Acquisition et détection. Les caméras des stations transmettent leurs flux vers le parcours d’acquisition VSS sur un serveur GPU sur site, qui utilise actuellement du matériel de type NVIDIA RTX PRO 6000 en périphérie. La vidéo est segmentée, et un modèle de détection d’objets déployé via NIM (YOLOX dans la configuration actuelle) génère des détections image par image avec des identifiants de suivi, de sorte que les objets persistent au-delà des limites des segments plutôt que d’être redécouverts toutes les quelques secondes.
Raisonnement. Les segments sont transmis à NVIDIA Cosmos 3 pour un sous-titrage dense et horodaté, ainsi que pour le raisonnement spatio-temporel. L’architecture « mixture-of-transformers » de Cosmos 3 associe un transformateur de raisonnement à un transformateur de génération expert ; ainsi, le modèle effectue un raisonnement sur les interactions entre objets, les mouvements et les relations spatio-temporelles en tant qu’opération à part entière, plutôt que de les déduire à partir de sous-titres au niveau de chaque image. Pour la lecture, les éléments qui nous intéressent sont la précision de l’horodatage et la compréhension relationnelle : non pas « un composant est serré dans un dispositif de fixation », mais « le dispositif de fixation reste desserré de 00:03:47 à 00:04:12 pendant que l’unité attend ». Cet intervalle constitue la conclusion proprement dite.
Recherche. Les légendes, les métadonnées des CV et les événements « Tulip » sont intégrés et indexés grâce aux NIM de NeMo, qui assurent l’intégration de texte et le reclassement ; c’est ce qui permet d’effectuer des recherches sur la chronologie en langage naturel plutôt qu’en se référant à la caméra et à l’horloge.
La partie « Tulip ». Le flux d'événements deTulip remplit trois fonctions qu'aucun pipeline de vision ne peut assurer à lui seul.
Il fournit le schéma suivant : station, Ordre de travail, opérateur, étape de l'application, état de la machine, résultat qualitatif – un vocabulaire permettant de définir ce qu'est un « moment », et pas seulement son aspect.
Il fournit les déclencheurs: un test échoué ou un signal Andon indique au pipeline quelles secondes d'enregistrement méritent d'être analysées, ce qui fait toute la différence entre un budget d'inférence gérable et une tâche titanesque sur des vidéos multi-caméras diffusées 24 heures sur 24, 7 jours sur 7.
Et cela fournit la référence temporelle: une chronologie faisant autorité sur laquelle s'alignent à la fois la vidéo, la télémétrie et l'action humaine.
Ce dernier point peut paraître banal, mais c’est là tout le secret. Sans horloge commune, vous disposez de deux archives. Avec celle-ci, vous disposez d’un enregistrement unique. En aval, ces mêmes séquences alignées fournissent à Omniverse un comportement opérationnel réel qui sert de base aux jumeaux numériques ; ainsi, la simulation est visualisée et validée par rapport à ce qui se passe réellement sur le terrain, plutôt que par rapport aux hypothèses d’un ingénieur des procédés.
Ce que cela vaut
La meilleure façon d’apprécier les avantages de cette solution est d’examiner ce que coûte aujourd’hui une enquête. Lorsqu’un problème est signalé depuis le terrain, l’équipe doit reconstituer manuellement le déroulement des événements à partir des éléments disponibles : journaux de bord des machines, rapports exportés et témoignages des personnes qui étaient de service. Ce travail peut prendre des heures, voire des jours, et mobilise généralement plusieurs personnes ; or, le résultat obtenu reste une reconstitution plutôt qu’un enregistrement.
Ce qui rend ce processus coûteux, ce n’est pas un manque d’expertise. Les équipes connaissent généralement le point de départ et le résultat final ; ce qui leur manque, c’est une vision fiable de ce qui s’est passé entre les deux. Par conséquent, l’essentiel des efforts consiste à produire des preuves a posteriori. Lorsque ces preuves existent déjà sous la forme d’une chronologie pouvant être rejouée, l’enquête commence à peu près là où elle s’arrêtait auparavant.
Il en découle quatre catégories de valeur, qui se cumulent à mesure que la couverture s'étend à l'ensemble d'une usine :
Débit. Les variations de durée de cycle d'une série à l'autre deviennent visibles et mesurables, et ne relèvent plus de l'anecdote. Des gains de débit modestes, de l'ordre d'un pourcentage à un chiffre, revêtent une grande importance dans la production discrète à forte valeur ajoutée, où chaque point se traduit directement par des unités livrées.
Qualité et retouches. En établissant un lien entre les incidents liés à la qualité et le moment de la vidéo qui les a provoqués, l'analyse des défauts passe d'une approche statistique à une approche causale. Les équipes cessent de débattre pour savoir lequel des quatre mécanismes plausibles a provoqué un mode de défaillance et regardent directement celui qui en est à l'origine.
Détection des anomalies. Un comportement de la machine qui se dégrade progressivement — et qui, de ce fait, ne dépasse jamais un seuil — apparaît lorsque vous pouvez rejouer la même opération sur plusieurs semaines et observer la dérive.
Sécurité et productivité. Les mouvements superflus, les temps d’attente et les agencements peu pratiques des postes de travail apparaissent clairement sur une chronologie pouvant être visionnée à plusieurs reprises, mais sont pratiquement invisibles dans un journal des transactions. Ces mêmes éléments justifient l’équilibrage des lignes de production et la refonte des postes de travail.
Dans le cadre d’exercices de modélisation menés sur des sites de production discrète à forte intensité, ces catégories ont permis d’identifier un potentiel annuel de plusieurs millions pour une seule usine. Il s’agit là de chiffres issus de la modélisation, et non de résultats effectifs, qui dépendent fortement de la densité de valeur de la production ; toutefois, la tendance est constante dans tous les déploiements que nous avons étudiés.
Il existe un bénéfice de second ordre qui prend de plus en plus d’importance au fil du temps. Les vidéos et les événements synchronisés s’accumulent pour former un enregistrement structuré du déroulement réel du processus, y compris le savoir-faire pratique qui, aujourd’hui, réside dans l’esprit des collaborateurs les plus expérimentés d’une usine et qui disparaît lorsqu’ils partent à la retraite. Capturée sous forme d’« Données process », cette expertise peut être transmise à la prochaine personne embauchée et constitue la base sur laquelle s’appuiera toute IA industrielle qui sera développée par la suite. Elle s’accumule comme un sous-produit de l’exploitation de l’usine.
Le point essentiel pour quiconque développe sur Cosmos : ce ne sont plus les modèles qui constituent le goulot d'étranglement. C'est l'ancrage dans la réalité. Les équipes qui tireront une réelle valeur de l'IA physique dans des contextes industriels seront celles qui sauront fournir au modèle une description structurée, rédigée par l'homme, de ce que le travail était censé être, puis lui permettre de raisonner sur l'écart entre cette description et ce qui s'est réellement passé. Les usines n'ont jamais été capables de « déboguer » la réalité. Désormais, elles peuvent la parcourir étape par étape.
Découvrez l'architecture, en direct
Ce qui précède n'est qu'un résumé. Si vous souhaitez la version complète, Rony Kubat, cofondateur et RSSI d’ Tulip, animera une session LinkedIn Live au cours de laquelle il présentera en détail l’architecture de Factory Playback : comment la vidéo d’une chaîne de télévision circule le long du parcours d’ingestion VSS sur le GPU périphérique, comment le raisonnement de Cosmos 3 est circonscrit par les déclencheurs d’événements d’ Tulip au lieu de s’exécuter à chaque image, comment les événements opérationnels sont indexés dans une chronologie consultable, et où se situaient réellement les problèmes techniques complexes. Il répondra également à vos questions ; n’hésitez donc pas à lui poser celles auxquelles cet article n’a pas répondu.
Inscrivez-vous à la session LinkedIn Live →
Mercredi 30 septembre à 14 h EST / 11 h PST
Venez vous initier à Operations Calling
Rejoignez les fabricants qui tirent déjà profit de l'IA sur Operations Calling. Créez une solution à partir d'une procédure opérationnelle standard (SOP), exploitez les données issues des machines connectées et des vidéos, et transférez-la d'un site à l'autre.