Jeder Softwareentwickler verfügt über einen Debugger. Man setzt einen Haltepunkt, durchläuft die Ausführung Schritt für Schritt und beobachtet, wie sich der Zustand Befehl für Befehl ändert. Wenn etwas schiefgeht, versucht man nicht, dies aus einer „ dashboard “ heraus zu ergründen, sondern spielt den Vorgang noch einmal ab.

In der Fertigung gibt es keinen Debugger. Ein Werk generiert enorme Mengen an Telemetriedaten: Maschinenzustände, „ Arbeitsauftrag “-Transaktionen, Qualitätsergebnisse und Freigaben durch das Bedienpersonal. All dies landet als Zeilen in Tabellen. Doch das, was den Fehler tatsächlich verursacht hat – etwa eine falsch eingesetzte Vorrichtung, ein Teil, das auf der falschen Seite des Arbeitstisches bereitgestellt wurde, oder ein Drehmomentwerkzeug, das von drei Stationen gemeinsam genutzt wird und elf Minuten lang nicht verfügbar ist –, geschieht in der Lücke zwischen den Protokolleinträgen. Die Transaktion besagt, dass der Schritt abgeschlossen wurde. Sie sagt jedoch nicht, wie. Genau diese Lücke schließt „Factory Playback“.

Was „Factory Playback“ ist und welches Problem es tatsächlich löst

„Factory Playback“ synchronisiert Videomaterial von Kameras in der Fertigungshalle mit dem von „ Tulip “ erfassten Betriebsereignisstrom auf einer einzigen Zeitachse. Klicken Sie in der Aufzeichnung auf einen fehlgeschlagenen Dichtheitstest, und das Video springt zu dem Zeitpunkt, an dem dieser auftrat. Fragen Sie: „Zeigen Sie mir alle Fälle, in denen ein Techniker letzte Woche die Kabelführung an Linie 2 nachbearbeitet hat“, und Sie erhalten die entsprechenden Videoclips – keinen Bericht.

Die Einordnung ist für jeden wichtig, der Bildverarbeitungsagenten entwickelt: Es handelt sich hierbei nicht um ein Problem der Videoanalyse, sondern um ein Problem der Verankerung. Wenn Sie ein Bildverarbeitungs-Sprachmodell (VLM) auf unbearbeitetes Fabrikmaterial anwenden, erhalten Sie allgemeine Beschreibungen wie „Eine Person arbeitet an einem Tisch.“ Das Modell hat keinerlei Kenntnis vom betrieblichen Kontext – etwa, dass es sich bei dem Tisch um Station 7 handelt, dass die Person Schritt 4 der Arbeitsanweisung „ Arbeitsauftrag “ 88213 ausführt, dass die Drehmomentspezifikation 42 Nm beträgt oder dass die letzten drei Einheiten, die diese Station durchlaufen haben, die Endprüfung nicht bestanden haben.

Die operative Transparenz ist in diesen Umgebungen aus drei strukturellen Gründen von Natur aus schwierig:

  • Große, dynamische physische Umgebungen. Mehrere Arbeitsstationen, weitläufige Arbeitsbereiche sowie Materialien, Werkzeuge und Vorrichtungen, die sich ständig bewegen. Es gibt keine feste Geometrie, an der man sich orientieren könnte.

  • Auftragsfertigung. Das Produkt an einer bestimmten Station kann ein Unikat oder in hohem Maße kundenspezifisch sein. Ein Modell, das darauf trainiert wurde, „wie ein korrektes Produkt aussieht“, verliert sofort an Aussagekraft.

  • Die Arbeit findet zwischen den Ereignissen statt. Systeme erfassen Transaktionen. Der physische Kontext, der diese erklärt, fehlt.

Genau hier treffen die Technologieplattformen von NVIDIA und Tulipaufeinander. Die Modelle und Rechenleistung von NVIDIA sorgen für beschleunigte Wahrnehmungs- und Schlussfolgerungsfähigkeiten; der Ereignisstrom von Tulip liefert den betrieblichen Kontext, der diesen Modellen mitteilt, welche Momente von Bedeutung sind und was sie in der Sprache der Fabrik bedeuten.

Warum „ Tulip “ NVIDIA einsetzt

NVIDIA hat Jahre damit verbracht, die Modell- und Microservice-Ebene für physikalische KI aufzubauen: NVIDIA Cosmos für die Weltinterpretation und -generierung, den NVIDIA Metropolis Blueprint für die Videosuche und -zusammenfassung (VSS), NIM für die einsetzbare Inferenz und Omniverse für die Simulation. Es handelt sich um eine bewusst allgemein gehaltene Grundlage, die so konzipiert ist, dass sie an einen bestimmten Anwendungsbereich angepasst werden kann, anstatt einen solchen vorauszusetzen. Die Anpassung an industrielle Abläufe erfordert eine Eingabe, die wirklich knapp ist: beschriftete Betriebsdaten in großem Maßstab. Die Generierung synthetischer Daten, in der Cosmos außergewöhnlich gut ist, vervielfacht diesen Ausgangsstoff; doch dieser muss zunächst bereitgestellt werden, und er muss eine originalgetreue Aufzeichnung darüber sein, wie qualifizierte Fachkräfte komplexe physikalische Arbeiten tatsächlich ausführen. Dies ist kein Datensatz, den man einfach per Crowdsourcing zusammenstellen kann. Er existiert nur dort, wo die Arbeit bereits mithilfe von Software ausgeführt wird.

Tulip betreibt dies als Nebenprodukt seiner Haupttätigkeit. Die Plattform ist in über 1.000 Fabriken in 45 Ländern im Einsatz, wobei jährlich rund 19 Milliarden Ereignisse über Frontline-Apps verarbeitet werden und mehr als 41.000 aktive Anwendungen in den Bereichen „ Montage “, Inspektion, Konfektionierung und Chargenabwicklung zum Einsatz kommen. Jedes dieser Ereignisse ist eine von Menschen erstellte, mit einem Zeitstempel versehene Angabe darüber, was hätte geschehen sollen und was tatsächlich geschehen ist.

Hier zeigt sich eine schöne Symmetrie, die wir inzwischen als „Kaizen“ im Sinne von „Reinforcement Learning from Human Feedback“ (RLHF) bezeichnen. „ kontinuierlicher Verbesserungsprozess “ ist bereits eine Rückkopplungsschleife, in der Menschen die Arbeit beobachten, bewerten und korrigieren. Formalisiert und mit Zeitstempeln versehen, stellt diese Schleife ein Präferenzsignal dar. Sie ist eine Referenz dafür, wie gute praktische Arbeit aussieht, und wird kontinuierlich von denjenigen generiert, die sie ausführen.

Die Arbeitsteilung ist also klar: NVIDIA entwickelt das Gehirn. „ Tulip “ ist das Nervensystem und die Laufzeitumgebung, die es mit der eigentlichen Arbeit verbindet.

Wie der Stack zusammenpasst

Factory Playback basiert auf dem NVIDIA Metropolis VSS-Blueprint und nutzt NVIDIA Cosmos 3 als VLM für die Schlussfolgerungen, wobei „ Tulip “ den operativen Index bereitstellt. Die Pipeline wird vor Ort betrieben, sodass die Kamerabilder das Gebäude zu keinem Zeitpunkt verlassen – eine zwingende Anforderung in Umgebungen, die den Bestimmungen von „ GxP “, ITAR und Betriebsratsvorschriften unterliegen.

Erfassung und Erkennung. Die Kameras der Station übertragen ihre Daten per Live-Stream in den VSS-Erfassungspfad auf einem lokalen GPU-Server, bei dem es sich derzeit um Hardware der NVIDIA RTX PRO 6000-Klasse am Netzwerkrand handelt. Das Videomaterial wird in Blöcke unterteilt, und ein über NIM bereitgestelltes Objekterkennungsmodell (in der aktuellen Konfiguration YOLOX) generiert pro Bild Erkennungsergebnisse mit Tracking-IDs, sodass Objekte über Blockgrenzen hinweg erhalten bleiben und nicht alle paar Sekunden neu erkannt werden müssen.

Schlussfolgerung. Die Datenblöcke werden an NVIDIA Cosmos 3 weitergeleitet, wo eine dichte, mit Zeitstempeln versehene Beschriftung sowie räumlich-zeitliche Schlussfolgerungen erfolgen. Die „Mixture-of-Transformers“-Architektur von Cosmos 3 kombiniert einen „Reasoning Transformer“ mit einem „Expert Generation Transformer“, sodass das Modell Interaktionen zwischen Objekten, Bewegungen und räumlich-zeitliche Beziehungen als eigenständige Operationen analysiert, anstatt diese aus Beschriftungen auf Frame-Ebene abzuleiten. Für die Wiedergabe sind für uns die Genauigkeit der Zeitstempel und das Verständnis von Beziehungen entscheidend: nicht „ein Bauteil ist in einer Halterung eingespannt“, sondern „die Halterung ist von 00:03:47 bis 00:04:12 nicht eingespannt, während die Einheit wartet“. Dieses Intervall ist die eigentliche Erkenntnis.

Abruf. Bildunterschriften, Lebenslauf-Metadaten und Ereignisse aus „ Tulip “ werden mithilfe der NeMo-Texteinbettung und der NIM-Neurangfolge eingebettet und indexiert; dadurch lässt sich die Zeitleiste in natürlicher Sprache abfragen, anstatt nach Kamera und Uhrzeit.

Die „ Tulip “-Seite. Der Event-Stream vonTulip erfüllt drei Aufgaben, die keine Bildverarbeitungspipeline aus eigener Kraft bewältigen kann.

  • Es liefert das Schema: Station, „ Arbeitsauftrag “, Bediener, App-Schritt, Maschinenzustand, Qualitätsergebnis – ein Vokabular dafür, was ein Moment ausmacht, und nicht nur dafür, wie er aussieht.

  • Es liefert die Auslöser: Ein fehlgeschlagener Test oder ein Andon-Alarm teilt der Pipeline mit, welche Sekunden des Filmmaterials eine Analyse rechtfertigen – und genau darin liegt der Unterschied zwischen einem überschaubaren Inferenzbudget und dem Versuch, bei 24/7-Mehrkamera-Video das Unmögliche zu erreichen.

  • Und sie liefert die Zeitangabe: eine verbindliche Zeitachse, an der sich Videoaufnahmen, Telemetriedaten und menschliches Handeln orientieren.

Letzteres klingt banal, und genau darin liegt der Clou. Ohne eine gemeinsame Uhr haben Sie zwei Archive. Mit ihr verfügen Sie über eine einheitliche Aufzeichnung. Im weiteren Verlauf liefern dieselben abgestimmten Sequenzen Omniverse das tatsächliche Betriebsverhalten als Grundlage für digitale Zwillinge, sodass die Simulation anhand der tatsächlichen Vorgänge in der Produktion visualisiert und validiert wird – und nicht anhand der Annahmen eines Prozessingenieurs.


Was es wert ist

Am deutlichsten lässt sich der Nutzen erkennen, wenn man betrachtet, was eine Untersuchung heute kostet. Wenn ein Problem aus dem Außendienst gemeldet wird, muss das Team den Hergang der Ereignisse manuell aus den noch vorhandenen Informationen rekonstruieren: Maschinenprotokolle, exportierte Berichte und die Erinnerungen derjenigen, die zu diesem Zeitpunkt im Dienst waren. Diese Arbeit kann Stunden oder Tage in Anspruch nehmen und erfordert in der Regel den Einsatz mehrerer Personen, und das Ergebnis ist immer noch eher eine Rekonstruktion als eine dokumentierte Aufzeichnung.

Was den Aufwand so hoch macht, ist nicht ein Mangel an Fachwissen. Die Teams kennen in der Regel den Ausgangspunkt und das Endergebnis; was ihnen jedoch fehlt, ist ein verlässliches Bild davon, was dazwischen geschehen ist. Daher fließt der größte Teil des Aufwands in die nachträgliche Erstellung von Beweismaterial. Wenn dieses Beweismaterial bereits in Form einer abspielbaren Zeitleiste vorliegt, beginnt die Untersuchung ungefähr dort, wo sie früher endete.

Daraus ergeben sich vier Wertkategorien, die sich mit zunehmender Abdeckung im gesamten Werk gegenseitig verstärken:

  • Durchsatz. Schwankungen der Zykluszeiten zwischen den einzelnen Fertigungsläufen werden sichtbar und messbar und sind nicht mehr nur vereinzelte Beobachtungen. Geringe prozentuale Steigerungen des Durchsatzes im einstelligen Bereich sind in der hochwertigen Einzelstückfertigung von Bedeutung, wo sich jeder Prozentpunkt direkt in der Anzahl der ausgelieferten Einheiten niederschlägt.

  • Qualität und Nacharbeit. Durch die Zuordnung von Qualitätsereignissen zu dem jeweiligen Videomoment, in dem sie auftraten, wird die Fehleranalyse von einer statistischen zu einer ursachenbezogenen Untersuchung. Die Teams diskutieren nicht mehr darüber, welcher von vier plausiblen Mechanismen einen Fehlermodus verursacht hat, sondern sehen sich den tatsächlich verantwortlichen Mechanismus an.

  • Anomalieerkennung. Ein Maschinenverhalten, das sich allmählich verschlechtert – und daher niemals einen Schwellenwert überschreitet –, lässt sich erkennen, wenn Sie denselben Vorgang über mehrere Wochen hinweg wiederholen und die Abweichung beobachten.

  • Sicherheit und Produktivität. Unnötige Bewegungen, Wartezeiten und ungünstige Anordnungen der Arbeitsplätze sind auf einer wiederabspielbaren Zeitleiste deutlich erkennbar, in einem Transaktionsprotokoll hingegen nahezu unsichtbar. Dieselben Erkenntnisse dienen als Grundlage für die Linienausgleichung und die Neugestaltung der Arbeitsplätze.

Bei Modellierungsübungen an Standorten mit auftragsorientierter Fertigung in der Schwerindustrie haben diese Kategorien in einem einzelnen Werk ein jährliches Potenzial im siebenstelligen Bereich ergeben. Dabei handelt es sich um modellierte Zahlen, nicht um erzielte Ergebnisse, und sie hängen stark von der Produktionswertdichte ab; die Tendenz ist jedoch bei allen von uns untersuchten Implementierungen einheitlich.

Es gibt einen Nutzen zweiter Ordnung, der im Laufe der Zeit an Bedeutung gewinnt. Abgestimmte Videoaufzeichnungen und Ereignisse fügen sich zu einer strukturierten Dokumentation darüber zusammen, wie der Prozess tatsächlich abläuft – einschließlich des praktischen Know-hows, das heute in den Köpfen der erfahrensten Mitarbeiter eines Werks schlummert und mit deren Ausscheiden aus dem Unternehmen verloren geht. Als „ Prozessdaten “ erfasst, lässt sich dieses Fachwissen an den nächsten neuen Mitarbeiter weitergeben und bildet die Grundlage für jede industrielle KI, die darauf aufbaut. Es entsteht als Nebenprodukt des Betriebs der Anlage.

Die übergeordnete Erkenntnis für alle, die auf Cosmos aufbauen: Nicht mehr die Modelle stellen den Engpass dar, sondern die Verankerung in der Realität. Die Teams, die in industriellen Umgebungen einen echten Nutzen aus physischer KI ziehen, werden diejenigen sein, die dem Modell eine strukturierte, von Menschen verfasste Beschreibung dessen, wie die Arbeit eigentlich hätte ablaufen sollen, zur Verfügung stellen und es dann die Diskrepanz zwischen dieser Beschreibung und dem tatsächlichen Geschehen analysieren lassen. Fabriken waren bisher nie in der Lage, die Realität zu „debuggen“. Nun können sie sie Schritt für Schritt durchgehen.


Erleben Sie die Architektur hautnah

Das Obige ist die Kurzfassung. Wenn Sie die ausführliche Version wünschen: Rony Kubat, Mitbegründer und CISO von Tulip, veranstaltet eine LinkedIn-Live-Session, in der er die Architektur von „Factory Playback“ von Anfang bis Ende erläutert: wie das Video der Station den VSS-Erfassungspfad auf der Edge-GPU durchläuft, wie die Cosmos-3-Auswertung durch die Ereignisauslöser von Tulip begrenzt wird, anstatt bei jedem Einzelbild ausgeführt zu werden, und wie Betriebsereignisse in einer abfragbaren Zeitleiste indiziert werden – sowie wo die eigentlichen technischen Herausforderungen lagen. Er wird auch Fragen beantworten – bringen Sie also gerne jene Fragen mit, die in diesem Beitrag noch nicht geklärt wurden.

Melden Sie sich für das LinkedIn Live an →
Mittwoch, 30. September, um 14:00 Uhr EST/11:00 Uhr PST

Erleben Sie es hautnah bei Operations Calling

Schließen Sie sich den Herstellern an, die bereits von den Vorteilen der KI profitieren – unter Operations Calling. Entwickeln Sie eine Lösung auf Basis eines Standardarbeitsanweisungs (SOP), arbeiten Sie mit vernetzten Maschinen- und Videodaten und übertragen Sie diese zwischen Standorten.

Unterer CTA Global