ソフトウェアエンジニアなら誰でもデバッガーを使います。ブレークポイントを設定し、実行をステップ実行しながら、1命令ずつ状態の変化を確認します。何か問題が発生したときは、ダッシュボードから推測するのではなく、その状況を再現して確認します。

製造現場にはデバッガーというものは存在しません。工場では、機械の状態、作業指示書の処理履歴、品質検査結果、オペレーターによる承認など、膨大な量のテレメトリデータが生成されます。 これらはすべて、テーブルの行として記録されます。しかし、治具の取り付けミス、作業台の反対側に部品が置かれていたこと、3つのステーションで共用されているトルクツールが11分間使用不能だったことなど、実際に欠陥を引き起こした事象は、ログ行の間の「隙間」で発生しています。トランザクションにはその工程が完了したことは記録されていますが、どのように完了したかは記録されていません。その「隙間」を埋めるのが、Factory Playbackなのです。

「ファクトリー・プレイバック」とは何か、そしてそれが実際に解決する問題について

「Factory Playback」は、製造現場のカメラから得られる映像と、Tulip によって記録された操作業務のイベントストリームを、単一のタイムライン上で同期させます。記録内の漏れ検査の不合格箇所をクリックすると、映像はその事象が発生した瞬間にジャンプします。「先週、2番ラインで技術者がハーネスの配線経路を修正したすべての場面を見せてください」と尋ねると、レポートではなく、その場面のクリップが表示されます。

ビジョンエージェントを開発する方にとって、この捉え方は重要です。これは単なる映像解析の問題ではなく、グラウンディングの問題なのです。ビジョン言語モデル(VLM)に工場の生映像を提示しても、「人がテーブルで作業している」といった一般的なキャプションしか得られません。 このモデルには、そのテーブルが「ステーション7」であること、その人物が作業指示書88213のステップ4を実行していること、トルク仕様が42 Nmであること、あるいはこのステーションを通過した直近の3台が最終検査に不合格だったことといった、業務上の文脈に関する知識が全くありません。

こうした環境において、業務の可視性を確保することは、以下の3つの構造的な理由から本質的に困難です:

  • 大規模で動的な物理環境です。複数の作業ステーション、広範囲にわたる作業エリア、そして絶えず移動する資材、工具、治具があります。固定された形状を基準とすることはできません。

  • 受注生産です。特定の工程にある製品は、唯一無二のもの、あるいは高度にカスタマイズされたものである場合があります。「正しい製品がどのようなものか」を学習したモデルは、すぐに精度が低下してしまいます。

  • その業務は、一連の事象の間に存在しています。システムは取引を記録しますが、それを説明する物理的な文脈が欠けています。

まさにこの点が、NVIDIAとTulipの技術スタックが融合する部分です。NVIDIAのモデルと演算能力により、知覚および推論能力が高速化されます。一方、Tulip のイベントストリームは、どの瞬間が重要であり、それが工場の文脈においてどのような意味を持つのかを、それらのモデルに伝える運用上のコンテキストを提供します。

Tulip がNVIDIAを採用している理由

NVIDIAは長年にわたり、物理AIのためのモデルおよびマイクロサービス層の構築に取り組んできました。具体的には、世界の推論と生成を行う「 NVIDIA Cosmos」、 動画検索・要約(VSS)のための 「 NVIDIA Metropolis Blueprint」、 実運用可能な推論を実現する「NIM」、そしてシミュレーションのための「Omniverse」 などです。これらは意図的に汎用性の高い基盤として構築されており、特定の分野を前提とするのではなく、各分野に合わせて適応できるよう設計されています。これを産業現場の運用に適応させるには、真に希少な入力データ、すなわち大規模なラベル付きの実運用データが必要となります。Cosmosが特に得意とする合成データの生成は、その「種」を倍増させますが、何らかの「種」が必要であり、その「種」は、熟練した作業者が実際に複雑な物理的作業をどのように遂行しているかを忠実に記録したものでなければなりません。これは、誰でもクラウドソーシングで集められるようなデータセットではありません。そのデータは、作業がすでにソフトウェアを通じて実行されている場所でのみ存在します。

Tulip 本業の副産物として開発されました。このプラットフォームは45カ国、1,000以上の工場で稼働しており、現場のアプリを通じて年間約190億件のイベントが処理され、組立、検査、キット作成、バッチ実行など、41,000以上のアクティブなアプリケーションが利用されています。これらのイベントはすべて、本来何が起こるはずだったか、そして実際に何が起きたかについて、人間が作成し、タイムスタンプが付けられた記録です。

ここには素晴らしい対称性があり、私たちはこれを「人間からのフィードバックによる強化学習(RLHF)」として「カイゼン」と呼ぶようになりました。継続的な改善とは、そもそも人間が作業を観察し、評価し、修正するというフィードバックループそのものです。このループを形式化してタイムスタンプを付ければ、それは「選好シグナル」となります。これは、優れた物理的な作業がどのようなものかを示す「グラウンドトゥルース」であり、実際に作業を行う人々によって継続的に生成されるものです。

つまり、役割分担は明確です。NVIDIAが「脳」を構築し、Tulip は「神経系」であり、それを実際の作業に結びつけるランタイムです。

スタックの構成について

Factory Playbackは、NVIDIA Metropolis VSSブループリントを基盤として構築されており、推論用VLMとしてNVIDIA Cosmos 3を採用し、オペレーショナルインデックスはTulip から提供されます。このパイプラインはオンプレミスで動作するため、カメラの映像データが建物外へ流出することはありません。これは、GxP 、ITAR、および従業員代表委員会の環境において必須の要件となっています。

取り込みと検出。ステーションのカメラからの映像は、オンプレミスのGPUサーバー上のVSS取り込みパスにストリーミングされます。現在、エッジ側ではNVIDIA RTX PRO 6000クラスのハードウェアが使用されています。映像はチャンクに分割され、NIMで展開された物体検出モデル(現在の構成ではYOLOX)が、トラッキングID付きのフレームごとの検出結果を出力します。これにより、物体はチャンクの境界を越えて追跡され続け、数秒ごとに再検出されることはありません。

推論。チャンクは、高密度でタイムスタンプ付きのキャプション生成および時空間推論を行うため、NVIDIA Cosmos 3に送られます。Cosmos 3の「Mixture of Transformers」アーキテクチャは、推論トランスフォーマーと専門的な生成トランスフォーマーを組み合わせているため、モデルはオブジェクト間の相互作用、動き、および時空間的な関係について、フレームレベルのキャプションから推測するのではなく、第一級の演算として推論を行います。 再生に関しては、重要な情報はタイムスタンプの精度と関係性の理解です。「部品が治具に固定されている」というのではなく、「ユニットが待機している間、00:03:47から00:04:12まで治具は固定されていない状態にある」という情報です。その時間間隔こそが、実際の知見となります。

検索。キャプション、CVメタデータ、およびTulip イベントは、NeMoのテキスト埋め込みおよびNIMの再ランク付けを通じて埋め込まれ、インデックス化されます。これにより、カメラや時刻ではなく、自然言語でタイムラインを検索できるようになります。

Tulip のハーフです。 Tulip のイベントストリームは、ビジョンパイプラインだけでは実現できない3つの役割を果たします。

  • このシステムは、ステーション、作業指示書、オペレーター、工程ステップ、機械の状態、品質結果といったスキーマを提供します。これは、単にその「見た目」だけでなく、「その瞬間」がどのようなものであるかを表す用語集です。

  • このシステムはトリガーを提供します。テストの失敗やアンドン信号によって、パイプラインはどの数秒間の映像を推論の対象とするべきかが判断されます。これが、処理可能な推論リソースの範囲内に収めることと、24時間365日のマルチカメラ映像をすべて処理しようとする「海を沸かすような」無謀な試みとの違いなのです。

  • そして、それは「時計」としての役割を果たします。つまり、映像、テレメトリ、そして人間の行動のすべてが、この唯一の信頼できるタイムラインに合わせて調整されるのです。

最後の点はありふれたように聞こえますが、そこにこそ秘訣があります。共有クロックがなければ、2つのアーカイブが存在することになります。共有クロックがあれば、1つの記録が得られます。下流では、同じ位置合わせが施されたシーケンスが、デジタルツインの基盤となる層 としてOmniverseに実際の運用挙動を提供するため、シミュレーションは、プロセスエンジニアの仮定ではなく、現場での実際の動作に基づいて可視化され、検証されることになります。


その価値とは

その効果を最も明確に把握するには、現在の調査にかかるコストを検証するのが一番です。現場から問題が報告されてくると、チームは残っていた資料――マシンのログ、エクスポートされたレポート、当直者の記憶など――をもとに、何が起きたのかを手作業で再構築しなければなりません。その作業には数時間から数日かかることもあり、通常は数人の人員を動員することになりますが、その結果得られるものはあくまで「再構築」であり、「記録」ではありません。

コストがかかる原因は、専門知識の不足ではありません。チームは通常、出発点と最終結果については把握していますが、その間に何が起きたかについて確かな全体像を把握できていないため、労力の大部分が事後の証拠作りにかかってしまうのです。その証拠が再生可能なタイムラインとしてすでに存在している場合、調査はかつての終了地点からほぼ同じ地点で開始されることになります。

そこから4つの価値のカテゴリーが導き出され、それらはプラント全体にカバー範囲が広がるにつれて相乗効果を生み出します:

  • スループット。ビルド間のサイクルタイムのばらつきが、単なる噂話ではなく、可視化・定量化できるようになります。高付加価値の個別生産においては、スループットが1桁台前半の低い割合で向上しただけでも大きな意味を持ち、その1ポイントの向上が、出荷台数に直接つながります。

  • 品質と手直し。品質上の事象を、それが発生した映像の場面と関連付けることで、欠陥分析は統計的なものから原因究明型へと変わります。チームは、4つのあり得るメカニズムのうちどれが故障モードを引き起こしたかについて議論するのをやめ、実際に原因となった場面を視聴するようになります。

  • 異常検知。徐々に性能が低下する(そのため、閾値を超えることがない)マシンの挙動は、数週間にわたって同じ操作を再現し、その変化を確認することで明らかになります。

  • 安全性と生産性。不必要な動き、待ち時間、不適切な作業場のレイアウトなどは、再生可能なタイムライン上では一目瞭然ですが、トランザクションログではほとんど見分けがつきません。この同じ証拠が、ラインのバランス調整や作業場の再設計の根拠となります。

大規模な離散型製造現場におけるモデリング演習では、これらのカテゴリーについて、単一の工場において年間で7桁規模の機会が見込まれています。これらはモデル化された数値であり、実際の成果ではありませんが、生産価値密度に大きく依存しているものの、当社が検討した導入事例全体を通じて、その傾向は一貫しています。

時間の経過とともに、より重要となる二次的な効果があります。同期された動画やイベントは、プロセスが実際にどのように稼働しているかを示す体系的な記録として蓄積されます。これには、現在、工場で最も経験豊富な人々の頭の中にのみ存在し、彼らが退職すると失われてしまう実践的なノウハウも含まれます。 プロセスデータとして記録されたその専門知識は、次に採用される人材に伝授できるようになり、その上に構築されるあらゆる産業用AIの基盤となります。これは、工場の運営に伴う副産物として蓄積されていくのです。

Cosmos上で開発を行うすべての方にとって重要な点は、もはやモデルがボトルネックではなく、グラウンディングこそがボトルネックであるということです。産業現場においてフィジカルAIから真の価値を引き出せるチームとは、その作業が本来どうあるべきかを、人間が作成した構造化された記述としてモデルに提示し、それをもとに、理想と現実のギャップについてモデルに推論させることができるチームです。工場はこれまで、現実をデバッグすることができませんでした。しかし今や、現実を段階を追って検証することができるようになったのです。


建築を、その場でご覧ください

以上の内容は要約版です。 詳しい内容をお知りになりたい方は、Tulip の共同創業者兼CISOであるRony Kubat氏が、LinkedIn Liveセッションを開催いたします。同セッションでは、Factory Playbackのアーキテクチャを端から端まで詳しく解説します。具体的には、ステーションの動画がエッジGPU上のVSS取り込みパスをどのように通過するか、Cosmos 3の推論処理がすべてのフレームで実行されるのではなく、Tulip のイベントトリガーによって範囲が限定される仕組み、運用イベントが1つのクエリ可能なタイムラインにインデックス化される仕組み、そして実際にどのような困難な技術的課題があったかについてお話しする予定です。 また、質疑応答の時間も設けておりますので、この記事では答えられなかったご質問がございましたら、ぜひお寄せください。

LinkedIn Live への登録はこちら →
9月30日(水)午後2時(EST)/午前11時(PST)

実際に体験してみてくださいOperations Calling

Operations Calling では、すでにAIから成果を上げているメーカー各社にぜひご参加ください。SOPに基づいてソリューションを構築し、接続された機械データや映像データを活用し、拠点間でソリューションを移行させることができます。

ボトム CTA グローバル