Amazon Nova verbessert multimodale Suche in der Fertigungsindustrie
Amazon Web Services hat Amazon Nova Multimodal Embeddings eingeführt, ein Werkzeug zur Verbesserung der Informationssuche in Fertigungsdokumenten durch die Integration von Text und Bildern.

Amazon Web Services (AWS) hat Amazon Nova Multimodal Embeddings vorgestellt, eine neue Funktion zur Verbesserung der Informationsgewinnung aus komplexen Fertigungsdokumentationen. Die Technologie bildet Text und Bilder in einem gemeinsamen Vektorraum ab und löst damit Herausforderungen, bei denen kritische Daten in Diagrammen, CAD-Dateien oder Fotografien und nicht in reinem Text enthalten sind.
Herkömmliche textbasierte Suchsysteme scheitern oft daran, Informationen zu finden, die in technischen Diagrammen, CAD-Zeichnungen oder Inspektionsfotos eingebettet sind. Nova Multimodal Embeddings schließt diese Lücke, indem es Textabfragen ermöglicht, visuelle Inhalte abzurufen, und Bildabfragen relevante schriftliche Spezifikationen finden. Diese Entwicklung ist besonders relevant für Branchen wie Luft- und Raumfahrt, Automobil und Schwerindustrie, in denen die Dokumentation von Natur aus multimodal ist.
Zur Demonstration seiner Fähigkeiten entwickelte AWS ein multimodales Abrufsystem für die Luft- und Raumfahrtfertigungsdokumentation unter Verwendung von Amazon Nova Multimodal Embeddings, Amazon Bedrock und Amazon S3 Vectors. Das System wurde anhand von 26 fertigungsbezogenen Anfragen evaluiert und seine Leistung mit einer rein textbasierten Abrufpipeline verglichen.
Die Bedeutung der multimodalen Suche in der Fertigung ergibt sich aus der gängigen Praxis, Text mit visuellen Elementen in wichtigen Dokumenten zu kombinieren. Arbeitsaufträge, Inspektionsberichte und Materialzertifikate enthalten häufig Montageanleitungen neben kommentierten Fotografien oder Röntgenbilder von Schweißnähten, gepaart mit detaillierten Messungen. Diese neue Technologie bietet Unternehmen eine umfassendere Möglichkeit, auf ihre technischen Daten zuzugreifen und diese zu nutzen.