Künstliche Intelligenz

Was ist multimodale KI? Modelle für Text, Bild und Ton

Talha Aslan 18 Minuten Lesezeit 2 Aufrufe

Was ist multimodale KI?

Multimodale KI ist ein System der künstlichen Intelligenz, das mehrere Datenarten wie Text, Bild, Ton und Video in einem einzigen Modell aufnimmt und gemeinsam versteht. Manche Modelle erzeugen auch mehrere Ausgabearten. Sie geben dem Modell zum Beispiel ein Foto und eine Frage und erhalten eine schriftliche Antwort.

Dazu ein einfacher Vergleich für alle, die fragen, was ist multimodale KI. Stellen Sie sich einen Berater vor, der nur Bücher liest. Zeigen Sie ihm zum Beispiel ein Foto, kann er nichts dazu sagen. Ein multimodales Modell gleicht dagegen einem Berater, der liest, hinschaut und zuhört. Außerdem erledigt er diese drei Aufgaben nicht getrennt, sondern verbindet sie in einem Kopf.

Dieser Beitrag behandelt daher genau einen Begriff. Verwandte Begriffe erwähnen wir kurz und verlinken für die Details auf unsere eigenen Artikel.

Was bedeutet Modalität, und warum sagt man multimodal?

Eine Modalität ist die Form, in der Information übertragen wird. Geschriebener Text ist eine Modalität. Ebenso sind ein Foto, eine Sprachaufnahme und ein Videoclip Modalitäten. Die Vorsilbe "multi" bedeutet viele, "modal" verweist auf die Form. Multimodal heißt also mehrere Formen zugleich.

Klassische KI Systeme arbeiten meist mit einer einzigen Modalität. Ein Modell, das Texte klassifiziert, kann zum Beispiel kein Foto ansehen. Ebenso kann ein Modell zur Bilderkennung Ihre E-Mail nicht zusammenfassen. Der multimodale Ansatz versucht deshalb, diese Mauer abzubauen.

Der Begriff hat zwei Seiten. Auf der Eingabeseite nimmt ein Modell mehrere Formen entgegen. Auf der Ausgabeseite kann es dann ebenfalls mehrere Formen erzeugen. Allerdings kann nicht jedes Modell beides. Ein Modell kann zum Beispiel ein Foto lesen und nur mit Text antworten. Das gilt trotzdem als multimodal.

Was ist multimodale KI, und wie funktioniert der gemeinsame Darstellungsraum?

Der Kern der multimodalen KI ist ein gemeinsamer Darstellungsraum. Das Modell wandelt zunächst jede Datenart in Zahlenreihen um. Diese Zahlenreihen heißen also Vektoren. Danach legt es die Vektoren verschiedener Datenarten dicht beieinander in einen Raum.

Ein Beispiel macht das konkret greifbar. Der Satz "ein Hund rennt am Strand" und ein Foto derselben Szene liegen im gemeinsamen Raum nebeneinander. Ein fremdes Foto bleibt dagegen weit entfernt, denn es hat keinen inhaltlichen Bezug. Das Modell baut also eine Brücke zwischen Wort und Bild.

Ein bekanntes Beispiel für diese Idee ist CLIP, das mit Paaren aus Bild und Text trainiert wurde. Die Forschenden zeigten außerdem, dass natürliche Sprache visuelle Konzepte beschreiben kann. Die Einzelheiten finden Sie in der Zusammenfassung des CLIP Papers auf arXiv.

Sind Vektoren neu für Sie, lesen Sie unseren Beitrag über Embeddings und Vektordatenbanken. Der gemeinsame Darstellungsraum ist im Kern die Embedding Idee, ausgeweitet auf mehrere Datenarten.

Wie liest ein Modell ein Bild?

Allerdings betrachtet ein Modell ein Bild nicht so wie Sie. Zunächst zerlegt es das Bild in kleine Quadrate. Wir nennen sie Patches. Jeder Patch wird dann zu einer Zahlenreihe. Danach reihen sich diese Zahlenreihen wie Wortteile in einem Satz aneinander.

Verbreitet hat sich dieser Weg durch Arbeiten, die die Transformer Architektur auf Bilder übertragen haben. Die Idee, Bildausschnitte als Folge zu behandeln, finden Sie im Paper zum Vision Transformer.

Im nächsten Schritt kommt das Sprachmodell ins Spiel. Konkret laufen die Zahlen aus den Bildausschnitten im selben Strom wie die Textteile. Das Modell wägt Frage und Bild gemeinsam ab und schreibt die Antwort Wort für Wort.

Deshalb spielt die Bildauflösung eine Rolle. Passt eine kleine Schrift nur in wenige Patches, kann das Modell die Buchstaben womöglich nicht unterscheiden. Die Anbieter beschreiben zudem in ihrer Dokumentation, wie sie die Bildgröße verarbeiten. Prüfen Sie die aktuellen Regeln dort.

Ein praktischer Tipp: Wenn Sie einen Screenshot oder eine Tabelle senden, schneiden Sie unnötige Ränder vorher ab. Der wichtige Inhalt erscheint dann größer. Halten Sie das Bild außerdem gerade, denn ein schiefes Foto senkt die Lesegenauigkeit.

Wie lernt ein multimodales Modell?

Zunächst läuft das Training meist in mehreren Stufen. In der ersten Stufe arbeitet das Modell mit sehr vielen zusammengehörigen Beispielen. Ein Foto und seine Bildunterschrift gehen zum Beispiel gemeinsam hinein. Ebenso bilden eine Sprachaufnahme und ihr Transkript ein Paar. Das Modell lernt, passende Paare näher zusammenzuziehen und unpassende auseinanderzuschieben.

In der zweiten Stufe verbindet sich ein Bildencoder mit einem Sprachmodell. Zunächst wandelt der Encoder das Bild in Zahlen um. Das Sprachmodell liest diese Zahlen wie Wörter. Dadurch lernt das Modell also, Fragen zu Bildern zu beantworten.

Die dritte Stufe ist das Feintuning. Die Anbieter bringen dem Modell bei, Anweisungen zu befolgen, sicher zu handeln und ein Gespräch zu führen. Mehr dazu lesen Sie in unserem Beitrag über Fine Tuning und LoRA.

Denn die Qualität der Trainingsdaten prägt das Ergebnis. Verzerrungen in den Daten zeigen sich folglich auch in der Ausgabe. Sind zum Beispiel Bilder aus einer Region selten, erkennt das Modell diese Region womöglich schlechter. Ihre eigenen Tests zählen daher mehr als die allgemeinen Aussagen eines Anbieters.

Wie verarbeitet multimodale KI Ton und Video?

Beim Ton gilt dann eine ähnliche Logik. Das Modell teilt eine Aufnahme in kurze Zeitabschnitte. Danach wird jeder Abschnitt zu einer Zahlendarstellung. Manche Systeme wandeln Sprache zuerst in Text um und geben diesen Text an das Sprachmodell weiter. Andere dagegen verarbeiten den Klang direkt im Modell.

Dieser Unterschied zählt in der Praxis. Systeme, die zuerst transkribieren, verlieren womöglich Tonfall, Pausen und Betonung. Systeme, die Audio direkt verarbeiten, können diese Hinweise erfassen. Allerdings bietet nicht jedes Produkt diese Funktion. Prüfen Sie in der Dokumentation, ob der Ton direkt oder über einen Transkriptionsschritt ins Modell gelangt.

Kurz gesagt besteht ein Video aus einer Folge von Bildern und Ton. Dabei entnimmt das Modell meist in Abständen einzelne Bilder. Danach wägt es diese Bilder zusammen mit der Tonspur ab. Bei langen Videos wäre jedes einzelne Bild zu teuer, deshalb tasten die Systeme nur stichprobenartig ab.

Videozusammenfassungen können daher Details verpassen. Eine entscheidende Szene kann zwischen den abgetasteten Bildern liegen.

Was ist multimodale KI, und worin unterscheidet sie sich von einem einmodalen Modell?

Der einfachste Unterschied liegt also darin, wie viele Formen Eingabe und Ausgabe tragen. Die folgende Tabelle stellt beide Ansätze gegenüber.

MerkmalEinmodales ModellMultimodales Modell
EingabeartNur Text oder nur BildText, Bild, Ton und Video gemeinsam
Typische AufgabeTexte zusammenfassen, Bilder klassifizierenEin Foto ansehen und eine Frage beantworten
KontextAuf eine Quelle begrenztVerbindet verschiedene Quellen
AufbauKann einfach und günstig seinKann aufwendiger und teurer sein
FehlerbildSprachfehler oder falsche KlasseFehlinterpretation eines Bildes

Ein einmodales Modell verliert nicht immer. Für eine enge, einfache Aufgabe ist ein kleines Spezialmodell oft schneller und günstiger. Manche Teams sortieren zudem zuerst günstig vor und schicken nur die schwierigen Fälle an ein multimodales Modell. Die richtige Wahl hängt also davon ab, ob die Aufgabe wirklich mehr als eine Form braucht.

Warum ist multimodale KI wichtig?

Zunächst kommt menschliche Information nicht in einer einzigen Form. Eine Produktseite enthält zum Beispiel Fotos, Beschreibungen und Bewertungen. Eine Rechnung enthält dagegen Tabellen, Logos und handschriftliche Notizen. Ein Kundengespräch enthält Stimme und Tonfall. Ein System, das nur eine Form versteht, übersieht die Hälfte dieser Information.

Multimodale Modelle schließen diese Lücke, denn sie lesen alle Formen zugleich. Dadurch brauchen Sie weniger Zwischenschritte. Früher mussten Sie zwei Systeme bauen: eines für das Bild und eines für den Text. Heute genügt dagegen in vielen Fällen eine einzige Anfrage.

Außerdem profitiert die Barrierefreiheit. Ein Modell kann ein Foto für blinde Nutzer vorlesen und Sprache für gehörlose Nutzer in Text umwandeln. Lassen Sie diese Ergebnisse trotzdem von einem Menschen prüfen.

Ein weiterer Gewinn ist der Kontext. Schickt ein Kunde zum Beispiel ein Foto eines Bauteils und fragt: "Passt das?", sieht ein reines Textsystem die Anschlussart nicht. Dagegen wägt ein multimodales System Frage und Foto gemeinsam ab. Folglich stellt Ihr Support weniger Rückfragen.

Den allgemeinen Rahmen finden Sie in unserem Einsteiger Leitfaden zu generativer KI.

Erzeugt jedes multimodale Modell jede Form?

Nein. Das ist eine der häufigsten Verwechslungen, daher lohnt sich ein genauer Blick. Ein Modell kann Bilder verstehen, aber nicht erzeugen. Ein anderes Modell dagegen erzeugt Bilder aus Text, kann aber keine Fragen zu Ihrem Foto beantworten.

Denken Sie an vier getrennte Kombinationen:

  • Eingabe Bild, Ausgabe Text. Systeme, die ein Foto beschreiben oder Fragen dazu beantworten.
  • Eingabe Text, Ausgabe Bild. Systeme, die aus einer Beschreibung Bilder erzeugen.
  • Eingabe Ton, Ausgabe Text. Systeme, die Sprache transkribieren oder zusammenfassen.
  • Gemischte Eingabe, gemischte Ausgabe. Systeme, die in einer Sitzung Bilder, Ton und Text aufnehmen und zurückgeben.

Schreiben Sie bei der Produktwahl zuerst auf, welche Kombination Sie brauchen. Vertrauen Sie deshalb nicht dem Versprechen "kann alles" aus der Werbung. Sehen Sie in der offiziellen Dokumentation des Anbieters die Liste der Ein- und Ausgaben an.

Wenn Sie Werkzeuge vergleichen möchten, die Bilder aus Text erzeugen, lesen Sie unseren Beitrag über kostenlose KI Bildgeneratoren im Vergleich.

Wie entsteht aus einem Bild eine Produktbeschreibung?

E Commerce ist eines der sichtbarsten Einsatzfelder multimodaler Modelle. Hier ein Beispielszenario: Ein kleiner Shop lädt Hunderte Produktfotos hoch, aber die Beschreibungen sind dünn. Dann gibt das Team dem Modell jedes Foto und die wichtigsten Produktfakten. Das Modell formuliert dann sichtbare Merkmale wie Farbe, Struktur und Verwendung.

Zwei Regeln helfen dabei, und beide sind einfach. Erstens: Fragen Sie das Modell nicht nach Informationen, die es nicht sehen kann. Den Stoffanteil kann es aus einem Foto nicht ableiten, den müssen Sie liefern. Zweitens: Ein Mensch liest die Ausgabe, bevor sie online geht.

Dieselbe Methode funktioniert außerdem für Alternativtexte. Das Modell betrachtet ein Foto und schlägt einen Alt Text vor. Anschließend passen Sie ihn an Ihre Marke und den Zweck der Seite an. Die Regeln dazu lesen Sie in unserem Beitrag über Alt Texte.

Sind Ihre Bilddateien sehr groß, verkleinern Sie sie zuerst mit dem Tool zum Bildverkleinern. Denn kleinere Dateien laden schneller hoch.

Wie liest multimodale KI Dokumente, Rechnungen und Formulare?

Dokumentenlesen geht einen Schritt über klassische OCR hinaus. Anders gesagt: OCR extrahiert nur Zeichen. Ein multimodales Modell betrachtet zusätzlich das Layout der Seite. Es erkennt, in welcher Spalte die Summe steht, wessen Logo oben sitzt und wo der Stempel ist.

Ein Beispielszenario: Ein Buchhaltungsteam tippt Datum, Betrag und Positionen aus Lieferantenrechnungen von Hand ein. Ein multimodaler Ablauf liest dagegen die Rechnung als Bild und zieht die Felder in strukturierter Form heraus. Danach prüft ein Mensch die unsicheren Felder.

Allerdings ist das Risiko hier der stille Fehler. Das Modell kann zum Beispiel eine 7 mit einer 1 verwechseln. Bauen Sie daher bei kritischen Feldern wie Beträgen eine zweite Prüfregel ein. Vergleichen Sie etwa die Summe der Positionen mit dem Gesamtbetrag auf dem Beleg.

In der Praxis kommen Dokumente selten sauber an. Scans liegen zum Beispiel schief, Fotos haben Schatten, Handschrift ist schwer lesbar. Setzen Sie deshalb eine Sicherheitsschwelle in den Ablauf. Ist das Modell unsicher, gibt es das Dokument an einen Menschen weiter.

Wie Sie so einen Ablauf auf Ihr Unternehmen übertragen, zeigt unsere Lösung zur KI Dokumentenverarbeitung.

Wie arbeiten Sprachassistenten und Videozusammenfassungen?

Bei einem Sprachassistenten spricht der Nutzer, das System hört zu, versteht und antwortet per Stimme. Ein multimodaler Aufbau kann hier daher die Verzögerung senken. Der Ton kann ohne separaten Transkriptionsschritt ins Modell gelangen. Die Architektur unterscheidet sich allerdings je nach Produkt.

Ein Beispielszenario: Ein Restaurant möchte telefonische Reservierungen an einen Sprachassistenten leiten. Zunächst nimmt der Assistent Datum und Personenzahl auf und fragt nach, wenn etwas unklar bleibt. Bei einer komplizierten Beschwerde übergibt er das Gespräch an einen Menschen. Ohne Übergabe an einen Menschen fährt sich ein Sprachassistent schnell fest.

Bei der Videozusammenfassung ist eine Meeting Aufnahme oder ein Schulungsvideo die Eingabe. In der Praxis wägt das Modell Gesprochenes und die Folie auf dem Bildschirm gemeinsam ab. So unterscheidet es, was auf der Folie stand und was die Sprecherin sagte. Bitten Sie trotzdem um Zeitmarken zur Zusammenfassung, denn sie erleichtern die Kontrolle.

Was sind multimodale Agenten und Echtzeit Nutzung?

Der nächste Schritt multimodaler Fähigkeit ist ein Modell, das auf einen Bildschirm schaut und handelt. Ein KI Agent kann einen Screenshot lesen und entscheiden, welche Schaltfläche er drückt. Dadurch kann er auch mit älteren Systemen arbeiten, die eine Oberfläche, aber keine Programmierschnittstelle haben.

Eine weitere Richtung ist dann die Nutzung in Echtzeit. Ein Nutzer öffnet die Kamera, zeigt ein Gerät und stellt per Stimme eine Frage. Das Modell hört also die Stimme, sieht das Bild und antwortet laut. Ein Techniker könnte zum Beispiel auf ein defektes Bauteil zeigen und nach den Wartungsschritten fragen.

Diese Szenarien bergen allerdings mehr Risiko. Drückt ein Agent die falsche Schaltfläche, hat das echte Folgen. Geben Sie Agenten deshalb enge Rechte und binden Sie nicht umkehrbare Aktionen an eine Freigabe. Zur Architektur lesen Sie unsere Seite zur Entwicklung von KI Agenten.

Was ändert sich bei Suche und Barrierefreiheit?

Zunächst beginnen Menschen eine Suche nicht mehr nur mit Wörtern. Sie fotografieren zum Beispiel etwas und fragen, wo es Ähnliches gibt. Oder sie laden einen Screenshot hoch und fragen nach einem Fehler. Anders gesagt: Die Suche selbst wird multimodal.

Das betrifft daher Ihre Website direkt. KI Systeme können Bild und Text Ihrer Seite gemeinsam bewerten. Dateiname, Alt Text und umgebende Bildunterschrift eines Bildes sollten daher zusammenpassen. Veröffentlichen Sie Video, ergänzen Sie ein Transkript. Bei Audio hilft stattdessen eine schriftliche Zusammenfassung.

Dieselben Gewohnheiten verbessern auch die Barrierefreiheit. Wer einen Screenreader nutzt, profitiert von gutem Alt Text. Ebenso profitieren gehörlose Besucher von Untertiteln und Transkripten.

Wie Ihre Marke in KI Antworten erscheint, erfahren Sie in unserem Leitfaden zum Messen der KI Sichtbarkeit.

Mit welchen Begriffen verwechselt man multimodale KI?

Die Begriffe überschneiden sich, deshalb ist Verwirrung normal. Die folgende Tabelle trennt daher die Nachbarn. Zu mehreren gibt es eigene Artikel, hier sehen Sie nur den Unterschied.

BegriffKurze DefinitionBeziehung zur multimodalen KI
Großes Sprachmodell (LLM)Ein großes Modell für TextViele multimodale Modelle bauen auf einem Sprachmodell auf
Generative KISysteme, die neue Inhalte erzeugenMultimodal kann generativ sein, muss es aber nicht
EmbeddingEin Zahlenvektor, der Daten darstelltBaustein des gemeinsamen Darstellungsraums
OCRWerkzeug, das Zeichen aus Bildern liestEin multimodales Modell versteht zusätzlich das Layout
BildgeneratorSystem, das aus Text Bilder zeichnetNur auf der Ausgabeseite multimodal
RAGExterne Dokumente abrufen und Antworten fundierenLässt sich mit visuellen Dokumenten verbinden

Zu Sprachmodellen lesen Sie unseren Beitrag über große Sprachmodelle. Für Antworten auf Basis Ihrer Dokumente lesen Sie unseren RAG Leitfaden.

Was ist eine visuelle Halluzination, und warum entsteht sie?

Kurz gesagt liegt eine Halluzination vor, wenn ein Modell etwas Unwahres selbstsicher behauptet. Bei multimodalen Modellen sieht das oft so aus, dass das Modell ein Objekt "sieht", das gar nicht im Bild ist. Den allgemeinen Begriff erklärt unser Beitrag zur KI Halluzination.

Visuelle Fehler haben dennoch typische Ursachen. Die Anleitung von OpenAI zu Bildeingaben nennt ähnliche Grenzen:

  • Kleine Schrift kann falsch gelesen werden.
  • Gedrehte oder auf dem Kopf stehende Inhalte können falsch gedeutet werden.
  • Außerdem bleibt die Anzahl von Objekten oft nur ungefähr.
  • Diagramme mit vielen Farben oder Linienarten können das Modell verwirren.
  • Aufgaben mit genauer Position oder räumlichen Beziehungen fallen schwer.

Außerdem füllt das Modell fehlende Information mitunter mit einer Vermutung. Es "ergänzt" zum Beispiel ein halb sichtbares Etikett. Weisen Sie das Modell daher bei kritischen Aufgaben an, Unsicherheit zu nennen, und vergleichen Sie die Ausgabe mit dem Quellbild.

Verlassen Sie sich bei Spezialbildern, etwa medizinischen Aufnahmen, nicht auf ein allgemeines Modell. Die Dokumentation der Anbieter setzt hier daher Grenzen.

Wie lesen Sie die Dokumentation der Anbieter richtig?

Die offizielle Dokumentation jedes Anbieters zeigt die echten Grenzen des Produkts. Lesen Sie stattdessen die technische Doku, nicht die Werbeseite. Achten Sie vor allem auf diese Punkte:

  • Welche Dateiformate nimmt der Dienst an, welche lehnt er ab?
  • Wie viele Bilder oder wie viel Ton können Sie pro Anfrage senden?
  • Gibt es eine Einstellung für die Bilddetailstufe, und wie wirkt sie auf die Kosten?
  • Speichert der Anbieter Ihre Daten oder nutzt er sie zum Training?
  • Wo listet die Dokumentation bekannte Grenzen und Warnhinweise auf?

Die Dokumentation von Google zum Bildverstehen mit Gemini erklärt zum Beispiel, wie Sie Bildeingaben übergeben und welche Aufgaben möglich sind. Solche Seiten ändern sich allerdings oft. Notieren Sie sich deshalb keine Zahl, um sie monatelang weiterzuverwenden.

Halten Sie schriftlich fest, wo dokumentierte Grenzen und Ihr Bedarf auseinanderliegen. Somit wissen Sie vor Projektbeginn, welches Risiko Sie akzeptieren.

Wie messen Sie die Qualität multimodaler Ergebnisse?

Qualität messen Sie mit Beispielen, nicht mit einem Gefühl. Wählen Sie zunächst eine repräsentative Stichprobe aus Ihrer echten Arbeit. Ein Beispielszenario: Ein Shop wählt eine kleine Gruppe von Fotos aus mehreren Kategorien, und das Team schreibt vorab zu jedem Foto die erwartete Beschreibung.

Vergleichen Sie danach die Modellausgabe mit der Erwartung. Sortieren Sie die Fehler nach Art: falsche Farbe, erfundenes Merkmal, fehlendes Detail, falscher Ton. So sehen Sie, ob das Problem zufällig oder systematisch auftritt.

Zudem hilft ein blinder Vergleich. Lassen Sie Ihr Team die Antworten zweier Modelle lesen, ohne zu sagen, welche von welchem stammt. Denn Markenwissen verzerrt das Urteil leiser, als man denkt.

Wiederholen Sie die Messung schließlich regelmäßig. Denn Ergebnisse können abdriften, wenn sich die Modellversion oder die Eingabeart ändert. Ihr Testset ist deshalb ein bleibender Wert. Beim Wechsel des Anbieters liefert dasselbe Set einen fairen Vergleich.

Wann ist multimodale KI überflüssig?

Nicht jedes Problem braucht eine multimodale Antwort. Manchmal genügt also Text. Andererseits sind strukturierte Daten manchmal zuverlässiger. Liegen Produktmerkmale zum Beispiel schon in einer Tabelle, ergibt es keinen Sinn, sie aus Fotos zu raten.

Bevorzugen Sie in diesen Fällen einen einmodalen oder regelbasierten Ansatz:

  • Die Eingabe kommt immer im selben sauberen Format.
  • Die Fehlertoleranz muss dann nahe null liegen.
  • Das Volumen ist so klein, dass Handarbeit günstiger ist.
  • Sie dürfen die Daten rechtlich oder vertraglich nicht nach außen geben.

Zudem ist die Latenz ein Kriterium. Bilder und Ton zu verarbeiten ist meist aufwendiger als reiner Text. Für eine einfache Aufgabe mit sofortiger Antwort passt daher oft ein kleines Modell besser. Probieren Sie also zuerst die einfache Lösung und wechseln Sie erst bei Bedarf zu einem multimodalen Modell.

Warum sind Datenschutz und Urheberrecht bei multimodaler KI wichtig?

Ein Foto oder eine Sprachaufnahme trägt dagegen weit mehr personenbezogene Information als Text. Gesichter, Kennzeichen, E Mails auf dem Bildschirm und Gespräche im Hintergrund können mit in die Aufnahme geraten. Senden Sie solche Daten an einen externen Dienst, können Sie als Verantwortlicher Pflichten treffen.

Prüfen Sie in der Praxis diese Punkte:

  • Enthalten die hochgeladenen Bilder Personen, Kennzeichen oder Ausweisdaten?
  • Nutzt der Anbieter Ihre Daten zum Training seiner Modelle?
  • In welcher Region verarbeitet der Anbieter die Daten, und wie lange speichert er sie?
  • Laden Ihre Mitarbeitenden Dateien in nicht freigegebene Werkzeuge hoch?

Allerdings wird der letzte Punkt oft übersehen. Wer Dokumente und Screenshots über private Konten hochlädt, öffnet einen ernsten Abflusskanal. Lesen Sie dazu unseren Beitrag über Shadow AI.

Beim Urheberrecht gibt es zwei getrennte Fragen: die Rechte an den Inhalten, die Sie hochladen, und die Rechte an der Ausgabe des Modells. Beides hängt also vom Land und vom Vertrag ab. Eine verwandte Perspektive bietet unser Beitrag zur kommerziellen Nutzung KI generierter Bilder. Dieser Beitrag ist keine Rechtsberatung, für eine verbindliche Antwort fragen Sie eine Juristin oder einen Juristen.

Wie sieht eine praktische Checkliste für multimodale KI im Unternehmen aus?

Beantworten Sie diese Fragen, bevor das Projekt beginnt:

  • Braucht das Problem wirklich mehr als eine Form, oder genügt ein einmodales Modell?
  • Welche Ein- und Ausgabeformate gibt es, und welche sind Pflicht?
  • Wer prüft Fehler, und in welchem Schritt?
  • Welche Felder sind kritisch und brauchen eine zweite Prüfung?
  • Gibt es für Bilder mit personenbezogenen Daten Einwilligung und Löschregeln?
  • Haben Sie aktuelle Grenzen und Preise in der offiziellen Dokumentation geprüft?
  • Haben Sie ein Testset vorbereitet, um die Ergebnisqualität zu messen?

Wir empfehlen, diese Liste auf die erste Seite des Projektaufbaus zu legen. Denn jeder offene Punkt ist eine Unsicherheit, die später teuer wird.

Füllen Sie die Liste nicht allein aus. Holen Sie Technik, Fachbereich und Datenschutz an einen Tisch. Denn jede Seite sieht ein anderes Risiko. Die Technik betont zum Beispiel die Latenz, der Fachbereich die Kosten von Fehlern und die Rechtsseite den Datenfluss.

Achten Sie auch auf die Preise. Bild und Ton können zum Beispiel anders abgerechnet werden als Text. Zur Einheitenlogik beim Text lesen Sie unseren Beitrag über Tokens. Prüfen Sie aktuelle Werte nur auf der offiziellen Seite des Anbieters.

Wie starten Sie ein multimodales Projekt?

Beginnen Sie mit einem kleinen Experiment statt mit einem großen Aufbau. Die folgende Reihenfolge empfiehlt unser Team bei ähnlichen Projekten:

  1. Wählen Sie einen engen Anwendungsfall. Zum Beispiel nur einen kurzen Beschreibungsentwurf aus einem Produktfoto.
  2. Sammeln Sie ein kleines Testset aus echten Beispielen. Nehmen Sie gute, schlechte und Grenzfälle auf.
  3. Probieren Sie dieselben Beispiele an mehreren Modellen. Vergleichen Sie die Ausgaben blind.
  4. Listen Sie die Fehlerarten auf. Schreiben Sie auf, welche Fehler Sie akzeptieren und welche nicht.
  5. Bauen Sie einen Schritt zur menschlichen Freigabe ein. Am Anfang liest ein Mensch jede Ausgabe.
  6. Erhöhen Sie die Automatisierung schrittweise in Bereichen mit geringem Risiko.
  7. Verfolgen Sie Kosten und Qualität regelmäßig.

Das Ziel dieser Reihenfolge ist, den Prozess zu testen und nicht das Modell. Modelle ändern sich dagegen mit der Zeit. Ihr Testset und Ihre Kontrollschritte bleiben.

Für eine Roadmap auf Unternehmensebene sehen Sie sich unsere Leistungen für KI und Automatisierung an.

Welche Fehler machen Teams bei multimodaler KI?

Diese Fehler sehen wir in der Praxis am häufigsten:

  • Dem Modell zu sehr vertrauen. Eine flüssige Antwort ist also keine richtige Antwort.
  • Schlechte Eingaben liefern. Unscharfe Fotos, verrauschter Ton und schiefe Scans ruinieren das Ergebnis.
  • Nach einer einzigen Demo entscheiden. Denn echte Daten sind viel unordentlicher als eine Demo.
  • Personenbezogene Daten vergessen. Auch ein Gesicht oder ein Kennzeichen im Bild ist ein personenbezogenes Datum.
  • Die Kosten nicht messen. Hochauflösende Bilder und lange Aufnahmen lassen die Rechnung mit der Nutzung wachsen.
  • Den menschlichen Schritt streichen. Bei kritischen Entscheidungen bleibt die letzte Prüfung beim Menschen.

Ein falsches Ziel ist zudem häufig. "Lass uns etwas Multimodales bauen" ist kein Ziel. "Lass uns die Rechnungserfassung verkürzen" ist ein messbares Ziel. Wählen Sie also zuerst das Problem und danach das Werkzeug.

Also: Was ist multimodale KI, und wo fangen Sie an?

Was ist multimodale KI also in einem Satz? Kurz gesagt ist multimodale KI der Sammelname für Systeme, die Text, Bild, Ton und Video gemeinsam in einem Modell verstehen. Ein gemeinsamer Darstellungsraum verbindet somit die verschiedenen Formen. Dadurch wird es möglich, ein Foto anzusehen und eine Frage zu beantworten oder eine Rechnung zu lesen.

Das Modell ist allerdings keine Magie. Es hat allerdings Grenzen wie visuelle Halluzination, Datenschutzrisiken und Kosten. Beginnen Sie deshalb mit einem kleinen Szenario, bereiten Sie ein Testset vor und lassen Sie die menschliche Kontrolle im Ablauf.

Modellnamen, Versionen und Preise ändern sich schnell. Wer das Konzept kennt, bleibt dabei dennoch sicher. Prüfen Sie aktuelle Funktionen immer in der offiziellen Dokumentation des Anbieters.

Häufig gestellte Fragen

Ist multimodale KI dasselbe wie generative KI?
Nein, das sind verschiedene Ideen. Generative KI beschreibt Systeme, die neue Inhalte erzeugen. Multimodale KI beschreibt die Arbeit mit mehr als einer Datenart. Ein Modell kann beides leisten, etwa ein Foto ansehen und Text schreiben. Ein Modell, das Fotos nur klassifiziert, ist bei der Eingabe multimodal, aber nicht generativ.
Liest ein multimodales Modell Text auf Fotos zuverlässig?
Oft ja, aber nicht immer. Kleine, unscharfe, gedrehte oder ungewohnte Schrift kann zu Fehlern führen. Bauen Sie bei kritischen Feldern wie Beträgen, Daten und Ausweisnummern eine zweite Prüfregel ein. Prüfen Sie die Ergebnisse außerdem stichprobenartig durch einen Menschen, statt jeder Extraktion blind zu vertrauen.
Wie wirkt multimodale KI auf personenbezogene Daten?
Bilder und Ton tragen mehr personenbezogene Daten als Text. Gesichter, Kennzeichen, E Mails auf dem Bildschirm und Gespräche im Hintergrund können in die Aufnahme geraten. Lesen Sie die Richtlinie des Anbieters zu Speicherung und Training, laden Sie keine Dateien mit unnötigen Personendaten hoch und holen Sie bei heiklen Fällen rechtlichen Rat ein.
Wie sollte ein kleines Unternehmen multimodale KI ausprobieren?
Starten Sie mit einem engen Anwendungsfall. Kurze Beschreibungsentwürfe aus Produktfotos sind ein guter erster Schritt. Bauen Sie aus echten Beispielen ein kleines Testset, lassen Sie jede Ausgabe von einem Menschen lesen und beobachten Sie die Kosten. Sind die Ergebnisse verlässlich, erweitern Sie den Umfang Schritt für Schritt.
Ist ein multimodales Modell immer besser als ein einmodales?
Nein. Bei engen Aufgaben mit nur einer Form ist ein kleines Spezialmodell oft schneller, günstiger und konsistenter. Ein multimodales Modell spielt seine Stärke aus, wenn die Aufgabe mehrere Informationsquellen verbinden muss. Entscheiden Sie nach Bedarf und eigenen Testergebnissen, nicht nach Markennamen, und probieren Sie zuerst die einfache Lösung.
Verschwinden die Grenzen multimodaler Modelle mit der Zeit?
Manche Grenzen werden besser, aber nicht alle verschwinden. Visuelle Halluzination, unklare Eingaben und Datenschutzfragen bleiben im Prinzip bestehen. Die Prüfgewohnheiten, die Sie heute aufbauen, nützen deshalb auch bei neuen Modellversionen. Prüfen Sie aktuelle Grenzen in der offiziellen Dokumentation des Anbieters und messen Sie regelmäßig mit Ihrem eigenen Testset nach.
  • multimodale ki
  • vision language model
  • ki begriffe
  • bildverstehen
  • dokumentenverarbeitung
  • sprachassistent
  • videozusammenfassung
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.