
Kurz gesagt: Multimodale KI heißt, dass ein Sprachmodell nicht nur Text, sondern auch Bilder versteht: Screenshots, Diagramme, Rechnungen und gescannte Dokumente. Wir haben das Textmodell GLM-5.3 sehend gemacht, ohne ein zweites Bildmodell davorzuschalten. Ein trainierter Projektor übersetzt Bildinhalte direkt in den Raum, in dem das Sprachmodell rechnet.
Das Wichtigste in Kürze
- Ein Modell statt zwei: Das Bild steht im selben Kontext wie der Text, die Antwort entsteht in einem Durchlauf.
- Das Sprachmodell bleibt unverändert: Trainiert wird nur der Projektor, die Brücke zwischen Bildencoder und Sprachmodell.
- Training in drei Stufen: Abbildung lernen, mit dem Bild denken, aus Fehlern lernen.
- 83,2 Prozent auf 5.059 Fragen: 79,3 Prozent bei Diagrammen, 89,0 Prozent bei Dokumenten, 86,0 Prozent bei Text in Bildern.
- Im eigenen Rechenzentrum: Bilder und Dokumente verlassen das Haus nicht.
Was ist multimodale KI?
Ein multimodales Sprachmodell verarbeitet mehrere Arten von Eingaben in einer Anfrage, in unserem Fall Text und Bild. Es liest nicht nur die Frage, sondern sieht auch den Screenshot, das Diagramm oder die Rechnung, um die es geht. Für Unternehmen ist das der Schritt von „die KI liest meine Texte“ zu „die KI arbeitet mit meinen Dokumenten und Oberflächen, so wie sie sind“.
Bildmodell davor oder Projektor: der Unterschied
Wer einem Sprachmodell Bilder zeigen will, hat zwei Möglichkeiten. Der übliche Weg schaltet ein spezialisiertes Bildmodell davor. Es beschreibt, was es sieht, und reicht den Text weiter. Das funktioniert, kostet aber doppelt: zwei Modelle im Speicher, zwei Wartungsstränge, und die Antwortzeit ist die Summe aus beiden.
Schwerer wiegt ein anderer Punkt. Das Sprachmodell sieht nie das Bild, sondern nur eine Beschreibung davon. Was der Beschreiber übersehen hat, ist verloren. Nachfragen am Bild gehen nicht, weil das Modell, das denkt, und das Modell, das sieht, keine gemeinsame Anfrage haben.

Was ist ein Projektor?
Ein Sprachmodell rechnet nicht mit Wörtern, sondern mit Vektoren. Jedes Token wird in einen hochdimensionalen Raum abgebildet, und dort findet das eigentliche Denken statt. Ein Bildencoder macht etwas Ähnliches: Er zerlegt ein Bild in Kacheln und bildet jede Kachel auf einen Vektor ab.
Beide Räume sind reichhaltig, sprechen aber nicht dieselbe Sprache. Der Projektor übersetzt zwischen ihnen. Er formt die Bildvektoren so um, dass das Sprachmodell sie wie gewöhnliche Token behandelt.
Trainiert wird nur dieser Projektor. Bildencoder und Sprachmodell bleiben, wie sie sind. Denkfähigkeit, Weltwissen und Werkzeugnutzung des Modells bleiben damit erhalten.

Wie wird der Projektor trainiert? Drei Stufen
Jede Stufe setzt auf dem Ergebnis der vorherigen auf und löst ein anderes Problem.
Stufe 1: die Abbildung lernen
Grundlage sind Bild-Text-Paare aus öffentlichen Datensätzen: Diagramme mit Fragen, Dokumente mit Antworten, Fotos mit Beschreibungen. Der Projektor lernt, welche Bildregion zu welchem Begriff gehört. Danach kann das Modell benennen, was es sieht.
Stufe 2: mit dem Bild denken
Benennen reicht nicht. Wer ein Balkendiagramm liest, vergleicht zwei Werte und bildet die Differenz. Dafür trainieren wir auf Denkspuren, also nicht nur auf die Antwort, sondern auf den Weg dorthin. Diese Spuren erzeugt das Modell selbst, und wir behalten nur die, bei denen die Antwort am Ende stimmt. So lernt der Projektor Repräsentationen, die zur Denkweise genau dieses Modells passen.
Stufe 3: aus Fehlern lernen
Bis hierhin sieht das Training nur richtige Beispiele. Die letzte Stufe nutzt Verstärkungslernen mit Gruppenvorteil: Zu jeder Frage erzeugt das Modell mehrere Antworten, die gegen die Referenz bewertet und untereinander verglichen werden. Das Lernsignal entsteht aus dem Unterschied zwischen besserer und schlechterer Antwort auf dieselbe Frage.
Zwei Details, die den Ausschlag geben
Die Belohnung muss messen, was am Ende zählt. Bewertet man im Training großzügiger als bei der Abnahme, optimiert das Modell an der Zielgröße vorbei, und man merkt es nicht. Bei uns benutzen Trainingsbewertung und Abnahme deshalb dieselbe Regel.
Die Auflösung im Training muss der im Betrieb entsprechen. Ein Projektor, der mit 1.800 Bildtoken trainiert wurde, verhält sich im Betrieb mit 2.500 Bildtoken anders als erwartet. Wir halten Trainings- und Betriebsbedingungen deshalb gleich.
Wie gut liest das Modell Bilder? Die Messwerte
Gemessen wird unter Produktionsbedingungen, also mit derselben Auflösung, denselben Grenzen und derselben Konfiguration wie im Livebetrieb. Zwei Trainingsstände vergleichen wir gepaart über dieselben Fragen und prüfen den Unterschied mit dem McNemar-Test. Ein Fortschritt zählt erst, wenn er diesen Test besteht.
Die Ergebnisse auf 5.059 Fragen:
- Diagramme lesen (ChartQA): 79,3 Prozent
- Dokumente verstehen (DocVQA): 89,0 Prozent
- Text in Bildern (TextVQA): 86,0 Prozent
- Gesamt: 83,2 Prozent
Angegeben sind die in der Forschung üblichen Metriken der jeweiligen Datensätze (Relaxed Accuracy, ANLS, VQA-Accuracy), damit die Werte mit veröffentlichten Zahlen vergleichbar sind. Intern messen wir zusätzlich strenger, mit exaktem Treffer der Antwort; dort liegt derselbe Stand bei 76,3 Prozent.
Praktisch heißt das: Neun von zehn Fragen zu einem Formular, einer Rechnung oder einem Vertragsauszug beantwortet das Modell richtig.

Wofür multimodale KI im Unternehmen taugt
Browser-Agenten: Ein Agent, der den Screenshot selbst sieht, muss nicht raten, was ein Beschreiber gemeint hat. Er erkennt die Schaltfläche, liest das Formularfeld und sieht die Fehlermeldung.
Dokumentenverarbeitung: Rechnungen, Verträge und gescannte Dokumente werden im Original gelesen, nicht in einer Zusammenfassung. Warum starre Vorlagen dabei an ihre Grenzen stoßen, zeigt unser Beitrag OCR vs. KI-Extraktion bei Rechnungen.
Diagramme und Berichte: Das Modell liest Werte aus Balken- und Liniendiagrammen und rechnet mit ihnen weiter.
Wie es weitergeht
Das Training läuft weiter, und drei Richtungen stehen an.
Mehr Strukturdaten. Ganze Dokumentseiten statt einzelner Ausschnitte. Wer eine Rechnung als Ganzes gesehen hat, findet die Summe auch dann, wenn sie nicht an der üblichen Stelle steht.
Höhere Auflösung. Kleine Schriften in Screenshots sind die häufigste verbleibende Fehlerquelle. Mehr Bildtoken kosten Rechenzeit, zahlen sich bei dichten Oberflächen aber aus.
Weitere Runden Verstärkungslernen. Jede Runde bringt einen kleinen, messbaren Zuwachs. Weil jede auf frischen Spuren des jeweils verbesserten Modells aufsetzt, lassen sie sich nicht beliebig wiederholen, sind aber noch nicht ausgereizt.
Häufige Fragen zu multimodaler KI (FAQ)
Was ist multimodale KI?
Multimodale KI verarbeitet mehrere Arten von Eingaben in einer Anfrage, zum Beispiel Text und Bild. Ein multimodales Sprachmodell kann so Fragen zu Screenshots, Diagrammen, Rechnungen oder gescannten Dokumenten beantworten.
Braucht man für multimodale KI ein zweites Modell?
Nein. Man kann ein Bildmodell davorschalten, das Bilder in Text beschreibt. Alternativ bekommt das vorhandene Sprachmodell über einen trainierten Projektor direkten Zugang zum Bild. Dann läuft ein Modell statt zwei, und das Sprachmodell sieht das Bild selbst.
Was macht ein Projektor in einem Sprachmodell?
Der Projektor ist ein kleines neuronales Netz zwischen Bildencoder und Sprachmodell. Er übersetzt die Bildvektoren so, dass das Sprachmodell sie wie Token behandelt. Nur er wird trainiert, Bildencoder und Sprachmodell bleiben unverändert.
Wie genau liest das Modell Dokumente und Diagramme?
Auf 5.059 Fragen aus ChartQA, DocVQA und TextVQA erreicht das Modell 83,2 Prozent, bei Dokumenten 89,0 Prozent und bei Diagrammen 79,3 Prozent, gemessen mit den üblichen Benchmark-Metriken und unter Produktionsbedingungen.
Kann multimodale KI im eigenen Rechenzentrum laufen?
Ja. Das hier beschriebene Modell läuft vollständig im eigenen Rechenzentrum. Bilder und Dokumente verlassen das Haus dabei nicht.
Weiterlesen
Wie Sie Sprachmodelle im eigenen Rechenzentrum betreiben, beschreiben wir im Leitfaden KI lokal betreiben. Was hinter dem Begriff steht, erklärt Was ist souveräne KI?. Einen Einblick in die Leistungsarbeit auf derselben Hardwareklasse gibt unser Erfahrungsbericht Kimi K3 auf AMD Instinct MI350X.
Sie wollen Dokumente, Diagramme oder Oberflächen mit einem Modell auswerten, das Ihr Haus nicht verlässt? Sprechen Sie mit uns.

Director, ADVISORI FTC GmbH
Über den Autor
Asan Stefanski ist Director des Bereichs Digital Transformation und „Head of Innovations" bei der ADVISORI FTC GmbH. Er leitet zudem das IT-Department des Unternehmens. Er verfügt über langjährige Erfahrung als Bereichsleiter für Software Engineering und ist spezialisiert auf Software Security, KI-Security, KI-Architektur sowie Security by Design / SSDLC. Als gefragter Speaker referiert er regelmäßig zu Themen wie generativer KI, RAG-Technologie und KI-Agenten und gibt praxisnahe Einblicke in konkrete Unternehmens-Use-Cases, unter anderem zur ADVISORI-eigenen KI-Agenten-Plattform

Souveräne KI · ADVISORI
Frontier-KI auf europäischer Infrastruktur
Frontier-Performance, vollständig in Europa und unter europäischem Recht: als lokale Sprachmodelle in Ihrer Infrastruktur oder orchestriert über Synthara AI Studio.
- EU-Inferenz: kein CLOUD Act, kein Kill-Switch
- DSGVO-konform auf europäischer Hardware
- Live in wenigen Wochen, ohne Vendor-Lock-in


