„Kann meine KI mit Bildern arbeiten?" sind in Wahrheit drei Fragen mit drei verschiedenen Antworten. Kläre zuerst, welche Du meinst — sonst suchst Du den Fehler an der falschen Stelle.
Was Du willst
Geht das?
Der Weg
Der Assistent soll den Inhalt eines Bildes kennen und danach suchen können
Eine Cloud-Datenquelle liest lose PNG-, JPG-, GIF- und WEBP-Dateien, aber
keine TIFF-, BMP- oder SVG-Dateien. Diese werden beim Sync übersprungen und
erscheinen weder in der Dateiliste noch als Fehler im Protokoll. Das sieht aus
wie ein Konfigurationsfehler und ist keiner. Details: Lose
Bilddateien. Ein Outpost verhält sich hier anders, siehe
unten.
Bilder innerhalb von Dokumenten werden gelesen. Ein Vision-Modell sieht sich die Bilder an und schreibt, was darauf steht, als Text in den Suchindex.
Wo das Bild liegt
Wird gelesen
In einer .docx oder .pptx
Ja
In einer PDF — eingebettete Abbildungen, dazu Seiten mit als Vektorgrafik gezeichneten Zeichnungen oder Tabellen
Ja
In einer .odt
Nein — nur der Text
Was das Modell dabei tut:
Text im Bild übernimmt es wörtlich — Überschriften, Beschriftungen, Bildunterschriften, Anmerkungen, Kleingedrucktes. Zahlen, Einheiten und Symbole bleiben stehen, es wird nicht übersetzt.
Tabellen bleiben Tabellen. Eine Maßtabelle in einer technischen Zeichnung landet als Tabelle im Index, nicht als Textwurst.
Zu Fotos, Diagrammen und Zeichnungen schreibt es einen kurzen, sachlichen Satz — auch dann, wenn gar kein Text darauf steht. Die Beschreibung ist Englisch, wenn das Dokument klar englisch ist, sonst Deutsch.
Es rät nicht. Branche, Funktion, Zweck oder die Identität eines Bauteils benennt es nur, wenn sichtbarer Text das hergibt. Das ist Absicht: eine geratene Teilenummer im Index ist schlimmer als keine.
Logos, Piktogramme und sehr kleine Bilder überspringt es bewusst, ebenso Bilder, die sich im Dokument mehrfach wiederholen — etwa ein Logo in jeder Kopfzeile. Sie kosten einen Modellaufruf und liefern eine Beschreibung, nach der niemand sucht.
Rein dekorative oder leere Bilder liefern nichts. Das ist kein Fehler.
Je Datei werden bis zu 64 Bilder gelesen, in der Reihenfolge des Dokuments, dazu bis zu 12 PDF-Seiten mit gezeichneten Abbildungen. Bei einem Katalog mit Hunderten Abbildungen bleiben die hinteren ungelesen.
Ein Outpost arbeitet ohne Vision-Modell. Er liest den Text in Bildern per klassischer Texterkennung — in Word- und PowerPoint-Dateien ebenso wie in eigenständigen Bilddateien (PNG, JPG, TIFF, BMP, WEBP, HEIC), auch in TIFF, BMP und HEIC, die eine Cloud-Datenquelle überspringt. Eine Beschreibung von Fotos, Diagrammen oder Zeichnungen entsteht dabei nicht, auf Zeichnungen und Scans schneidet die Texterkennung deutlich schlechter ab, und Bilder erscheinen nicht im Chat.
Zeilen, die nach Rauschen der Texterkennung aussehen, übernimmt der Outpost nicht in den Index; der Text des Dokuments selbst bleibt dabei vollständig erhalten. Liest die Texterkennung eine Seite eines Scans oder eine Bilddatei nicht verlässlich, etwa eine auf dem Kopf stehende Seite, meldet der Outpost die Datei als fehlgeschlagen. Eine zuvor indexierte Fassung der Datei bleibt dann durchsuchbar. Was er außer Bildern aus Word- und PowerPoint-Dateien liest: Was gelesen wird, und was nicht.
Zu jedem Bild, das das Vision-Modell gelesen hat, legt MeinGPT eine Kopie ab. Zitiert eine Antwort eine Textstelle, die ein solches Bild beschreibt, zeigt der Chat das Bild als Vorschaubild unter der Antwort — mit der Nummer der Quellenangabe, zu der es gehört. Ein Klick öffnet die Quellenvorschau an der zitierten Stelle, mit dem Bild groß darüber.
Fragst Du etwa „Wie sieht die Spannvorrichtung aus?" und steht in der Betriebsanleitung ein Foto mit der Unterschrift „Abb. 1: Spannvorrichtung SV-200", erscheint das Foto unter der Antwort.
Es erscheinen nur Bilder aus den Quellen. Der Assistent erzeugt keine Bilder und verlinkt keine; gezeigt wird nur, was zur zitierten Textstelle im Dokument gehört.
Wenige, nicht alle. Höchstens drei Bilder je Quellenangabe und vier je Antwort. Steht dasselbe Bild in mehreren Dateien, erscheint es einmal, mit den Nummern aller Quellenangaben. Welches Bild zu welcher Stelle gehört, entscheidet die Stelle, an der das Bild im Dokument steht.
Eine gezeichnete PDF-Seite zählt als ein Bild. Bei Explosionszeichnungen und Schaltplänen zeigt der Chat die ganze Seite.
Die Kopie ist verkleinert (höchstens 1600 Pixel an der längeren Seite) und ohne Metadaten wie Kamera- oder Ortsangaben gespeichert. Das Original bleibt, wo es ist.
Hinweis
Voraussetzungen. Bilder im Chat erscheinen bei jeder Cloud-Datenquelle,
für alle, die die Quelle nutzen dürfen — außer bei Quellen, die früher auf
Nur Textausschnitte oder Nur Text eingeschränkt wurden, siehe
Quellenangaben in Antworten. Wer die Quelle nicht sehen darf, sieht
auch ihre Bilder nicht. Bilder werden beim Einlesen abgelegt: Eine
Datei, die vor dieser Funktion eingelesen und seither nicht geändert wurde,
zeigt ihre Bilder erst, wenn sie neu eingelesen wird — ändere sie, oder bitte
den Support, die Datenquelle neu einlesen zu lassen.
Die abgelegten Bilder zählen zum Speicherkontingent Deines Workspace. Ein Bild, das in mehreren Dateien derselben Datenquelle vorkommt, wird nur einmal gespeichert und nur einmal gezählt. Wird eine Datei gelöscht, zeigt der Chat ihre Bilder sofort nicht mehr; die Kopien selbst werden spätestens einen Tag nach dem nächsten Sync entfernt, mit der Datenquelle sofort.
Für einen überschaubaren, gepflegten Bestand, der nicht in Dokumenten steht — Explosionszeichnungen, Einbaulagen, Typenschilder als einzelne Dateien —, bleibt ein Skill der Weg: Bilddateien mit einer SKILL.md in ein .zip (höchstens 50 MB je Paket, 20 Pakete je Assistent), im Assistenten-Editor im Bereich Skills hochladen und im System-Prompt sagen, wann welches Bild gezeigt wird. Der Bereich setzt die Code-Sandbox voraus.
Eine Cloud-Datenquelle liest JPG-, PNG-, GIF- und WEBP-Dateien wie Dokumente, ohne dass Du etwas einschalten musst: Das Vision-Modell beschreibt jede Bilddatei, die Beschreibung ist durchsuchbar, die Datei erscheint normal in der Dateiliste und im Zähler, und der Chat zeigt das Bild unter der Quellenangabe. Es gelten dieselben Grenzen wie für eingebettete Bilder, höchstens 10 MB je Bild. TIFF, BMP und SVG werden übersprungen.
Eine neue Datenquelle liest Bilddateien vom ersten Sync an. Datenquellen, die es schon gab, bevor Bilddateien gelesen wurden, kommen nach und nach an die Reihe — ein paar pro Viertelstunde, damit nicht alle gleichzeitig ihre Bilder laden; bis dahin weist der Tab Dateien die Bilder als noch nicht gelesen aus. Ist eine Quelle an der Reihe, holt der nächste Sync ihre Bilddateien nach — bei OneDrive und Google Drive einmalig mit einem vollständigen Abgleich, der etwas länger dauert. Bei SharePoint erscheinen sie erst, wenn sie geändert werden; sonst bitte den Support, die Datenquelle neu einlesen zu lassen.
Soll ein Ordner voller Fotos oder Screenshots nicht durchsucht werden, verbinde ihn nicht mit der Datenquelle: Jede Bilddatei kostet beim Einlesen einen Modellaufruf und zählt zum Speicherkontingent.
Die Regel dahinter ist simpel: das Modell schreibt nur, was zu sehen ist. Danach richtet sich alles Weitere.
Ein Bild je Abschnitt, mit Überschrift und Bildunterschrift
Der Text um das Bild herum trägt die Datei — er ist es, worüber die Suche
das Bild findet. „Abb. 4: Spannschiene, Modell XY, Einbaulage" macht ein
Bild auffindbar, das ohne Unterschrift nur als „eine Metallschiene an
schwarzem Gewebe" im Index steht. Eine Bildunterschrift in dieser Form zeigt
der Chat auch zum Bild an.
Was das Bild identifiziert, muss im Bild oder direkt daneben stehen
Positionsnummern mit Legende, Typenschild, Maßtabelle, beschriftete Achsen.
Ein Detailfoto ohne jede Beschriftung lässt sich beschreiben, aber nicht
zuordnen — und das Modell soll die Zuordnung ausdrücklich nicht erraten.
Zeichnungen und Scans in ordentlicher Auflösung
Gelesen wird, was lesbar ist. Unleserliche Stellen werden als solche
markiert statt geraten, und eine 96-dpi-Bildschirmkopie einer Maßtabelle
verliert genau die Zahlen, wegen derer sie im Index sein soll.
Keine Sammelseiten
Zwölf Details auf einer Seite ergeben eine Beschreibung für zwölf
Sachverhalte. Eine Seite je Detail liefert zwölf gezielt auffindbare
Abschnitte — und zwölf Bilder, die der Chat einzeln zeigen kann.
Prüfen statt hoffen
In der Datenquelle im Tab Übersicht unter Ausprobieren eine echte Frage stellen und ansehen, aus
welchem Dokument und welcher Textstelle die Treffer kommen. Das ist der
einzige belastbare Nachweis, dass ein Bildinhalt wirklich im Index steht.
Jede Quellenangabe in einer Antwort lässt sich anklicken und zeigt die Fundstelle. Die Datei selbst öffnen oder herunterladen — etwa um eine Zeichnung am Original zu prüfen — geht bei jeder Cloud-Datenquelle für alle, die die Quelle nutzen dürfen — außer bei Quellen, die früher auf Nur Textausschnitte oder Nur Text eingeschränkt wurden, siehe Quellenangaben in Antworten. Bei einem Outpost nur, wenn der Ordner in der Outpost-App auf Text und Originaldateien steht; voreingestellt ist Nur Text. Mehr dazu: Freigabestufe.
Bilder aus Confluence-Seiten. Der Confluence-Sync liest Seitentext. Ein als Anhang eingebettetes Bild landet nur als Platzhalter mit seinem Dateinamen im Index, ein per URL eingebundenes Bild hinterlässt gar nichts; im Chat erscheint keins von beiden. Siehe Confluence.
Bilder, die das Modell nicht gelesen hat. Logos, Piktogramme, sehr kleine und sich wiederholende Bilder sowie alles jenseits der 64 Bilder je Datei bleiben ohne Beschreibung — und damit auch ohne Vorschaubild.
Bilder über einen Connector in den Chat laden. Die Datei-Connectoren übergeben Dokumentformate an den Chat, keine Bildformate.
Was dagegen jederzeit geht: ein Bild im Chat anhängen. Praktisch alle aktuellen Flaggschiff-Modelle nehmen JPEG, PNG, GIF und WEBP als Anhang entgegen — siehe Modelle.