Formate & Zugriff

Unterstützte Dateiformate, E-Mails und Anhänge, Zugriffskontrolle für Datenpools

Welche Dateiformate ein Datenpool durchsuchbar macht und wer auf einen Datenpool zugreifen darf. Setup und Konfiguration einer Datenquelle: Datenquellen & RAG.

Dateiformate

Gut unterstützt sind alle Formate, die primär aus Text bestehen:

  • Office-Dokumente: DOCX, PPTX, ODT (OpenDocument Text)
  • Tabellen: XLSX und XLS (mit Einschränkungen, siehe unten) sowie CSV
  • PDF
  • E-Mail-Dateien: EML und MSG (siehe „E-Mails und Anhänge“ unten)
  • TXT, Markdown, RTF, EPUB, HTML
  • Bilddateien: PNG, JPG, GIF und WEBP (ein Vision-Modell beschreibt sie, siehe Bilder aus einem Datenpool)

Was beim Sync übersprungen wird

  • Nicht gelistete Dateiendungen. Nur die oben genannten Formate werden inhaltlich durchsuchbar gemacht. Dateien mit anderen Endungen (zum Beispiel .json) nimmt der Sync nicht in den Datenpool auf - sie erscheinen weder in der Dateiliste noch als Fehlermeldung in den Synchronisierungsprotokollen noch im Zähler der übersprungenen Dateien. Fehlt eine erwartete Datei, prüfe zuerst ihre Endung gegen die Liste oben.
  • Manche Bilddateien. PNG, JPG, GIF und WEBP liest eine Cloud-Datenquelle; TIFF, BMP, SVG und andere Bildformate werden übersprungen. Bilder innerhalb von Dokumenten werden gelesen - wie das funktioniert, wie Du Bilder dafür ablegst und wie ein Bild im Chat sichtbar wird, steht unter Bilder aus einem Datenpool.
  • Verschlüsselte oder rechtegeschützte PDFs. Ist eine PDF-Datei mit einem Passwort verschlüsselt oder hat ein Rechteschutz-Profil (DRM), kann MeinGPT ihren Inhalt nicht auslesen und nicht durchsuchbar machen. Entferne den Passwortschutz bzw. exportiere das Dokument ohne DRM-Beschränkung, bevor Du es in den Datenpool aufnimmst.
  • Excel-Tabellen sind ein Sonderfall. Beim Aufteilen in durchsuchbare Abschnitte (sogenanntes Chunking) geht der Tabellenkontext verloren - eine einzelne Datenzeile ohne ihre Spaltenheader ergibt oft keinen Sinn mehr. Für Berechnungen, Auswertungen und Visualisierungen aus Excel-Dateien nutze stattdessen die Code-Sandbox, die die Originaldatei direkt verarbeitet.

OneNote-Workaround. OneNote-Dateien werden derzeit nicht direkt indexiert, weil das Format proprietär ist. Workaround: OneNote-Inhalte regelmäßig automatisiert exportieren, etwa via Make oder n8n, als PDF oder Text. Die exportierten Dateien lassen sich dann ganz normal als Quelle anbinden.

Achtung

OneNote-Notizbücher erscheinen nicht im Sync-Status - auch nicht als „übersprungen“. Wie alle nicht gelisteten Dateitypen tauchen OneNote-Notizbücher und -Abschnitte weder in der Dateiliste noch in den Fehlermeldungen der Synchronisierungsprotokolle noch in der Anzahl der übersprungenen Dateien auf (siehe Indexierungsfortschritt). Enthält die verbundene SharePoint-Quelle noch andere unterstützte Dateien, werden diese normal indexiert - der Sync-Status zeigt dann z. B. „1 indiziert - Keine Fehler“, obwohl das OneNote-Notizbuch selbst nicht im Index gelandet ist. Ein fehlerfreier Sync-Status ist deshalb kein Nachweis dafür, dass OneNote-Inhalte durchsuchbar sind. Prüfe stattdessen die Dateiliste der Datenquelle gezielt auf die erwarteten Dateien, oder nutze den oben beschriebenen Export-Workaround.

E-Mails und Anhänge

E-Mail-Dateien in den Formaten EML (offener Standard) und MSG (Outlook) kannst Du direkt in einen Datenpool legen. Betreff, Absender, Empfänger und der Nachrichtentext werden ausgelesen und durchsuchbar gemacht. Beide Formate werden gleichwertig unterstützt - eine vorherige Umwandlung von MSG nach EML ist nicht nötig.

Achtung

Anhänge in E-Mail-Dateien sind ein Sonderfall. Bei kleineren E-Mails wird der Inhalt von Anhängen (z. B. ein PDF) mitgelesen und indexiert. Bei größeren E-Mails werden Anhänge aus Performance-Gründen auf ihren Dateinamen reduziert - ihr Inhalt ist dann nicht durchsuchbar. Wenn ein PDF-Anhang genauso zuverlässig indexiert werden soll wie ein PDF, das direkt im Datenpool liegt, lege den Anhang zusätzlich als eigene Datei in den Datenpool.

Zugriffskontrolle

Ein neu angelegter Datenpool ist zunächst privat für die Ersteller:in - niemand sonst hat automatisch Zugriff, auch nicht über einen verknüpften Assistenten. Um andere Zugriff zu geben, teilst Du den Datenpool gezielt: mit einzelnen Nutzer:innen, einem Team, oder workspace-weit für alle - aktuell jeweils als Lesezugriff ("Kann ansehen"). Zusätzlich lässt sich der Zugriff auf bestimmte Teams einschränken: Du legst Teams in der Admin-Oberfläche an und ordnest sie spezifischen Datenquellen zu. So steuerst Du, welche Nutzergruppen welche Daten sehen.

Details zum Anlegen und Verwalten von Teams: Team-Management.

Achtung

Assistenten-Freigabe hebt eine Zugriffsbeschränkung des Datenpools nicht auf. Ist ein Datenpool nicht für alle freigegeben - etwa nur für bestimmte Nutzer:innen, ein Team oder Admins -, gilt diese Einschränkung unabhängig davon, mit wem der zugehörige Assistent geteilt wurde. Wer den Assistenten öffnen darf, aber keinen eigenen Zugriff auf den Datenpool hat, bekommt aus diesem Datenpool nichts. MeinGPT sagt das offen: Unter der Antwort steht z. B. „1 Quelle dieses Assistenten ist für dich nicht freigegeben“, und der Assistent nennt nur den Namen der Quelle - nie etwas aus ihrem Inhalt. Wer einen Assistenten weiter teilt als eine seiner Quellen, sieht im Assistenten-Editor bei „Wissen“ den Hinweis „Kollegen ohne Zugriff auf … finden darin nichts“.

Wer darf Datenquellen anlegen?

Unter Einstellungen → Datenquellen legen Admins fest, wer Datenquellen anlegt:

  • Zentral (Standard): Nur Admins legen Datenquellen an und teilen sie mit dem Team. „Einstellungen → Datenquellen“ ist dann ein reiner Admin-Bereich.
  • Dezentral: Zusätzlich legt jedes Mitglied eigene Datenquellen an. Mitglieder sehen unter Einstellungen → Datenquellen nur ihre eigenen Datenquellen. Eine neue Datenquelle ist zuerst nur für die Person selbst sichtbar; sie kann sie wie gewohnt teilen und mit ihren eigenen Assistenten verbinden.

Admins sehen und verwalten weiterhin alle Datenquellen. Bestehende Datenquellen ändern sich durch die Umstellung nicht: Wechselt der Workspace zurück auf „Zentral“, bleiben die Datenquellen der Mitglieder samt Freigaben erhalten und werden ab dann von Admins verwaltet. Jede Umstellung steht im Audit-Log.

Einem Assistenten lassen sich nur Datenquellen hinzufügen, auf die man selbst Zugriff hat.

Unabhängig davon sehen Mitglieder unter Einstellungen → Datenquellen auch die Datenquellen, für die sie verantwortlich sind.

Verantwortliche für eine Datenquelle

Admins müssen nicht jede Datenquelle selbst betreuen. Auf der Seite einer Datenquelle legt ein:e Admin unter Einstellungen → Verantwortliche einzelne Personen oder Teams fest, die genau diese Quelle verwalten dürfen.

Verantwortliche können für ihre Quelle:

  • Name und Zweck ändern, bei Outpost-Quellen auch die Treffer pro Antwort
  • Jetzt synchronisieren auslösen sowie Status, Dateien und Aktivität einsehen
  • die Testsuche nutzen, auch „als" ein anderes Mitglied — Treffer mit Dokumenttext sehen sie nur, wenn die Quelle auch mit ihnen geteilt ist
  • die Quelle mit Personen und Teams teilen oder Freigaben entfernen

Verantwortliche können eine Datenquelle nicht löschen und ihre Verbindung nicht ändern (ein gespeichertes Konto würde sonst einen anderen Ort lesen) — das bleibt Admins vorbehalten und in einem dezentralen Workspace der Person, die die Quelle angelegt hat. Nur Admins legen in einem zentralen Workspace Datenquellen an, teilen eine Quelle mit allen im Workspace, heben eine gespeicherte Freigabestufe auf, legen weitere Verantwortliche fest und ändern Workspace-Einstellungen wie Berechtigungen aus der Quelle.

Verantwortlich zu sein gibt keinen Suchzugriff — wer die Inhalte im Chat finden soll, steht weiterhin in der Freigabe. Was Verantwortliche ändern oder teilen, protokolliert das Audit-Log genauso wie bei Admins. Das Standard-Team „Alle" kann nicht verantwortlich sein; dafür ist der Admin-Zugang da.

Weiterführend

War diese Seite hilfreich?