Wie die Suche in Datenpools funktioniert, Freigabestufen, Quellenangaben und das 3-Stufen-Modell
Wie MeinGPT einen Datenpool durchsucht, was in einer Antwort landet und wie tief die KI bei Bedarf in eine einzelne Datei geht. Setup und Konfiguration einer Datenquelle: Datenquellen & RAG.
Kunden-Wissensbestände sind oft groß. Hunderte oder tausende Gigabyte an Word-, PDF- und anderen Dateien sind keine Seltenheit. Jede Suchanfrage durch alle Dateien zu schicken wäre viel zu langsam. Deshalb wird vorab ein Suchindex aufgebaut. Funktioniert ähnlich wie Google, nur eben für Deine internen Dokumente.
Die initiale Indexierung kann je nach Datenmenge Stunden bis Tage dauern. Word-, PDF- und ähnliche Formate sind binär aufgebaut, der Text muss erst extrahiert werden. Dieser einmalige Aufwand zahlt sich danach in schnellen Suchergebnissen aus.
Du musst darauf aber nicht warten. Der Index wird in zwei Stufen aufgebaut: zuerst die Stichwortsuche, danach die Bedeutungssuche. Eine Datei ist deshalb schon durchsuchbar, sobald ihre Stichwortsuche steht — die Bedeutungssuche kommt im Hintergrund nach, Datei für Datei. Wie weit beide sind, siehst Du unter Indexierungsfortschritt.
Eigenschaften der Suche:
Stichwortsuche: Findet genau die Begriffe, die Du eingibst — Aktenzeichen, Artikelnummern, Eigennamen. Sie wird zuerst aufgebaut und steht immer zur Verfügung.
Semantisch: Dokumente werden in mathematische Repräsentationen umgewandelt (sogenannte Embeddings), die den inhaltlichen Sinn erfassen, nicht nur einzelne Wörter. Admins können sie nicht abschalten. Standardmäßig laufen Stichwort- und Bedeutungssuche zusammen; der Assistent kann eine einzelne Suche auf eines der beiden Verfahren beschränken. Die Bedeutungssuche pausiert nur, solange eine Cloud-Datenquelle im Schlafmodus ist.
Sortierung nach Relevanz: Treffer werden nach inhaltlicher Passung sortiert, nicht nach Häufigkeit eines Suchbegriffs. Ein Dokument, das thematisch zur Frage passt, kann höher ranken als eines mit dem exakten Schlüsselwort.
Anzahl der Treffer: Eine Suche liefert bis zu zwölf Textstellen, über alle durchsuchten Datenquellen zusammen und höchstens drei aus derselben Datei. Ausgenommen ist eine Suche in genau einer Datei, etwa einer im Chat angehefteten: Dort können alle zwölf Textstellen aus dieser Datei kommen. Der Assistent kann weniger anfordern und bei Bedarf weitere Suchen stellen. Bei Cloud-Datenquellen ist die Anzahl nicht einstellbar; für Outpost-Datenquellen siehe Sucheinstellungen.
Dateinamen-Suche: Neben dem Inhalt kann auch gezielt nach Dateinamen gesucht werden, etwa "Zeig mir Datei XY".
Achtung
Kein Filtern nach eigenen Metadatenfeldern. Datenquellen durchsuchen Dateiinhalte (semantisch) und Dateinamen. Zusätzlich lässt sich nach eingebauten Dateieigenschaften filtern: Pfad, Dateiendung, MIME-Typ, Erstellungs-/Änderungsdatum. Eigene Metadatenfelder aus Quellsystemen werden nicht als eigene, filterbare Felder übernommen — sie stehen der KI höchstens als Text im Dokumentinhalt zur Verfügung und sind damit nur über die semantische Suche auffindbar, nicht zuverlässig filterbar.
Im Chat wählst Du über + → In Datenquelle suchen die Quelle. Darunter findest Du Nach Dateityp oder Datum filtern: Im Eingabefeld erscheinen dann zwei Filter — Dateityp (PDF, Dokumente, Tabellen, Präsentationen, Text & Web, Bilder) und Zeitraum (letzte 7 Tage, 30 Tage, 12 Monate). Sobald Du eine Quelle gewählt hast, stehen sie automatisch daneben.
Die Filter gelten für jede Suche der KI in diesem Chat, bis Du sie zurücksetzt. Die KI kann innerhalb Deiner Auswahl weiter eingrenzen, sie aber nicht erweitern: Fragst Du nach Tabellen, während nur PDFs gewählt sind, sagt sie Dir, dass dafür der Filter geändert werden muss. Outpost-Datenquellen unterstützen diese Filter nicht und werden ausgelassen, solange einer gesetzt ist.
Eine Cloud-Datenquelle hat keine Sucheinstellungen: Stichwort- und Bedeutungssuche laufen immer beide, und wie gesucht wird, stimmt MeinGPT ab. Die einzige Einstellung, die es für Datenquellen gibt, gilt für den ganzen Workspace: Berechtigungen aus der Quelle.
Bei Outpost-Datenquellen stellst Du unter Einstellungen ganz unten auf der Seite der Datenquelle Textstellen pro Antwort ein (Standard 10, möglich sind 1 bis 100); in der Cloud wählt der Assistent die Anzahl pro Suche. Was eine bestimmte Frage in der Quelle findet, prüfst Du direkt mit Ausprobieren auf derselben Seite.
Unter dem Namen der Datenquelle steht ihr Status in einem Wort — derselbe wie in der Liste der Datenquellen — mit dem Grund oder dem Zeitpunkt der letzten Aktualisierung.
Während eine Quelle eingelesen wird, zeigt die Übersicht jede Datei als Punkt, der seine Farbe wechselt: gefunden → per Stichwort durchsuchbar → per Bedeutung durchsuchbar. Darüber steht, wie viele Dateien schon durchsuchbar sind, darunter, welche Datei gerade gelesen wird. Sobald die ersten Dateien per Stichwort durchsuchbar sind, ist die Datenquelle nutzbar; die Bedeutungssuche zieht im Hintergrund nach. Bei sehr großen Quellen steht ein Punkt für mehrere Dateien. Ist nichts in Bewegung, fasst die Seite dieselben Zahlen in einer Zeile zusammen.
Dateien, die nicht durchsuchbar sind, zählt die Übersicht getrennt: nicht lesbar (der letzte Versuch ist fehlgeschlagen) und übersprungen (bewusst ausgelassen, etwa Formate ohne Text oder Systemdateien). Einzelne solcher Dateien machen eine Quelle nicht „ungesund". Der Tab Dateien gruppiert sie nach Grund, mit einem nächsten Schritt je Gruppe, und zeigt für jede Datei unter Prüfen, wie weit sie gekommen ist. Dateien, deren Endung nicht auf der Liste der Dateiformate steht, nimmt der Abgleich gar nicht erst auf.
Kann die Plattform den Stand gerade nicht abfragen, sagt die Seite das ausdrücklich, statt Nullen zu zeigen — bei einer Cloud-Datenquelle, weil der Cloud Vault nicht geantwortet hat, bei einer Outpost-Datenquelle, weil der Outpost offline oder nicht erreichbar ist. Einen Abgleich, der gerade läuft, betrifft das nicht.
Antworten aus einer Datenquelle enthalten nummerierte Quellenangaben als anklickbare Badges neben dem Text. Ein Klick öffnet eine Vorschau mit Titel, Fundstelle und Ausschnitt des jeweiligen Ursprungsdokuments - zusätzlich mit einer Option, die Originaldatei zu öffnen oder herunterzuladen. Bei einer Outpost-Datenquelle erscheint diese Option nur, wenn der Ordner die Originaldatei freigibt (Freigabestufe).
Achtung
Quellenangabe erscheint nicht anklickbar? Das ist kein bekanntes, gewolltes Verhalten. Wende Dich mit einem Link zum betroffenen Chat an support@meingpt.com, damit wir das gezielt prüfen können.
Bei einer Cloud-Datenquelle bekommt jede Person, die die Quelle nutzen darf, alles: den vollständigen Text der Dokumente, die Originaldatei zum Öffnen und Herunterladen und Bilder aus den Dokumenten im Chat. Der Assistent darf eine Originaldatei bei Bedarf in den Chat oder die Code-Sandbox laden. Eine Stufe, die das einschränkt, gibt es für Cloud-Datenquellen nicht — wer was sieht, regelst Du allein über die Zugriffskontrolle. Hatte ein Admin eine Cloud-Datenquelle früher auf Nur Textausschnitte oder Nur Text eingeschränkt, gilt diese Einschränkung weiter, bis ein Admin sie unter Einstellungen auf der Seite der Datenquelle mit Einschränkung aufheben aufhebt; neu setzen lässt sie sich nicht.
Bei einer Outpost-Datenquelle entscheidet der Ordner in der Outpost-App, was die Plattform bekommt — siehe Freigabestufe.
Bei Quellenangaben aus SharePoint, OneDrive, Google Drive, Confluence und dem Web-Crawler zeigt die Vorschau zusätzlich Quelle öffnen. Das öffnet das Dokument im Quellsystem in einem neuen Tab; dort gelten dessen Berechtigungen, Du siehst das Dokument also nur, wenn Du es dort selbst öffnen darfst. Hast Du Dein Microsoft- oder Google-Konto mit MeinGPT verbunden, zeigt MeinGPT bei SharePoint, OneDrive und Google Drive stattdessen die Vorschau des Anbieters direkt in MeinGPT an.
Bei diesen Quellen ersetzt Quelle öffnen die Vorschau der in MeinGPT gespeicherten Kopie; nur PDF-Quellenangaben mit Seitenangabe öffnen weiterhin die Kopie an der zitierten Seite. Original herunterladen bleibt verfügbar, wo die Quelle die Originaldatei freigibt.
Bei allen anderen Quellen (etwa WebDAV, Amazon S3 oder einem Outpost) gibt es keinen Link ins Quellsystem. Gibt die Quelle den Text oder die Originaldatei frei, öffnet die Quellenangabe die in MeinGPT gespeicherte Kopie; sonst zeigt sie nur die Fundstelle.
Jede Cloud-Datenquelle hat einen eigenen Tab Wissenslandkarte (Datenquelle öffnen → Wissenslandkarte). Er zeigt, wie die Dokumente dieser Quelle tatsächlich genutzt werden - nicht manuell kuratiert, sondern berechnet aus den letzten 30 Tagen echter Suchen:
Karte der Ordner: Jede Fläche ist ein Ordner der obersten Ebene; ihre Größe ist die Zahl der Dateien, ihre Farbe, wie oft Suchen dort fündig werden.
Meistgenutzte Dokumente: Die Dateien mit den meisten Treffern.
Viel drin, nie gefragt: Große Ordner, in denen im Zeitraum keine Suche fündig wurde - ein Hinweis, den Zuschnitt zu prüfen.
Die Karte zeigt nur Häufigkeiten, keine Suchtexte und keine Personen.
Hinweis
Der Tab braucht vorherige Suchaktivität. Solange in diesem Pool noch nicht gesucht wurde, zeigt der Tab einen Hinweis, dass Wissen indexiert wird - das ist kein Fehler. Der erste Snapshot erscheint meist innerhalb weniger Minuten, nachdem eine Suche in diesem Pool stattgefunden hat.
Nicht jede Anfrage erfordert die gleiche Verarbeitungstiefe. MeinGPT entscheidet pro Anfrage automatisch, wie tief es gehen muss. Es gibt drei Stufen:
Stufe
Was passiert
Reicht für
1. Suche
Die Plattform durchsucht alle konfigurierten Quellen und liefert Snippets sowie Dateinamen zurück
Einfache Fragen wie "Gibt es ein Dokument zu Thema X?"
2. Volltext laden
Das Modell lädt den kompletten Inhalt einzelner Dateien, die nach Stufe 1 relevant erscheinen
Inhaltliche Fragen zu einzelnen, nicht zu großen Dokumenten
3. Code Sandbox
Die Originaldatei wird in einem abgeschotteten Bereich (Sandbox) geöffnet und mit Python verarbeitet
Berechnungen, Auswertungen, Diagramme aus großen oder strukturierten Dateien (z. B. Excel mit vielen Zeilen)
Du brauchst nichts manuell zu konfigurieren. Mehr Details zur Sandbox: Code Sandbox.
Achtung
Volltext kann viel Kontext verbrauchen. Stufe 2 lädt den kompletten Inhalt einer Datei oder Confluence-Seite auf einmal in den Chat – nicht nur den relevanten Ausschnitt. Sind mehrere große Quellen an denselben Assistenten oder Chat angebunden (z. B. eine Datenquelle und ein Confluence Space), kann bereits eine einzelne Anfrage einen erheblichen Teil des Kontextfensters des Modells verbrauchen. Behalte dazu die Kontextfenster-Anzeige im Eingabefeld im Blick und bevorzuge bei sehr großen oder stark verschachtelten Seiten (z. B. Confluence-Seiten mit vielen eingebetteten Makros) gezielte, eng gefasste Fragen. Mehr dazu: Chat zu groß für das Modell.
Für On-Premise-Datenquellen gilt bei Stufe 3 eine zusätzliche Einschränkung:
Hinweis
Hinweis für On-Premise-Setups: Stufe 3 (Sandbox) lädt Originaldateien temporär in die MeinGPT Cloud, weil die Sandbox-Umgebungen dort laufen — aber nur, wenn der Outpost-Ordner auf Text und Originaldateien (ORIGINAL_FILES) steht. Bei Nur Text (FULL_TEXT) oder der älteren Stufe PASSAGES wird die Sandbox-Anfrage abgelehnt, bevor eine Originaldatei hochgeladen wird. Erlaubte Dateien werden nach der Verarbeitung sofort gelöscht. Bei datenschutzsensiblen Setups solltest Du das Deinen Stakeholdern transparent kommunizieren.
Wenn eine PDF-Quellenangabe eine Seite enthält und die Quelle den Zugriff auf die Originaldatei erlaubt, öffnet die Vorschau diese Seite. Gezählt wird ab der ersten PDF-Seite, einschließlich Deckblättern und leeren Seiten. Die Position kann deshalb von der aufgedruckten Seitenzahl abweichen.
Bereits indexierte PDFs müssen erneut verarbeitet werden, damit neue Antworten Seitenverweise enthalten können. Bestehende Quellenangaben in Chats und Quellen ohne Seiteninformation öffnen weiterhin die gesamte Datei.
Bei einer Datenquelle auf einem Outpost legst Du in der Outpost-App pro Ordner fest, was Deine Räume verlassen darf. Die Plattform zeigt den gemeldeten Wert unter Einstellungen → Datenquellen nur an und kann ihn nicht ändern.
Stufe
Was aus dem Ordner herausgeht
Nur Text (voreingestellt)
Die passenden Fundstellen, der Dateiname und der vollständige Text der gefundenen Dokumente
Text und Originaldateien
Zusätzlich die Datei selbst
Erst Text und Originaldateien schaltet Öffnen und Herunterladen der Originaldatei an der Quellenangabe frei — und erlaubt dem Assistenten, die Datei in den Chat oder die Code-Sandbox zu laden. Unabhängig davon gilt weiterhin, wer die Datenquelle überhaupt nutzen darf (Zugriffskontrolle).
Achtung
Die Freigabestufe wirkt für alle Nutzer:innen dieser Quelle gleich. Es gibt aktuell keine Möglichkeit, sie nach Rolle oder Nutzergruppe zu differenzieren. Wer Zugriff auf die Datenquelle hat, bekommt dieselbe Stufe wie alle anderen mit Zugriff.
Cloud-Datenquellen haben keine Freigabestufe: Wer sie nutzen darf, bekommt Text, Originaldatei und Bilder.