Datenquellen sind die Basis für Retrieval-Augmented Generation (RAG) in MeinGPT. Inhalte aus angebundenen Quellen werden indexiert und stehen Deinen Assistenten als Wissen zur Verfügung. Du kannst eine Datenquelle aber auch direkt in einem Chat anhängen, wenn Du nur einmal etwas darin nachlesen möchtest.
Jede dieser Quellen bindest Du direkt über Einstellungen → Datenquellen an, ohne eigene Hardware.
Dateien, die euer Netz nicht verlassen sollen?
Diese sechs Quellen laufen alle in der MeinGPT Cloud. Sollen Quelldateien
und Suchindex stattdessen in eurem eigenen Netz bleiben, ist das der
Outpost — ein separater Weg, kein Häkchen auf
dieser Seite.
Für die meisten Teams ist die cloud-basierte Datenquelle die richtige Wahl.
Eigenschaft
Wert
Hosting
MeinGPT Cloud (Hetzner, Deutschland)
Sync-Intervall
Alle 15 Minuten
Suchergebnisse pro Anfrage
Bis zu 12 Textstellen je Suche, höchstens 3 je Datei; der Assistent wählt die Anzahl, nicht einstellbar
Suchverfahren
Stichwortsuche und Bedeutungssuche (Embeddings, sortiert nach Relevanz), immer beide
Verfügbarkeit
Im Standardpaket enthalten
Speicherbudget
300 GB pro Workspace (Rohdaten, alle Cloud-Datenpools zusammengerechnet)
Cloud-Datenpools teilen sich ein Speicherbudget pro Workspace: standardmäßig 300 GB an rohen, importierten Daten - zusammengerechnet über alle Cloud-Datenpools des Workspaces. Ist das Budget ausgeschöpft, werden keine neuen Inhalte mehr indexiert, bis wieder Platz frei ist, etwa durch Entfernen nicht mehr benötigter Dateien. Den aktuellen Verbrauch siehst Du als Admin unter Einstellungen → Datenquellen.
Wenn Du SharePoint-Daten in MeinGPT nutzen willst, hast Du zwei Optionen: den nativen Microsoft 365 Connector oder eine Datenquelle mit SharePoint als Quelle. Beide haben ihre Stärken.
Kriterium
Microsoft 365 Connector
Datenquelle mit SharePoint-Quelle
Suchverfahren
Direktzugriff in Echtzeit
Vorab-Index, Sync alle 15 Minuten
Berechtigungen
Respektiert SharePoint-Permissions automatisch (auf Nutzer-Ebene über OAuth)
Admin gibt die Datenquelle frei. SharePoint-Permissions je Datei nur mit der Workspace-Einstellung Berechtigungen aus der Quelle
Authentifizierung
Jeder Nutzer authentifiziert sich individuell
Zentral konfiguriert
Skalierung
Gut für gezielte Recherche in einzelnen Sites oder Ordnern
Skaliert auf große Datenmengen, mehrere Quellen kombinierbar
Quellen kombinieren
Nur SharePoint und OneDrive
Mehrere Quellen in einer Datenquelle (SharePoint, lokale Dateien, Drive, …)
Faustregel:
Microsoft 365 Connector für die meisten SharePoint-Anwendungsfälle. Vor allem dann, wenn jeder Nutzer nur das sehen soll, was er auch in SharePoint selbst sehen darf.
Datenquelle, wenn Du große Bestände zentral indexieren willst, mehrere Quellen mischen musst oder eine zentrale Wissensdatenbank ohne individuelle Permissions brauchst.
Es gibt kein hartes Datenlimit. Aber je mehr Daten eine Datenquelle umfasst, desto stärker konkurrieren irrelevante Treffer mit den passenden. Empfehlung:
Beim Verbinden eines SharePoint-/OneDrive-Ordners werden alle Unterordner automatisch mit einbezogen - Du musst Unterordner nicht einzeln als eigene Datenquelle hinzufügen
Pro Datenquelle gezielt 500 bis 1.000 relevante Dateien anbinden, nicht den gesamten SharePoint
Lieber mehrere spezialisierte Datenquellen als eine riesige, zum Beispiel "HR-Richtlinien", "Produkt-Spezifikationen", "Vertriebs-Material"
Je präziser eine Datenquelle, desto besser die Treffer
Achtung
Dieselbe Ordnerstruktur in mehreren Datenquellen bedeutet doppelte Indexierung. Es gibt keine plattformweite Deduplizierung über Datenquellen hinweg - verweisen zwei Datenquellen auf denselben oder überlappenden SharePoint-/OneDrive-Ordner, wird dieser Inhalt vollständig zweimal gecrawlt, gechunkt und eingebettet, mit entsprechend doppeltem Speicher- und Rechenaufwand. Ist ein Assistent an beide Datenquellen angebunden, kann dieselbe Datei zusätzlich doppelt in den Suchergebnissen einer einzelnen Anfrage auftauchen. Binde einen Ordner deshalb nur einmal als Datenquelle an und teile diese eine Datenquelle mit allen Assistenten, die darauf zugreifen sollen, statt pro Assistent eine eigene Datenquelle auf denselben Ordner anzulegen.
Die Kurzbeschreibung einer Datenquelle ist nicht nur Doku. Sie wird vom Modell genutzt, um zu entscheiden, ob eine Datenquelle für eine Anfrage relevant ist. Eine schlechte Beschreibung führt dazu, dass Datenquellen bei passenden Fragen nicht durchsucht werden.
Gut: "Enthält alle internen HR-Richtlinien, Prozessbeschreibungen und Onboarding-Dokumente."
In Assistenten-Instruktionen lohnt es sich, Datenquellen explizit anzusprechen. Zum Beispiel: "Starte jede Konversation damit, relevante Informationen aus der angebundenen Datenquelle abzurufen." Das macht die Nutzung der Datenquelle zuverlässiger.
Symptom: Assistent ignoriert einen verknüpften Datenpool. Antwortet ein Assistent trotz korrekt synchronisiertem und verknüpftem Datenpool aus allgemeinem Wissen statt aus dem Datenpool, ist eine fehlende Referenz im System-Prompt die häufigste Ursache — nicht ein Konfigurationsfehler am Datenpool selbst. Prüfe zuerst, ob die Anweisungen den Datenpool explizit erwähnen, bevor Du Sync-Status oder Berechtigungen untersuchst.
Wenn Du eine eigene On-Premise-Wissensinfrastruktur betreiben willst, etwa für regulierte Branchen oder besondere Sicherheitsanforderungen, kannst Du einen eigenen Outpost einsetzen. Quelldateien und Suchindex bleiben dort gespeichert; es gibt keine zentrale Dauerkopie. Bei einer Anfrage überträgt der Outpost jedoch genau die Inhalte, die Du pro Ordner am Outpost freigegeben hast: aufbereiteten Text und Metadaten oder zusätzlich eine Kopie der Originaldatei. In der MeinGPT-Weboberfläche gibt es dafür keine zweite Einstellung. Die temporäre Sandbox-Verarbeitung ist unter Suche & Antworten beschrieben.
Neben den sechs Cloud-Quellen oben und manuell hochgeladenen Dateien gibt es Ordner und Netzlaufwerke, die nur ein Outpost lesen kann. Die vollständige Übersicht mit der Cloud-vs-Outpost-Unterscheidung: Datenquellen.