Datenquellen & RAG

Überblick zu Datenquellen, RAG und Quellenanbindung

Datenquellen (RAG)

Datenquellen sind die Basis für Retrieval-Augmented Generation (RAG) in MeinGPT. Inhalte aus angebundenen Quellen werden indexiert und stehen Deinen Assistenten als Wissen zur Verfügung. Du kannst eine Datenquelle aber auch direkt in einem Chat anhängen, wenn Du nur einmal etwas darin nachlesen möchtest.

Datenquelle hinzufügen

Öffne Einstellungen → Datenquellen und klicke auf Datenquelle hinzufügen:

Jede dieser Quellen bindest Du direkt über Einstellungen → Datenquellen an, ohne eigene Hardware.

Dateien, die euer Netz nicht verlassen sollen?

Diese sechs Quellen laufen alle in der MeinGPT Cloud. Sollen Quelldateien und Suchindex stattdessen in eurem eigenen Netz bleiben, ist das der Outpost — ein separater Weg, kein Häkchen auf dieser Seite.

Eckdaten der Cloud-Datenquelle

Für die meisten Teams ist die cloud-basierte Datenquelle die richtige Wahl.

EigenschaftWert
HostingMeinGPT Cloud (Hetzner, Deutschland)
Sync-IntervallAlle 15 Minuten
Suchergebnisse pro AnfrageBis zu 12 Textstellen je Suche, höchstens 3 je Datei; der Assistent wählt die Anzahl, nicht einstellbar
SuchverfahrenStichwortsuche und Bedeutungssuche (Embeddings, sortiert nach Relevanz), immer beide
VerfügbarkeitIm Standardpaket enthalten
Speicherbudget300 GB pro Workspace (Rohdaten, alle Cloud-Datenpools zusammengerechnet)

Cloud-Datenpools teilen sich ein Speicherbudget pro Workspace: standardmäßig 300 GB an rohen, importierten Daten - zusammengerechnet über alle Cloud-Datenpools des Workspaces. Ist das Budget ausgeschöpft, werden keine neuen Inhalte mehr indexiert, bis wieder Platz frei ist, etwa durch Entfernen nicht mehr benötigter Dateien. Den aktuellen Verbrauch siehst Du als Admin unter Einstellungen → Datenquellen.

SharePoint Connector vs. Datenquelle: wann was?

Wenn Du SharePoint-Daten in MeinGPT nutzen willst, hast Du zwei Optionen: den nativen Microsoft 365 Connector oder eine Datenquelle mit SharePoint als Quelle. Beide haben ihre Stärken.

KriteriumMicrosoft 365 ConnectorDatenquelle mit SharePoint-Quelle
SuchverfahrenDirektzugriff in EchtzeitVorab-Index, Sync alle 15 Minuten
BerechtigungenRespektiert SharePoint-Permissions automatisch (auf Nutzer-Ebene über OAuth)Admin gibt die Datenquelle frei. SharePoint-Permissions je Datei nur mit der Workspace-Einstellung Berechtigungen aus der Quelle
AuthentifizierungJeder Nutzer authentifiziert sich individuellZentral konfiguriert
SkalierungGut für gezielte Recherche in einzelnen Sites oder OrdnernSkaliert auf große Datenmengen, mehrere Quellen kombinierbar
Quellen kombinierenNur SharePoint und OneDriveMehrere Quellen in einer Datenquelle (SharePoint, lokale Dateien, Drive, …)

Faustregel:

  • Microsoft 365 Connector für die meisten SharePoint-Anwendungsfälle. Vor allem dann, wenn jeder Nutzer nur das sehen soll, was er auch in SharePoint selbst sehen darf.
  • Datenquelle, wenn Du große Bestände zentral indexieren willst, mehrere Quellen mischen musst oder eine zentrale Wissensdatenbank ohne individuelle Permissions brauchst.

Konfiguration & Empfehlungen

Daten gezielt eingrenzen

Es gibt kein hartes Datenlimit. Aber je mehr Daten eine Datenquelle umfasst, desto stärker konkurrieren irrelevante Treffer mit den passenden. Empfehlung:

  • Beim Verbinden eines SharePoint-/OneDrive-Ordners werden alle Unterordner automatisch mit einbezogen - Du musst Unterordner nicht einzeln als eigene Datenquelle hinzufügen
  • Pro Datenquelle gezielt 500 bis 1.000 relevante Dateien anbinden, nicht den gesamten SharePoint
  • Lieber mehrere spezialisierte Datenquellen als eine riesige, zum Beispiel "HR-Richtlinien", "Produkt-Spezifikationen", "Vertriebs-Material"
  • Je präziser eine Datenquelle, desto besser die Treffer

Achtung

Dieselbe Ordnerstruktur in mehreren Datenquellen bedeutet doppelte Indexierung. Es gibt keine plattformweite Deduplizierung über Datenquellen hinweg - verweisen zwei Datenquellen auf denselben oder überlappenden SharePoint-/OneDrive-Ordner, wird dieser Inhalt vollständig zweimal gecrawlt, gechunkt und eingebettet, mit entsprechend doppeltem Speicher- und Rechenaufwand. Ist ein Assistent an beide Datenquellen angebunden, kann dieselbe Datei zusätzlich doppelt in den Suchergebnissen einer einzelnen Anfrage auftauchen. Binde einen Ordner deshalb nur einmal als Datenquelle an und teile diese eine Datenquelle mit allen Assistenten, die darauf zugreifen sollen, statt pro Assistent eine eigene Datenquelle auf denselben Ordner anzulegen.

Kurzbeschreibung sorgfältig formulieren

Die Kurzbeschreibung einer Datenquelle ist nicht nur Doku. Sie wird vom Modell genutzt, um zu entscheiden, ob eine Datenquelle für eine Anfrage relevant ist. Eine schlechte Beschreibung führt dazu, dass Datenquellen bei passenden Fragen nicht durchsucht werden.

Gut: "Enthält alle internen HR-Richtlinien, Prozessbeschreibungen und Onboarding-Dokumente."

Weniger gut: "HR-Dokumente."

Tool-Referenz im System-Prompt

In Assistenten-Instruktionen lohnt es sich, Datenquellen explizit anzusprechen. Zum Beispiel: "Starte jede Konversation damit, relevante Informationen aus der angebundenen Datenquelle abzurufen." Das macht die Nutzung der Datenquelle zuverlässiger.

Symptom: Assistent ignoriert einen verknüpften Datenpool. Antwortet ein Assistent trotz korrekt synchronisiertem und verknüpftem Datenpool aus allgemeinem Wissen statt aus dem Datenpool, ist eine fehlende Referenz im System-Prompt die häufigste Ursache — nicht ein Konfigurationsfehler am Datenpool selbst. Prüfe zuerst, ob die Anweisungen den Datenpool explizit erwähnen, bevor Du Sync-Status oder Berechtigungen untersuchst.

Vertiefung

Erweitert: Kundenverwalteter Outpost (On-Premise)

Wenn Du eine eigene On-Premise-Wissensinfrastruktur betreiben willst, etwa für regulierte Branchen oder besondere Sicherheitsanforderungen, kannst Du einen eigenen Outpost einsetzen. Quelldateien und Suchindex bleiben dort gespeichert; es gibt keine zentrale Dauerkopie. Bei einer Anfrage überträgt der Outpost jedoch genau die Inhalte, die Du pro Ordner am Outpost freigegeben hast: aufbereiteten Text und Metadaten oder zusätzlich eine Kopie der Originaldatei. In der MeinGPT-Weboberfläche gibt es dafür keine zweite Einstellung. Die temporäre Sandbox-Verarbeitung ist unter Suche & Antworten beschrieben.

Weitere Quellen

Neben den sechs Cloud-Quellen oben und manuell hochgeladenen Dateien gibt es Ordner und Netzlaufwerke, die nur ein Outpost lesen kann. Die vollständige Übersicht mit der Cloud-vs-Outpost-Unterscheidung: Datenquellen.

Custom Data Preparation Pipelines

Ein eigenes Muster mit S3-Übergabepunkt für Drittsysteme findest Du hier:

Verwandte Seiten

War diese Seite hilfreich?