Datenquellen

Welche Quellen ein Outpost anbindet, welche MeinGPT direkt anbindet, und wie eine Verbindung zustande kommt.

Eine Datenquelle bekommt in MeinGPT ihren Namen und ihre Berechtigungen — dort entscheidet sich, wer sie finden darf. Ordner auf einem Outpost-Rechner entstehen dagegen dort und werden hier nur übernommen; wie viel ein Ordner herausgibt, entscheidet ebenfalls der Outpost. Wo ihre Dokumente liegen, entscheidet sich danach — und für einen Teil der Quellen ist die Antwort „auf einem Rechner bei euch“, und genau dafür gibt es den Outpost.

Wer holt die Dateien?

QuellenWo konfiguriert
MeinGPT direktSharePoint, OneDrive, Google Drive, Confluence, S3, WebDAV, Web-CrawlerVollständig in MeinGPT. Kein eigener Rechner nötig.
Nur über einen OutpostOrdner auf einem Rechner — auch SMB-Freigaben, sofern eingebunden; in der separat freigeschalteten Dienste-Vorschau auch Datenbanken, lokale MCP-Server und interne HTTP-APIsDatenquelle in MeinGPT, Verknüpfung im Outpost

Dienste sind nicht allgemein freigeschaltet

Datenbanken, MCP-Server und HTTP-APIs erscheinen nur, wenn die kontrollierte Dienste-Vorschau für euren Workspace aktiviert ist. Ohne diese Freischaltung zeigt der Outpost ausschließlich dateibasierte Freigaben. Details zur Einrichtung: Dienste.

Welche Datenbanken werden unterstützt?

Unterstützt werden PostgreSQL, MySQL und Microsoft SQL Server — dieselben Datenbanksysteme wie beim Datenbank-Tool in der Cloud. Andere Systeme sind nicht angebunden.

Im Standardfall braucht ihr keinen Outpost

Wenn eure Dokumente in SharePoint oder Google Drive liegen, bindet MeinGPT sie direkt an. Ein Outpost lohnt sich, wenn Quelldateien und Suchindex in eurem Netz bleiben oder Systeme aus der Cloud gar nicht erreichbar sind — ein Netzlaufwerk und eine Datenbank im eigenen Netz sind es nicht. Was eine Anfrage übertragen darf, legt ihr pro Ordner am Outpost fest.

So kommt eine Outpost-Quelle zustande

Zwei Hälften an zwei Orten, in dieser Reihenfolge:

  1. Im Outpost: Ordner freigeben — Pfad wählen und festlegen, wie viel er herausgibt.
  2. In MeinGPT: den gemeldeten Ordner unter Freigaben übernehmen und benennen. Dort entscheidet sich, wer ihn finden darf.

In MeinGPT gibt es keinen Knopf, der einen Ordner anlegt. Sucht ihr ihn, fehlt Schritt 1 — er passiert auf dem Rechner.

Für Ordner kennt der Dialog im Outpost nur einen Quellentyp: einen Ordnerpfad auf diesem Rechner — auch eine dauerhaft eingebundene SMB-Freigabe zählt dazu. Bei freigeschalteter Dienste-Vorschau kommt eine Datenbank, ein lokaler MCP-Server oder ein internes HTTP-API über denselben Einstieg hinzu: Freigeben im Outpost, dann den passenden Typ wählen und Verbindungsdaten und Zugriffsrechte festlegen. Anders als ein Ordner wird ein gemeldeter Dienst in MeinGPT nicht erst übernommen und benannt — Du legst direkt fest, wer ihn nutzen darf. Details zu Status und Zugriffsrechten stehen unter Konsole & Betrieb → Datenbank, MCP und HTTP. S3-Speicher, WebDAV und Web-Crawler bindet ihr ausschließlich direkt in MeinGPT an. Ist ein solcher Dienst aus dem Internet nicht erreichbar, etwa ein internes MinIO oder eine Nextcloud, braucht es dafür eine eigene Verbindungsart (IP Allowlisting, Unternehmens-Verbindungsnetzwerk oder VPN) statt eines Outposts — siehe Leitfaden: On-Premise.

Quellen im Detail

Braucht einen Outpost

Direkt in MeinGPT, kein Outpost nötig

Verbinden: erst prüfen, dann speichern

  • Bei S3, WebDAV und Confluence prüft MeinGPT die Zugangsdaten, bevor die Quelle angelegt wird. Falsches Passwort, falscher Bucket oder ein nicht erreichbarer Server werden direkt im Dialog gemeldet, zusammen mit einer Vorschau der ersten Einträge.
  • Ist derselbe Ordner, dieselbe Bibliothek oder ein übergeordneter Ort schon als Datenquelle verbunden, weist der Dialog darauf hin. So entstehen keine doppelten Kopien derselben Dateien.
  • Neu verbinden öffnet das Formular mit den gespeicherten Einstellungen; nur das Geheimnis muss neu eingegeben werden. Danach startet der Abgleich sofort.
  • Der Name einer Quelle lässt sich jederzeit direkt auf ihrer Seite ändern.

Was bei jeder Quelle gleich ist

  1. Der Outpost holt die Dateien in seinen Arbeitsbereich auf diesem Rechner.
  2. Er extrahiert Text, teilt ihn in Abschnitte, kodiert sie und legt sie im Suchverzeichnis ab.
  3. Spätere Läufe verarbeiten nur, was sich geändert hat.
  4. Was er nicht lesen kann, überspringt er — und protokolliert es nach Dateiendung in der Zeile des Ordners unter Freigaben.

Punkt 4 ist der, den man im Blick behalten muss: eine übersprungene Datei ist nicht auffindbar, und die Suche sagt das niemandem. → Konsole & Betrieb

Eine Ausnahme: War eine Datei schon einmal lesbar und ist nur ihre neueste Fassung beschädigt, verschlüsselt oder leer, bleibt die letzte lesbare Fassung auffindbar, bis eine lesbare gespeichert wird. Konsole und MeinGPT zeigen solche Dateien als fehlgeschlagene Aktualisierung mit Grund. Löschst Du die Datei oder schließt sie aus, verschwindet auch die alte Fassung aus der Suche.

Berechtigungen entstehen in MeinGPT, nicht im Dateisystem

Datei-, NTFS-, AD- und POSIX-Rechte werden nicht in den Index übernommen. Wer eine Datenquelle in MeinGPT sehen darf, findet alles darin. Die Aufteilung in Datenquellen ist euer Berechtigungsmodell.

Ausnahme: Für lokale NTFS-Ordner gibt es die Beta-Funktion Windows-Nutzerrechte (Beta), die echte NTFS-Berechtigungen je Nutzer:in berücksichtigt — Details unter Wer sieht was.

War diese Seite hilfreich?