Architektur

Übersicht über alle Komponenten einer Outpost-Bereitstellung

Komponenten

Eine Outpost-Bereitstellung besteht aus mehreren Komponenten, die zusammenarbeiten, um Daten zu erfassen, zu verarbeiten und zu speichern. Die folgende Übersicht zeigt die Hauptkomponenten und ihre Funktionen.

Übersicht der Outpost-Bereitstellungskomponenten

Outpost

Der Outpost ist das Herzstück einer Outpost-Bereitstellung. Seine Hauptaufgabe ist es, Daten aus verschiedenen Quellen zu lesen, zu verarbeiten und in der Vektordatenbank zu speichern sowie Suchanfragen von meinGPT zu beantworten. Zu diesem Zweck werden die Daten mithilfe eines speziellen KI-Modells, dem Embedding-Modell, in Vektoren umgewandelt, die in der Vektordatenbank gespeichert werden. Dies ermöglicht eine effiziente Suche nach semantisch ähnlichen Textpassagen über Tausende von Dokumenten hinweg.

Der Outpost wird als Desktop-Anwendung für Windows und Linux ausgeliefert — als signierter Installer, den ihr in meinGPT herunterladet. Server, Vektordatenbank und Embedding-Modell sind darin enthalten; es ist nichts zusätzlich zu installieren.

Achtung

Frühere Versionen wurden als Container-Verbund ausgeliefert. Dieser Weg wird nicht mehr veröffentlicht. Bestehende Installationen laufen nicht weiter — sie müssen umgestellt werden, und weil Embedding-Modell, Datenbank und Indexer neu sind, werden die Datenbestände dabei neu indexiert. Meldet Euch unter enterprise@meingpt.com, wir machen den Umstieg gemeinsam mit Euch — siehe Umstieg.

Vektordatenbank

Die Vektordatenbank speichert die vom Embedding-Modell erstellten Vektoren zusammen mit den zugehörigen Textabschnitten und beantwortet die Ähnlichkeitssuche.

Welche Datenbank dabei läuft, hängt von der Bereitstellungsart ab:

  • Outpost-Anwendung für Windows und Linux: SQLite für die Metadaten, LanceDB für die Vektoren. Beides läuft im Outpost-Prozess selbst und liegt als Dateien auf der Platte. Es ist im Installer enthalten — es wird kein separater Datenbankdienst installiert oder betrieben.
  • Server-Bereitstellungen — die Vorgängergeneration und die von uns betriebene Cloud: PostgreSQL mit der Erweiterung VectorChord. Metadaten und Vektoren liegen dort in derselben Datenbank.

In beiden Fällen kombiniert eine Suchanfrage die Vektorsuche mit einer Stichwortsuche (BM25), und jede Anfrage ist auf genau einen Data Pool eingegrenzt.

Embedding-Modell

Das Embedding-Modell ist ein KI-Modell, das Text in mathematische Vektoren (Embeddings) umwandelt. Diese Vektoren repräsentieren die Bedeutung des Textes in einem hochdimensionalen Raum, sodass semantisch ähnliche Texte auch ähnliche Vektoren erzeugen.

Die Qualität des Embedding-Modells hat direkten Einfluss auf die Qualität der Suchergebnisse:

  • Je besser das Modell, desto besser versteht es die Bedeutung der Texte
  • Je mehr Dimensionen die Vektoren haben, desto genauer können Bedeutungsnuancen dargestellt werden
  • Je größer das Modell, desto mehr Rechenleistung wird benötigt

Der Outpost unterstützt verschiedene Embedding-Modelle:

  • Cloud-basierte Modelle von OpenAI, Azure und Nebius
  • Selbst gehostete OpenAI-kompatible Embedding-Dienste
War diese Seite hilfreich?