Öffne Einstellungen → Datenquellen, klicke auf Datenquelle hinzufügen und wähle Web-Crawler. Trage die Start-URL ein und klicke Verbinden — alle weiteren Felder sind optional und haben sinnvolle Standardwerte.
Der Web-Crawler läuft als Cloud-Datenquelle; ein eigener Outpost wird dafür nicht benötigt und wird von diesem Source-Typ aktuell nicht unterstützt.
| Feld | Standard | Beschreibung |
|---|
| Start-URL | — | Die URL, bei der der Crawler beginnt |
| Scraping-Methode | Basic (HTTP) | Basic nutzt HTTP-Anfragen, Browser aktiviert JavaScript-Rendering — nötig für Seiten, die Inhalte per JS nachladen |
| Maximale Tiefe | 3 | Wie viele Klicks tief der Crawler ausgehend von der Start-URL folgt |
| Maximale Seiten | 1000 | Obergrenze für die Zahl gecrawlter Seiten |
Für passwortgeschützte Intranets: Der Crawler meldet sich einmal an und bleibt für den gesamten Crawl angemeldet.
| Feld | Beschreibung |
|---|
| Login-URL | Ziel-URL des Login-Formulars — muss HTTPS verwenden |
| Benutzername / Passwort | Zugangsdaten für das Login-Formular |
| Feld | Standard | Beschreibung |
|---|
| Pfade einschließen / ausschließen | — | Pfad- oder vollständige URL-Muster mit Platzhaltern, eines pro Zeile |
| Auf Selektor warten | — | Nur im Browser-Modus: CSS-Selektor, auf den vor der Extraktion gewartet wird |
| Seiten-Timeout | 30 s | Timeout pro Seite |
| Anfrageverzögerung | 1,0 s | Wartezeit zwischen Anfragen |
| Gleichzeitige Anfragen | 5 | Parallel laufende Crawl-Anfragen |
| Wiederholungsversuche | 2 | Erneute Versuche bei Fehlern |
| Ausgabeformat | Markdown | Markdown, HTML oder Text |
| Nur Hauptinhalt | An | Extrahiert nur den Hauptinhaltsbereich, ohne Navigation und Footer |
| Maximales Alter | 24 h | Seiten, die älter als dieser Schwellenwert sind, werden erneut gecrawlt |
| Proxy-Server / -Benutzername / -Passwort | — | Für Crawls über einen Proxy |
| User Agent | — | Eigener User-Agent-String |
Mit /docs/* schließt du Seiten unter /docs/ ein. Mit /docs/private/* kannst du einen Teilbereich ausschließen. * steht für beliebigen Text einschließlich Schrägstrichen, ? für genau ein Zeichen. Ausschlüsse haben Vorrang.
Muster, die mit / beginnen, beziehen sich nur auf den URL-Pfad, ohne Abfrageparameter. Vollständige URL-Muster wie https://example.com/docs/* werden ebenfalls unterstützt. Reguläre Ausdrücke werden nicht unterstützt; die einfache bisherige Schreibweise /docs/.* bleibt kompatibel. Ungültige Regeln werden abgelehnt statt ignoriert.
Die Startseite kann zum Finden passender Links abgerufen werden. Ihr Inhalt wird nur indexiert, wenn er zu den Filtern passt. Filter gelten für nachfolgende Crawls; bereits indexierte Inhalte außerhalb des konfigurierten Bereichs werden dadurch nicht automatisch entfernt.
- MeinGPT crawlt ausgehend von der Start-URL und speichert extrahierten Inhalt pro gefundener Seite.
- Jeder Datenbestand wird alle 15 Minuten vom Sync-Scheduler geprüft (siehe Sync-Intervall); eine Seite wird aber erst neu gecrawlt, wenn die eingestellte maximale Alterszeit (Standard 24 Stunden) seit dem letzten Crawl abgelaufen ist.
- Nutze Pfad-Filter, um den Crawl-Umfang eng zu halten.