Webseiten werden zu Daten, die du wirklich nutzen kannst.
goScraper holt Inhalte von Webseiten, PDFs und Bildern und macht daraus saubere Dateien — zum Durchsuchen, Trainieren oder Weitergeben.
So läuft ein Durchgang
- 1
Adressen angeben
Du hinterlegst eine oder mehrere Webseiten. Der Scraper holt sich von dort den Inhalt — bei Bedarf folgt er auch internen Links.
- 2
Lauf starten
goScraper liest die Seiten, räumt Menüs und Werbung weg und behält den eigentlichen Text. Optional auch PDFs und Text aus Bildern.
- 3
Daten mitnehmen
Wenn der Lauf fertig ist, lädst du das Ergebnis herunter: Tabelle, Text, PDF oder ein Zip mit allen Textformaten.
Was landet im Ergebnis
Text der Seite
Überschriften, Absätze, Listen — ohne Cookie-Banner, Navigation und ähnlichen Ballast.
Bilder
Wichtige Fotos und Grafiken, nicht jedes Icon. Der Text daraus kann mitgelesen werden — Originale landen nicht im Download.
PDFs
Wenn du PDFs einschaltest, wird der Text daraus mitgelesen und landet in den Exportdateien.
Text aus Bildern
Optional: der Scraper liest auch Schrift auf Bildern — etwa bei Scans oder Infografiken.
Formate zum Download
- CSVTabelle, z. B. für Excel
- JSON / JSONLFür Tools und Weiterverarbeitung
- MarkdownLesbarer Text mit Metadaten
- PDFZum Durchlesen und Archivieren
- ZipJSONL, JSON, Markdown und CSV in einem Paket
Gut zu wissen
- Ein Projekt ist eine Konfiguration: welche Seiten, wie tief, ob Bilder und PDFs dabei sind.
- Du kannst einen Lauf anhalten, nochmal starten und die Einstellungen später anpassen.
- Robots.txt wird standardmäßig beachtet — der Scraper geht nicht überall hin, wo es unerwünscht ist.
- Impressum und Datenschutz findest du unten auf jeder Seite.