Zurück zum Blog

Automatische Datenextraktion von öffentlichen Websites und Regierungsportalen

Erfahren Sie, wie Sie visuelle Scraper erstellen, die Daten von Websites ohne API sammeln, die Informationen verarbeiten und in Tabellenkalkulationen oder interne Systeme exportieren.

Regierungsportale, öffentliche Konsultationsseiten, Preistabellen, Rankings und Online-Verzeichnisse – im Internet sind riesige Datenmengen zugänglich, die gesammelt, organisiert und genutzt werden müssen. Wenn keine API verfügbar ist, ist die visuelle Datenextraktion mit Dablio Robô der praktischste Weg, dies zu tun.

Was ist Datenextraktion (Web Scraping) mit RPA?

Beim Web Scraping mit RPA kommt ein Roboter zum Einsatz, der wie ein Mensch durch den Browser navigiert, die Datenelemente auf der Seite – Tabellen, Felder, Texte, Links – identifiziert und für die spätere Verwendung erfasst. Im Gegensatz zu codebasierten technischen Scrapern können Sie dies mit Dablio Robô visuell tun, indem Sie auf Elemente auf dem Bildschirm zeigen.

Schritt 1: Identifizieren Sie die Datenselektoren

Bevor Sie den Flow erstellen, greifen Sie auf die Zielwebsite zu und ermitteln Sie, wo sich die Daten befinden, die Sie erfassen möchten. Überprüfen Sie die Elemente mit den DevTools (F12) des Browsers und beachten Sie die CSS-Selektoren oder den Beschriftungstext in der Nähe. Je stabiler der Selektor ist, desto zuverlässiger ist die Automatisierung.

Schritt 2: Erstellen Sie den Extraktionsfluss

Erstellen Sie in Dablio Robô einen Fluss mit den folgenden Aktionen: URL öffnen → Auf Laden warten → Element durch Selektor erfassen → In Variable speichern → Für andere Felder wiederholen → Zeile in Tabelle speichern → Zur nächsten Seite gehen (falls Paginierung vorhanden) → Wiederholen.

Struktur des Extraktionsflusses
Portal-URL oder Auflistungsseite öffnen
Warten Sie, bis die Seite vollständig geladen ist
Erfassen Sie jedes Datenfeld pro Selektor
Speichern Sie Werte in Flussvariablen
Zeile in Ausgabeblatt schreiben
Suchen Sie nach der nächsten Seite
Wiederholen, bis alle Datensätze erschöpft sind

Schritt 3: Behandeln Sie die Paginierung und das dynamische Laden

Viele Portale zeigen Daten auf mehreren Seiten an oder laden Inhalte asynchron über JavaScript. Konfigurieren Sie Dablio Robô so, dass es vor der Erfassung auf das Vorhandensein eines bestimmten Elements wartet. Dadurch wird sichergestellt, dass die Daten bereits auf dem Bildschirm angezeigt werden. Fügen Sie für die Paginierung eine Schleife hinzu, die auf die Schaltfläche „Weiter“ klickt und die Extraktion wiederholt.

Exportieren der Daten

Dablio Robô kann die extrahierten Daten in einer Excel-Tabelle, CSV-Datei oder Datenbank speichern oder direkt an eine API senden. Konfigurieren Sie das Ziel am Ende des Flows. Für große Mengen bevorzugen Sie CSV oder Bank – für benutzerfreundliche Berichte ist Excel praktischer.

Alle Artikel Demo anfordern
🤖 Nächster Schritt

Bereit zum Platzieren
das in der Praxis?

Erleben Sie, wie Dablio Robô mit einer personalisierten Demo für Ihr Unternehmen arbeitet.