Regierungsportale, öffentliche Konsultationsseiten, Preistabellen, Rankings und Online-Verzeichnisse – im Internet sind riesige Datenmengen zugänglich, die gesammelt, organisiert und genutzt werden müssen. Wenn keine API verfügbar ist, ist die visuelle Datenextraktion mit Dablio Robô der praktischste Weg, dies zu tun.
Was ist Datenextraktion (Web Scraping) mit RPA?
Beim Web Scraping mit RPA kommt ein Roboter zum Einsatz, der wie ein Mensch durch den Browser navigiert, die Datenelemente auf der Seite – Tabellen, Felder, Texte, Links – identifiziert und für die spätere Verwendung erfasst. Im Gegensatz zu codebasierten technischen Scrapern können Sie dies mit Dablio Robô visuell tun, indem Sie auf Elemente auf dem Bildschirm zeigen.
Schritt 1: Identifizieren Sie die Datenselektoren
Bevor Sie den Flow erstellen, greifen Sie auf die Zielwebsite zu und ermitteln Sie, wo sich die Daten befinden, die Sie erfassen möchten. Überprüfen Sie die Elemente mit den DevTools (F12) des Browsers und beachten Sie die CSS-Selektoren oder den Beschriftungstext in der Nähe. Je stabiler der Selektor ist, desto zuverlässiger ist die Automatisierung.
Schritt 2: Erstellen Sie den Extraktionsfluss
Erstellen Sie in Dablio Robô einen Fluss mit den folgenden Aktionen: URL öffnen → Auf Laden warten → Element durch Selektor erfassen → In Variable speichern → Für andere Felder wiederholen → Zeile in Tabelle speichern → Zur nächsten Seite gehen (falls Paginierung vorhanden) → Wiederholen.
Schritt 3: Behandeln Sie die Paginierung und das dynamische Laden
Viele Portale zeigen Daten auf mehreren Seiten an oder laden Inhalte asynchron über JavaScript. Konfigurieren Sie Dablio Robô so, dass es vor der Erfassung auf das Vorhandensein eines bestimmten Elements wartet. Dadurch wird sichergestellt, dass die Daten bereits auf dem Bildschirm angezeigt werden. Fügen Sie für die Paginierung eine Schleife hinzu, die auf die Schaltfläche „Weiter“ klickt und die Extraktion wiederholt.
Exportieren der Daten
Dablio Robô kann die extrahierten Daten in einer Excel-Tabelle, CSV-Datei oder Datenbank speichern oder direkt an eine API senden. Konfigurieren Sie das Ziel am Ende des Flows. Für große Mengen bevorzugen Sie CSV oder Bank – für benutzerfreundliche Berichte ist Excel praktischer.