ブログに戻る

公共の Web サイトや政府ポータルからの自動データ抽出

API を使用せずに Web サイトからデータを収集し、情報を処理してスプレッドシートや内部システムにエクスポートするビジュアル スクレイパーを作成する方法を学びます。

政府ポータル、公的相談サイト、価格表、ランキング、オンライン ディレクトリなど、Web 上には収集、整理、使用する必要がある膨大な量のデータがアクセス可能です。利用可能な API がない場合は、Dablio Robô を使用して視覚的にデータを抽出するのが最も現実的な方法です。

RPAによるデータ抽出(Webスクレイピング)とは

RPA を使用した Web スクレイピングとは、人間と同じようにブラウザーを操作し、ページ上のデータ要素 (テーブル、フィールド、テキスト、リンク) を識別し、後で使用するためにそれらをキャプチャするロボットを使用することを意味します。コードベースのテクニカル スクレイパーとは異なり、Dablio Robô では、画面上の要素をポイントすることでこれを視覚的に行うことができます。

ステップ 1: データ セレクターを特定する

フローを作成する前に、ターゲット Web サイトにアクセスし、キャプチャするデータがどこにあるかを特定します。ブラウザの DevTools (F12) を使用して要素を検査し、近くにある CSS セレクターまたはラベル テキストに注目します。セレクターが安定しているほど、自動化の信頼性が高くなります。

ステップ 2: 抽出フローを作成する

Dablio Robô で、次のアクションを含むフローを作成します。 URL を開く → 読み込みを待つ → セレクターで要素をキャプチャ → 変数に保存 → 他のフィールドで繰り返す → スプレッドシートに行を保存 → 次のページに移動 (ページネーションがある場合) → 繰り返し。

抽出フロー構造
ポータルの URL またはリスト ページを開く
ページが完全にロードされるまで待ちます
セレクターごとに各データフィールドをキャプチャします
フロー変数に値を保存する
行を出力シートに書き込む
次のページを確認してください
すべてのレコードがなくなるまで繰り返します

ステップ 3: ページネーションと動的読み込みを処理する

多くのポータルは、複数のページにデータを表示するか、JavaScript を介してコンテンツを非同期的に読み込みます。キャプチャする前に特定の要素の存在を待機するように Dablio Robô を構成します。これにより、データがすでに画面上にあることが保証されます。ページネーションの場合は、「次へ」ボタンをクリックして抽出を繰り返すループを追加します。

データのエクスポート

Dablio Robô は、抽出したデータを Excel スプレッドシート、CSV ファイル、データベースに保存したり、API に直接送信したりできます。フローの最後に宛先を設定します。大量の場合は、CSV またはバンクをお勧めします。人間が使用できるレポートの場合は、Excel の方が実用的です。

すべての記事 デモをリクエストする
🤖 次のステップ

設置準備完了
これは実際に?

Dablio Robô があなたのビジネスに合わせてパーソナライズされたデモを活用している様子をご覧ください。