政府门户网站、公共咨询网站、价格表、排名和在线目录——网络上有大量数据需要收集、组织和使用。当没有可用的 API 时,使用 Dablio Robô 进行可视化数据提取是最实用的方法。
什么是 RPA 数据提取(网络抓取)
使用 RPA 进行网页抓取意味着使用机器人像人类一样导航浏览器,识别页面上的数据元素(表格、字段、文本、链接)并捕获它们以供以后使用。与基于代码的技术抓取工具不同,Dablio Robô 允许您通过指向屏幕上的元素来直观地完成此操作。
第 1 步:识别数据选择器
在创建流之前,访问目标网站并确定要捕获的数据所在的位置。使用浏览器的开发工具 (F12) 检查元素,并记下附近的 CSS 选择器或标签文本。选择器越稳定,自动化就越可靠。
第 2 步:创建提取流
在 Dablio Robô 中,通过以下操作创建流程:打开 URL → 等待加载 → 通过选择器捕获元素 → 存储在变量中 → 对其他字段重复 → 在电子表格中保存行 → 转到下一页(如果有分页) → 重复。
萃取流程结构
✓打开门户 URL 或列表页面
✓等待页面完全加载
✓捕获每个选择器的每个数据字段
✓将值存储在流变量中
✓将行写入输出表
✓检查下一页
✓重复直到所有记录都用完
第 3 步:处理分页和动态加载
许多门户在多个页面上显示数据或通过 JavaScript 异步加载内容。将 Dablio Robô 配置为在捕获之前等待特定元素的存在 - 这可确保数据已显示在屏幕上。对于分页,添加一个循环,单击“下一步”按钮并重复提取。
导出数据
Dablio Robô 可以将提取的数据保存在 Excel 电子表格、CSV 文件、数据库中或直接发送到 API。在流程末尾配置目标。对于大量数据,首选 CSV 或银行格式 - 对于人工报告,Excel 更实用。