火车采集器|网页表格数据批量采集 + 导出完整方案

火车采集器|网页表格数据批量采集 + 导出完整方案

适配场景:网页标准 Table 表格、分页表格、多页面表格批量抓取,直接导出 Excel/CSV,全程基于火车采集器(火车头采集器)原生功能,无需额外插件。

一、核心采集思路

  1. 配置列表页地址(含分页)
  2. 定位网页<table>表格区域
  3. 自动识别表头、各行单元格数据
  4. 清洗空格、换行、无用标签
  5. 批量导出 CSV/Excel,支持增量采集

二、分步配置教程

1. 新建任务,填入目标网址

打开火车采集器 → 新建采集任务 → 输入表格所在网页 URL

如果存在分页:在【网址采集规则】配置分页正则 / 翻页参数

2. 采集内容规则(表格抓取两种方案)

方案 A:自动表格解析(推荐,最简)

适用:规范 HTML<table><tr><td>标准网页表格

  1. 点击【获取网页】加载页面源码
  2. 可视化选取整个表格区域
  3. 右键 →解析为表格数据
    火车采集器会自动:
  • 提取每一行<tr>
  • 拆分<td>单元格为独立字段
  • 自动识别第一行作为表头字段名
方案 B:正则表达式提取(不规则表格 / 嵌套表格)

如果可视化识别失败,使用正则批量提取行

提取所有表格行正则: <tr[\s\S]*?>([\s\S]*?)</tr>

子规则循环提取每行单元格:

<td[\s\S]*?>([\s\S]*?)</td>

开启【循环采集】,一行数据生成一条采集结果。

3. 数据清洗(必做)

字段清洗规则添加:

  • 去除 HTML 标签:清除<div> <a> <span>等标签
  • 去除首尾空白、换行符、&nbsp;
  • 替换多余制表符(避免导出表格错乱)
  • 过滤空行、表头重复行

清洗常用替换:
查找:&nbsp;替换为空
查找:\s+替换为单个空格

4. 分页表格批量采集

  1. 进入【网址采集规则】
  2. 获取下一页链接,编写分页正则
    示例分页地址page=1,page=2
    使用地址递增模式:
    shturl.cc/o5qZr54aNix4o3Sy[1-100]
    设置起始页、结束页、步长,实现全自动翻页抓取全部表格。

三、批量导出设置

方式 1:导出本地文件(CSV/Excel)

任务采集完成 →【导出数据】
可选格式:

  • CSV(推荐,兼容性最强,Excel 直接打开)
  • Excel (xls)
    勾选:第一行为表头,字段顺序和网页表格保持一致。

注意:大量数据优先 CSV,上万条数据导出 Excel 不易卡顿。

方式 2:自动定时导出(自动化批量任务)

任务计划→开启定时采集,搭配导出插件,采集结束自动输出文件到指定文件夹,实现无人值守批量采集表格。

四、高级常见问题优化

  1. 表格跨页、动态加载表格(AJAX 表格)
    普通源码抓取不到数据 → 使用火车采集器【内置浏览器模式】加载页面,等待表格渲染完成再提取。
  2. 多个表格同时抓取(一页多 Table)
    使用区域过滤,分别定位不同<table>区块,分开采集,区分数据分类。
  3. 导出后单元格错乱、错位
    原因:表格内部存在换行、<br/>、嵌套表格
    解决:清洗规则删除<br>,统一清理换行符号。
  4. 需要定时增量采集表格,只抓新增数据
    开启【重复数据过滤】,设置唯一标识字段(编号 / ID),重复数据不入库、不重复导出。

五、可直接套用简易规则模板(标准 Table)

  1. 区域过滤(限定表格范围)
<table[^>]*>([\s\S]*?)</table>
  1. 循环提取行
<tr>([\s\S]*?)</tr>
  1. 循环提取单元格