五矿集团网页爬取
1、立项背景和目标
五矿集团电子采购平台会持续发布大量招标、采购项目公告,采购信息分散在多页列表中,人工逐条复制项目名称、采购单位、预计采购时间等信息录入 Excel 表格工作量大、容易出错,且分页翻阅统计效率低下。本项目立项目标:基于 Playwright 自动化浏览器抓取五矿集团电子采购网多页采购公示数据,自动解析字段并写入 Excel 文件,实现采购数据批量结构化导出,方便后续数据整理、统计与归档,同时掌握动态网页分页爬取、XPath 层级定位、openpyxl 表格持久化存储的完整爬虫开发流程。
2、软件功能、核心功能模块介绍
三大核心功能模块
(1)Excel 表格初始化模块:使用 openpyxl 库新建工作簿,创建名为 “五矿集团” 工作表,预先写入表头【项目名称、采购单位、预计采购时间】,定义全局列表用于临时存储抓取到的结构化数据,为后续数据落地做准备。
(2)浏览器自动化页面交互模块:调用 Playwright 启动本地 Edge 浏览器,配置可视化运行窗口、操作减速防反爬;自动访问五矿集团采购官网首页,定位导航栏采购栏目完成点击跳转,循环 5 次执行分页加载逻辑,每页设置长时间强制等待,保证后端动态渲染的采购列表完整加载。
(3)数据解析与表格写入模块:通过层级 XPath 定位每一条采购项目 DOM 容器,循环提取项目标题、采购单位、两段拼接而成的预计采购时间;增加单页最多抓取 50 条数据限制,逐条将字段追加写入 Excel 工作表,最终完整保存为本地表格文件。
3、业务流程、功能路径描述
(1)程序初始化:创建 Excel 文件、新建工作表并设置表头;配置本地 Edge 浏览器启动路径与反爬兼容参数;
(2)自动化访问目标网站:打开五矿集团电子采购平台首页,等待页面完全加载后,通过 XPath 定位导航栏 “采购” 菜单并模拟鼠标点击进入采购公告列表页;
(3)分页循环抓取:执行 5 轮分页爬取,每一页等待 10 秒确保列表数据 JS 渲染完成;定位所有采购条目父级容器;
(4)逐条解析字段:遍历每条条目 DOM 节点,分别提取项目名称、采购单位,拼接两个时间节点作为预计采购时间,限制单页最大抓取 50 条避免数据冗余;
(5)数据入库存储:每解析一条数据立即 append 追加写入 Excel 对应行;5 页全部抓取完成后保存 Excel 文件,关闭浏览器,程序执行结束。
物流仓储