程序聚合 软件案例 五矿集团网页爬取

五矿集团网页爬取

2026-07-29 17:40:48
行业:物流仓储
载体:爬虫/脚本、网站
技术:JavaScript、Python

业务和功能介绍

1、立项背景和目标
五矿集团电子采购平台会持续发布大量招标、采购项目公告,采购信息分散在多页列表中,人工逐条复制项目名称、采购单位、预计采购时间等信息录入 Excel 表格工作量大、容易出错,且分页翻阅统计效率低下。本项目立项目标:基于 Playwright 自动化浏览器抓取五矿集团电子采购网多页采购公示数据,自动解析字段并写入 Excel 文件,实现采购数据批量结构化导出,方便后续数据整理、统计与归档,同时掌握动态网页分页爬取、XPath 层级定位、openpyxl 表格持久化存储的完整爬虫开发流程。
2、软件功能、核心功能模块介绍
三大核心功能模块
(1)Excel 表格初始化模块:使用 openpyxl 库新建工作簿,创建名为 “五矿集团” 工作表,预先写入表头【项目名称、采购单位、预计采购时间】,定义全局列表用于临时存储抓取到的结构化数据,为后续数据落地做准备。
(2)浏览器自动化页面交互模块:调用 Playwright 启动本地 Edge 浏览器,配置可视化运行窗口、操作减速防反爬;自动访问五矿集团采购官网首页,定位导航栏采购栏目完成点击跳转,循环 5 次执行分页加载逻辑,每页设置长时间强制等待,保证后端动态渲染的采购列表完整加载。
(3)数据解析与表格写入模块:通过层级 XPath 定位每一条采购项目 DOM 容器,循环提取项目标题、采购单位、两段拼接而成的预计采购时间;增加单页最多抓取 50 条数据限制,逐条将字段追加写入 Excel 工作表,最终完整保存为本地表格文件。
3、业务流程、功能路径描述
(1)程序初始化:创建 Excel 文件、新建工作表并设置表头;配置本地 Edge 浏览器启动路径与反爬兼容参数;
(2)自动化访问目标网站:打开五矿集团电子采购平台首页,等待页面完全加载后,通过 XPath 定位导航栏 “采购” 菜单并模拟鼠标点击进入采购公告列表页;
(3)分页循环抓取:执行 5 轮分页爬取,每一页等待 10 秒确保列表数据 JS 渲染完成;定位所有采购条目父级容器;
(4)逐条解析字段:遍历每条条目 DOM 节点,分别提取项目名称、采购单位,拼接两个时间节点作为预计采购时间,限制单页最大抓取 50 条避免数据冗余;
(5)数据入库存储:每解析一条数据立即 append 追加写入 Excel 对应行;5 页全部抓取完成后保存 Excel 文件,关闭浏览器,程序执行结束。

项目实现

1、整体架构和设计思路,不同模块使用的技术栈
整体架构
采用Python 单文件线性执行架构,自上而下分为四层:文件持久化层→浏览器驱动层→页面交互层→数据提取存储层,逻辑简单直观,轻量化无额外中间件,适合小型定向垂直网站数据采集。
各模块技术栈
开发语言:Python 3.12;
浏览器自动化:Playwright 同步 API,驱动 Chromium 内核 Edge 浏览器,解决采购列表动态 JS 渲染、接口异步加载无法用静态请求抓取的问题;配置 slow_mo 操作延时、长时间页面等待模拟真人访问;
数据持久化:openpyxl 库,用于新建 Excel 工作簿、创建工作表、表头写入、行数据追加、本地文件保存,生成可直接打开编辑的.xlsx 文件;
元素定位:绝对路径 + 相对层级 XPath 表达式,精准嵌套定位列表父容器内的子字段标签;
辅助逻辑:for 循环实现 5 页分页批量爬取、if 条件限制单页最大抓取条数,做基础数据量管控。
2、本人负责模块与量化成果
本项目为个人独立全流程开发,全权完成代码编写、页面元素调试、分页逻辑、Excel 写入、边界条件限制全部工作:
完成 Edge 浏览器适配启动配置,解决本地浏览器路径调用、自动化操作过快被网站风控拦截问题;
编写首页跳转、导航菜单点击进入采购列表页的自动化交互逻辑;
设计 5 页循环分页抓取方案,每页 10 秒超时等待保障数据加载完整性;
编写多层嵌套 XPath 定位规则,拆解三个目标字段,对两段时间文本做拼接处理,增加单页最多 50 条数据截断限制;
对接 openpyxl 实现自动建表、表头填充、逐条数据入库;
量化成果:最多可稳定抓取 5 页采购公告数据,单页上限 50 条,总计最高可采集 250 条结构化采购信息,自动生成规范 Excel 台账,无需手动复制粘贴,数据录入零人工误差,信息整理耗时从半小时缩短至 1 分钟以内。
3、开发遇到的难点、坑点及解决方案
难点 1:采购列表为前端异步动态渲染,静态 requests 无法获取列表内容
问题:直接请求网页源代码只能拿到框架代码,采购条目由接口异步返回后 JS 渲染到页面,无法解析。
解决:使用 Playwright 真实浏览器引擎加载完整页面,等待页面完全渲染后再执行元素定位,确保 DOM 中存在完整采购条目。
难点 2:页面层级极深,XPath 路径复杂,容易因页面微小改动定位失效
问题:网站 DIV 嵌套层级过多,绝对 XPath 容错率低,子标签序号容易变动导致定位不到数据。
解决:采用父容器批量定位 + 内部相对 XPath 二次提取的写法,先拿到所有条目大盒子,再在每个盒子内部相对路径取标题、单位、时间,提升定位稳定性。
难点 3:预计采购时间拆分在两个不同 DIV 标签内,字段分散
问题:开始时间和结束时间分别在两

示例图片视频


不穿花秋裤
24小时内活跃
方向: 爬虫/脚本-爬虫/脚本、
交付率:100.00%
相似推荐
Python CSV/XLSX 表格自动化清洗工具
这是一个自主开发的表格数据清洗演示项目,面向需要重复整理 Excel、CSV 文件的办公场景。工具支持清除文本首尾空格、删除空白行、按照用户指定的列去除重复记录,并将处理结果保存为新文件,避免覆盖原始数据。用户通过命令行指定源文件、去重列和输出位置即可运行,适合客户名单、商品资料、订单记录等结构化表格的批量预处理。当前支持 CSV 和 XLSX 格式,后续可根据具体需求增加字段转换、表格合并和异常数据标记等规则。
多渠道餐饮外卖 SaaS 平台
本项目面向餐饮商户打造一站式外卖聚合管理 SaaS 系统。目标实现一个后台统一管理多家外卖平台订单、商品、配送、资金对账,降低商户多平台操作成本。核心模块包含多平台商品同步、外卖订单接收、第三方配送调度、支付与退款、财务对账、订单数据统计。业务流程:商户绑定美团、饿了么等外卖渠道,订单自动同步至后台;可选择平台自有配送或顺丰、达达等第三方运力;完成订单收款、退款流水记录,自动生成营业对账报表,服务数千家餐饮商户线上经营。
企业级网络终端设备远程管理系统-AVASA 云网管平台
一、立项背景与目标 痛点:传统网络设备(OLT/ONU/FTTR)只能局域网管理,远程运维困难;多系统割裂,认证、计费、AI训练各自为政。 目标:打造一套企业级远程网管平台,支持设备批量操作、实时监控、自动告警,集成认证计费与AI训练能力,覆盖Web/H5/APP三端,国内国际双版本,实现一站式智能运维。 二、核心功能模块 设备通信与管理:基于MQTT实现设备双向指令下发与状态上报,WebSocket实时推送,支持远程升级、配置批量下发。 多租户后台管理:组织-人员-角色权限管控,租户隔离;后台涵盖设备关联、合同审批、APP商品管理等。 Port认证与计费(RADIUS):支持手机号/账号/微信等认证方式,时长控制与自动断网,话单记录供对账。 AI算法训练平台:集成YOLOv5/MMDetection,支持数据集上传、在线标注、模型训练与自动分发至设备端。 三、业务流程简示 设备上线与配置:设备上电注册 → 平台存储状态 → 管理员选模板下发 → 设备执行并回传结果 → 前端实时展示。 告警处理:设备异常上报告警 → 消息队列分发 → 多渠道推送(邮件/短信/APP/弹窗)→ 运维处理并更新状态。 WiFi认证计费:用户连WiFi → 跳转认证页 → 验证身份 → 记录在线计时 → 时长耗尽自动断网 → 生成话单。 AI模型训练下发:选择模型 → 上传图片数据集 → 在线标注 → 提交训练 → 实时看进度 → 完成后FTP分发设备 → 设备升级生效。
大族贝金网页
传统实体企业、初创公司缺乏线上品牌展示渠道,通用模板网站同质化严重,无法匹配企业专属品牌形象与个性化业务展示需求,且模板网站功能固定,难以拓展留言、预约、产品在线咨询等经营功能。 本定制网站项目围绕客户企业品牌定位、主营业务、宣传需求进行一对一专属开发,目标打造独一无二的企业官方网站,完整展示企业品牌、产品案例、企业资讯、联系方式,同时搭建访客互动功能,实现品牌线上曝光、客户线索收集、线上形象宣传的核心目标,适配电脑、手机、平板全设备浏览。 2、软件功能、核心功能模块介绍 首页品牌展示模块:定制专属轮播大图、企业简介板块、核心业务分区、合作客户展示、底部联系栏,根据客户品牌视觉定制配色、排版,无模板复用; 产品 / 案例管理模块:后台可自主新增、编辑、删除产品图片、参数、详情文案,支持产品分类检索、图文详情展示、案例图集放大预览; 资讯新闻模块:企业动态、行业资讯发布管理,支持图文排版、文章分类,前端实现分页浏览、文章详情查看; 访客线索互动模块:在线留言表单、预约咨询表单,访客提交信息后后台实时接收,支持后台导出客户线索数据; 联系我们模块:展示企业地址、联系电话、微信二维码、百度地图定位,一键拨号、导航跳转; 网站后台管理模块:独立管理账号,权限分级,可视化修改网站文字、图片、轮播内容,无需代码基础即可自主更新全站内容; 移动端自适应模块:网站页面自动适配手机、平板屏幕尺寸,移动端优化按钮尺寸、图片排版,保证手机端浏览流畅美观。 3、业务流程、功能路径描述 网站后台更新流程:管理员登录独立后台→对应模块修改图文内容(产品 / 新闻 / 轮播图)→保存发布,前端网站实时同步更新内容; 访客浏览网站流程:访客通过电脑浏览器 / 手机微信、浏览器访问网站首页→自主切换业务、产品、新闻栏目浏览详细内容; 客户线索收集流程:访客浏览产品后点击咨询 / 预约按钮→填写姓名、电话、需求内容并提交表单→后台管理端即时收到访客提交的线索信息,管理员可查看、导出客户信息跟进对接; 企业宣传推广流程:企业将官网域名印在名片、宣传物料、短视频、社交平台引流,客户通过链接进入官网全面了解企业实力、产品服务,实现线上品牌获客。
流程引擎-流程引擎
内部审批系统,一体化管控审批全流程。支持一键同意、拒绝、撤回与转派,操作留痕,全程可溯。可视化流程图制作,直观呈现节点状态与流转路径,助力精准追踪与快速决策。让权力运行透明高效,赋能协作,提升组织整体效能。
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服