程序聚合 软件案例 Python自动化数据处理脚本集(Excel / 网页采集 / PDF提取)

Python自动化数据处理脚本集(Excel / 网页采集 / PDF提取)

2026-07-09 14:12:03
行业:电商
载体:爬虫/脚本
技术:Python

业务和功能介绍

本项目是一个Python自动化脚本工具集,覆盖三类最常见的办公数据处理场景,旨在替代人工重复操作、提升数据整理效率。

【模块一:Excel批量合并与清洗】
业务场景:企业每月产生多份结构不统一的销售/运营报表,手工合并耗时且易出错。
功能:自动遍历读取多个Excel文件 → 合并为单一汇总表 → 清洗空值、重复行、异常格式 → 输出按维度的汇总统计(月度/产品/人员)。

【模块二:公开网页数据采集与整理】
业务场景:需要定期从公开网页获取结构化信息(如行业资讯、商品列表、政策公示),手工复制粘贴效率低。
功能:模拟浏览器请求 → 解析HTML提取目标字段(标题、作者、标签等)→ 翻页自动遍历 → 输出为CSV文件,可直接导入Excel或数据库。

【模块三:PDF信息提取】
业务场景:企业收到大量PDF格式的发票、合同、报表,需要提取关键字段录入系统。
功能:读取PDF文档 → 定位并提取日期、金额、编号等关键信息 → 汇总输出为Excel表,替代手工逐一录入。

全部脚本采用模块化设计,修改少量配置参数即可适配不同客户的数据结构,交付周期1-2天。

项目实现

【Demo 1:Excel批量合并与清洗】
输入:模拟生成的5个月度销售数据Excel文件,分布在 `sample_data/` 目录下。包含正常数据行、含空值的行(产品名称为空、销量/单价缺失)以及一个故意复制的重复月份文件,用于测试去重和清洗逻辑。
处理流程:
1. 使用 Path.glob 遍历读取所有 .xlsx 文件
2. 使用 pd.read_excel 逐个读取,并为每行标记来源文件名
3. 使用 pd.concat 合并所有DataFrame
4. 使用 drop_duplicates 去重,dropna 清洗全空行和关键列为空的行
5. 按月份+产品维度分组汇总,计算合计销售额
6. 使用 df.to_excel 输出结果文件
输出:单个格式统一的Excel文件 `合并清洗结果.xlsx`,包含清洗后的完整明细数据。
关键代码量:约200行,核心处理逻辑约50行。

【Demo 2:公开网页数据采集】
目标站点:quotes.toscrape.com(专为爬虫学习设计的公开站点,符合 robots.txt 允许规则)。
处理流程:
1. 使用 requests 发送GET请求,设置 User-Agent 模拟浏览器
2. 使用 BeautifulSoup(优先lxml、回退html.parser)解析HTML,CSS选择器定位目标元素
3. 循环翻页(自动检测"Next"按钮是否存在),每次请求间隔1秒
4. 使用 csv.DictWriter 将结构化数据写入CSV文件(UTF-8 BOM编码,兼容Excel直接打开)
输出:`采集结果_名人名言.csv`,包含名言、作者、标签、作者链接、采集时间等字段。
合规措施:已检查 robots.txt、设置请求间隔、仅采集公开数据、脚本头部标注法律边界注释。

【Demo 3:PDF信息提取】
输入:使用 reportlab 自动生成3张模拟发票PDF文件,分布在 `sample_invoices/` 目录(如生成工具不可用则自动回退到内置数据演示模式)。
处理流程:
1. 使用 pdfplumber.open 逐页读取PDF
2. 正则表达式匹配提取:发票号、日期、客户、品名、数量、单价、金额等字段
3. 异常处理:匹配失败时填入空值,不中断整个流程
4. 使用 pandas.DataFrame 汇总所有发票数据
5. 输出为格式化的Excel文件
输出:`发票提取结果.xlsx`,每行一张发票,列含发票号/日期/金额/客户名称/品名/文件名/采集时间。
关键代码量:约350行(含PDF生成),核心提取逻辑约80行。

示例图片视频


锁游林迹象
30天前活跃
方向: 后端-Python、低代码-低代码、
交付率:100.00%
相似推荐
聚合支付系统
该项目是通过对接不同的上游支付渠道,封装被扫/主扫支付、订单查询、支付异步回调、退款等全套HTTP接口。映射出不同的支付场景,例如POS机收款、商店收款码、商户收银插件、微信公众号、微信小程序等 商户进件成功后可以建立不同的门店,门店下可以新增店长店员。门店收载后店长可以查询门店交易信息,商户可以查询所有门店交易信息等等
量化
核心要解决的是加密货币量化交易的痛点: 人工盯盘不可持续 — 7×24 小时行情,人不可能实时做技术指标计算 + 风控 + 下单。 策略无法自动进化 — 传统量化策略写死参数后不会自我迭代。 赛道:加密货币衍生品 三模式运行:read_only(只读模拟)/ demo(模拟盘,自动加 x-simulated-trading)/ live(实盘,强制过安全检查清单)。
内部-宁波银行对公营销决策系统
该项目是宁波银行自己的名为星云平台中的脚手架搭建的微服务项目,本系统包含7个微服务分别 是:数据集服务、标签服务、客户群服务、决策服务、触点服务、事件服务、工单服务。整体是的数据集跑批到每个标签,客户群中配置每个客户群所包含的标签,用户主要在决策的画布中配置营销模型,包含决策所属的客户群,发放的权益种类、发放的时间和频率、发放后续的处理。主要用于银行在做一些业务推广时,需要通过发奖的方式达到宣传效果。会针对不同权益奖品所用到的不同的发放规则,发放客户群,发放时机落地到每一个策略中,以达到业务需求。
C++高性能量化回测系统-QuantPilot
面向个人投资者的A股策略回测平台,解决"策略上线前无法验证"的痛点。 核心功能:①双均线、动量、网格三类内置策略模板,支持参数化配置;②基于真实历史行情的逐笔撮合回测引擎;③收益曲线、最大回撤、夏普比率等绩效指标自动计算与可视化报告。使用流程:导入行情数据→选择策略配置参数→运行回测→查看绩效报告,全程无需编程基础。
某金融风控和模型系统
1. 风控决策引擎的研发与优化(核心主线) 这是我工作中最核心、贯穿始终的部分。我负责开发和维护机审规则引擎,它决定了贷款申请能否通过审批。具体工作包括: 开发了大量风控规则,例如:经纬度反欺诈规则、AppListName规则、银行卡信息核验、内部人脸黑名单(百度接口)、多平台共债规则、首复贷进件限制、逾期天数限制等。 主导了机审规则的两次大版本优化(2021/2/18-3/10),大幅提升了规则执行的效率与可维护性。 引入了RocketMQ,将风控规则调用、埋点数据上报等改为异步解耦,提升了系统吞吐量。 2. 多国支付网关对接(关键业务闭环) 我独立负责了泰国、尼日利亚、印尼等多个国家的支付渠道对接,完成了从支付下单、回调验签到放款、还款的完整闭环。其中: 尼日利亚支付是你投入时间最长的模块之一(持续从5月到7月),涉及Paystack渠道的深度集成,包括USSD还款、BVN(银行验证号)验证、核销对账等复杂业务。 我解决了多个生产环境的关键问题,如还款数据重复写入、姓名验证BUG等,保障了资金安全。 3. 电销与催收管理系统的功能开发 你为越南/菲律宾市场开发了电销名单自动分单系统,包括案件分配、回收时间逻辑、意向客户标记、拨打任务查询等功能,提升了贷后转化效率。同时,也涉及催收系统的部分功能(如手动分配催收订单)。 4. 数据模型与报表支持 我配合风控模型团队,将多个模型分(菲律宾模型02、越南H5模型、越南模型11/13、贷中评分卡模型等) 落地到系统中,并根据模型结果进行风险定价和档位评定。同时,我为运营提供了大量数据支持(如商户对账单、跑马灯SQL优化等)。
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服