大数据 爬虫/脚本 软件定制 案例

程序聚合 软件案例 大数据 爬虫/脚本
动态网页数据抓取爬虫/工具-企业股票行情数据
立项背景与目标: 金融分析用户常需获取股市热门标的名单,但东方财富网数据为动态加载,手动复制效率极低。本项目目标是实现热门股吧榜单的自动化采集,输出结构化数据供后续分析使用。 软件功能: 输入目标接口地址,一键运行即可获取企业名称、股吧代码、行情代码三项核心信息,输出为UTF-8编码的纯文本表格。 核心功能模块: · 请求模块:模拟浏览器访问API接口 · 解析模块:提取JSON中指定字段 · 存储模块:写入本地TXT文件 业务流程: 用户双击运行脚本→程序自动请求接口→解析返回数据→提取三个字段→生成结果文件到当前目录。 功能路径: 下载脚本→确认网络通畅→双击运行→打开同目录下生成的文本文件查看结果
金融、大数据
Python、SQLite
贵州城市天气数据采集-黔城天气采集工具
立项背景与目标: 当前气象数据获取方式仍以人工查询为主,效率低且难以批量处理。本项目旨在通过自动化手段,实现对目标地区天气信息的快速采集与结构化存储,减少人工重复劳动,提升信息获取效率。 1. 数据采集模块:向目标网页发送请求,获取页面内容。 2. 数据解析模块:定位并提取温度、天气状况等关键字段。 3. 数据存储模块:将提取结果写入本地文件,便于后续查阅或导入其他系统。用户运行脚本 → 程序自动请求目标网页 → 解析天气数据 → 写入本地文件 → 完成采集。功能路径描述: 脚本启动 → HTTP 请求 → HTML 解析 → 字段提取 → 文件写入 → 结束运行
大数据、生活服务
Python、SQLite
百万级数据容器性能对比器
数据生成:生成百万级的学生数据(学号、姓名、成绩),以CSV格式存储。 数据加载:把CSV里的数据,分别加载到三种不同的数据结构里(vector、map、unordered_map)。 精确查询测试:随机生成一个学号,测试三种容器查询一个特定学生成绩的耗时。 范围查询测试:给定一个成绩区间(如80-90分),测试三种容器统计这个区间内学生数量的耗时。 性能对比结论:用高精度计时,对比三种容器在不同查询场景下的效率差异,得出选型建议。
大数据
C++、Linux
通用网页数据采集器--网页抓取导出Excel工具
立项背景和目标:市场调研、电商比价、行业数据收集等场景经常需要从网页提取结构化数据,人工复制粘贴效率低、易出错、无法复用。本项目目标是开发一款通用网页数据采集工具,一条命令完成"抓取→清洗→导出"全流程,让非技术人员也能轻松采集数据。 核心功能模块:① 智能抓取引擎——通过 CSS 选择器或表格定位自动抓取列表页与详情页数据;② 多页抓取——支持下一页按钮翻页、页码参数翻页、无限滚动三种模式,自动识别并防死循环;③ 数据清洗管道——自动去空白、字段映射、类型转换(支持金额千分位、日期等)、跨页去重;④ 断点续抓——SQLite 缓存已抓页面,失败任务自动进入重试队列,中断后可继续;⑤ 多格式导出——Excel(多 Sheet、自动列宽、表头样式、冻结首行)、CSV(UTF-8 兼容 Excel)、JSON。 业务流程:输入 URL 与选择器配置 → 逐页抓取(限速+重试)→ 数据清洗转换 → 去重 → 导出文件 → 生成抓取报告(成功/失败/耗时统计)。
大数据
Python、Beautiful Sou...
多平台情报扫描 + AI 分析摘要 + 报告自动投递管线(无人值守 30 天零故障)-多平台情报扫描管线
背景:多平台(知乎/小红书/豆瓣/微博)信息监控靠人工翻页,一天 2 小时起且容易漏,竞品动态和市场变化经常错过。功能:多数据源聚合搜索(权重排序)、定时抓取、AI 分析摘要、报告自动投递到聊天工具、失败重试 + 告警;支持自定义引擎权重和监控关键词。成果:每日自动跑 30 天零故障;单轮全平台扫描 7.6 秒 / 109 条结果;摘要含评分与评论数,直接可用于决策。
大数据
Python、Docker
51job招聘数据爬取
架构与技术栈 整体采用模块化 Python 爬虫架构,分为网页请求模块、页面解析模块、数据清洗模块、文件存储四大模块。核心技术使用 requests 库发送网络请求,BeautifulSoup 完成 HTML 页面标签解析,re 正则表达式做文本提取,pandas 库进行批量数据处理与 Excel 文件导出,通过 time 模块添加随机延时构建反爬策略。 个人负责内容与量化成果 本人独立完成全部代码编写与项目落地,定向抓取上海平面设计、深圳游戏设计两类岗位,累计抓取有效招聘数据 400 余条,完成 20 余项字段拆分、重复数据剔除、异常薪资格式修正,最终输出两份完整结构化 Excel 数据集,数据完整率达 98% 以上,可直接导入工具进行可视化分析。 难点与解决方案 难点 1:网站存在访问频率限制,短时间高频请求容易触发 IP 拦截。 解决:设置 1-3 秒随机请求间隔,模拟自然人浏览行为,降低访问风险。 难点 2:岗位薪资、任职要求为不规则长文本,格式混乱无法直接统计。 解决:编写正则匹配规则拆分薪资上下限、工作年限、专业技能关键词,统一数据格式;利用 pandas 重复值检测函数自动去重,提升数据集整洁度
大数据
Python
国家法律知识库爬虫 · 法信 API 逆向
把国家法律法规原文搬进个人知识库:官方页面是加密参数的单页应用,正文还是动态加载,普通爬虫根本抓不到。目标是不碰页面解析,直接批量拿到法律全文,自动归档成可检索、可引用的结构化知识库,支持按时效性快速筛选和长期维护。 独立开发者「糊糊小樱」,软硬通吃工作室主理人。使用 Python 完成网站接口逆向:绕过前端加密参数,直接调用官方后端数据接口,成功收录二十二条国家法律原文,全部为法律效力级别,并按时效状态自动分为五类归档,最终生成支持双向链接的检索索引,形成可长期使用的个人法律知识库。
大数据
Python、Requests、Beau...
优衣库销售分析
1、立项背景和目标 线下与线上多渠道服装销售产生海量订单、客群、地域、品类数据,原始 Excel 表格数据零散,无法直观定位销售高峰、热销品类、核心消费人群及区域差异。本项目目标:通过 BI 工具搭建一站式销售可视化驾驶舱,对优衣库全年销售数据进行多维度拆解分析,定位经营优势与薄弱板块,为库存备货、营销投放、产品选品提供数据支撑。 2、核心功能模块介绍 核心指标卡片模块:汇总展示销售总额、客户总数、订单总数、总利润 4 项关键经营指标,直观呈现整体营收规模; 时间维度分析模块:包含月度每日销售折线趋势图、星期维度销售额柱状图,分析淡旺季、周度消费波动规律; 地域销售分析模块:中国地图气泡分布图,以气泡大小和数值展示不同地区销售额贡献,识别高营收核心区域; 客群分层分析模块:环形图展示各年龄群体消费占比、柱状图区分男女客户销售额,精准刻画目标消费人群画像; 产品结构分析模块:横向条形图展示全品类产品销售额排名,明确爆款品类与滞销品类; 联动筛选模块:顶部设置日期区间、产品类别、年龄群体下拉筛选器,可一键钻取指定条件下全图表联动数据。 3、业务流程描述 整理清洗全年销售原始数据,梳理订单日期、下单地区、产品品类、客户年龄性别、营收利润等字段; 在 BI 工具中搭建数据集,分别配置指标卡、折线图、地图、环形图、条形图等可视化组件; 完成大屏整体布局排版,绑定全局筛选器实现所有图表数据联动; 运营人员可直接查看整体经营概况,也可通过筛选条件缩小分析范围,完成销量、客群、区域、品类多维经营分析。
大数据
MySQL Workbench
2015世界幸福报告
1、立项背景和目标 世界幸福报告包含各国幸福指数、人均寿命、GDP、区域健康得分等多维度海量数据,纯表格数据可读性差,难以直观对比不同国家、大洲之间的差异。本项目目标:基于 BI 工具搭建可视化分析看板,将 2015 年度幸福数据拆解为排名表格、柱状图、地图热力图等多类图表,直观展示全球幸福度分布、寿命与幸福度关联、区域得分差异,实现数据可视化解读与多维对比分析。 2、软件功能、核心功能模块介绍 数据基础展示模块:搭建两个排名数据表,分别展示全球国家幸福分数排行榜、各国健康预期寿命排行榜,支持排序查看 TOP 榜单; 地理分布可视化模块:通过世界地图气泡图展示各国 GDP 数值,以气泡大小直观体现经济体量地域分布; 区域维度对比模块:两组柱状图分别展示全球各大区域健康预期寿命得分、区域平均幸福分数,横向对比大洲间整体差距; 筛选交互模块:顶部配置地区、国家下拉筛选器,可单独查看指定区域、指定国家的全部指标数据,实现钻取分析。 3、业务流程、功能路径描述 导入 2015 世界幸福报告原始数据集,完成数据清洗、字段拆分(国家、地区、幸福分数、预期寿命、GDP、大洲分类); 按需创建 5 类可视化组件:排名表格、世界地图、两组区域柱状图; 将图表布局整合为完整可视化大屏,绑定顶部地区、国家全局筛选控件; 使用者可直接查看整体数据,也可下拉筛选指定地区,联动所有图表刷新对应数据,完成幸福度、寿命、经济的多维度分析。
大数据
MySQL Workbench
豆瓣top250-爬虫
本项目用于自动化采集豆瓣电影Top250榜单数据,包括电影名称和评分。通过定时或按需运行,可快速获取当前热门高分影片列表,为影迷选片、影视行业市场分析、口碑监测及长期榜单变化跟踪提供参考。系统支持分页遍历全部250部影片,数据准确度高,且代码结构清晰,易于扩展至其他榜单(如分类排行)或增加更多字段(如导演、主演、短评数),满足轻量级数据采集与分析需求。
大数据、音视频
Python、ScraperAPI、Sc...
猫眼榜单爬虫
本项目面向电影行业数据监测场景,旨在自动化采集猫眼专业版实时票房榜单,覆盖影片排名、综合票房、票房占比及排片场次等核心指标。系统可替代人工手动查表,支持高频定时抓取(如每1分钟执行一次),为影院排片、宣发策略调整、竞品分析提供及时、准确的数据依据,帮助从业者快速洞察市场动态,提升决策效率。同时,结构化存储的数据便于后续进行票房趋势分析、影片生命周期研究和档期效果评估。
大数据、搜索
Python、ScraperAPI、Sc...
大数据政策-爬虫
本项目是一个面向政策信息网站的智能爬虫系统,专注于自动采集与“航空航天”产业相关的政策文件、通知公告、工作动态等公开信息。系统通过模拟用户登录、处理动态加载内容,抓取政策的标题、正文、发布网站、技术领域和发布时间等核心字段,并将数据结构化存储至Excel表格中,便于后续的政策分析、趋势研判和产业研究。该工具可有效替代人工检索,大幅提升信息获取效率,为政府决策、企业规划及学术研究提供及时、全面的政策数据支撑。
大数据、搜索
Python、ScraperAPI、Sc...
toc大规模爬虫与数据分析
1、爬取诗词库两百多万首诗歌以及作者相关信息,进行情感分析与作者履历分析 2、使用代理爬虫,实时监控负载情况动态调整爬虫线程数,确保对目标网站无性能影响。基于大模型对诗词进行情感分析,以及提取人物履历分析。
大数据
Python
电商商品数据采集与分析系统
商品数据采集 → 数据清洗 → 多维统计分析 → 专业Excel报表自动生成 功能介绍 多页商品数据自动采集,支持请求间隔与反爬对抗 数据去重、异常值清洗、格式标准化处理 多维度统计分析:价格分布、销量排行、评分对比、分类占比 双Sheet Excel报表输出:商品明细页 + 数据概览页 热销商品自动高亮、条件格式、自适应列宽
电商、大数据
Python、Pandas、Reques...
跨境网络赌博案
使用工具:MySQL、SQL Server、PyCharm、WPS 自2010年公安机关开展网络赌博专项整治以来,打击力度持续加大。2019—2023年初疫情导致网络赌博激增,我司配合多地公安机关成立专案组,提供全链条数据技术支撑。 一、数据采集与入库 将渗透爬取的赌博网站后台数据(会员、充值提现、代理关系、佣金等多表)导入MySQL,梳理表结构及关联关系,绘制ER图。针对银行反馈的千万级流水数据,编写Python分块清洗脚本(chunk_size=10万行),完成去空格、日期格式化、金额校验、去重等操作,通过LOAD DATA LOCAL INFILE批量导入,效率提升数十倍。 二、赌客与代理分析 数据量<100万时,使用Excel的VLOOKUP/XLOOKUP快速匹配代理与会员;数据量>100万时,编写MySQL复杂查询(多表JOIN+窗口函数)提取代理信息、名下会员、佣金等。对平台工作人员的支付宝流水,通过转账备注、周期性规律、虚拟币兑换记录挖掘关联人员。 三、资金穿透与跑分团伙识别 通过赌客银行卡流水进行资金追溯,向上找出出款卡、向下找出入款卡,对多张赌客卡的共同转入/转出方做聚合分析,标记疑似跑分卡并上报申调,确认后整理涉案金额及日期,最终冻结划扣。通过Python调用区块链浏览器API追踪虚拟币资金去向,识别混币和变现行为。 四、涉案人员档案制作 根据各地公安申调模板差异,持续维护Python代码,批量生成标准化银行卡申调表。整合代理信息、会员、佣金、涉案金额、关联账号等,生成代理“一人一档”。针对不同类型跑分卡,批量生成冻结“一卡一档”审批表。对代理个人卡流水全面分析,统计提现金额、消费水平、合法收入,判断其退赃退赔能力。 五、成果输出 制作包含涉案金额汇总、资金流向图、代理层级图的可视化报表,配合抓捕行动提供数据落查支撑,案件收网后完成全量审计,形成完整证据链。 以上为项目核心技术实现,全程为公安机关打击网络赌博提供高效、精准的数据支撑。
大数据
Python、SQL、MySQL
顶流电商平台数据采集和价格监控
1.随着电商行业竞争白热化,某日化品牌客户面临竞品价格变动快、促销策略滞后、库存监控缺失等痛点。为辅助其动态定价决策,本项目立项建设一套分布式电商数据采集中台。核心目标是实现竞品SKU价格、促销活动、评论情感及库存状态的实时监控与趋势分析,将数据获取时效从人工每日核查提升至分钟级自动化采集,为运营团队提供精准的数据弹药。 2.系统包含四大核心模块:任务调度中心(支持定时/触发式采集任务配置)、多源适配器(针对不同平台封装独立解析引擎)、反爬对抗层(集成动态代理池与验证码识别服务)、数据治理管道(完成去重、格式标准化与异常预警)。各模块松耦合设计,支持水平扩展。 3. 运营人员在管理后台创建采集任务(设定目标URL、采集字段与频次)→ 调度中心下发任务至爬虫集群 → 适配器执行采集并实时对抗反爬 → 原始数据进入清洗管道 → 结构化数据存入MongoDB,同时价格波动触发钉钉告警 → 最终数据通过API同步至客户BI看板,完成从需求到决策的闭环。
大数据、电商
Python、Selenium、Sele...
批量数据清洗与标准化工具-Data Cleaning & Standardization Toolkit
立项背景:客户拥有来自多个渠道的客户信息数据(CSV/Excel),格式混乱、存在大量重复和错误数据,无法直接用于分析和营销。 核心功能: 1. 导入多个 CSV/Excel 文件,自动识别列结构和数据类型 2. 去重逻辑:基于姓名+手机号模糊匹配,合并重复记录 3. 格式标准化:统一日期格式、电话号码格式、地址补全 4. 异常值检测:自动标记超出正常范围的数据项 5. 输出清洗后数据 + 清洗报告(哪些数据被修改/删除及原因) 处理 10000 行数据仅需约 30 秒。
企业服务(saas)、大数据
Python、NumPy、Pandas
Excel 自动化报表生成系统-Automated Excel Report Generator
立项背景:客户每周需要从原始 CSV 销售数据手动制作 Excel 周报,包含汇总统计和图表,每次耗时 2~3 小时。 核心功能: 1. 拖拽 CSV 文件,自动读取数据 2. 自动计算销售额、订单量、客单价等 KPI 3. 生成柱状图(月度趋势)和折线图(日销售额) 4. 输出多 Sheet 工作簿:Dashboard 总览 + 数据明细 + 汇总分析 5. 脚本可复用,换新的 CSV 数据直接重新生成报表 交付后客户制作周报的时间从 2 小时缩短为 5 分钟。
企业内部管理、大数据
Python、NumPy、Pandas
网页数据采集与导出工具-E-commerce Data Scraper
立项背景:客户需要从多个电商网站批量获取商品信息(名称、价格、评分、库存),但手动复制粘贴效率极低且容易出错。 核心功能: 1. 输入目标网址和要抓取的数据字段 2. 自动遍历分页,逐页提取商品数据 3. 数据自动去重和格式标准化 4. 输出为 CSV/Excel/JSON 文件,可直接用 Excel 打开 5. 支持断点续传,中断后从上次位置继续 适用于电商商品监控、竞品分析、企业名录采集等场景。
电商、大数据
Prolog、Beautiful Sou...
数智平台
数字经济持续深化,全域多渠道经营已成电商商家主流模式,淘宝、京东、拼多多、抖音、快手等平台独立搭建数据体系,各后台指标口径、字段格式、结算规则互不统一,形成大量数据孤岛。商家需跨多后台导出报表人工汇总,运营、财务对账成本高、数据滞后且误差频发,无法直观掌握全渠道营收、库存、投放 ROI 整体情况,品牌难以开展全域用户分析与竞品对标决策。伴随数据要素市场化政策落地,企业数字化经营需求持续攀升,跨平台数据打通、统一清洗、可视化分析的刚需快速释放,叠加 API 接口、大数据处理技术成熟,可一站式整合全渠道经营、竞品、流量数据的电商数据聚合平台迎来广阔发展空间,成为品牌实现全域数字化管理、精细化运营的核心基础设施
电商、大数据
Java、SQL、FastAPI、Vue
  • 1
  • 2
  • 3
  • 4
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服