程聚宝
程序员
软件外包公司
项目案例
发布需求
人才入驻
登录
注册
原"程序聚合"
工作台
程序员
软件开发公司
软件案例
发布需求
开发者入驻
帮助文档
小程序
登录
注册
原“程序聚合”
内容平台 爬虫/脚本 软件定制 案例
行业:
全部
电商
企业内部管理
社交
在线教育
金融
旅游
云计算
医疗健康
人工智能
物流仓储
外卖跑腿
企业服务(saas)
物联网
VR/AR
区块链
内容平台
出行
安全
人力资源/HR
大数据
广告营销
农业
搜索
音视频
生活服务
汽车
游戏/电竞
工业互联网
智慧数字孪生
能源
零售/新消费
政务服务
房地产
展开
收起
载体:
全部
安卓APP
IOS APP
网站
小程序
H5
爬虫/脚本
插件
游戏
Windows应用
Mac应用
嵌入式软件
硬件
电视应用
云服务/云平台
算法模型
框架或代码包
车载应用
操作系统
鸿蒙应用
展开
收起
程序聚合
软件案例
内容平台
爬虫/脚本
分类筛选
分布式爬虫与代理池系统-distributed_crawler
1、立项背景和目标:单机爬虫在面对大规模数据采集时存在效率瓶颈和IP被封风险。本项目目标是构建一个支持多机协作的分布式爬虫系统,集成代理IP池实现自动IP轮换,解决反爬限制下的批量数据采集问题。 2、核心功能模块:①代理池模块从多个免费代理网站爬取IP,通过20线程并发验证可用性,基于分数机制自动淘汰劣质代理(初始100分,成功+1,失败-10,归零删除);②分布式爬虫基于Scrapy-Redis实现多进程共享URL队列,支持断点续爬和自动去重,共采集999条图书数据;③代理中间件每个请求自动从代理池API获取代理IP,使用后反馈结果调整分数;④监控面板实时展示代理池状态、爬取数据统计和评分分布图表。 3、业务流程:代理池爬取IP→多线程验证→Redis存储打分→爬虫从Redis队列取URL→代理中间件自动加IP→请求目标网站→数据存入MongoDB→Streamlit面板实时监控。代理池API提供6个HTTP接口供爬虫调用,去重1049个URL,队列剩余0个。
电商、内容平台
Python、MongoDB、Redis...
当当图书爬虫与数据服务系统-books_api
1、立项背景和目标:电商图书数据分散在各平台接口中,缺乏统一的数据采集与查询方案。本项目目标是从当当网电子书频道批量采集图书数据,构建从爬取到查询到可视化的完整数据服务管线。 2、核心功能模块:①爬虫模块负责从当当网JSON接口抓取书名、价格、封面图片等字段,支持自动翻页;②API服务模块提供分页查询、关键词搜索、价格筛选、统计聚合4个RESTful接口;③可视化面板模块展示图书总数、均价、最高/最低价等指标卡片,支持实时筛选和价格分布图表。 3、业务流程:启动爬虫→解析JSON接口提取数据→下载封面图片→存入SQLite数据库(幂等去重)→通过FastAPI对外提供查询接口→Streamlit面板读取数据库生成可视化报表。共采集1017条图书数据,价格区间¥0.36~¥2480。
电商、内容平台
Python、FastAPI、Panda...
BiliBili话题播放量排行榜
本项目属于内容创作辅助工具领域,服务于 Bilibili 平台的 UP 主群体。Bilibili 作为国内领先的视频社区,拥有数百万活跃内容创作者,平台每月推出数百个创作活动和征稿话题。UP 主需要在海量话题中快速识别高流量、高参与度的活动,以便合理分配创作资源。目前市场上缺乏专门针对 Bilibili 话题数据聚合和管理的桌面端工具,大多数 UP 主依赖手动浏览网页或使用简易脚本,存在数据获取不全面、管理混乱、操作繁琐等问题。本工具填补了这一市场空白,为 UP 主提供专业的话题数据洞察和管理能力。 本工具的核心价值在于将分散的 Bilibili 活动话题数据进行聚合、分析和可视化展示。通过一键同步功能,UP 主可以在数分钟内获取平台上千个活动话题的完整数据,并通过播放量排行快速锁定高价值话题。工具还支持话题状态跟踪,自动标记活跃和已结束的话题,帮助 UP 主把握参与时机。本地 SQLite 数据库确保持久化存储,历史数据可随时查询对比。整体设计注重数据密度和操作效率,采用暗色主题降低长时间使用的视觉疲劳,虚拟滚动技术确保大数据量下的流畅体验。
内容平台、搜索
Rust、reqwest、React、S...
arch桌面-end4
在Arch Linux下,我深度定制了Hyprland桌面环境,从零编写Dotfiles管理配置,集成Waybar状态栏、Wofi应用启动器、swaybg动态壁纸,并配合系统级色彩方案(如Catppuccin)实现全局统一视觉。为了兼顾美观与效率,我优化了窗口动画、快捷键映射和工作区布局,将日常开发、调试、文档查阅等流程整合进同一工作流中。这套配置不仅让我每天工作心情愉悦,更锻炼了我对Linux底层、Wayland协议以及性能调优的实战能力,体现出我对细节和工程体验的极致追求。
内容平台
SQLite
省市级政府采购招标公告 API 逆向与批量采集系统
本系统实现两套省级政府采购平台的招标公告全自动采集: 福建省平台(ggzyfw.fj.gov.cn):MD5 请求签名破解 + AES-CBC 响应解密 广东省平台(ygp.gdzwfw.gov.cn):双源 API 架构(门户列表+源平台详情) 总计采集 2000+ 条公告,每条包含项目名称、招标编号、招标人、招标代理、 合同估算价、投标/开标截止时间、公告正文全文等完整结构化字段。 可用于招投标信息整合、竞争对手分析、供应链情报等商业场景。
内容平台
Python
网页数据监控采集系统-Python爬虫
为客户开发的竞品价格自动监控工具。解决人工每天刷新网页看价格的痛点。脚本定时抓取指定网页的商品价格数据,自动对比历史记录,价格发生变动时通过邮件或即时通讯发送告警通知。支持配置多页面、多字段监控,可自定义检查频率和监控规则。数据自动存储到本地数据库,支持历史趋势查询和数据导出。交付完整源码、配置文件和使用说明,客户至今稳定运行中。
电商、内容平台
Python、Beautiful Sou...
智慧知识社区
立项背景和目标:面向开发者群体打造一站式技术知识社区,解决技术人员在学习进阶、项目实战、资源获取中信息分散、质量参差不齐的痛点。目标是构建高活跃、高质量的技术内容生态,汇聚开发者群体,提供文章分享、资源下载、定制开发三位一体的服务平台。 软件功能、核心功能模块:核心模块包括①博客文章系统 —— 支持技术文章发布、分类检索(后端 / 前端等标签)、最新发布列表与详情浏览;②资源下载中心 —— 提供开发工具、源码、教程等技术资源下载;③程序订做服务 —— 承接 C/C++、Java、Python、小程序、安卓等多方向的定制开发需求;④用户与会员体系 —— 注册登录、会员中心、有效期管理与增值权益;⑤站点数据看板 —— 实时展示浏览总量、注册人数、今日更新等运营数据。 业务流程、功能路径描述:访客进入首页可直接浏览最新文章与站点概况,通过导航栏切换博客、资源、订做等板块;注册登录后解锁发布文章、下载资源、提交定制需求等权限;会员用户享受专属资源与优先服务;程序订做流程为用户提交需求 → 客服对接评估 → 开发交付 → 售后支持,形成完整的内容消费与服务闭环。
人工智能、内容平台
Spring Boot、Vue、Dock...
垂直网络文学(悬疑/规则怪谈)创作逻辑大纲管理系统-创作逻辑大纲管理系统
本系统是针对长篇垂直领域小说(如悬疑、规则怪谈、无限流等)创作团队或工作室定制的剧情脉络与核心设定管理系统。主要解决长线文学创作中规则设定繁杂、伏笔过多容易导致剧情逻辑崩溃、前后矛盾的痛点。系统提供核心规则冲突校验、多线叙事线索追踪、核心人设库管理等业务功能。
企业服务(saas)、内容平台
Python、SQL、TypeScrip...
爬虫脚本-爬虫
自动获取建筑社多页面数据,并进行多次的核心数据获取,同时将数据存放入表格中方便后续数据分析,可自行选择删改数据,并且可跟随网站的数据页面变更获取更多页面的数据可根据自身意愿清除添加数据。
内容平台
Selenium
抖音用户数据采集与分析系统 - douyin-user-scraper
抖音用户公开数据自动化采集系统 1.支持用户对关注主页的信息抓取 2.签名逆向破解、反爬绕过、数据清洗与结构化输出,用户指定输出格式存储 3.累计完成 589 条实战数据采集,支持批量处理和增量更新
内容平台
Python、FastAPI、Postg...
学习网页开发,翻译软件开发以及管理系统开发
1. 学习网网页开发(大创项目) 项目描述:面向程序员、学生及技术爱好者的一站式在线学习平台,作为大学生创新创业训练计划项目核心成员。 核心职责:担任前端开发负责人,主导视觉化设计与交互逻辑实现。 技术落地:基于 Vue 3 和 Node.js 技术栈,独立完成了从登录注册鉴权、主页面架构到各子功能模块的开发。 项目成果:完善了页面功能与内容生态,实现了高保真的视觉还原,显著提升了用户的学习体验与页面交互流畅度。 2. 智能翻译软件开发 项目描述:专为学生群体打造的高效辅助翻译工具,旨在解决多场景下的语言转换需求。 核心职责:负责后端架构与接口集成,打通多模型调用链路。 技术落地:利用 FirstAPI 聚合了多个主流大语言模型(LLM),并成功接入某知名翻译软件的成熟接口。 项目成果:实现了多模型并发调用与结果优选,保证了翻译的高准确率与响应速度,有效满足了学生群体的日常使用需求。 3. 综合管理系统开发(人力资源/校内教学) 项目描述:涵盖人力资源与校内教学管理的综合性后台系统,旨在提升管理效率与数据同步能力。 核心职责:担任系统开发主负责人,全权负责后端核心逻辑编写与数据库设计。 技术落地:采用 Java 结合 MySQL 的传统稳健架构,实现了复杂业务逻辑的数据处理与持久化。 项目成果:系统功能完善,界面普及度高且交互友好;经测试,系统具备优异的数据同步性,低时延、高性能,整体运行稳定性达到优秀标准。
内容平台、人力资源/HR
Java、JavaScript、Node...
数据获取
跨境物流公司的信息收集 客户是做跨境电商服务的,需要联系跨境目标国家靠谱的物流公司的相关情况,以供公司进行下一步商务活动,在目标网站获取以下相关信息 公司名称 公司地址 公司网址 联系电话 负责人名字
内容平台
Python
基于Python的可视化影视信息-Python
业务目标1. 循环遍历电影列表 遍历提前解析好的电影节点列表 movieItemList ,为每一部电影单独创建空字典 movieDict ,用来单条存储一部电影的全部字段。 2. XPath精准提取网页数据 通过XPath语法,从网页节点中定位并抓取4类核心信息: - title :电影主名称 - otherTitle :电影别名/其他译名 - link :电影详情页URL链接 - star :电影评分 - quote :电影短评/经典一句评语 3. 数据清洗与字典封装 - 合并主标题+别名,拼接为完整电影名称存入字典 - 把链接、评分、评语依次存入字典对应key - 打印单条电影字典,做运行调试校验 - 把单条字典追加进全局电影列表 movieList 批量抓取豆瓣电影列表页的电影信息,提取标题、链接、评分、经典评语,最终规整保存到本地 doubanMoive.csv 表格文件,方便后续查看、统计与数据分析。
内容平台
Java、JavaScript、Pyth...
n8n + AI 内容抓取与自动分发-AI内容抓取与自动分发工作流
本项目基于n8n工作流引擎,构建了一套从热点监控到内容再加工再到多渠道分发的全自动流水线。立项背景是新媒体运营团队每天需手动刷知乎、微博、36氪等平台找热点,手工改写后分发到微信群/飞书/公众号,效率极低。 核心功能: 1. 定时热点抓取:每30分钟自动抓取知乎热榜、微博热搜、36氪快讯等多平台内容。 2. AI内容再加工:GPT对原始内容进行摘要提取、去重过滤、风格改写(支持多种文风模板)。 3. AI配图生成:ComfyUI Stable Diffusion 根据文章主题自动生成配图。 4. 质量过滤:AI评分机制,低于0.7分的内容自动丢弃,避免低质信息轰炸。 5. 多渠道推送:对接企业微信群机器人、飞书、钉钉等多渠道一键分发。 6. 异常告警:单节点失败自动重试3次,连续失败推送告警至运维群。
内容平台、广告营销
PostgreSQL、Redis、Ten...
内容管理与自动化发布平台
该项目实现了微信公众号文章的全流程自动化发布,包括内容生成、配图制作、编辑器操控和定时发布。 立项背景:客户运营多个微信公众号,每周需要发布3-5篇文章,传统方式下需要手动排版、插入图片、设置封面、保存草稿,单篇耗时1-2小时。需要一套自动化系统大幅提升发布效率。 核心功能模块: 1. AI内容生成:基于关键词和大纲,通过DeepSeek等大模型自动生成2000字以内的文章正文 2. 智能配图:集成DashScope图片生成API,根据文章主题自动生成中文技术配图 3. CDP浏览器操控:通过Chrome DevTools Protocol直接操控微信公众号后台编辑器,实现标题填写、正文写入、图片上传、样式排版的全自动化 4. 封面设置与草稿保存:自动从正文选取封面图,保存为草稿供人工审阅后发布 业务流程:提供文章主题/大纲 → AI生成正文 → 自动生成配图 → CDP打开公众号后台 → 自动填充编辑器 → 上传图片 → 保存草稿 → 人工审阅发布。
内容平台、零售/新消费
Python、SQLite
掘⾦技术社区⽂章索引
随着掘金社区技术文章数量快速增长,用户手动筛选特定关键词(如 “AI”)的相关文章效率极低,难以快速获取目标领域的优质内容。本项目旨在开发一款自动化爬虫工具,通过模拟浏览器访问、动态加载页面、关键词过滤与数据整理,帮助用户批量获取并结构化存储符合需求的技术文章,大幅提升信息检索效率,为学习研究提供数据支持。 本工具基于 Python 开发,核心功能分为三大模块:①动态页面爬取模块,通过 SeleniumBase 模拟浏览器滚动加载,完整获取掘金后端板块的文章列表;②数据解析与过滤模块,使用 BeautifulSoup 解析 HTML,提取文章标题、作者、发布时间、阅读量等信息,并按用户设定的关键词进行不区分大小写的匹配筛选;③数据存储模块,通过 Pandas 将筛选后的结果去重并导出为 Excel 文件,方便用户后续查看与分析。 工具运行时,首先启动自动化浏览器访问掘金目标板块,通过多次模拟滚动触发页面加载,获取完整的页面源码;随后解析 HTML 中的文章条目,提取关键信息并按关键词规则过滤;接着对重复文章标题进行去重处理,确保数据唯一性;最后将清洗后的结构化数据整理为表格形式,保存为 Excel 文件并提示文件路径,用户可直接打开文件查看所有匹配结果。
内容平台
Beautiful Soup、Panda...
欧冠小程序
欧冠小程序是面向全球欧冠球迷的一站式足球服务平台,聚焦欧冠联赛全周期服务,整合赛事资讯、实时数据、互动社区、周边商城、会员权益于一体,依托微信生态即用即走,满足球迷“看赛、聊球、玩竞猜、买周边、享专属福利”的核心需求,打造轻量化、高体验的官方球迷服务入口。
内容平台
C++、Python
企业舆情saas
1.立项背景和目标: 当前网络信息传播极速扩散,传统人工舆情监测存在覆盖不全、响应滞后、分析低效等问题,企业机构机构亟需轻量化、可弹性扩容的舆情管理工具,打造全国企业舆情 SaaS 系统。 2.软件功能,核心功能模块的介绍 a).账号权限认证系统(经root账号/自动 进行权限分配 包含页面、按钮、功能) b).数据获取(入池前,经python、java等其他语言进行各平台基础数据获取) c).数据清洗(入池前,对个平台重复数据进行清洗,此轮进行舆情标注三类:正面、中性、负面 四级: 一般 关注 重点 紧急,舆情类别判断 民生、政治、企业、谣言等) d).数据入池(入池,将通过初次数据清洗数据进行入池) e).根据账号权限、要求获取数据(二次清洗) 3.主要流程: 企业: 账号购买功能鉴权(线下购买,线上开启权限) -> 设定舆情点 -> 使用 我司: 线下磋商 -> 成功后提供注册地址 -> 注册后开启部分权限(自动、手动两种方案) 网站: 数据采集 -> 数据首次清洗 -> 入池 -> 数据二次清洗 -> 查询报送(舆情报告)
企业服务(saas)、内容平台
Java、Python、Elastics...
云南省建设监管公共服务平台企业数据采集(滑块校验 + 加密参数逆向 + Excel落地)
- Python:requests.Session(会话维持/接口请求)、pandas(Excel导出) - JS逆向与复用:execjs 调用本地 JS(复用站点加密逻辑) - 加密算法:RSA(JSEncrypt 分段加密生成 params)、AES(CryptoJS AES-ECB + Pkcs7,用于滑块点位与验证码头) - 风控处理:滑块验证码 blockPuzzle 识别(打码平台返回滑动距离 x)、二次校验后换取业务数据、翻页抓取与去重 - Python爬虫 / 接口采集 - JS逆向 / 加密参数还原 - AES/RSA 加解密 - 验证码对抗(滑块) - Session会话保持 - 数据清洗与表格落地(Excel) - 业务背景:住建监管类平台对企业信息查询接口做了参数加密与滑块校验,常规爬虫无法直接批量获取。项目目标是实现企业分页查询数据的自动化采集与结构化导出,用于企业库分析/数据归档。 - 核心功能: - 企业列表分页采集:按 pageNum/pageSize 拉取企业 records - 反爬突破:还原前端加密参数(RSA/AES)与滑块验证码校验链路 - 稳定采集:requests.Session 维持校验后的状态;企业名称去重避免重复写入 - 交付产物:字段统一清洗后导出 Excel(示例文件为“云南企业数据.xlsx”)
内容平台、政务服务
JavaScript、Python、Pa...
赢商大数据项目库采集与结构化落地
- Python爬虫 - Web自动化/浏览器爬虫 - 动态渲染采集 - Scrapy工程化采集 - 数据清洗与结构化存储(CSV/表格) - 反爬处理/登录态维持 - 业务背景:对商业地产行业数据进行汇总分析,需要批量获取赢商大数据平台的项目库信息,形成可分析的数据集(项目维度字段齐全、可导入Excel/BI)。 - 核心功能: - 项目列表翻页采集:按页获取项目入口链接,支持配置页数批量抓取 - 项目详情解析:进入详情页抽取关键字段并做字段名清洗与映射 - 采集稳定性:动态渲染等待、限速控制、低并发策略减少风控触发 - 数据落地:按统一字段写入 CSV,支持追加写入与断点续跑
内容平台、大数据
Python
1
2
帮助文档
Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服
微信扫一扫直接聊
无需加好友