搜索 爬虫/脚本 软件定制 案例

BiliBili话题播放量排行榜
本项目属于内容创作辅助工具领域,服务于 Bilibili 平台的 UP 主群体。Bilibili 作为国内领先的视频社区,拥有数百万活跃内容创作者,平台每月推出数百个创作活动和征稿话题。UP 主需要在海量话题中快速识别高流量、高参与度的活动,以便合理分配创作资源。目前市场上缺乏专门针对 Bilibili 话题数据聚合和管理的桌面端工具,大多数 UP 主依赖手动浏览网页或使用简易脚本,存在数据获取不全面、管理混乱、操作繁琐等问题。本工具填补了这一市场空白,为 UP 主提供专业的话题数据洞察和管理能力。 本工具的核心价值在于将分散的 Bilibili 活动话题数据进行聚合、分析和可视化展示。通过一键同步功能,UP 主可以在数分钟内获取平台上千个活动话题的完整数据,并通过播放量排行快速锁定高价值话题。工具还支持话题状态跟踪,自动标记活跃和已结束的话题,帮助 UP 主把握参与时机。本地 SQLite 数据库确保持久化存储,历史数据可随时查询对比。整体设计注重数据密度和操作效率,采用暗色主题降低长时间使用的视觉疲劳,虚拟滚动技术确保大数据量下的流畅体验。
内容平台、搜索
Rust、reqwest、React、S...
异步多源招聘信息聚合爬虫(job-scraper)
多源数据采集:集成 Remotive 公开 API 和 Hacker News 招聘帖两个数据源,异步并发抓取,单源失败不影响其他源 数据标准化:将不同格式的招聘信息统一映射为标准结构,支持职位标题、公司、地点、薪资、标签等字段 智能去重:基于数据源+ID 主键去重,重复抓取自动更新而非重复插入 数据导出:一键导出 CSV/JSON 格式,支持 Excel 直接打开(UTF-8-SIG 编码) 数据分析报告:自动生成薪资分布(分桶统计)、技能词频、地区/公司 Top-N 排名等分析报告 定时任务:支持 cron 表达式配置,定时自动抓取(默认每天 09:00)
搜索
Python
猫眼榜单爬虫
本项目面向电影行业数据监测场景,旨在自动化采集猫眼专业版实时票房榜单,覆盖影片排名、综合票房、票房占比及排片场次等核心指标。系统可替代人工手动查表,支持高频定时抓取(如每1分钟执行一次),为影院排片、宣发策略调整、竞品分析提供及时、准确的数据依据,帮助从业者快速洞察市场动态,提升决策效率。同时,结构化存储的数据便于后续进行票房趋势分析、影片生命周期研究和档期效果评估。
大数据、搜索
Python、ScraperAPI、Sc...
大数据政策-爬虫
本项目是一个面向政策信息网站的智能爬虫系统,专注于自动采集与“航空航天”产业相关的政策文件、通知公告、工作动态等公开信息。系统通过模拟用户登录、处理动态加载内容,抓取政策的标题、正文、发布网站、技术领域和发布时间等核心字段,并将数据结构化存储至Excel表格中,便于后续的政策分析、趋势研判和产业研究。该工具可有效替代人工检索,大幅提升信息获取效率,为政府决策、企业规划及学术研究提供及时、全面的政策数据支撑。
大数据、搜索
Python、ScraperAPI、Sc...
招聘网站数据采集-excel表格
开发定向爬虫程序,针对主流招聘门户网站开展公开岗位信息采集;自动抓取岗位名称、薪资范围、工作地点、任职要求、公司行业、福利标签等字段;对抓取的原始数据进行去重、空值过滤、薪资区间标准化清洗;最终结构化导出Excel表格,可用于岗位薪资调研、行业人才需求分析、竞品公司招聘动向监测;程序自带请求间隔、随机切换基础反爬策略,降低页面封禁概率,支持指定城市、岗位关键词定向采集。
搜索
Python
智能影视搜索爬取与多线程下载脚本
一、业务介绍 本项目是基于 Python 开发的影视剧集智能爬取与 M3U8 多线程下载工具,针对动态渲染影视网站开发。 用户只需输入影视名称,程序自动完成全网剧集检索、页面动态 JS 渲染解析、M3U8 流媒体地址逆向抓取,支持自选集数、多线程高速分片下载,并自动规范命名保存,解决传统手动找资源、单线程下载慢、文件杂乱难管理的痛点,实现搜剧、爬集、解析、下载、自动命名一站式自动化处理。 二、核心功能介绍 影视关键词搜索 支持输入任意影视名称,程序自动检索匹配相关影视资源,抓取对应全部剧集列表。 剧集列表爬取展示 自动爬取该影视下所有分集信息,展示可下载集数,供用户自由选择需要下载的单集或多集。 JS 动态渲染解析 调用浏览器内核进行 JS 渲染,逆向解析动态网页,精准提取隐藏的M3U8 流媒体真实地址。 多线程分片下载 采用多线程技术对 M3U8 分片资源并行下载,大幅提升下载速度,相比单线程效率显著提升。 智能文件自动命名 下载完成后自动按照 影视名称 + 所选集数 规则命名文件,格式规整、方便本地整理和查找。 整体流程自动化 全程无需手动抓包、找链接,从搜剧→爬集→选集→解析 M3U8→多线程下载→自动命名,全流程自动化运行。
音视频、搜索
Python
合规公开数据采集工具
立项背景和目标: 日常需要批量采集公开网页数据,市面上的爬虫工具要么依赖繁琐的第三方库,要么缺乏合规保障。目标是做一个"开箱即用、合规优先"的本地爬虫控制台,双击脚本即可启动,无需任何安装。 核心功能: ①粘贴 URL 批量爬取,自动提取标题、正文摘要、图片链接;②自动检查 robots.txt,隐私内容(手机号/身份证)自动过滤;③蜘蛛模式支持递归爬取,可设定最大深度、域名页面上限;④429/5xx 自动冷却限速,连续失败自动停止;⑤内置轻量 NLP 引擎(TextRank 摘要 + TF-IDF 关键词提取 + 中文实体识别),无需大模型;⑥数据存入 SQLite,支持搜索、排序、CSV 导出;⑦SSE 实时日志推送,三色主题切换。 业务流程: 前端(原生 JS)→ HTTP API(Python 内置 http.server)→ 爬虫引擎(状态机调度)→ Fetcher(请求/重试/代理/内容解析)→ NLP 处理 → SQLite 持久化 → 前端实时展示。
搜索
Python
微信小程序-家教预约平台
经实地考察,发现该地区某大学家教业务火爆,且机构管理方式需要大量的人力物力成本,故制作该程序,将管理成本大幅降低,只需广告推销成本,并结合平台的营收方案,进一步扩大盈利。 目标是做到全国最大的家教信息中转站。 软件功能: 1.最新教育咨询实时获取 2.内嵌ai智能体,可进行实时对话 3.根据不同地区,不同需求,筛选出最合适的老师或学生人选 4.个人信息展示 5.预约功能
在线教育、搜索
Java、JavaScript、UniA...
采集某网站书籍信息
采集某网站书籍信息 构建一个面向多源图书电商平台的分布式数据采集系统,实现书籍元信息(基础属性、价格、评分、评论等)的自动化采集、清洗与结构化存储,为后续的价格监控、推荐系统和数据分析提供数据基础。
搜索、生活服务
Python、AutoHotkey、Py...
Python爬虫项目-线上接单平台猿急送项目信息爬取
一个可执行的Python脚本文件,用于爬取线上接单平台-猿急送发布的项目信息数据,包括项目名称、合作方式、预估价格、项目周期、需求描述、是否可投递等信息,整合处理后汇总到一个csv文件内。(后期可视需求添加筛选条件)
搜索
Python
多线程爬取樱花动漫视频
. 动漫视频下载器 (网站克隆工具/) 业务功能: 在樱花动漫网站搜索动漫资源 获取动漫简介、剧集列表 解析M3U8播放地址,多线程下载TS分片 自动合并为MP4视频文件 技术特点: Base64/Hex URL解密算法 多线程并发下载(可配置线程数) 集成FFmpeg视频合并 进度条实时显示下载状态
音视频、搜索
Cheerio、Colly
文件搜索及数量统计工具-文件数量统计工具
智能搜索:支持搜索文件和文件夹,包含模糊匹配和精确匹配 灵活范围:可选择当前目录、整个硬盘或所有硬盘进行搜索 详细统计:统计找到的文件/文件夹所在目录的文件数量和大小 快速访问:双击搜索结果可直接打开文件或文件夹 性能优化:多线程处理,避免界面卡顿
搜索
Python
淘宝运单号获取
获取发货订单的收货地址以及运单号信息 获取发货订单的收货地址以及运单号信息 获取发货订单的收货地址以及运单号信息 获取发货订单的收货地址以及运单号信息 获取发货订单的收货地址以及运单号信息
搜索
Selenium WebDriver
  • 1
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服