程序聚合 软件案例 拉勾网招聘职位批量采集系统(反反爬 + 多源数据提取)

拉勾网招聘职位批量采集系统(反反爬 + 多源数据提取)

2026-07-24 00:11:15
行业:在线教育
载体:爬虫/脚本
技术:Python

业务和功能介绍

针对拉勾网(lagou.com)——国内主要互联网招聘平台——的职位信息批量采集。
采用双重数据提取策略:优先从 Next.js 的 SSR 渲染数据(__NEXT_DATA__)中
直接提取结构化 JSON,失败时降级为 DOM 选择器遍历。使用持久化浏览器档案
和反自动化检测绕过技术,成功避开拉勾网的反爬拦截。

项目实现

- Playwright launch_persistent_context 使用独立 Chrome Profile 目录
保持登录态和浏览器指纹一致性
- 禁用自动化标志 --disable-blink-features=AutomationControlled
- 自定义 User-Agent 伪造为 Chrome 125 正式版浏览器
- 手动验证码等待循环:实时检测 .nc-container 和 aliyunCaptcha-slider
等待用户手动完成滑动验证后继续(最长 180s 超时)
- 主数据路径:page.evaluate("window.__NEXT_DATA__") 提取 Next.js 的
完整 SSR JSON 数据,递归遍历 15 层深度查找 positionId 和 positionName
- 降级路径:DOM querySelectorAll 遍历 .job-list-box li 等选择器
- 数据容错:positionName/positionId/salary/company 等多个备选字段名兼容
- 标签智能聚合:positionLables/labels/tags/skillTags/industryField 等多源合并去重
- 岗位描述 HTML 标签清洗,按 120 字截断预览
- JSON 结构化输出,字段:职位名称/薪资/工作地点/学历/年限/标签/公司/描述


示例图片视频


我开动啦
24小时内活跃
方向: 爬虫/脚本-爬虫/脚本、后端-Python、
交付率:100.00%
相似推荐
微信定时群发助手-桌面自动化
1、立项背景和目标 在社群电商和社区团购业务中,运营人员需要每天在固定时间(如午餐前、晚餐前)向多个微信群发送营销消息(如当日菜单、限时优惠、接龙提醒等)。实际操作中,运营人员需要逐个打开微信群、复制消息内容、粘贴发送,整个过程重复性高、耗时且容易遗漏。如果团队管理数十个群,每次群发需要15-30分钟,且必须准时操作,占用大量人力。此外,远程桌面场景下微信窗口的激活和焦点获取存在技术难题,普通自动化脚本在远程断开重连后容易失效。本项目的核心目标是:构建一个Windows桌面自动化工具,实现微信消息的定时批量群发——用户只需配置群列表和发送时间,工具自动在指定时间激活微信、搜索群、粘贴消息并发送,全程无人值守。 2、软件功能、核心功能模块的介绍 工具涵盖以下核心模块:定时调度引擎——基于schedule库实现多时间点注册,支持配置多个发送时间(如午餐11:30、晚餐17:00),到点自动触发批量发送;配置文件动态加载——支持多套独立配置(如config_lunch.py、config_dinner.py),不同时段发送不同内容和群列表,通过命令行参数灵活切换;微信窗口强制激活——通过win32gui+pyautogui组合,实现远程桌面环境下窗口的可靠前置,解决了SetForegroundWindow在远程会话中的权限限制问题;搜索与切换群——模拟Ctrl+F搜索、Ctrl+A全选删除、粘贴群名、回车打开群聊的完整流程,支持任意群名;消息发送——支持普通文本和@所有人两种模式(消息以@all@开头则自动@所有人);消息动态生成——支持在配置文件中定义get_message()函数,每次发送时动态生成消息内容(如包含当天日期、实时库存等)。 3、业务流程、功能路径描述 用户创建配置文件(如config_lunch.py),配置GROUP_NAMES群列表、SCHEDULE_TIMES发送时间、get_message()消息生成函数 → 双击运行脚本并传入配置名(如python main.py config_lunch)→ 工具启动,注册定时任务 → 到设定时间(如11:30)自动触发batch_send()→ 工具激活微信窗口(强制置顶+模拟点击标题栏)→ 按Ctrl+F打开搜索框 → 清空搜索框 → 粘贴第一个群名 → 按回车打开群聊天窗口 → 点击输入框获取焦点 → 粘贴消息内容(若以@all@开头则先输入@并回车再粘贴正文)→ 按回车发送 → 记录成功日志 → 等待2-4秒后处理下一个群 → 全部发送完成后等待下一个定时点。工具持续运行,支持多轮定时任务。
全栈电商购物车系统-ShopCart
1、立项背景和目标 搭建一套功能完善的全栈电商购物车演示系统,完整实现前端商品浏览到后端数据持久存储的全技术流程。项目一方面为有电商开发需求的客户提供可复用、可参考的落地方案,另一方面用作全栈开发能力的展示案例。系统内置商品检索筛选、购物车增删改查、跨会话数据持久保存等电商核心能力。 2、软件功能、核心功能模块介绍 产品浏览模块:内置 12 款演示商品,分为电子、服饰、家居、运动四大品类;支持关键词检索、分类筛选、价格与名称排序;商品卡片展示商品评分、库存数量、可视化图标。 购物车模块:支持商品加入购物车并自动校验库存、调整商品数量、单独删除商品、一键清空购物车,实时计算商品小计与订单总金额;依托会话标识机制,实现购物车数据跨页面、跨访问会话持久保存。 后端 API 服务:采用 RESTful 接口规范,共开发 7 个接口,包含 GET、POST、PATCH、DELETE 多种请求方式;接口覆盖商品列表、商品详情、商品分类、购物车增删改查功能,统一使用 JSON 格式返回数据,规范 HTTP 状态码。 首页展示模块:包含品牌宣传主视觉区域、品类快捷导航入口、高分优质商品推荐、项目技术架构展示板块。 3、业务流程、功能路径描述 用户访问网站首页,浏览品类导航或平台推荐商品,跳转至商品列表页面,可使用搜索、筛选、排序功能查找目标商品;点击商品加入购物车,商品数据绑定当前会话标识存入 SQLite 数据库,页面购物车图标实时更新商品数量;用户打开购物车页面,可修改商品数量、删除商品、查看订单金额汇总,选择继续选购商品或进入结算演示页面。
SkillTrust
SkillTrust 是面向 AI Agent Skill / MCP 生态的安全扫描与可信发布平台,主要解决第三方 Agent Skill 来源分散、权限隐蔽、风险难识别、发布前缺少安全准入机制等问题。平台围绕“先扫描,再信任”的思路,提供 Agent Skill 聚合、风险检测、可信评级和准入治理能力。 核心功能包括:一是多源 Skill 聚合,接入 SkillHub、MCP 市场等生态数据,形成可检索、可追踪的 Agent Skill 资产库;二是安全扫描引擎,对 Skill 的描述、Manifest、README、工具参数、源码依赖和调用链进行分析,识别提示注入、工具投毒、命令执行、数据外传、凭据访问、依赖风险等问题;三是风险评分与准入决策,输出风险等级、证据说明和处置建议,支持通过、人工复核、阻断三类策略;四是可信发布管理,为开发者和平台方提供发布前检测、版本追踪和报告留存能力。 平台适用于高校实验室、AI 应用开发团队、中小企业和 Agent Skill 平台运营方,可帮助用户在引入或发布第三方 Skill 前完成安全评估,降低人工审核成本,提升 AI Agent 工具生态的安全性和可信度。
婴儿护理产品品牌展示网站-BabyCare
BabyCare 是主打婴幼儿护理产品的品牌官网,面向 0-24 个月婴幼儿家长,主要用于展示品牌全线产品、塑造品牌信任感、引导用户咨询与购买,打造一站式母婴产品浏览与咨询服务平台。 核心功能模块 首页:包含品牌主视觉展示、产品分类导航、热销商品展示、用户口碑评价以及转化引导模块。 产品页:展示 9 款核心产品,支持喂养、服装、育儿、尿布、玩具多维度分类筛选,具备加入购物车交互功能。 关于页:展示品牌发展故事、品牌核心理念,涵盖有机材质、合规采购、安全检测、可持续发展优势,同时展示品牌团队信息。 服务页:提供月度母婴订阅礼盒、婴儿信息登记、线上儿科咨询、育儿专题工坊、产品以旧换新、定制礼品服务等特色功能。 博客页:展示 4 篇专业育儿资讯文章,自带发布日期、内容分类、内容摘要信息。 联系页:配置完整咨询表单,可填写姓名、邮箱、主题、留言内容;同时展示品牌官方邮箱、联系电话、门店地址与营业时间等企业信息。 业务流程 用户访问网站首页,浏览产品分类,查看对应产品详情,可将商品加入购物车,数据通过本地存储持久化保存,用户可提交咨询表单并获取提交成功反馈。全站采用统一导航体系,顶部导航固定展示,移动端适配汉堡折叠菜单,实现全页面流畅跳转与访问。
毫米波雷达在线测厚系统
1.背景:工业级别生产线使用雷达扫描生产货品,得到数据后需要进行检验产线是否合格,项目需要实现获取雷达扫描数据进行分析,得到验证结果,提供预警或者决策是否调整产线。 2.串口方式接入设备实时分析测算。
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服