5天前活跃

JR

• UID:32421
综合评分 32
方向: 爬虫/脚本-爬虫/脚本 后端-Python
广州市
500元/8h
1年经验
求职意愿:接单·不求职(15天前更新)

个人简介

擅长写代码脚本,开发各种软件项目,也可编写爬虫代码

技能

核心技能:
其他技能: Python、Node.js
交流语言: 普通话( 母语水平 )
行业经验: 大数据

项目案例

51job招聘数据爬取
架构与技术栈 整体采用模块化 Python 爬虫架构,分为网页请求模块、页面解析模块、数据清洗模块、文件存储四大模块。核心技术使用 requests 库发送网络请求,BeautifulSoup 完成 HTML 页面标签解析,re 正则表达式做文本提取,pandas 库进行批量数据处理与 Excel 文件导出,通过 time 模块添加随机延时构建反爬策略。 个人负责内容与量化成果 本人独立完成全部代码编写与项目落地,定向抓取上海平面设计、深圳游戏设计两类岗位,累计抓取有效招聘数据 400 余条,完成 20 余项字段拆分、重复数据剔除、异常薪资格式修正,最终输出两份完整结构化 Excel 数据集,数据完整率达 98% 以上,可直接导入工具进行可视化分析。 难点与解决方案 难点 1:网站存在访问频率限制,短时间高频请求容易触发 IP 拦截。 解决:设置 1-3 秒随机请求间隔,模拟自然人浏览行为,降低访问风险。 难点 2:岗位薪资、任职要求为不规则长文本,格式混乱无法直接统计。 解决:编写正则匹配规则拆分薪资上下限、工作年限、专业技能关键词,统一数据格式;利用 pandas 重复值检测函数自动去重,提升数据集整洁度
大数据

工作经历

广东技术师范大学
  
501-1000人
学生
2025.08 - 2026.04
主要负责数据爬取工作

教育经历

广东技术师范大学
2025.09 - 2029.06
通信工程
本科
相似推荐
北京市
后端-Python、前端-Web前端
技能:Python、NestJS、Vue、React
上海市
爬虫/脚本-爬虫/脚本、后端-Java
技能:Apache Cassandra、Selenium WebDriver
沈阳市
后端-Python、嵌入式-嵌入式应用开发
技能:Python
深圳市
后端-C++、后端-Python
技能:C++、Python
唐山市
爬虫/脚本-爬虫/脚本、前端-Web前端
技能:Scrapy、Python
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服