程序聚合 程序员 七年老码农
15天前活跃

七年老码农

• UID:32289
综合评分 34
方向: 爬虫/脚本-爬虫/脚本
长沙市
200元/8h
1年经验
求职意愿:接单·不求职(15天前更新)

个人简介

熟练使用 Python 进行网页数据采集开发,掌握 requests 网络请求、re 正则表达式数据提取、CSV 数据导出存储。能够完成公开网页的数据抓取、数据清洗、结构化导出工作。 可以承接:公开网页爬虫开发、网页数据采集、数据清洗整理、简单自动化脚本开发,输出 CSV/JSON 格式数据文件。

技能

核心技能:
其他技能: Python、C++
交流语言: 普通话( 母语水平 )
行业经验: 大数据 智慧数字孪生

项目案例

豆瓣电影短评爬取
立项背景和目标:为方便对公开电影短评数据做统计分析,开发本网页数据采集脚本,目标是获取豆瓣电影公开的用户短评内容,把评论、评分、评论时间等公开信息批量导出,用于数据分析练习,仅采集网页公开可见数据,不触碰用户隐私。软件功能、核心功能模块:基于 Python 开发,使用 requests 发送网络请求,BeautifulSoup4 解析网页 HTML 源码;实现分页遍历、网页解析、数据清洗模块;提取电影短评的用户名、星级评分、评论正文、发布时间;过滤无效空白内容,将采集完成的数据保存为 txt 格式文件。业务流程、功能路径:输入目标电影短评页面地址,脚本携带请求头访问网页,循环访问多页短评;解析页面提取目标字段,清洗整理数据;完成多页采集后,把全部结果写入本地 txt 文件,完成数据落地存储。
大数据

工作经历

教育经历

浏阳市第一中学
1981.09 - 1984.06
高中/中专
相似推荐
上海市
爬虫/脚本-爬虫/脚本、后端-Java
技能:Apache Cassandra、Selenium WebDriver
唐山市
爬虫/脚本-爬虫/脚本、前端-Web前端
技能:Scrapy、Python
深圳市
爬虫/脚本-爬虫/脚本
技能:Selenium
泉州市
爬虫/脚本-爬虫/脚本
技能:C
芜湖市
设计师或建模-设计师其他、爬虫/脚本-爬虫/脚本
技能:MATLAB
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服