30天前活跃

鶙臅

• UID:30292
综合评分 33
方向: 爬虫/脚本-爬虫/脚本
大连市
300元/8h
1年经验
求职意愿:接单·不求职(30天前更新)

个人简介

Python爬虫新手,能写脚本抓静态页面、洗数据、导出表格。有完整项目经验(豆瓣Top250采集),懂基础反爬。在校生,时间多、回复快、不怕改。价格不高,想用首单换好评,欢迎试单。

技能

核心技能:
其他技能: Selenium、easyocr
交流语言: 普通话( 母语水平 )
行业经验: 游戏/电竞

项目案例

豆瓣电影Top250数据采集-豆瓣电影Top250数据采集脚本
立项背景和目标:豆瓣电影Top250是互联网上最具公信力的影视榜单之一,但官方未提供批量导出接口,用户只能手动翻阅10个页面复制信息,耗时约2小时且无法直接进行数据分析。本项目旨在利用Python爬虫技术,实现榜单数据的全自动采集与结构化存储,将250部电影的核心字段(名称、导演、年份、评分、评价人数)在15秒内汇总为一份可直接使用的Excel报表,为后续影评分析、可视化图表制作提供高质量数据源。 核心功能模块:本工具包含四个核心模块。一是网络请求模块,基于Requests库发送HTTP请求,通过设置浏览器UA头绕过基础反爬,并遍历10个分页URL;二是内容解析模块,利用BeautifulSoup的CSS选择器精准定位每部电影的标题、评分等元素,从杂乱HTML中提取目标文本;三是数据清洗模块,使用Pandas处理原始文本中的换行符和多余空格,统一日期和数字格式,确保每条记录规整无误;四是导出存储模块,调用OpenPyXL引擎将清洗后的数据直接写入.xlsx文件,一行为一部电影,字段清晰可查。 业务流程:用户只需在Python环境中执行脚本,程序会自动按顺序请求10页榜单(每页25条),每完成一页解析后停顿1秒,最终将全部数据整理为表格并保存到脚本同级目录下。全程无需人工干预,打开生成的Excel文件即可看到完整的Top250榜单数据,可直接导入Tableau等工具做进一步分析。
工业互联网

工作经历

教育经历

大连市金州区职教中心
2024.06 - 2026.06
计算机
高中/中专
相似推荐
广州市
爬虫/脚本-爬虫/脚本
技能:Python、Selenium、SQLite、PyAutoGUI
深圳市
爬虫/脚本-爬虫/脚本、后端-Python
技能:SQL、Vue
柳州市
爬虫/脚本-爬虫/脚本
技能:Python、Burp Suite、C++
武汉市
后端-Python、爬虫/脚本-爬虫/脚本
技能:C、Python
焦作市
爬虫/脚本-爬虫/脚本
技能:JAutoIt
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服