我主要负责是数据的整理和入库,还有数据的爬虫,从各个招聘网站上,批量爬取这个公开招聘信息,做了近100个不同公司的插件,爬取数据过百万条,并且可以持续使用,并非一次性的爬虫。还有负责数据入库,批量整理数据如我们项目组的数据库
【整体架构与技术栈】
系统采用分层架构:调度层负责任务分发与增量采集;采集层采用插件化设计,每个目标站点对应一个独立插件,共开发适配插件近 100 个;解析层负责结构化抽取与字段标准化;存储层按数据特性分别入库,关系型数据存 MySQL,半结构化原始页存 NoSQL,去重与任务去重依赖 Redis。技术栈:Python 为主,异步请求 + 协程并发,配合动态渲染页面处理方案、代理池与自动重试机制,配套日志监控与失败告警。
【我的负责模块与量化结果】
我独立负责插件框架设计、调度与入库链路开发及数据清洗。一是抽象出统一插件接口,将站点差异收敛到配置层,新增一个站点的适配成本从原来的一天缩短到 1–2 小时;二是设计增量采集与断点续采策略,避免重复抓取;三是搭建数据清洗与去重规则,统一字段口径。最终累计采集入库数据超 100 万条,覆盖近 100 个站点,[入库成功率/数据可用率约 XX%],支撑后续数据整理与分析直接使用。
【难点与解决方案】
难点一:站点页面结构高度异构、改版频繁。解法是插件化 + 配置化抽取规则,站点改版只需调整对应插件配置,不影响主流程。
难点二:采集稳定性,目标站点存在访问频控、动态加载等限制。解法是引入限速策略、请求失败指数退避重试、代理轮换与动态渲染适配,并将采集严格限定在公开可访问范围内。
难点三:数据质量,重复与脏数据比例高。解法是建立多级去重(URL 指纹 + 内容指纹)与字段校验规则,入库前统一标准化。