本项目是一个面向政策信息网站的智能爬虫系统,专注于自动采集与“航空航天”产业相关的政策文件、通知公告、工作动态等公开信息。系统通过模拟用户登录、处理动态加载内容,抓取政策的标题、正文、发布网站、技术领域和发布时间等核心字段,并将数据结构化存储至Excel表格中,便于后续的政策分析、趋势研判和产业研究。该工具可有效替代人工检索,大幅提升信息获取效率,为政府决策、企业规划及学术研究提供及时、全面的政策数据支撑。
项目基于Scrapy框架构建,结合Playwright异步浏览器自动化库,实现复杂动态页面的模拟交互。爬虫首先通过保存的登录状态(auth.json)绕过身份验证,进入目标站点;随后循环点击“加载更多”按钮,触发列表懒加载,直至全部数据展示;再依次点击“下一页”进行翻页,利用CSS选择器提取每条政策的标题、内容摘要、来源网站、领域分类及发布时间,并调用clean_text函数去除多余空白字符。采集过程中,爬虫实时去重,最终将全部有效记录写入zc.xlsx文件,完成了从请求、渲染、解析到持久化的全链路数据采集流程。