1.立项背景和目标:公开网页笔记信息人工收集统计效率低,手动复制作者、标题、互动数据容易遗漏出错。本项目使用 Python 结合 DrissionPage 开发自动化信息采集工具,目标是模拟浏览器访问网页,自动抓取搜索结果下笔记相关信息,完成字段提取,输出结构化 CSV 表格,减少人工重复操作,提升信息整理效率。
2.软件功能、核心功能模块的介绍:包含本地目录管理模块,自动创建存储文件夹;浏览器自动化与接口监听模块,启动浏览器并监听后端接口拿到原始返回数据;页面滚动加载模块,循环下拉页面触发内容加载;数据解析提取模块,提取笔记 ID、标题、作者、点赞收藏评论分享等字段,加入异常捕获防止单条数据异常导致程序终止;数据导出模块,将采集完成的数据写入带表头的 CSV 文件。
3.业务流程、功能路径描述:用户输入搜索关键词,程序创建存储目录;启动浏览器,访问对应搜索页面;循环下拉页面触发接口加载,捕获接口返回数据包;解析每条笔记字段,把有效数据存入列表;全部采集结束后,将数据集输出保存为本地 CSV 表格文件。
1.整体架构和设计思路,不同模块使用的技术栈:项目采用 Python 语言开发,基于 DrissionPage 浏览器自动化库实现浏览器驱动与接口抓包监听;os 模块负责本地文件夹的创建与路径管理;time 模块控制页面加载、滚动等待时序;csv 模块完成结构化数据持久化存储。整体分为浏览器驱动模块、接口监听捕获模块、页面滚动加载模块、数据解析提取模块、文件输出模块。通过浏览器监听捕获搜索接口返回 JSON 数据,避免解析复杂 HTML 页面,直接获取后端原始结构化数据,再完成字段提取与本地导出。
2.我负责全部模块开发与调试,实现关键词自定义输入,循环下拉页面批量采集笔记 ID、标题、作者信息、点赞、收藏、评论、分享等互动指标,单次任务可采集数百条笔记数据,输出带完整表头的 UTF‑8 编码 CSV 文件,数据导出完整可用,替代人工复制整理,信息采集效率得到大幅提升。
3.开发过程遇到动态下拉加载无法稳定拿到接口返回数据、部分笔记字段缺失导致程序直接崩溃两大问题。通过设置合理 sleep 等待页面与接口完成响应,保证接口数据包稳定捕获;增加 try‑except 异常捕获机制,当单条笔记字段异常缺失时跳过该条记录,不会中断整体采集任务,提升程序运行稳定性。