程序聚合 软件案例 Yelp商家数据采集与统计系统

Yelp商家数据采集与统计系统

2026-04-08 15:58:30
行业:生活服务
载体:爬虫/脚本
技术:Python、AntiCaptcha

业务和功能介绍

一套完整的商家公开数据采集与统计分析系统,支持按城市、区域、商家类型(餐饮、酒店、加油站、商场、教育机构等)多维度自动采集Yelp平台上的商家信息,包括名称、地址、联系电话、用户评分、评论数量、营业时间、商家官网等。系统可满足市场调研、竞品分析、商圈评估、选址决策等商业需求,采集结果自动去重、清洗,并导出为Excel/CSV等结构化文件。帮助企业快速获取大规模、高可信度的本地商家数据。

项目实现

使用 Python 编写爬虫,以 Playwright 为核心引擎处理页面的动态渲染。
Playwright 启动 Chromium 实例时,通过 launch 参数禁用自动化特征(如 --disable-blink-features=AutomationControlled),并利用 add_init_script 注入脚本抹除 navigator.webdriver 属性。

针对平台的反爬机制,重点实施了以下绕过策略:

模拟真实设备指纹
通过 Playwright 的 context 配置,随机化视口大小、时区、语言、地理位置等浏览器环境。
使用第三方库 playwright-stealth 或自定义脚本,伪造 Canvas 指纹、WebGL 渲染器、字体列表、音频上下文等硬件指纹特征,避免被识别为自动化工具。
每次创建上下文时,随机生成 User-Agent(匹配主流 Chrome 版本)并携带真实的 Accept-Language、Sec-Ch-UA 等请求头。

动态代理 IP 轮换
集成住宅代理池,为每个 Playwright 上下文绑定不同的代理 IP。
实现代理健康检查机制:对连续失败 3 次的 IP 自动剔除,并从池中获取新 IP 重试。
针对同一商家的分页请求,维持 IP 粘性(sticky session),避免频繁切换 IP 触发风控。

请求行为模拟
在两次请求之间加入随机延迟(2-5 秒),并模拟人类鼠标移动轨迹与滚动行为。

通过上述等手段,系统能够稳定采集公开数据,成功绕过目标站点的反爬策略。

示例图片视频


溯流破冰
30天前活跃
方向: 爬虫/脚本-爬虫/脚本、安全/逆向-安全/逆向、
交付率:100.00%
相似推荐
大模型 API 测速台——可视化对比大模型 API 性能的 Web 工具
## 一、Demo 简介 - **是什么**:一个单页 Web 应用,用户填写 API 信息即可对大模型进行测速,实时展示首字延迟、TPS(Token/秒)等关键指标,并支持多模型历史数据对比图表。 - **面向谁**:开发者、产品经理、AI 技术选型者,以及所有需要接入和评估大模型 API 的人。 - **主要功能**: 1. 单模型测速:填写 API 地址、密钥、模型名称、测试 Prompt,一键发起请求,实时返回首字延迟、成功率、TPS、等指标。 2. 多模型对比:支持将多次测速结果保存到历史记录,以图表形式横向对比不同模型的关键性能指标。 3. 结果可视化:用图表直观呈现测试数据,避免"看 JSON"的低效方式。
模型部署优化
为应对 DeepSeek-V4-Pro 模型在长上下文、高并发推理场景下的性能瓶颈,我们启动了 H20 集群推理服务优化项目。原单机部署方案在解码阶段依赖 DSpark 投机解码(num_speculative_tokens=3)进行加速,但在实际业务流量(高峰约 100 req/min)下,KV Cache 显存占用成为主要限制,导致请求承载能力仅约 10% 的流量比例,大量请求因资源不足被拒绝或排队,严重影响服务可用性和用户体验。 本次项目旨在通过架构升级,将部署规模从单机扩展至双 H20 集群,并引入 LMCache KVCache Pool 池化技术,实现 KV Cache 跨实例复用,显著降低长上下文场景下重复 Prefill 计算开销,最终目标是将业务承载能力提升至 25% 以上,保障高峰流量下的服务稳定性与低延迟响应。
个人安全中心系统与个人博客-http://alicececilia.top/
Alice Cecilia站点业务全景 站点定位:技术博客+安全防护演示+AI服务+Minecraft社区的综合型个人站点,域名alicececilia.top,服务自建私有服务器,通过OpenFRP内网穿透对外暴露,隐藏真实物理位置。 核心业务线: 博客(主业务):Markdown写作,支持frontmatter元数据;7大分类:安全防御/Windows/人工智能/游戏/站点/日常/我的世界服务器(置顶);集成Pagefind全文搜索、Bilibili追番+TMDB元数据模块、RSS订阅、Canvas海报分享;响应式暗色主题(樱花粉/奶白浅色系)。已发布27篇文章,涵盖安全防御架构、Windows加固、AI部署等内容。 自研WAF:七层防御体系(早期拒绝→扫描器检测→蜜罐→速率限制→CSRF→路径归一化→代理转发);含6+种虚假响应蜜罐(.env泄露、WordPress等)及Tarpit延迟;支持CL+TE冲突检测、TE值混淆的请求走私防护;5条路径混淆对抗规则;扫描器识别(同路径连续+总量阈值+零合法访问);扫描器302重定向至gov.cn/miit/网警等站点;IPv4/IPv6 CIDR子网级永久封禁,拦截记录存档;三级熔断(NORMAL→LOCKDOWN仅静态→KILLED全站下线),看门狗60s自愈;JSONL持久化威胁日志,含威胁评分与扫描器分类。 AEGIS全域防护中心(部署于/aegis,实时态势感知核心):四象限布局——Q1在线用户&流量详情:实时显示活跃IP、服务归属、地区、在线时长;博客/对话/动漫/管理四项流量柱状图;8大区域(东亚/东南亚等)在线/累计热力图。Q2全球攻防流量地图:globe.gl+Three.js/WebGL渲染3D地球;红/蓝飞线区分攻击/正常访问(虚线流动动画);脉冲信标(大小对应流量)、52个全球城市节点;对象池优化避免闪烁。Q3系统统计&实时监控:NORMAL/WARNING/DANGER三级状态指示;RPS实时计算+迷你趋势图;4xx/5xx错误率统计;L0-L7七段防御状态条;蜜罐触发数/封禁IP数/熔断状态统计;SQL注入/扫描器等威胁标签自动分类。Q4攻击详情:攻击类型排行柱状图;HTTP方法(GET/POST/HEAD等异常)分布统计;实时攻击日志流(类型标签+路径+来源IP+计数)。面板特性:2秒全实时刷新;sec-fetch-site浏览器保护避免WAF误判;通过/alice/admin/stats JSON API拉取数据;攻击源IP自动地理定位。
aigc4lk企业多智能体(个人demo项目)-基于spring ai alibaba创建
【仅为个人在github得deno项目】 aigc4lk 是一个企业级多 Agent 编排平台,采用 "Commander(编排中心) + Sub-Agents(子 Agent 集群) + Shared Memory(共享记忆)" 的三层架构。平台通过 CommanderAgent 枢纽协调由 LLM 驱动的子 Agent,实现完整的意图识别 → 计划生成 → 计划校验 → 多模式执行 → 质量评估 → 记忆自进化的闭环。
自研大模型中转平台
立项背景和目标:当前大模型生态呈现多模型并行发展的格局,不同模型在能力侧重、价格、调用方式上差异显著,用户频繁切换平台成本高、对话数据分散。本平台旨在打造统一的大模型中转聚合入口,将主流大模型能力整合到同一交互界面中,实现一次接入、多模型可用,降低用户使用门槛,提升对话管理与知识沉淀效率。 软件功能、核心功能模块:核心模块包括①多模型对话系统 —— 支持 GPT 系列等主流大模型的切换调用,提供文字、附件、语音等多模态输入方式,流式输出响应;②对话管理模块 —— 新对话创建、历史对话搜索、对话分组归类,方便用户按主题管理会话;③笔记功能 —— 对话过程中关键内容可一键沉淀为笔记,便于知识复盘与整理;④用户与权限体系 —— 独立用户账号、使用记录与配额管理,保障数据隔离与安全;⑤模型切换中心 —— 顶部快捷切换不同模型版本,对比不同模型输出效果。 业务流程、功能路径描述:用户登录后进入对话主界面,默认加载上次会话或新建对话;通过顶部下拉切换目标大模型,在输入框输入文字、上传附件或发送语音发起提问;系统将请求转发至对应模型接口,流式返回回复内容并渲染到对话区;用户可通过左侧导航栏搜索历史对话、创建分组归类、将重要内容保存为笔记,形成 "提问 — 对话 — 沉淀 — 管理" 的完整使用闭环。
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服