大数据 算法模型 软件定制 案例

基于本地化GUI的AI助手客户端-智语助手
立项背景与目标: 在日常工作与学习中,用户频繁需要获取AI辅助回答,但网页端使用需频繁切换浏览器,效率较低。本项目旨在开发一款轻量级桌面AI助手,提供一键式智能问答体验,降低使用门槛,提升日常信息获取效率。 软件功能: 用户输入问题后,点击提交或回车键,程序自动调用AI模型生成回答,并即时显示在窗口中,支持长文本自动换行。 核心功能模块: 1. 用户输入模块(Entry控件) 2. AI接口调用模块(requests + 智谱AI API) 3. 结果显示模块(Label控件 + 自动换行) 业务流程: 用户输入问题 → 点击提交 → 程序获取输入 → 调用AI接口 → 返回结果 → 窗口显示回答 功能路径: 启动程序 → 输入框输入问题 → 点击“提交”按钮 → 查看AI回答 → 输入框自动清空,等待下一次提问
人工智能、大数据
Python、PyAutoGUI
百万级数据容器性能对比器
数据生成:生成百万级的学生数据(学号、姓名、成绩),以CSV格式存储。 数据加载:把CSV里的数据,分别加载到三种不同的数据结构里(vector、map、unordered_map)。 精确查询测试:随机生成一个学号,测试三种容器查询一个特定学生成绩的耗时。 范围查询测试:给定一个成绩区间(如80-90分),测试三种容器统计这个区间内学生数量的耗时。 性能对比结论:用高精度计时,对比三种容器在不同查询场景下的效率差异,得出选型建议。
大数据
C++、Linux
跨场景高光谱图像无监督域适应研发平台-MAE/Transformer + 最优传输集成
高光谱遥感模型在跨传感器、跨年份和跨场景应用时会遭遇光谱分布偏移,目标域通常又缺少训练标签。项目目标是建立一条可复现、可审计的无监督域适应研发链,而不是只展示单次最高精度。平台包含MAE/Transformer自监督表征、EMP/Gabor多编码器、最优传输伪标签与对齐、跨模型集成、合法与oracle诊断分离、多随机种子配对实验、集群运行交接、预注册和停止门禁。流程从共享波段与类别协议开始,训练源域模型,再在不读取目标训练标签的合法路径上适配;目标标签仅用于最终评价。每轮研究冻结配置、种子、日志、权重和决策,若未达到预注册阈值则保留负结果并停止扩张。
人工智能、大数据
Python、SciPy、Scikit-...
Covers集群监控平台研发
本系统专注于集群运行状态的深度监控与可视化呈现。通过采集集群配置、服务端口及运行指标等多维度数据,系统对原始监控信息进行结构化解析与标准化处理,最终转化为直观的图表看板与动态表格,帮助运维人员实时掌握集群健康状态。此外,平台还集成了数据检索、日志查询与文档管理等功能模块,为日常运维排障与信息查阅提供一站式便捷服务。
企业内部管理、大数据
Java、MyBatis
Paper大数据计算平台研发
本项目定位于企业级分布式数据服务平台,始终以数据价值释放与平台化服务能力为核心导向,构建了覆盖数据接入、数据整合、数据存储与数据计算的全链路数据闭环体系。平台采用分布式架构设计,具备海量数据的实时采集与离线批处理能力,通过标准化服务接口对外提供统一的数据底座支撑,有效降低数据使用门槛,赋能上层业务快速实现数据驱动决策。
大数据
Java、Apache HttpClie...
B站排行榜数据深度分析
1、立项背景和目标:基于B站排行榜爬取的数据,进行深度数据分析和可视化呈现,挖掘视频播放量分布规律、分区热度差异、UP主影响力等洞察。 2、软件功能:①UGC分区平均播放量对比分析;②PGC各类型内容播放量对比;③UGC播放量TOP20视频排行;④PGC播放量TOP20作品排行;⑤播放量与点赞数相关性散点图分析;⑥UGC分区视频数量占比饼图;⑦TOP15 UP主影响力排行。共生成7张可视化图表。 3、业务流程:读取爬虫采集的CSV数据,使用pandas进行数据清洗(去除空值、类型转换)、分组聚合(按分区/类型统计均值),使用matplotlib绑定中文字体渲染7张可视化图表并保存为PNG。
内容平台、大数据
Python、Matplotlib、Nu...
工业设备时序数据异常检测算法Demo
基于工业设备采集的时序数据,开发了一套轻量级异常检测算法Demo。通过滑动窗口统计、3σ原则对设备运行指标进行异常识别,支持数据可视化展示与异常点标记,可用于快速发现设备运行中的异常波动,辅助工业运维人员进行故障预判,提升数据驱动运维的效率。
大数据、工业互联网
Python、Matplotlib、Nu...
RAG Agent
一、立项背景与目标 1. 立项背景 在传统的知识库问答系统中,普遍存在以下痛点: - 流程混乱:通用ReAct Agent在处理复杂业务时,容易发生步骤跳跃或逻辑错乱,导致回答质量不稳定。 - 上下文断裂:多轮对话中,用户常使用代词(如“它多少钱?”),传统向量检索缺乏指代消解能力,导致检索失败。 - 意图混杂:闲聊式提问(如“你好”)与知识检索式提问(如“XX产品参数是多少”)被统一处理,浪费算力且影响用户体验。 - 状态丢失:用户刷新页面或稍后再访问时,对话历史无法延续,每次都是“新会话”。 2. 项目目标 - 构建一个流程可控、意图可分流、上下文可理解、状态可持久的智能知识助手。 - 实现复杂业务逻辑的结构化解耦,提升系统的可维护性与稳定性。 - 显著提升多轮对话场景下的检索命中率与回答准确率。 二、软件功能与核心模块 1.整体功能概述 本系统是一个基于LLM的智能对话式知识库问答助手,支持用户通过自然语言提问,从向量知识库中精准检索并生成回答。系统特别强化了多轮对话中的指代消解能力与流程可控性。 2.核心功能模块介绍 模块名称 功能说明 Planner(规划器) 基于LLM + 专用Prompt,硬编码业务流程。负责解析用户请求,按固定流程调度执行,防止逻辑跳跃。 语义路由器 基于LLM的分类工具,动态识别用户意图为“chat”(闲聊)或“retrieval”(知识检索),实现分支分流。 历史加载与写入模块 与Redis集成,自动追加对话历史,确保跨会话的上下文连续性。 查询重写模块 结合历史对话,将存在指代或省略的用户问题(如“它多少钱?”)改写为语义完整的独立问句。 混合检索引擎 同时执行向量语义检索与关键词检索,通过RRF算法融合排序,提升召回效果。 Executor(执行器) 根据Planner的指令,调用重写、检索、生成等环节,最终输出回答。 系统流程严格遵循:语义路由 → 历史加载 → (分支判断) → 查询改写/直接回答 → 知识库检索 → 最终生成 三、业务流程与功能路径 以下为用户与系统交互的完整功能路径描述: 场景一:用户进行知识检索(多轮对话) 场景二:用户发起闲聊 场景三:用户首次访问 / 会话恢复
人工智能、大数据
Python、FastAPI、PyTor...
Python脚本 / 数据可视化 / 多源数据可视化分析系统-多源数据可视化分析系统
本系统是一套面向多源数据的可视化分析工具,基于Python数据分析生态构建,可读取结构化Excel数据源并自动生成专业级分析图表和HTML报告。 系统聚焦两大分析场景: 1. A股金融市场分析:读取沪深A股4000+只股票的实时数据,自动生成板块分布饼图、成交量Top15排行柱状图、涨跌幅分布直方图,直观展示市场结构和资金动向。针对个股(如贵州茅台600519),生 成日K线走势图并叠加MA20/MA60双均线,标注历史最高收盘价,辅助技术分析决策。 2. 豆瓣影评数据分析:读取豆瓣电影Top250完整榜单,生成评分分布直方图、评分区间占比饼图,以及年度电影数量与平均评分的双Y轴趋势图。可直观看到经典电影年代分布和评分走势。 所有图表统一采用专业配色方案,支持中文渲染,输出为高分辨率PNG图片(150 DPI)。同时自动生成一个响应式HTML分析报告页面,将所有图表嵌入精美卡片布局,包含概览统计卡片和技术指标说明,可直接用于演示汇报或嵌入Web页面。
金融、大数据
Python、Matplotlib、Pa...
华为杯研究生数学建模大赛-抗胰腺癌候选药物的优化建模
据 2020 年国际癌症研究机构(IARC)调查的最新数据显示,乳腺癌在全球女性癌症中的发病率为 24.2%,位居女性癌症的首位。在药物研发领域,利用预测模型对能够拮抗 ERα 活性的化合物进行筛选的方法受到广泛的关注,本文通过建立回归与分类预测模型,对化合物的生物活性和 ADMET 性质做多目标优化求解
人工智能、大数据
Python
多源数据融合机器学习解决预警模型-基于多源监测数据的边坡预警模型的研究
边坡稳定性是水利工程、 交通路网及露天矿山等领域的核心安全问题。 本项目基于多源监测数据,围绕边坡预警问题建立了系统的数学模型,利用python/matlab/mysql实现项目落地,建立了分级预警机制,确保了工程实践中的高效决策支持,具有较强的物理可解释性与工程适用性,可为边坡灾害精准防控提供数据支撑与决策依据
大数据、安全
MATLAB、Python
Petal Search以图搜图
华为Petal Search核心图像搜索能力,用户拍照或上传图片即可在电商、旅游等场景下找到相似商品或地点。覆盖全球170+国家,月活2000万+,是Mate 40等旗舰机型海外版的标配功能,也是华为终端出海战略中的核心AI能力之一,支撑华为移动服务HMS生态建设。
大数据、生活服务
Python
自动网络渗透攻击平台
主要负责工作为使用 python +强化学习+实现群体智能算法开发后台训练端,在原有的基础上使用C#对网络空间靶场端功能进行再开发,使用现实靶场进行网络渗透,成功获取所需数据和整个靶场的网络情况,辅助同事使用 godot 开发展示端功能,然后结合三端实现此项目 开发攻击端,负责后端开发,使用大模型+意图槽位增加模型开发网络安全助手攻击端功能
大数据
C#、Python、Godot、PyTo...
基于深度学习的英雄联盟比赛胜率预测
LOL-DeepWinPredictor 是一款基于深度学习的英雄联盟比赛胜率预测系统,面向对局分析与战局决策场景,通过对海量历史对局数据的训练,实现对当前对局胜率的实时预测与可视化展示。核心功能模块分为三部分:一是数据采集模块,使用线程池并发爬取英雄联盟对局数据,通过 json 库完成字段提取与清洗,存储至 MongoDB 复制集保障数据高可用;二是模型预测模块,将 MongoDB 复制集数据通过 RocketMQ 消息队列传输至 Spark 集群进行分布式计算,完成大规模数据的批量推理;三是 Web 可视化模块,使用 Flask 搭建后端服务,前端基于原生 HTML + JavaScript 构建交互界面,集成 ECharts 绘制胜率对比图表,用户可直观查看各英雄组合的胜率分布与趋势分析。整体流程为:爬取数据 → 清洗入库 → 队列调度 → 集群计算 → Web 展示。
人工智能、大数据
Python、Flask、MongoDB...
基于CVAE人脸图像生成
基于条件变分自编码器(CVAE)的人脸图像生成技术深入。 通过构建CVAE模型,对人脸数据集进行预处理后开展模型训练,采用重构损失与KL散度以及二者结合的总损失函数,通过ReLU优化算法进行优化,以及梯度裁剪提升训练的稳定性和收敛性,最后通过网格图像以及FID对生成的图像进行评估。 该模型在生成人脸图像质量和多样性方面表现良好,能够有效实现人脸属性编辑、人脸合成等应用。
人工智能、大数据
Python、PyTorch
基于YOLOv8的道路病害智能检测系统
本项目面向传统道路巡检依赖人工、效率低且主观性强的问题,设计并实现了一套基于深度学习的道路病害智能检测系统,旨在提升道路养护的自动化与智能化水平。 系统核心功能包括道路图像中裂缝、坑洞等典型病害的自动识别与定位。整体功能模块分为:数据处理模块、模型训练模块、检测推理模块及结果可视化模块。用户可上传道路图像或视频,系统自动完成病害检测并输出带标注的结果图像。 业务流程为:首先对原始数据进行清洗与标注,并通过数据增强扩展样本多样性;随后基于YOLOv8进行模型训练与优化;在推理阶段输入图像,模型输出病害类别与边界框;最终通过可视化模块展示检测结果,辅助道路养护决策。
人工智能、大数据
Python、OpenCV、PyTorc...
内容工厂
新媒体运营者每天需要从大量 RSS 信息源中筛选热点、提炼要点、撰写各平台差异化文案,再手动粘贴到微信公众号、微博、头条号等编辑器——全流程耗时长、重复劳动多,且各平台对排版格式要求不同,人工适配成本极高。 本项目(mp-agent)的目标是构建一条"信息聚合 → AI 生成 → 多平台分发"的全自动内容流水线:定时从订阅的 RSS 源抓取文章,由大语言模型自动摘要和合写每日资讯,并按平台规范格式化后一键发布或提供带主题排版的富文本复制,将单期内容生产时间从数小时压缩至分钟级,支持零人工干预的定时全自动运行,也支持人工介入的半自动审核模式。
大数据
Python
数据链路搭建-DPO数据链路
在人工智能领域飞速发展的背景下,抖音集团正积极投入建设具备世界领先水平的内部多模态大模型。该模型旨在深度理解和生成结合文本、图像、视频、音频等多种模态的数据,以此赋能集团旗下多样化的产品与业务场景(如内容推荐、智能创作、用户交互、内容审核等)。 为了确保这些强大的多模态大模型不仅具备卓越的性能,更能精准对齐人类偏好(Human Alignment)、提升其安全性、有用性、一致性与个性化表现,我们引入了 **Direct Preference Optimization (DPO)作为关键的后训练(Post-training)** 策略。DPO 通过利用人类偏好反馈数据直接优化模型,相比传统的 RLHF(基于强化学习的人类反馈)流程更高效、稳定。 本项目的核心目标正是 ——构建一个高效、稳定、可扩展的端到端数据链路,为 DPO 训练提供高质量、高通量的结构化数据。这一数据链路的搭建,是确保我们的多模态大模型能够持续迭代、不断优化、最终在复杂现实场景中表现卓越的基石。它不仅将加速模型迭代周期,更是我们在下一代 AI 技术竞争中保持领先的关键一步。 本项目的核心在于设计与实现一个自动化、智能化的DPO 训练数据生产平台。其核心功能可概括为三个紧密相连的阶段: 大规模、周期性数据采集与整合: 平台将具备强大的数据集成能力,能够定期、自动化地从集团内部多样化的原始数据源(如用户交互日志、内容创作数据、搜索查询、运营反馈、模型推理日志等)以及特定外部数据集获取海量多模态数据。确保数据的新鲜度、全面性和多样性,为后续的精细化标注提供充足的 “原材料”。 高度定制化与智能化的复杂标注工作流: 平台将支持一个多阶段、多模态融合、且深度定制化的标注链路。此环节并非简单的标签分类,而是专注于DPO 训练所需的偏好型数据构建。它将引导专业标注员或通过 AI 辅助标注,根据预设的严苛评估标准(如安全性、事实准确性、逻辑连贯性、指令遵循度、创意性、语气风格等),对模型在特定 Prompt 下的多个响应进行优劣排序、对比选择,乃至识别并生成对抗性样本。此流程将针对多模态内容的特点,支持文本 - 图像、文本 - 视频等多维度关联信息的标注与评估。 标准化、可追溯的 DPO 训练数据输出(Pair 对数据): 最终,数据链路将把经过复杂标注处理后的信息,精确地格式化为 DPO 训练框架可直接消费的 “Pair 对数据”。这意味着,对于给定的一个 Prompt 或上下文,我们将输出至少包含一个 **“偏好响应(Preferred Response)”和一个“拒绝响应(Rejected Response)”** 的结构化数据对。这些数据将包含必要的元信息(如评估维度分数、置信度、标注员 ID、时间戳等),确保数据质量高、可追溯,并可直接无缝地灌入集团的 DPO 训练系统,为模型的持续优化提供高质
人工智能、大数据
Python、PyTorch、Ray
cv, nlp, data-analysis
LLM微调,CV,NLP多个项目经历: yolov8,yolov11,yolov12,yolo26应用,优化,集成 swin-tf,U-net,VIT分割,识别,分类,标注 RAG,情感分类,分词,生词,熟练应用BERT 可嵌入到软件,网页中,需后端 可接入一些LLM(如GPT,DS等)的API 可接中型/小型软件开发 可接科研项目,论文复现,AI/大数据/数据分析都可
人工智能、大数据
PyTorch、Transformers
电商公司 年度数据分析报告
立项背景:随着电商业务规模扩大,海量交易、用户行为等数据亟待系统化分析,为业务决策提供数据支撑。核心目标是挖掘年度经营数据价值,优化产品布局、营销策略及用户体验。核心功能包括数据收集整合、多维度分析(销售、用户、供应链)及可视化呈现,通过梳理数据流转逻辑,清晰呈现业务关键指标关联,为公司战略调整提供直观依据。
电商、大数据
Python
  • 1
  • 2
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服