音视频 Windows应用 软件定制 案例

程序聚合 软件案例 音视频 Windows应用
音书桌面端-QT
实时语音转写:手机端采集语音 → 后端识别生成文字 → PC端通过socket.io监听text_update事件实时接收,并逐句显示在Qt文本编辑区(QTextEdit),支持光标跟踪与暂存。 文章生成与保存:PC端可对转写文本进行编辑、分段、标题设定,点击“保存”调用socket.emit('save_article')将完整文章上传云端(附时间戳、用户ID)。 历史管理:启动时通过socket.emit('fetch_history')获取文章列表(JSON格式),以QListView展示;支持按标题/日期检索。 操作扩展: 修改:双击列表项加载内容至编辑区,保存时覆盖云端原文档(update_article事件)。 下载:选定文章,调用socket.emit('download_article'),以QFileDialog保存为本地.txt/.docx。 删除:触发delete_article事件,列表即时刷新(通过article_deleted广播同步)。
音视频
C++
抖音视频批量下载工具
本工具的功能为批量下载用户关注/点赞/收藏的作品,用户登录后,获取用户关注列表,将需要下载的作者加入列表中,点击 下载按钮,开始下载指定作者的作品,已下载过的作者会被保存到已下载过作品的作者清单中,下次运行程序,可通过更新功能下载该清单的作者的最新作品,更新时,不会下载已下载过的作品,只获取本地不存在但在服务器上存在的新作品
音视频
JavaScript、Node.js、E...
音视频聊天系统-音视频聊天系统
模拟微信开发可以实现单聊、群聊,以及音频和视频通话,聊天可发送基本表情包和消息以及图片发送等;客户端有桌面端和网页端两种访问方式,用户可以搜索不同用户,邀请、添加好友,与好友音频或者视频通信,可以设置个人信息,包括头像上传等;用户可使用桌面端、手机或者电脑访问网页登录账号;
音视频、工业互联网
C++、Qt、Vue、Docker Co...
同声翻译工具软件
本系统是一款基于微软语音服务的同声翻译工具软件,专为跨国会议、涉外商务谈判及多语言协作场景设计,支持实时录制扬声器声音与麦克风声音,实现语音识别、实时翻译、音频保存与会议记录生成。主要功能模块如下: 1. 双轨录音功能:支持录制扬声器声音(捕捉他人发言)与麦克风声音(捕捉自己发言),确保会议中各方发言内容完整采集,不遗漏任何信息。 2. 语音识别与翻译:基于微软语音服务,将实时录制的语音转换为文字,并根据用户设置的声音源语言和目标语言进行即时翻译。支持中、英、日、韩、德、法等多种语言互译,识别准确率高、延迟低,满足实时会议需求。 3. 语言设置:用户可分别配置扬声器音轨和麦克风音轨的源语言与目标语言,支持不同发言者使用各自母语,软件自动识别并翻译为指定目标语言,实现跨语言无障碍沟通。 4. 音频保存功能:会议过程中自动将录制的原始声音保存为本地音频文件(如WAV格式),支持按时间分段保存或整场会议保存,便于会后回放与复核。 5. 会议记录生成:会议结束后,系统自动将识别出的文字与翻译文本按时间轴整合,生成带时间戳的双语或多语会议记录。 各模块协同工作,形成从实时翻译到会后归档的完整闭环,显著提升多语言会议效率,降低人工翻译成本与沟通误差。
企业内部管理、音视频
Qt、C/C++
抖音视频自动下载桌面工具
1、立项背景和目标:开发一款面向个人用户的抖音视频下载工具,支持通过分享链接一键下载无水印视频,降低普通用户保存视频的门槛。 2、软件功能:①剪贴板自动监听,用户复制抖音分享链接后自动填入输入框,无需手动粘贴;②视频无水印下载,通过Selenium驱动Edge浏览器解析抖音视频真实下载地址;③下载去重机制,基于视频ID自动跳过已下载视频,避免重复保存;④自定义下载目录,支持在设置中修改保存路径;⑤下载进度实时显示,支持取消下载;⑥程序打包为exe,用户无需安装Python环境即可直接运行。 3、业务流程:用户双击exe启动程序,在抖音App点击分享复制链接,程序自动捕获剪贴板内容并填入,点击下载按钮后程序通过浏览器自动化解析视频地址并下载到本地downloads文件夹。
音视频
Python、Requests、Sele...
Windows 桌面视频批量下载工具(多平台链接解析下载 + 机器码授权体系)-视频批量下载工具
背景:抖音/B站/小红书用户要下载视频没趁手工具,网上资源倒卖要么失效要么要装全家桶,自媒体剪辑缺素材留存手段。功能:多平台链接解析下载、批量队列、画质选择、下载历史管理;Windows 桌面版 + Android 版双端。技术:yt-dlp 引擎封装(1700+ 平台)、机器码 + HMAC-SHA256 注册码授权体系(一机一码、离线验证)、PyInstaller 打包、GitHub Actions 自动构建 APK。成果:授权系统 18/18 测试通过;真实下载 212s/12.62MB 无错;已在闲鱼销售,审核 1 小时过审。
音视频
Python、Docker
本地音乐播放器
LocalMusic 是一款面向个人本地音乐管理与播放场景开发的离线音乐播放器。项目立项背景来源于用户对“无登录、无广告、无联网、数据留在本机”的音乐播放需求。许多在线音乐软件依赖账号、云同步和网络资源,而用户本地收藏的 MP3、FLAC、WAV、M4A 等音频文件往往缺少轻量、纯粹、易管理的播放工具。因此,本项目目标是构建一款可在 Android、Windows、Web 等平台使用的本地音乐应用,让用户能够直接读取设备音频文件,完成播放、整理、歌单管理、歌词查看等核心操作。 软件主要功能包括本地音乐扫描与导入、歌曲播放控制、播放模式切换、歌曲信息管理、封面显示、歌单管理、搜索排序、歌词与桌面歌词等模块。播放模块支持点击歌曲播放、暂停、上一首、下一首、拖动进度条,以及顺序播放、单曲循环、随机播放等模式。歌曲管理模块可读取音频标签中的标题、歌手、专辑信息,并支持修改后写回音频标签;封面优先使用音频内嵌封面,没有封面时显示默认图标。歌单模块支持创建、重命名、删除歌单,批量添加歌曲,并可拖动调整歌单或歌曲顺序。搜索排序模块支持按歌曲名、歌手、专辑检索,也支持按创建时间或歌曲首字母升降序排列。歌词模块可识别同名 `.lrc` 文件,播放时自动同步当前歌词,并支持桌面歌词窗口显示。 业务流程上,用户首先安装并启动应用,授权读取音频或文件权限;随后将音乐文件放入指定目录,或通过应用导入功能添加歌曲。进入本地音乐列表后,用户可浏览、搜索、排序并点击歌曲播放。播放过程中可通过底部播放器控制进度和切歌,也可进入歌词页查看同步歌词。若需要分类管理,用户可创建歌单,在歌单中搜索并批量添加歌曲,之后拖动调整顺序并保存。若文件被移动或删除,用户还可以通过“清理找不到音源”维护歌单数据,保证本地音乐库整洁可用。
内容平台、音视频
Dart、Flutter
基于 LLM TTS 多模态 api调用的 Live2D 桌面宠物应用-live2dpet
1.传统桌面宠物仅具备基础动画效果,交互形式单一、陪伴感薄弱,随着大语言模型与情感语音合成技术的发展,用户对具备智能对话、情绪反馈、环境感知能力的桌面陪伴产品需求日益增长。本项目旨在打造一款融合 Live2D 形象渲染与多模态 AI 能力的桌面宠物应用,为用户提供高沉浸感的桌面陪伴与交互体验。 2.涵盖 Live2D 模型渲染、LLM 智能对话、情感驱动语音合成、系统状态监控、屏幕视觉分析、事件管理器五大核心模块,支持自定义角色提示词与多平台大模型切换。 3.应用启动后,前端进程自动拉起对话、语音、监控三个独立后端进程,在桌面渲染支持拖拽的 Live2D 角色,实现自动眨眼、眼球追鼠等基础动画;用户输入对话时,请求经 ZeroMQ 发送至 LLM 后端,生成带情感标签的回复并流式展示在对话气泡中,同步驱动 TTS 后端合成对应情感风格的语音实时播放;监控后端持续采集 CPU、内存等硬件状态与前台窗口信息,结合多模态视觉分析结果,在低电量、高负载等场景触发宠物主动搭话;空闲达到设定时长后宠物会概率进入睡眠状态,点击可唤醒并触发起床台词,形成完整的自主交互闭环。
人工智能、音视频
Python、Qt、ZeroMQ、Ope...
基于音序器原理的跨端音乐制作应用-Doit Synth
传统音乐制作软件(Ableton Live、FL Studio、Logic Pro 等)以时间线编排和 MIDI 钢琴卷帘为核心交互模型,学习门槛高、操作链路长。Doit Synth 将创作入口前移至打击垫网格——用户通过点击 24 个彩色垫即可实时触发声音,配合每垫独立的步进音序器参数(间隔、延迟、重复次数),在分钟级时间内完成一段完整的节奏型或旋律循环。 这一设计使得: - **零基础用户**可以像使用实体鼓机一样通过触控直觉创作 - **进阶用户**可以通过和弦模式、滤波器包络、侧链压缩等专业参数深度调音 - **协作分享场景**下,用户可通过一键复制的压缩模版码将整套音色与编曲配置传递给其他用户 全链路合成而非采样回放 区别于基于采样的鼓机应用,Doit Synth 的全部声音均由实时合成生成。每个打击垫可独立路由至 8 个合成器槽位,每个槽位配备完整的振荡器、多模滤波器、独立包络发生器和声像控制。鼓声部同样由振荡器与噪声发生器实时合成,支持频率扫频(底鼓音高下降)、多击连击(拍手/滚奏)等精细参数调节。 这意味着: - 音色具有无限调制空间,不存在采样精度或版权限制 - 同一套参数配置可通过模版码完整传递,在不同设备上获得完全一致的音频输出 - 所有合成运算在浏览器 Web Audio API 中完成,无需服务器或云端处理
生活服务、音视频
Node.js、TypeScript、R...
离线语音转换工具-Gzx语音转换助手
1、立项原因 旨在解决网络环境不佳或完全断网场景下,开发者无法依赖云端服务进行高效编码的问题。尤其针对“vibe coding”(氛围式/对话式编程)开发模式中,需频繁口头表述需求、反复整理和调整关键词的痛点,通过引入本地化的语音转换输入能力,降低操作门槛,提升离线状态下的开发效率与体验。 2、行业场景 适用于边缘计算、野外作业、移动车载、工业现场、保密内网等弱网或断网环境下的软件开发场景。在此类业务背景下,传统在线IDE或云编码工具不可用,而开发者仍需快速迭代原型或调试代码,本方案可为其提供轻量、即时、无需联网的语音辅助编程支持。 3、功能模块 入口(`main.py`):负责单实例互斥、日志初始化、全局异常钩子,以及启动画面展示与模型延迟加载的协调。 语音识别引擎(`asr_engine.py`):核心模块,统筹音频采集、VAD切句、ASR识别、实时模拟输入和LLM异步纠错的全流程。 配置管理(`config.py`):单例模式读写`settings.json`,支持配置变更通知和原子写入。 LLM客户端(`llm_corrector.py`):封装HTTP请求,实现与本地或远程大语言模型的通信、可用性探测及超时重试。 系统托盘(`tray_app.py`):基于pystray实现托盘图标、全局快捷键(左Alt+Q)监听及状态显示。 启动画面(`splash.py`):无边框进度窗口,带毛玻璃效果,展示模型加载进度。 设置界面(`settings_ui.py`):独立线程运行的Tkinter配置窗口,支持LLM地址/模型修改及连接测试。 VAD指示器(`vad_indicator.py`):鼠标旁动态彩色光点,实时显示语音概率和音量大小。 4、功能描述 核心工作流程如下: 用户按下全局热键(左Alt+Q)后,系统通过PyAudio采集麦克风音频,经Silero VAD进行语音活动检测与切句,再由SenseVoiceSmall端到端模型实时识别为文字。识别结果立即模拟键盘输入上屏,确保低延迟反馈。 同时,系统将识别文本送入LLM纠错队列,在用户静默3秒后自动触发批量纠错。LLM修正标点和错字后,通过模拟退格删除原文并粘贴修正文本,实现无感替换。纠错过程支持取消重入——若用户在LLM处理中继续说话,当前请求被取消,未处理句子自动归还队列等待下一批次。
生活服务、音视频
Python
Go+FFmpeg 抖音财经股票指标视频自动化生成系统
一、项目简介 本人自1993年接触证券市场,2004年尝试用PHP开发自动化指标筛选程序,因并发性能限制,批量数据运算耗时过长。2015年转向Go语言,依托原生并发模型,将运算耗时由半小时优化至1分钟内,期间对比Python、Julia等语言后,最终选定Go为主力开发语言。 2025年启动本项目:基于自研股票指标函数体系,搭建财经短视频自动化流水线,将量化指标可视化内容批量生成视频并适配抖音平台分发标准。 技术迭代上,初期采用fogleman/gg生成PNG图片序列,再由FFmpeg合成视频。经持续优化,现绝大部分素材渲染直接交由FFmpeg完成,仅在FFmpeg耗时过高、分辨率无法满足需求时,回退使用GG生成静态图片。整套系统已实现数据解析、图表渲染、视频合成一站式自动化。 二、业务功能 批量指标运算:批量读取量化数据,自动运算生成股票指标信号。 数据可视化渲染:支持FFmpeg滤镜实时绘图,兼容GG静态PNG绘图兜底方案。 短视频自动合成:按平台规范自动合成视频,适配抖音等主流短视频平台分辨率与码率要求。 全流程自动化调度:从数据到视频全链路自动化,支持持续产出可视化素材。 智能渲染链路切换:根据耗时、画质需求,自动选择最优渲染方案(FFmpeg主链路/GG兜底)。 三、技术栈 Go、FFmpeg、fogleman/gg、股票量化接口、自动化调度脚本
金融、音视频
Go、FFmpeg
热榜视频分析创作系统-热榜视频分析创作系统
1、用户根据关键词,检索选择抖音垂类热榜视频,获取垂类热榜视频粉丝画像详细数据。根据粉丝画像详细数据,选择要参考的热榜视频。 2、选择扣子工作流,进行二次创作,如视频详情解析、视频文案解析、视频文案改写、视频二次创作等等。 3、热榜视频一站式分析和创作,极大提升视频创作效率。
音视频、内容平台
Python
安防集成平台
安防集成平台开发(C#、WPF、C++,MFC,VS2019,BOOST,FFMPEG,LIVE555, MPEG4,H.264,GB28181,SQLSERVER2016,插件) 集成接入各厂家视频相关平台、设备、协议,提供统一对外接口SDK,给上层应用或第三方客户二次开发使用。 实现功能:实时视频播放、远程录像播放、本地文件播放、播放控制、PTZ操作、数字PTZ操作、图像显示调整、本地抓取图像、本地抓取录像、录像查询、录像下载、音视频原始码流、标准码流、解码后码流输出、报警、电视墙视频切换等。
音视频、物联网
C#、C++、Microsoft SQL...
CMS-内容管理和播放系统
各楼层和区域的房间及工位预订楼层地图显示,带有以颜色区分的实时预订状态。可自定义用户界面/用户体验。 今日会议目录来自访客管理系统的即将举行的会议活动。可自定义用户界面/用户体验。 仪表板显示实时 ESG 信息,例如室内空气质量、室内和室外温度、碳排放;实时香港天文台天气及风暴警报、RSS 实时新闻推送等。 在入口/接待区域播放宣传视频和电子海报。 提供数字标牌管理系统(CMS)以控制和监控多个办公地点的多个标牌播放器。功能包括内容管理、布局设计、排程与播放列表、播放器分组与监控、紧急消息广播等。 提供可自定义的数字标牌显示模板。 提供工业级数字标牌播放器(安卓和 Windows 平台),支持单路或多路视频输出,适用于各种尺寸和分辨率的液晶显示屏和拼接屏。 支持多媒体内容格式,如视频、图片、音频、文字、PowerPoint、Facebook & YouTube Live、流媒体视频、RSS 推送、实时天气信息、HTML5 等。 提供各种尺寸的 4K 专业显示屏。 与房间与工位预订系统及访客管理系统实现完全整合。
内容平台、音视频
C++、Java、JavaScript、...
硬盘数据克隆与恢复分析工具
DataClone 是面向硬盘/固态硬盘数据恢复场景的桌面端工具,目标是在源盘存在坏道、文件系统异常或历史任务中断的情况下,尽量安全地完成数据克隆、文件系统解析、文件扫描和恢复导出。系统支持新建/打开任务、选择源设备与输出目标,输出 RAW/VHD/VHDX 镜像;提供多阶段复制、暂停/继续/终止、断点续传、全盘校验、LBA 状态位图、十六进制查看等能力。解析侧支持 NTFS、FAT、exFAT 文件系统,可浏览目录树、搜索文件、按扩展名/时间分组、查看节点详情和区段追溯;扫描侧通过文件签名识别图片、文档、压缩包、音视频、SQLite 等候选文件,并支持候选导出、删除项恢复和 PDF 修复副本生成,适合做数据恢复流程中的镜像、分析、验证和结果导出。
人工智能、音视频
C++、Qt、SQLite、Window...
视频防泄密系统
视频防泄密系统是针对于Windows客户机安全,防止外来人员直接访问或间接访问时对客户机进行录屏、截屏等一系 列泄露客户机信息的行为。主要通过用户在服务端配置水印信息,下发到客户机上的客户端,客户端根据获取的水印配置信息生成 文字、二维码、图片和隐式水印。除此之外,客户端还可以通过hook获取到用户在访问客户机时下载的视频文件,并对其进行 AES数据加密。被加密后的视频文件会保存到特定的安全区,并生成链接文件暴露的原下载地址供用户访问,视频播放需要使用专 用的解密播放器才可以播放。另外。播放器这边也可以对客户机上已经存在的视频文件进行加密、绑定账号以及设置播放时间段和 播放时长等一系列参数限制。
安全、音视频
C++、FFmpeg、Postman、W...
录制程序-Violetcam
一款基于Qt框架开发的高性能桌面屏幕录制软件。 简洁直观的用户界面,操作简单,上手零门槛。 强大的录制控制:支持开始、暂停、继续录制。 暂停/继续功能让您轻松跳过无需录制的片段,提升后期编辑效率。 内置高性能视频编码器,确保录制过程流畅稳定。 采用先进的H.264视频编码格式(根据实际二选一或写“先进的H.26x系列编码”)。 H.264编码保障了高清晰度视频的小文件体积,节省存储空间。 输出主流格式的MP4视频文件,兼容各类播放器和编辑软件。 录制帧率可调,满足从普通教学到高速操作的不同需求。 支持多种视频质量预设,从草稿到超清,随心选择。 录制结束后自动保存视频,防止内容丢失。 生成的视频文件体积小,便于通过网络分享和传输。 纯C\C++编写,底层优化,资源占用低,运行速度快。
音视频
C++
音视频编辑引擎 WES 自动化测试平台-万兴喵影
WES 是公司中台部门自研的基于本地执行的 C++ SDK,主要实现时间线编辑、音视频处 理、特效添加以及各类音视频格式导出等功能。原先无中台自动化测试,依赖开发提供的 Demo 进行手工验证。个人主导从 0 到 1 逐步构建起自动化测试框架。
音视频
C++、Python
OTT直播流媒体编码服务器-LiveEncoder
1. 立项背景和目标 为内容供应商如体育联盟、电影电视产业、音视频行业提供专业卓越的音视频质量,采用高精度编码技术、广播级视频传输应用设计,在分发过程中最大限度保留原始视频的图像细节、清晰度和色彩梯度,成为提供OTT/IP视频平台的关键头端组件。 2. 主要功能和特性 - 多信源接入 支持开放标准的系统输入流协议, 支持采集卡(Decklink、AJA等)、Webcam、NDI、TS over TCP/UDP/RTP/RTMP/HTTP/HLS/SRT/ZIXI等。 - 多协议输出 支持开放标准的直播流协议,如RTMP/RTP/SRT/ZIXI/HLS/MP4等,可以接驳各种主流的流媒体服务器。 - 广泛的数据服务 除了音视频,提供标准的数据服务,如隐藏式字幕(CC 608/708)、DVB Subtitle、Teletext、SMPTE2038、广告信号SCTE-104/35透传/转换/插入等,为视频提供合规、增值服务。 - 可靠的冗余设计 提供输入输出信号级别、工作流级别、节点实例和设备级别的故障转移冗余设计,支持自动手动、手动、预设方式的1+1/N+M故障转移方式。 3. 业务流程 工作流:工作配置 -> 输入 -> 预处理 -> 编码 -> 输出 - 工作配置 音视频格式,编码参数设置,数据支持等模版 - 输入 接收客户提供的信号,分解信号内容 - 预处理 如果需要,解码成工作配置的音视频格式,解析各种包含在信号里的数据如字幕、广告点,添加台标,等 - 编码 根据编码参数设置编码成输出格式,支持CPU/GPU编码 - 输出 交织并封装音视频,支持各种流媒体协议输出
音视频、企业服务(saas)
C++、Node.js、TypeScri...
某政府单位电视监测业务仿真测试平台
同时操控多个测试测量仪器和前端(待测物),使用多个通讯协议; 模板化复杂测试,节约大量人力成本和时间成本; 支持人工定制化,控制各测量仪器对前端进行自定义测试; 多线程以及线程间同步, 支持同时测试多台前端
音视频
C#、C/C++、Microsoft P...
  • 1
  • 2
  • 3
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服