音视频 框架或代码包 软件定制 案例

程序聚合 软件案例 音视频 框架或代码包
ASR 全链路质量评估平台
一、立项背景与目标 随着语音交互在智能客服、车载、医疗记录等场景广泛落地,ASR 模型质量直接决定下游业务可用性。但业内存在两个痛点:一是模型评测常依赖厂商宣传数字,缺乏独立、可复现的客观评估手段;二是选型时面对百度、讯飞、阿里等多家厂商,难以在相同测试集上横向比较真实能力、错误类型与服务性能。本项目"ASR 全链路质量评估平台"即针对上述背景立项,目标是搭建一套端到端、可扩展、可复现的 ASR 自动化质量评估工具:输入一批待测音频及对应标准答案,平台自动调用被测 ASR 接口完成转写,基于编辑距离计算 CER 与 WER,细分替换/删除/插入三类错误,挖掘高频错误模式与场景短板,输出含 Bad Case 与优化建议的评估报告。项目既可作为个人测试工程能力的综合实战,也可作为团队 ASR 选型与回归测试的基础设施。 二、软件功能 平台提供命令行一体化入口,功能包括:测试数据生成(正弦波合成与 Windows TTS 真人发音两条路径)、批量调用真实 ASR 接口、文本归一化、多维度指标计算、错误画像分析、并发压测、Markdown 与交互式 HTML 双格式报告生成。所有第三方凭证均通过环境变量注入,仓库零明文敏感信息。 三、核心功能模块 1) 指标计算模块(metrics.py):基于 Levenshtein 编辑距离的动态规划实现,对参考文本与识别结果做字符级与词级双向对齐,输出命中、替换、删除、插入四类计数及派生比率,并以 jiwer 库做数值交叉校验。 2) 文本归一化模块(textnorm.py):依次执行去标点、NFKC 全角转半角、中文数字转阿拉伯数字、合并被空格分隔的单字母序列、统一小写,专用于消除"表示形式不同"导致的虚假错误。 3) ASR 客户端层(asr_client.py):以 typing.Protocol 定义统一 transcribe 接口,实现 Mock、通用 HTTP、百度(HTTP+token 两步鉴权)、讯飞(WebSocket+HMAC-SHA256 签名+流式分帧)四类客户端,由工厂函数按配置返回。 4) 错误分析模块(error_analysis.py):聚合字符级与词级错误构成、按场景标签分组画像、用 Counter 挖掘高频替换对/漏识字/多识字,并基于启发式规则自动生成优化建议。 5) 并发压测模块(benchmark.py):基于 ThreadPoolExecutor 线程池对真实接口压测,统计 QPS、延迟 P50/P90/P99、成功率与错误分类,自动解读百度业务错误码。 6) 报告生成模块(report.py / report_html.py):Jinja2 渲染 Markdown 与离线 HTML 报告,后者使用本地 vendor 的 ECharts + echarts-wordcloud
人工智能、音视频
PowerShell、Python
高性能 QUIC 通信框架设计与实现 (AI 辅助全栈实现)
项目背景:该系统适用于弱网、高丢包、高抖动等复杂网络环境下的实时数据与音 视频传输场景,涵盖多人会议、直播连麦、在线教育、远程协作、工业采集、车载回传、 安防监控及物联网边缘上传等业务。同时,该系统可作为中心转发与媒体中继节点,承 担上行流的接入、解析、转发、路由和分发能力,并支持视频流与结构化业务数据在服 务端的统一接入、存储与后续处理,从而提升整体传输效率、系统稳定性与用户体验。
音视频
C++、OpenGL、OpenSSL
用于批量下载Kemono帖子内容的高度可自定义性的命令行工具-KToolBox
该项目是一个用于批量下载 Kemono 中帖子内容的实用命令行工具,在 GitHub 上开源,500+ stars。 ## 功能 - 支持多文件并发下载 - API 调用和下载失败后 **自动重试** - 支持下载单个帖子以及指定的画师的 **全部帖子** - 可 **更新已下载** 的画师目录至最新状态 - 支持自定义下载的帖子/画师的 **文件和目录名格式**、**目录结构** - 例如帖子目录可设置为 `[2025-01-02]_TheTitle` 的格式,图片文件设置为按顺序的 `1.jpg`、`2.jpg` 等 - 当你希望将某作者的所有帖子图片统一存放至一个目录下,以便预览,可以使用 `job.mix_posts` 配置项搭配自定义文件名格式,你将得到几百上千张图片的目录 - 如 `[2025-01-02]_TheTitle_1.jpg`、`[2025-01-02]_TheTitle_2.jpg`、`[2025-01-02]_TheTitle_3.jpg` 等 - 支持排除 **指定格式** 的文件或仅下载指定格式的文件 - 例如当你不想下载庞大重复的 PSD 和压缩包文件时,可以在配置中排除 `.psd` 和 `.zip` 文件 - 支持按**文件大小**过滤下载 - 例如,如果你想在磁盘空间不足时避免下载大型视频文件,可以在配置中设置最大文件大小限制 - 你也可以设置最小文件大小,以跳过下载缩略图或预览图片 - 支持按帖子**标题关键词**过滤下载 - 例如你只想下载标题中包含“表情、効果音差分”的帖子,可以使用 `sync-creator` 命令的 `--keywords` 选项 - 如果你想排除标题中包含指定关键词的帖子,可以使用 `--keywords-exclude` 选项 - 支持按帖子发布日期**时间范围**过滤下载 - 能够解析帖子页面 HTML 多信息文本中包含的图片并下载 - 这类帖子特征为:浏览器页面刚进入时图片可能没有加载出来,且没有预览图 - 能够收集帖子页面中列出的**网盘链接**并保存至文本文件 - 可搜索画师和帖子,并导出结果 - 如果你希望自己处理画师和帖子数据,可以使用该功能导出 JSON 数据 - 支持全平台,并提供 iOS 快捷指令 - 纯 Python 分支可在 iOS 的 a-Shell 或浏览器的 Pyodide 上运行
内容平台、音视频
Python、Pytest、dotenv
视频字幕通翻译制作-在线视频字幕
1、项目背景:网络视频流行,对海外视频影片的字幕翻译制作需求增长,为客户提供准确便捷高效的字幕翻译制作平台 目标:视频批量中英文字幕翻译制作,用户便捷高效翻译转换,促进海外视频影片传播推广 2、软件功能:通过字幕通翻译制作平台,用户可在线进行视频批量中英文字幕翻译制作,准确便捷高效的视频字幕翻译制作工具 核心功能模块:包括视频导入下载,视频切轴,视频字幕翻译,视频翻译审校,视频压制与上传,及各部分问题处理,根据角色按流程分工处理,管理员进行总体管控,各模块由组长、小组长、组员分别处理完成对应任务,总体实现在线视频批量中英文字幕翻译制作 3、业务流程和功能路径:需求规划分析、架构设计与开发、编码与测试、部署上线与维护
企业内部管理、音视频
C#、.NET Framework、AS...
AVS+解码器
1.对输入的符合《GY/T 257.1-2012 广播电视先进音视频编解码 第1部分:视频标准》的AVS/AVS+基本流进行分帧解码,解码输出为YUV图像帧。 2.支持多线程多帧同时解码。 3.支持AVS/AVS+码流的序列头信息提取。 4.提供演示程序演示分帧解码,以及YUV数据在windows平台下的显示,以及提供windows下播放软件,解码基本流和TS流。
音视频
视频字幕提取及擦除
将待处理的视频输出为字幕擦除后的视频及附加字幕提取文件(若客户需求) 需求多为要能兼容横板及竖版视频,字幕多为英文或中文单行及多行形式 难点在于成本及输出效果,成本通过下述项目实现具体阐述,输出效果的区别在于无码化,详见上传的结果示例
音视频、人工智能
Python、OpenCV、PyTorc...
  • 1
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服