程序聚合 软件案例 听词 https://www.voicute.com/

听词 https://www.voicute.com/

2026-06-10 17:54:49
行业:人工智能
载体:网站
技术:Java、Python

业务和功能介绍

用户在线输入自定义唤醒词、命令词,平台全自动完成训练量化,几秒内输出适配端侧设备的轻量模型;同步支持声纹核验模型生成,附带可直接集成的 SDK,全程无需人工干预,自助完成整套语音方案获取。

1、项目有哪些具体功能模块
包含用户注册登录、关键词提交、自动化模型训练、模型文件打包下载、配套 SDK 分发、声纹模型定制、订单自动交付、后台订单管理八大模块。
2、项目的主要功能描述
用户在线输入自定义唤醒词、命令词,平台全自动完成训练量化,几秒内输出适配端侧设备的轻量模型;同步支持声纹核验模型生成,附带可直接集成的 SDK,全程无需人工干预,自助完成整套语音方案获取。

项目实现

1、个人负责任务
全程独立负责产品构思、前后端编码、训练调度服务搭建、自动化交付流程开发、服务器部署运维、站点上线运营,全程单人完成从 0 到 1 搭建并持续运营 voicute 官网。
2、技术栈、架构,亮点难点
采用前后端分离架构,训练链路自研调度逻辑;大量借助 Claude Code 辅助算法调试、代码编写优化;适配低算力端侧设备量化压缩;难点在于多唤醒词区分防误触、自动化训练稳定性,亮点是全流程无人值守交付、无门槛适配零散小单客户。

示例图片视频


蚂蚁
15天前活跃
方向: 人工智能-语音识别与合成、后端-Java、
交付率:100.00%
相似推荐
离线语音转换工具-Gzx语音转换助手
1、立项原因 旨在解决网络环境不佳或完全断网场景下,开发者无法依赖云端服务进行高效编码的问题。尤其针对“vibe coding”(氛围式/对话式编程)开发模式中,需频繁口头表述需求、反复整理和调整关键词的痛点,通过引入本地化的语音转换输入能力,降低操作门槛,提升离线状态下的开发效率与体验。 2、行业场景 适用于边缘计算、野外作业、移动车载、工业现场、保密内网等弱网或断网环境下的软件开发场景。在此类业务背景下,传统在线IDE或云编码工具不可用,而开发者仍需快速迭代原型或调试代码,本方案可为其提供轻量、即时、无需联网的语音辅助编程支持。 3、功能模块 入口(`main.py`):负责单实例互斥、日志初始化、全局异常钩子,以及启动画面展示与模型延迟加载的协调。 语音识别引擎(`asr_engine.py`):核心模块,统筹音频采集、VAD切句、ASR识别、实时模拟输入和LLM异步纠错的全流程。 配置管理(`config.py`):单例模式读写`settings.json`,支持配置变更通知和原子写入。 LLM客户端(`llm_corrector.py`):封装HTTP请求,实现与本地或远程大语言模型的通信、可用性探测及超时重试。 系统托盘(`tray_app.py`):基于pystray实现托盘图标、全局快捷键(左Alt+Q)监听及状态显示。 启动画面(`splash.py`):无边框进度窗口,带毛玻璃效果,展示模型加载进度。 设置界面(`settings_ui.py`):独立线程运行的Tkinter配置窗口,支持LLM地址/模型修改及连接测试。 VAD指示器(`vad_indicator.py`):鼠标旁动态彩色光点,实时显示语音概率和音量大小。 4、功能描述 核心工作流程如下: 用户按下全局热键(左Alt+Q)后,系统通过PyAudio采集麦克风音频,经Silero VAD进行语音活动检测与切句,再由SenseVoiceSmall端到端模型实时识别为文字。识别结果立即模拟键盘输入上屏,确保低延迟反馈。 同时,系统将识别文本送入LLM纠错队列,在用户静默3秒后自动触发批量纠错。LLM修正标点和错字后,通过模拟退格删除原文并粘贴修正文本,实现无感替换。纠错过程支持取消重入——若用户在LLM处理中继续说话,当前请求被取消,未处理句子自动归还队列等待下一批次。
音乐分享平台
平台面向普通用户与管理员,提供邮箱验证登录、角色权限控制、音乐收藏管理、分类管理、音乐文件安全上传及元数据维护等功能。 前端采用 Vue.js 构建响应式管理界面,后端基于 Spring Boot 提供业务接口与数据处理能力,并部署于 Linux 服务器,通过 Nginx 完成服务代理与发布。用户可按关键词、音乐类别及歌曲元数据进行快速搜索和筛选;管理员可对用户、音乐资源、分类及上传内容进行审核和管理。 项目采用 Scrum 敏捷开发模式,结合测试、文档和权限控制保障数据隐私、系统安全与代码质量。
万能水印相机打卡
本项目为外勤工作场景打造的水印相机工具,旨在解决传统照片无时间、地点、人员信息,导致考勤、工程验收、巡检记录无法溯源、易篡改的问题。 业务背景覆盖建筑施工、物业巡检、物流配送、环卫检查、外勤打卡等行业,用户需要快速拍摄带可篡改水印的现场照片,作为工作留痕与合规凭证,提升管理效率与数据可信度。
直播平台-嗨播谷
一站式短视频生态APP全部开发完成,集内容浏览、视频创作、直播带货、流量分润于一体。完善创作者激励、商家入驻、订单交易系统,适配多端流畅运行,依托智能分发机制高效引流,为个人创作者与商家提供完整流量变现渠道。
Go+FFmpeg 抖音财经股票指标视频自动化生成系统
一、项目简介 本人自1993年接触证券市场,2004年尝试用PHP开发自动化指标筛选程序,因并发性能限制,批量数据运算耗时过长。2015年转向Go语言,依托原生并发模型,将运算耗时由半小时优化至1分钟内,期间对比Python、Julia等语言后,最终选定Go为主力开发语言。 2025年启动本项目:基于自研股票指标函数体系,搭建财经短视频自动化流水线,将量化指标可视化内容批量生成视频并适配抖音平台分发标准。 技术迭代上,初期采用fogleman/gg生成PNG图片序列,再由FFmpeg合成视频。经持续优化,现绝大部分素材渲染直接交由FFmpeg完成,仅在FFmpeg耗时过高、分辨率无法满足需求时,回退使用GG生成静态图片。整套系统已实现数据解析、图表渲染、视频合成一站式自动化。 二、业务功能 批量指标运算:批量读取量化数据,自动运算生成股票指标信号。 数据可视化渲染:支持FFmpeg滤镜实时绘图,兼容GG静态PNG绘图兜底方案。 短视频自动合成:按平台规范自动合成视频,适配抖音等主流短视频平台分辨率与码率要求。 全流程自动化调度:从数据到视频全链路自动化,支持持续产出可视化素材。 智能渲染链路切换:根据耗时、画质需求,自动选择最优渲染方案(FFmpeg主链路/GG兜底)。 三、技术栈 Go、FFmpeg、fogleman/gg、股票量化接口、自动化调度脚本
帮助文档   Copyright @ 2021-2024 程聚宝 | 浙ICP备2021014372号
人工客服