一、整体业务定位
本项目是多模态 AI 语音智能终端客户端,面向政企、客服、访谈、会议场景,集成语音转写、大模型 AI 处理、多语种实时翻译三大核心能力,配套完整账号权限审核、本地 + 云端双架构管线,采用现代化 Android Compose+Hilt 分层架构,可承接二次开发、私有化部署、定制化迭代、功能拓展类外包需求。
二、核心业务功能清单
1. ASR 语音识别模块(录音转写核心)
文件转写:本地音频文件批量解析、文字输出
实时转写:麦克风实时收音、边录边出文字
录音转写:本地历史录音文件一键解析
对话模式:双人 / 多人对话区分发言人、分段输出对话文本
2. AI LLM 大模型智能处理模块
LLM 大模型对话:本地 / 云端大模型问答、连续对话交互
AI 预处理:音频降噪、语音过滤、文本清洗、无效内容剔除
AI 后处理:错别字修正、语句通顺化、口语书面化转换
自动摘要:长录音 / 长对话一键生成精简摘要、要点提炼
3. 多语种翻译模块
10 大语种双向互译,支持文本批量翻译
实时同传:搭配实时 ASR,语音实时翻译输出双语字幕
4. 账号安全审核体系
完整 auth 账号认证逻辑,支持账号登录、权限校验、接口鉴权、多端账号管控、非法访问拦截,适配企业内部账号分级审核场景。
三、项目工程架构分层(代码目录说明)
├── data/ 数据层(数据源、远程&本地存储、协议、配置、更新)
│ ├── audio/ 音频底层:音频解码、播放、录音采集能力封装
│ ├── auth/ 账号认证、登录校验、权限审核模型与逻辑
│ ├── config/ 全局统一配置中心,支持190+配置字段动态管理
│ ├── local/ 本地持久化:Room数据库 + 本地独立后台服务
│ ├── protocol/ 大模型专属二进制通信协议,自定义数据编解码
│ ├── remote/ 云端接口、AI服务、语音管线、翻译云端请求封装
│ └── update/ 应用自动更新、版本校验、增量更新逻辑
├── di/ Hilt依赖注入容器,全局统一管理依赖
├── domain/ 领域层:业务实体、UseCase、纯业务逻辑(解耦UI&数据)
├── ui/ 视图层:Jetpack Compose 全页面实现,共20+业务页面
└── util/ 通用工具工具箱,封装18套独立工具类(日期、文件、加密、音频、字符串等)
清晰分层,高内聚低耦合
UI 不写业务、业务不写网络、数据不污染上层。改需求不牵一发动全身。
可配置、可插拔、可私有化
190+ 配置字段:模型地址、超时、语种、开关等都能动态改。
适合企业私有化、内网部署、无外网环境。音频 + AI + 翻译全链路管线化
录音 → 预处理 → ASR → 文本框 → AI 润色 → 摘要 → 翻译 → 保存
整条链路稳定、可监控、可重试、可断点续传。
账号审核体系前置
从 auth 层统一拦截:登录态、权限、审核状态、设备绑定、访问频率。
本地优先,离线可用
Room 本地存储 + 本地服务,断网也能录音、转写、编辑、保存。
上线网自动同步。
Compose 现代化开发
交付快、UI 统一、易扩展、易做深色模式 / 平板适配