AI 语音智能模块 — 端云协同 AI 交互系统
开发中AI 工程化
一个面向多终端载体的端云协同 AI 语音交互系统实验,探索 STT、LLM、TTS、Agent 工具调用、运行配置和可观测性如何组合成低延迟、可维护的语音链路。
项目概要
- 所属阶段
- 开发中
- 公开程度
- 项目档案
- 下一步
- 继续推进 Trace、延迟、Apply / Reload、工具清单一致性和端到端稳定性测试。
- 与其他项目的关系
- AI 工程化深水区,验证端侧实时交互、云端编排、Agent 工具调用和后台配置化。
- 边界说明
- 多终端协同和一脑多形属于未来方向;不公开内部地址、账号、密钥、MQTT 默认值或生产接口。
- 技术栈
- Python
- Rust
- WebSocket
- gRPC
- SenseVoice
- Qwen TTS
- LLM
- MCP
- MySQL
- Docker
- Kubernetes
一句话定位
AI 语音智能模块是一个端云协同的 AI 交互系统实验,重点不是“模型能不能调用”,而是“真实语音系统能不能稳定、低延迟、可配置、可观测、可持续迭代”。
它可以理解为一个可挂载到不同终端载体上的语音智能层:端侧负责强实时交互和设备接入,云端负责模型编排、工具调用、运行配置和 Trace 观测。
项目背景
语音交互会把音频采集、VAD、网络传输、STT、LLM、TTS、播放队列、打断控制和设备状态放到同一条链路里。任何一段抖动都会被用户直接感知。
这个项目用于沉淀这些工程问题:如何拆分端侧和云端职责,如何组织 STT / LLM / TTS 流水线,如何让 Agent 工具调用可审计,如何让后台配置真正影响运行时,而不是停留在静态配置文件里。
关键链路
用户语音输入 -> 端侧 VAD -> 音频上传 -> STT -> LLM -> Tool / Agent -> TTS -> 流式播放 -> 打断控制
这条链路的关键不是把模块串起来,而是控制端到端延迟、处理打断、管理播放队列,并在模型或网络波动时有可降级路径。
技术架构
端侧 Edge
实时交互与设备接入
- 硬件唤醒 / 采音
- WebRTC VAD / 打断
- TTS 播放 / 音频 ducking
- 设备接入 / WebSocket Client
云端 Cloud
智能编排与模型服务
- Gateway / Session Runtime
- STT Service / LLM Service / TTS Service
- MCP / Tool Service
- Trace / Observability
后台 Admin
配置化与运营治理
- Bot / Robot / Agent 配置
- MCP Server 管理
- 模型参数 / Runtime Config
- Apply / Reload / 状态查看
端侧
- 硬件唤醒、音频采集、WebRTC VAD、TTS 播放、语音打断、本地音频 ducking、设备接入、WebSocket 客户端。
- 端侧优先保证交互实时性和设备稳定性,不承载复杂模型推理。
云端
- Gateway、STT Service、LLM Service、TTS Service、MCP / Tool Service、Runtime Config、Trace / Observability。
- 客户端到云端使用 WebSocket,服务间优先按 gRPC 拆分,后台配置落到 MySQL 的运行配置表。
当前模型口径
- STT:SenseVoiceSmall。
- LLM:Qwen / OpenAI-compatible API。
- TTS:Qwen TTS Realtime / qwen3-tts-flash-realtime。
- 工具协议:MCP / Function Calling / 本地 Agent。
当前完成度
已完成
- 端云分离基础链路与 WebSocket 客户端接入
- STT / LLM / TTS 基础编排
- 语音打断基础能力与部分 MCP 工具调用
- 后台配置化雏形
进行中
- 端到端延迟优化和 Trace 链路观测
- Agent 工具清单治理
- 后台 Apply / Reload 稳定性
- 端到端测试和运行状态治理
未来计划
- 多 Agent 场景模板和机器人任务编排
- 更完整的 Admin UI 与真实 Demo 展示页
- 更强可观测性
- 多终端协同仍属于未来方向,不写成已交付能力
工程指标
首包音频
当前目标:尽量压到 800ms 左右。
关注原因:决定语音交互是否有实时感。
端到端回复
当前目标:尽量接近 2s。
关注原因:STT、LLM、TTS 三段叠加最容易失控。
打断响应
当前目标:用户打断后快速停止播放并切换状态。
关注原因:影响语音系统是否像“可对话”的系统。
可降级路径
当前目标:模型、工具、TTS Provider 可替换。
关注原因:避免单点不可用拖垮整条链路。
可观测性
当前目标:通过会话 ID 串联 STT、LLM、TTS、Tool Trace。
关注原因:定位慢请求、失败工具和异常状态。
与其他项目的关系
AI 语音智能模块是项目地图里的 AI 工程化实践之一,不是 wzk.icu 的唯一主线,也不再和 AscendLab 混写。AscendLab 负责公开工具实验,这个页面负责记录端云协同语音系统的工程边界和阶段进展。
风险与边界
- 这是个人 AI 工程化实验项目,不是对外承诺 SLA 的生产产品。
- 当前能力、进行中能力和未来愿景分开描述,避免把尚未落地的多终端协同写成已交付能力。
- 页面不展示内部地址、密钥、服务器、账号、MQTT 默认值、真实生产接口或公司敏感信息。
- 多终端协同执行仍属于未来愿景,不写成已经完整落地的能力。
Project Asset
项目资产连接
这个项目如何连接专题、阅读路径、系列文章和后续内容计划。关联阅读路径
- AI Engineering 专题STT / LLM / TTS / Agent 的应用链路
- AI Infra 专题模型服务、Trace、可观测和成本治理
关联系列
- LangChain / LLM 应用系列Agent、工具调用和 RAG 基础
- AI 调研 / AI Engineering 系列AI 工程背景和技术趋势
下一步内容计划
- 补充端侧 / 云端 / 后台三层架构说明。
- 继续记录 STT / LLM / TTS、MCP / Tool / Agent、Trace / Observability、Apply / Reload。
- 明确一脑多形仍是未来方向。
项目 FAQ
- 一脑多形是否已经完整落地?
- 没有。它是未来方向,当前公开页面只把端云协同语音模块作为实验项目记录。