AI 语音智能模块 — 端云协同 AI 交互系统

开发中

AI 工程化

一个面向多终端载体的端云协同 AI 语音交互系统实验,探索 STT、LLM、TTS、Agent 工具调用、运行配置和可观测性如何组合成低延迟、可维护的语音链路。

AI 语音智能模块项目封面,展示端云语音链路、STT、LLM、TTS 和 Agent 编排
创建时间
更新时间

项目概要

所属阶段
开发中
公开程度
项目档案
下一步
继续推进 Trace、延迟、Apply / Reload、工具清单一致性和端到端稳定性测试。
与其他项目的关系
AI 工程化深水区,验证端侧实时交互、云端编排、Agent 工具调用和后台配置化。
边界说明
多终端协同和一脑多形属于未来方向;不公开内部地址、账号、密钥、MQTT 默认值或生产接口。
技术栈
  • Python
  • Rust
  • WebSocket
  • gRPC
  • SenseVoice
  • Qwen TTS
  • LLM
  • MCP
  • MySQL
  • Docker
  • Kubernetes
AILLMvoiceagentMCPedge-cloud

一句话定位

AI 语音智能模块是一个端云协同的 AI 交互系统实验,重点不是“模型能不能调用”,而是“真实语音系统能不能稳定、低延迟、可配置、可观测、可持续迭代”。

它可以理解为一个可挂载到不同终端载体上的语音智能层:端侧负责强实时交互和设备接入,云端负责模型编排、工具调用、运行配置和 Trace 观测。

项目背景

语音交互会把音频采集、VAD、网络传输、STT、LLM、TTS、播放队列、打断控制和设备状态放到同一条链路里。任何一段抖动都会被用户直接感知。

这个项目用于沉淀这些工程问题:如何拆分端侧和云端职责,如何组织 STT / LLM / TTS 流水线,如何让 Agent 工具调用可审计,如何让后台配置真正影响运行时,而不是停留在静态配置文件里。

关键链路

用户语音输入 -> 端侧 VAD -> 音频上传 -> STT -> LLM -> Tool / Agent -> TTS -> 流式播放 -> 打断控制

这条链路的关键不是把模块串起来,而是控制端到端延迟、处理打断、管理播放队列,并在模型或网络波动时有可降级路径。

技术架构

端侧

  • 硬件唤醒、音频采集、WebRTC VAD、TTS 播放、语音打断、本地音频 ducking、设备接入、WebSocket 客户端。
  • 端侧优先保证交互实时性和设备稳定性,不承载复杂模型推理。

云端

  • Gateway、STT Service、LLM Service、TTS Service、MCP / Tool Service、Runtime Config、Trace / Observability。
  • 客户端到云端使用 WebSocket,服务间优先按 gRPC 拆分,后台配置落到 MySQL 的运行配置表。

当前模型口径

  • STT:SenseVoiceSmall。
  • LLM:Qwen / OpenAI-compatible API。
  • TTS:Qwen TTS Realtime / qwen3-tts-flash-realtime。
  • 工具协议:MCP / Function Calling / 本地 Agent。

当前完成度

已完成

  • 端云分离基础链路与 WebSocket 客户端接入
  • STT / LLM / TTS 基础编排
  • 语音打断基础能力与部分 MCP 工具调用
  • 后台配置化雏形

进行中

  • 端到端延迟优化和 Trace 链路观测
  • Agent 工具清单治理
  • 后台 Apply / Reload 稳定性
  • 端到端测试和运行状态治理

未来计划

  • 多 Agent 场景模板和机器人任务编排
  • 更完整的 Admin UI 与真实 Demo 展示页
  • 更强可观测性
  • 多终端协同仍属于未来方向,不写成已交付能力

工程指标

首包音频

当前目标:尽量压到 800ms 左右。

关注原因:决定语音交互是否有实时感。

端到端回复

当前目标:尽量接近 2s。

关注原因:STT、LLM、TTS 三段叠加最容易失控。

打断响应

当前目标:用户打断后快速停止播放并切换状态。

关注原因:影响语音系统是否像“可对话”的系统。

可降级路径

当前目标:模型、工具、TTS Provider 可替换。

关注原因:避免单点不可用拖垮整条链路。

可观测性

当前目标:通过会话 ID 串联 STT、LLM、TTS、Tool Trace。

关注原因:定位慢请求、失败工具和异常状态。

与其他项目的关系

AI 语音智能模块是项目地图里的 AI 工程化实践之一,不是 wzk.icu 的唯一主线,也不再和 AscendLab 混写。AscendLab 负责公开工具实验,这个页面负责记录端云协同语音系统的工程边界和阶段进展。

风险与边界

  • 这是个人 AI 工程化实验项目,不是对外承诺 SLA 的生产产品。
  • 当前能力、进行中能力和未来愿景分开描述,避免把尚未落地的多终端协同写成已交付能力。
  • 页面不展示内部地址、密钥、服务器、账号、MQTT 默认值、真实生产接口或公司敏感信息。
  • 多终端协同执行仍属于未来愿景,不写成已经完整落地的能力。

Project Asset

项目资产连接

这个项目如何连接专题、阅读路径、系列文章和后续内容计划。

关联阅读路径

关联系列

相关内容入口

项目时间线

下一步内容计划

  • 补充端侧 / 云端 / 后台三层架构说明。
  • 继续记录 STT / LLM / TTS、MCP / Tool / Agent、Trace / Observability、Apply / Reload。
  • 明确一脑多形仍是未来方向。

项目 FAQ

一脑多形是否已经完整落地?
没有。它是未来方向,当前公开页面只把端云协同语音模块作为实验项目记录。