微光实验室 · 标签归档
标签: 实时语音
共 17 篇文章,按主题汇总相关教程、案例、工程实践和阶段性总结。
GPT-Live 到底发布了什么:从回合式语音到连续交互循环
一个语音 Agent 可以做到 300 毫秒出声,仍然可能很难用。 用户只是停下来想了半秒,它抢着回答;用户说“等等”,它要到整段 TTS 播完才停;搜索需要十几秒,会话就像断线;后台结果回来时,用户已经换了问题,它却继续念旧答案。
实现 GPT-Live-like:两条路线、一个控制面和六阶段验收
开头:先把“像 GPT-Live”改写成可验收的问题 “我们也做一个 GPT-Live-like 系统”,听起来像一个模型选型任务。团队可能先替换 Realtime 模型,或者把原有 ASR、LLM、TTS 全部推翻...
GPT-Live 与 GPT-Realtime:产品模型和公开 API 不应混写
开头:把发布页里的名字填进 model,是一次很典型的事故 新模型发布后,团队最容易出现一条看似合理的工作流:产品经理看到了 ChatGPT Voice 的新体验,技术文章写着 GPT-Live-1,开发者便把 model 配置改成同名字符...
前台语音与后台任务为什么要做双循环:从委派到结果新鲜度
一个迟到结果如何变成事故 用户对语音 Agent 说:“帮我找上海周末适合孩子的活动。”系统把搜索交给后台,前台没有卡住,还能自然回应:“好,我查一下,你可以继续补充要求。” 两秒后,用户补充:“不要室外的,最好周日下午。
打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛
元信息 文章类型:语音交互状态机与事件协议 目标读者:实时语音 Agent、智能硬件、客服语音和多模态系统的工程师与技术负责人 读者问题:怎样区分打断、附和、旁人语音、环境声和停顿,并让取消、播放与历史最终一致?
全双工语音 Agent 如何评测:从首音延迟到事件级验收
元信息 文章类型:Voice Agent 评测方法与验收合同 目标读者:正在开发实时语音、客服、车载、机器人或工具型 Voice Agent 的工程团队 读者问题:除了首音延迟,怎样判断系统真的会倾听、会打断、能恢复并正确完成任务?
GPT-Live 可能怎样实现:从公开行为到架构约束的证据梯度
开头:同一种体验,可能来自完全不同的系统 用户在系统说话时插入一句“等等,不是杭州,是青岛”,旧回答迅速停下,新答案沿着纠正后的目标继续。看到这个行为,很容易写出一个看似专业的结论:GPT-Live 一定使用双音频流...
WebRTC 已经双向,语音 Agent 为什么还会抢话?
备用标题 1. 语音 Agent 全双工的三层验收:传输、推理与话权 2. 音频能同时收发之后,真正难的是四份状态保持一致 3. 从 sendrecv 到自然打断:全双工语音系统还缺什么 开头钩子 一个语音 Agent 的 WebRTC 指...
开放权重不是唯一控制权:Kimi K3、Hy3 与 Seed 的九项交付比较
企业评估模型时,最容易问错的一个问题是:它到底开放还是闭源? 这个二分法对软件许可证有用,却不足以描述一套 AI 系统真正交给采用团队的东西。拿到权重,意味着可以固定版本、选择部署位置并修改运行时,但不代表已经获得成熟的工作流...
同一画面,两种动作:多模态 Agent 如何验证状态是否足够
先看两个合成工程场景。它们不是公开事故,也不是作者实测。 机械臂在两次测试中看到几乎相同的 RGB 画面:夹爪已经合拢,杯子位于指尖之间。策略都准备“向上抬升”。第一次杯子被稳定拿起;第二次杯子刚离开桌面就滑落。
生产模型路由不是一次难度分类:从硬约束可行域到状态检查点升级
发布边界:产品能力和公开案例绑定来源;通用控制面、检查点与副作用账本属于工程设计,不宣称为供应商内部实现。 生产模型路由不能被简化为一次 Prompt 难度分类。
低延迟不是更快地猜:EOU、Barge-in 与 Turn Protocol 为什么必须统一
发布边界:协议、状态机和预算属于工程设计;供应商事件名只在对应产品边界内成立,不冒充作者已完成的线上实测。 摘要 语音 Agent 的低延迟不只是缩短静音阈值。EOU 决定何时允许一轮产生后果,Barge-in 决定旧一代工作何时失去提交资...
1.2GB 离线语音 Agent 真正值得复用的,不是 908ms
摘要:一台 Galaxy S23 Ultra 上的离线语音 Agent 曾测得 908ms 首音频和 1,116MB PSS。但真正值得复用的不是这两个数字,而是四阶段职责、状态感知 Tool Schema...
Shippy 的启示:可靠 Agent 不是“更听话”,而是更少犯错空间
摘要:高风险 Agent 的可靠性不能只押注于模型更强。Shippy 的工程价值 在于用版本化行为工件、确定性 CLI、会话隔离和整套 Agent Eval,持续缩小 动作空间、状态空间与错误后果。
从 Java 后端到实时语音 AI:我的工作为什么越来越像 FDE
阅读说明:本文只使用已披露的 Java、Go、Python、实时语音、端云链路和机器人端经历,不虚构客户交付、采用率或 ROI;重点是复盘工程所有权如何变化。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
OpenAI 的首款硬件不是“音箱”问题:无屏 AI 伴侣成立的十二个条件
发布边界:无屏、可移动、音箱形态仍来自媒体匿名信源;OpenAI 官方只确认团队与设计合作。 核心结论 1. OpenAI 已确认的是团队与设计能力,不是最终产品规格。[S01] 2. Bloomberg 所述“无屏、可移动...
GPT-5.6 Sol、Terra、Luna 怎么选:内容仓库为什么默认 Sol + Medium
推荐标题:GPT-5.6 Sol、Terra、Luna 怎么选:内容仓库为什么默认 Sol + Medium 备选标题1:Sol + Medium 为什么适合长期内容仓库 备选标题2:内容仓库如何选择 GPT-5.6 模型与推理档位 备选标...