微光实验室 · 博客归档

博客 第3页

记录技术探索与工程思考,共 731 篇文章。

微光实验室技术博客封面:AI 工程化、Java 后端与长期写作
全部文章 Java247后端工程50微服务9AI Engineering86LLM109Big Data267Data Engineering59Kubernetes / 云原生3实时语音1机器人39长期成长1 更多标签 →
原创工程实践 预计阅读时间: 18 分钟

Video VAE 不是末端编解码器:它如何定义视频模型的系统边界

发布边界:不同模型家族的时间压缩、空间压缩、潜通道和缓存语义必须分别核对;本文不声称已完成作者自有重建或显存实验。 摘要 Video VAE 在主模型之前就决定时空网格、信息损失和 token 数量,在主模型之后又决定解码峰值...

AI 调研与资料整理 预计阅读时间: 22 分钟

VLA 已经能输出动作,为什么机器人仍需要多时间尺度闭环

发布边界:控制频率、接口字段和云边分工均为工程量级与示例;须按具体机器人、传感器、网络和风险等级实测校准。 摘要 VLA 能共享视觉、语言与动作表示,却不能取消传感器时钟、动力学、关节限位、网络故障和事故责任。

AI 调研与资料整理 预计阅读时间: 29 分钟

从世界状态到可执行控制:Cosmos 3 Edge 与机器人控制器之间应建立什么合同

发布边界:本文依据公开技术资料提出接口与安全架构;4B、15 Hz 和公开性能数据只在原始测试条件内成立,不推广为任意硬件或机器人上的实测承诺。

AI 调研与资料整理 预计阅读时间: 31 分钟

Inkling 975B 可部署性阶梯:开放权重之后,真正的门槛才开始

发布边界:运行时版本、托管模态与硬件路径需发布前复核;作者容量计算只作理论估算,不得改写为官方验证配置或部署建议。 摘要 Inkling 的 Apache 2.0 权重可以下载,但可获得并不等于可适配、可装载、可运行、可验证多模态...

AI 调研与资料整理 预计阅读时间: 29 分钟

1M Context 也会失忆:Coding Agent 为什么需要 Context Ledger

发布边界:价格、会员层级、模型 ID、默认 effort、缓存与 compact 行为需在发布前复核;本文不声称已完成本地吞吐或成本实测。 摘要 1M Context 解决容量上限,却不能自动保证约束没有在 compact 中丢失...

AI 调研与资料整理 预计阅读时间: 25 分钟

权重已到、Recipe 还在变:Kimi K3 发布后该怎样做工程验收

摘要: Kimi K3 的完整权重已经出现在官方仓库,但“权重可获得”不等于 “生产可运营”。本文把一次开放权重发布拆成七道可审计门,并给出可直接落库的 Release Acceptance Ledger,用来约束 Revision...

AI 调研与资料整理 预计阅读时间: 22 分钟

高能力模型评估为什么需要一份可验证的 Containment Contract

发布边界:本文讨论公开事件与工程控制框架,不声称掌握未公开事故细节,也不把架构建议冒充已经完成的生产验证。 摘要 “禁公网”不等于“没有公网能力”。代理、DNS、身份服务、缓存、共享文件系统和短期凭证都可能形成传递可达路径。

AI 调研与资料整理 预计阅读时间: 26 分钟

生产模型路由不是一次难度分类:从硬约束可行域到状态检查点升级

发布边界:产品能力和公开案例绑定来源;通用控制面、检查点与副作用账本属于工程设计,不宣称为供应商内部实现。 生产模型路由不能被简化为一次 Prompt 难度分类。

AI 调研与资料整理 预计阅读时间: 28 分钟

Ask/Allow 不是安全边界:企业 Coding Agent 必须建立四层治理

发布边界:四层模型是工程控制框架;具体产品的权限、隔离和合规能力必须逐项核验。 交互式 Ask/Allow 只能表达一次人机确认,不能承担企业安全边界。

AI 调研与资料整理 预计阅读时间: 29 分钟

同一套 ComfyUI 工作流,第二次为什么快一倍?

发布边界:标题中的快一倍是待解释现象,不是作者实测承诺;任何性能结果都必须绑定工作流、硬件、版本和运行条件。 摘要 同一套 ComfyUI 工作流第二次运行明显更快,可能来自模型常驻、编译预热、节点缓存或实际执行子图变化...

AI 调研与资料整理 预计阅读时间: 39 分钟

低延迟不是更快地猜:EOU、Barge-in 与 Turn Protocol 为什么必须统一

发布边界:协议、状态机和预算属于工程设计;供应商事件名只在对应产品边界内成立,不冒充作者已完成的线上实测。 摘要 语音 Agent 的低延迟不只是缩短静音阈值。EOU 决定何时允许一轮产生后果,Barge-in 决定旧一代工作何时失去提交资...

AI 调研与资料整理 预计阅读时间: 20 分钟

Token 单价更低,Agent 任务为什么反而更贵

摘要:IBM 的一次 AppWorld 实验中,纸面 Token 单价更低的模型反而产生 更高任务总成本。多步 Agent 的正确计量单位不是一次调用,而是包含缓存、 工具、重试、升级、失败和人工处理的完整任务轨迹。

AI 调研与资料整理 预计阅读时间: 30 分钟

1.2GB 离线语音 Agent 真正值得复用的,不是 908ms

摘要:一台 Galaxy S23 Ultra 上的离线语音 Agent 曾测得 908ms 首音频和 1,116MB PSS。但真正值得复用的不是这两个数字,而是四阶段职责、状态感知 Tool Schema...

AI 调研与资料整理 预计阅读时间: 20 分钟

Pi 真的打赢 Claude Code 和 Codex 了吗?Databricks Harness 基准的正确读法

Databricks 在内部真实代码任务上比较了多种模型与 Coding Agent Harness。 最容易传播的说法是“Pi 打赢 Claude Code 和 Codex”,但公开证据支持的是一个 更窄、也更有工程价值的结论

AI 调研与资料整理 预计阅读时间: 20 分钟

Shippy 的启示:可靠 Agent 不是“更听话”,而是更少犯错空间

摘要:高风险 Agent 的可靠性不能只押注于模型更强。Shippy 的工程价值 在于用版本化行为工件、确定性 CLI、会话隔离和整套 Agent Eval,持续缩小 动作空间、状态空间与错误后果。

AI 调研与资料整理 预计阅读时间: 17 分钟

Claude Code 权限分析器为什么必须 Fail Closed

推荐标题:Claude Code 权限分析器为什么必须 Fail Closed 备选标题1:别只看表面:Claude Code 权限分析器为什么必须 Fail Closed真正要验收什么 备选标题2:

AI 调研与资料整理 预计阅读时间: 18 分钟

Kimi K3 2.8T:超稀疏 MoE、百万上下文与真实部署边界

研究快照:2026-07-21。完整权重、许可证、模型配置和技术报告在该日期尚未公开。本文讨论的是已经确认的架构与部署边界,不是完整本地部署实测。 摘要 Kimi K3 最容易被误读的数字是 2.8T。

AI 调研与资料整理 预计阅读时间: 18 分钟

Search Console 开始追踪社交和视频内容

发布边界:该功能仍在逐步开放,只覆盖 Instagram、TikTok、X、YouTube 在 Google Search/Discover 的表现,不代表平台内部曝光;API 支持未确认。 入库说明:

AI 调研与资料整理 预计阅读时间: 16 分钟

vLLM 0.25.1:推理引擎升级的正确性门禁

推荐标题:vLLM 0.25.1:推理引擎升级的正确性门禁 备选标题1:别只看表面:vLLM 0.25.1真正要验收什么 备选标题2:一张工程图拆解 vLLM 0.25.1 备选标题3:vLLM 0.25.1为什么经常被理解错

AI 调研与资料整理 预计阅读时间: 16 分钟

恶意 Dataset 不是文件风险,而是一条执行链

推荐标题:恶意 Dataset 不是文件风险,而是一条执行链 备选标题1:如果 Dataset Loader 能执行代码,隔离该怎么做 备选标题2:只做文件扫描,为什么拦不住 Dataset 攻击 备选标题3: