微光实验室 · 标签归档
标签: 评测
共 30 篇文章,按主题汇总相关教程、案例、工程实践和阶段性总结。
从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线
一个内容团队把研究、写稿、审核、配图和发布串成自动流程。开始几天很顺:模型能写文件,脚本能跑, 图片能上传。后来编辑改了两段正文,旧审核结论仍显示通过;上传图片只改了 Markdown 链接,却又触发 一次全文和逐图复审;
全双工语音 Agent 如何评测:从首音延迟到事件级验收
元信息 文章类型:Voice Agent 评测方法与验收合同 目标读者:正在开发实时语音、客服、车载、机器人或工具型 Voice Agent 的工程团队 读者问题:除了首音延迟,怎样判断系统真的会倾听、会打断、能恢复并正确完成任务?
GPT-Live 可能怎样实现:从公开行为到架构约束的证据梯度
开头:同一种体验,可能来自完全不同的系统 用户在系统说话时插入一句“等等,不是杭州,是青岛”,旧回答迅速停下,新答案沿着纠正后的目标继续。看到这个行为,很容易写出一个看似专业的结论:GPT-Live 一定使用双音频流...
GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同
发布边界:本文依据 2026-07-30 可访问的 OpenAI 与 ARC Prize 第一方资料。
Code Mode 什么时候更省:别只数工具调用,要数模型往返
判断 Code Mode 是否更省,最容易犯的错误,是盯着“工具调用了多少次”。 同样读取 10 个文件,可以是模型发起 10 次串行决策,也可以是模型先写一个有界程序,让程序完成 10 次读取、筛选和聚合,再把一份压缩结果交还模型。
SWE-1.7 的提升究竟来自哪里?先把 Agent 能力拆成五个变量
一个团队把 Agent 模型从 A 换成 B,任务成功率明显上升,最容易出现的结论是:新模型的权重更强,所以换到任何系统里都能得到同样提升。 这个结论通常越过了最关键的一步:Agent 的表现不是由模型名单独决定的,而是由模型检查点...
开放权重不是唯一控制权:Kimi K3、Hy3 与 Seed 的九项交付比较
企业评估模型时,最容易问错的一个问题是:它到底开放还是闭源? 这个二分法对软件许可证有用,却不足以描述一套 AI 系统真正交给采用团队的东西。拿到权重,意味着可以固定版本、选择部署位置并修改运行时,但不代表已经获得成熟的工作流...
Prompt 之外,生产级 Agent Harness 到底在控制什么
发布边界:本文的六层控制面是作者工程综合,不是 OpenAI 官方产品架构。预算阈值、权限强度和状态转换必须按具体系统验证。 摘要 “最多搜索五次”“不要浪费 Token”“完成后立刻停止”写在 Prompt 中...
模型发布可以按天看,生产默认模型不能按天切:一套可回退的 30 天验收流程
证据截止:2026 年 7 月 31 日。本文将厂商直接说明的日期、状态、入口和价格写为事实;厂商公布的性能与客户反馈写为厂商主张;跨厂商解释写为作者推断;30 天验收流程、阈值和回退条件均为工程建议。
不要问模型是 Transformer 还是 Diffusion:一套五层技术栈检查法
发布边界:五层框架是作者工程综合,不是学界统一 taxonomy;速度、质量和能力结论必须绑定模型、配置、硬件与评测条件。 摘要 Transformer、VAE、Diffusion、Flow 和 Solver 经常被放在同一张比较表里...
同样的 Rate Card,为什么更强的 Sol 反而更快耗尽 Codex 限额
发布边界:模型定位、Rate Card、限额和 reasoning effort 行为可能变化;发布前必须复核官方页面。文中场景和决策表用于说明方法,不代表作者完成了对照实测。 摘要 GPT-5.6 Sol 与 GPT-5.5 的公开 To...
从视频模型到决策世界模型:进入 Agent 与机器人闭环前的证据门槛
发布边界:L0-L5 是作者提出的工程证据梯子,不是论文统一分级;不得把厂商演示或视觉指标改写成规划、控制或安全有效性。 摘要 视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续...
Video VAE 不是末端编解码器:它如何定义视频模型的系统边界
发布边界:不同模型家族的时间压缩、空间压缩、潜通道和缓存语义必须分别核对;本文不声称已完成作者自有重建或显存实验。 摘要 Video VAE 在主模型之前就决定时空网格、信息损失和 token 数量,在主模型之后又决定解码峰值...
权重已到、Recipe 还在变:Kimi K3 发布后该怎样做工程验收
摘要: Kimi K3 的完整权重已经出现在官方仓库,但“权重可获得”不等于 “生产可运营”。本文把一次开放权重发布拆成七道可审计门,并给出可直接落库的 Release Acceptance Ledger,用来约束 Revision...
高能力模型评估为什么需要一份可验证的 Containment Contract
发布边界:本文讨论公开事件与工程控制框架,不声称掌握未公开事故细节,也不把架构建议冒充已经完成的生产验证。 摘要 “禁公网”不等于“没有公网能力”。代理、DNS、身份服务、缓存、共享文件系统和短期凭证都可能形成传递可达路径。
生产模型路由不是一次难度分类:从硬约束可行域到状态检查点升级
发布边界:产品能力和公开案例绑定来源;通用控制面、检查点与副作用账本属于工程设计,不宣称为供应商内部实现。 生产模型路由不能被简化为一次 Prompt 难度分类。
同一套 ComfyUI 工作流,第二次为什么快一倍?
发布边界:标题中的快一倍是待解释现象,不是作者实测承诺;任何性能结果都必须绑定工作流、硬件、版本和运行条件。 摘要 同一套 ComfyUI 工作流第二次运行明显更快,可能来自模型常驻、编译预热、节点缓存或实际执行子图变化...
Token 单价更低,Agent 任务为什么反而更贵
摘要:IBM 的一次 AppWorld 实验中,纸面 Token 单价更低的模型反而产生 更高任务总成本。多步 Agent 的正确计量单位不是一次调用,而是包含缓存、 工具、重试、升级、失败和人工处理的完整任务轨迹。
1.2GB 离线语音 Agent 真正值得复用的,不是 908ms
摘要:一台 Galaxy S23 Ultra 上的离线语音 Agent 曾测得 908ms 首音频和 1,116MB PSS。但真正值得复用的不是这两个数字,而是四阶段职责、状态感知 Tool Schema...
Pi 真的打赢 Claude Code 和 Codex 了吗?Databricks Harness 基准的正确读法
Databricks 在内部真实代码任务上比较了多种模型与 Coding Agent Harness。 最容易传播的说法是“Pi 打赢 Claude Code 和 Codex”,但公开证据支持的是一个 更窄、也更有工程价值的结论
Shippy 的启示:可靠 Agent 不是“更听话”,而是更少犯错空间
摘要:高风险 Agent 的可靠性不能只押注于模型更强。Shippy 的工程价值 在于用版本化行为工件、确定性 CLI、会话隔离和整套 Agent Eval,持续缩小 动作空间、状态空间与错误后果。
Claude Code 权限分析器为什么必须 Fail Closed
推荐标题:Claude Code 权限分析器为什么必须 Fail Closed 备选标题1:别只看表面:Claude Code 权限分析器为什么必须 Fail Closed真正要验收什么 备选标题2:
Kimi K3 2.8T:超稀疏 MoE、百万上下文与真实部署边界
研究快照:2026-07-21。完整权重、许可证、模型配置和技术报告在该日期尚未公开。本文讨论的是已经确认的架构与部署边界,不是完整本地部署实测。 摘要 Kimi K3 最容易被误读的数字是 2.8T。
vLLM 0.25.1:推理引擎升级的正确性门禁
推荐标题:vLLM 0.25.1:推理引擎升级的正确性门禁 备选标题1:别只看表面:vLLM 0.25.1真正要验收什么 备选标题2:一张工程图拆解 vLLM 0.25.1 备选标题3:vLLM 0.25.1为什么经常被理解错
GitHub Models 7 月 30 日关闭:迁移别只换 Base URL
日期:2026-07-20 状态:完整母稿 时间边界:2026-07-23 第二次 Brownout 与 2026-07-30 全面退役均为未来事件。Brownout 的具体 HTTP 状态码和错误 Body 尚未由官方公告明确...
GPT-Red:自动化红队如何形成 Agent 安全数据飞轮
章节角色:旗舰热点研究母稿 优先级:P0 推荐长度:8,000—12,000 字 验证状态:官方事实已核验;核心指标为厂商内部评测 一句话核心论点:GPT-Red 的意义不在于“AI 会攻击 AI”,而在于把威胁模型、攻击搜索、真实工具后果...
FDE 到底是什么:为什么 AI 时代重新需要前线部署工程师
阅读说明:公司岗位和公开计划按 2026-07-18 的一手页面核对;招聘状态可能变化。本文讨论工程责任边界,不虚构客户采用、ROI 或业务收益。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
从 Java 后端到实时语音 AI:我的工作为什么越来越像 FDE
阅读说明:本文只使用已披露的 Java、Go、Python、实时语音、端云链路和机器人端经历,不虚构客户交付、采用率或 ROI;重点是复盘工程所有权如何变化。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
OpenAI 为什么需要 FDE:模型公司正在变成交付公司
阅读说明:OpenAI 公司公告、岗位与产品页面按 2026-07-18 的一手来源核对。本文分析部署战略,不把招聘快照或规划扩写成已经实现的业务结果。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
Fable 5 的 7 月 19 日不是发布延期:模型可用性正在变成动态资源
发布边界:配额与 7 月 19 日窗口是动态状态,发布当天必须再次核验官方公告。 核心结论 Fable 5 是 Anthropic 的正式模型,不是社区代号或拼写错误;模型 ID 为 claude-fable-5。