微光实验室 · 博客归档
博客 第2页
记录技术探索与工程思考,共 731 篇文章。
GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同
发布边界:本文依据 2026-07-30 可访问的 OpenAI 与 ARC Prize 第一方资料。
Code Mode 什么时候更省:别只数工具调用,要数模型往返
判断 Code Mode 是否更省,最容易犯的错误,是盯着“工具调用了多少次”。 同样读取 10 个文件,可以是模型发起 10 次串行决策,也可以是模型先写一个有界程序,让程序完成 10 次读取、筛选和聚合,再把一份压缩结果交还模型。
从生成一张图到交付一套资产:怎样验收 AI 图片的连续可编辑性
事实复核截止:2026 年 8 月 1 日;发布前于 2026 年 8 月 8 日重新核对来源可达性与产品状态边界。 生成模型最容易展示的是第一张图,生产团队真正付费的却是第五次修改之后仍然正确。
MCP 无状态核心之后:身份、任务、幂等与审计状态到底放在哪里
发布边界:规范事实按 MCP 2026-07-28 稳定版核验;operationid、operation ledger、outcomeunknown 与审计字段属于作者架构设计,Tasks 是可选扩展,发布前复核勘误和目标 SDK 支持。
OpenAI 重置 GPT-5.6 Sol 使用限额:18% 改善到底意味着什么
2026 年 7 月 28 日 21:09(美国太平洋夏令时间),OpenAI Codex 负责人 Tibo Sottiaux 发布了 GPT-5.6 Sol 使用限额调查更新;换算为中国标准时间是 7 月 29 日 12:09。
SWE-1.7 的提升究竟来自哪里?先把 Agent 能力拆成五个变量
一个团队把 Agent 模型从 A 换成 B,任务成功率明显上升,最容易出现的结论是:新模型的权重更强,所以换到任何系统里都能得到同样提升。 这个结论通常越过了最关键的一步:Agent 的表现不是由模型名单独决定的,而是由模型检查点...
VLA 落地先签动作合同:从视觉语言输入到可执行控制指令
发布边界:合成接口与示意时序不得写成公开模型原生 Schema、作者实测或安全认证;公开频率和动作维度只用于对应论文系统。 摘要 VLA 能输出动作,不代表它已经能接到真实机器人。输入必须带时间和版本,动作必须声明坐标、单位、范围、频率...
MiniMax H3 的多模态参考为什么比 2K 更重要
事实复核截止:2026 年 8 月 4 日。本文依据 MiniMax 官方发布文章、V2 API 文档、官方 Hugging Face 模型卡与价格页展开;没有运行 H3 API 或本地权重,不提供画质、速度、口型和稳定性的实测结论。
开放权重不是唯一控制权:Kimi K3、Hy3 与 Seed 的九项交付比较
企业评估模型时,最容易问错的一个问题是:它到底开放还是闭源? 这个二分法对软件许可证有用,却不足以描述一套 AI 系统真正交给采用团队的东西。拿到权重,意味着可以固定版本、选择部署位置并修改运行时,但不代表已经获得成熟的工作流...
同一画面,两种动作:多模态 Agent 如何验证状态是否足够
先看两个合成工程场景。它们不是公开事故,也不是作者实测。 机械臂在两次测试中看到几乎相同的 RGB 画面:夹爪已经合拢,杯子位于指尖之间。策略都准备“向上抬升”。第一次杯子被稳定拿起;第二次杯子刚离开桌面就滑落。
Prompt 之外,生产级 Agent Harness 到底在控制什么
发布边界:本文的六层控制面是作者工程综合,不是 OpenAI 官方产品架构。预算阈值、权限强度和状态转换必须按具体系统验证。 摘要 “最多搜索五次”“不要浪费 Token”“完成后立刻停止”写在 Prompt 中...
2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统
统计截止:2026 年 7 月 31 日。本文只收录能由官方发布页、模型卡或平台文档确认的模型事件,并区分首次发布、正式 GA、API 开放、权重开放和受限预览。
模型发布可以按天看,生产默认模型不能按天切:一套可回退的 30 天验收流程
证据截止:2026 年 7 月 31 日。本文将厂商直接说明的日期、状态、入口和价格写为事实;厂商公布的性能与客户反馈写为厂商主张;跨厂商解释写为作者推断;30 天验收流程、阈值和回退条件均为工程建议。
GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本
事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。 摘要 Luna Standard 短上下文输入...
GitHub Code Quality GA 后,100 名开发者真的只要每月 1000 美元吗?
事实核验时间:2026 年 7 月 30 日。文中的价格演算均为示例,不是作者账单、客户数据或 GitHub 官方 ROI。 发布边界:公开价、产品支持范围、Runner 单价、AI Credits 与预算行为均为 2026-07-30 快...
不要问模型是 Transformer 还是 Diffusion:一套五层技术栈检查法
发布边界:五层框架是作者工程综合,不是学界统一 taxonomy;速度、质量和能力结论必须绑定模型、配置、硬件与评测条件。 摘要 Transformer、VAE、Diffusion、Flow 和 Solver 经常被放在同一张比较表里...
同样的 Rate Card,为什么更强的 Sol 反而更快耗尽 Codex 限额
发布边界:模型定位、Rate Card、限额和 reasoning effort 行为可能变化;发布前必须复核官方页面。文中场景和决策表用于说明方法,不代表作者完成了对照实测。 摘要 GPT-5.6 Sol 与 GPT-5.5 的公开 To...
从随机动作块到真实闭环:Diffusion 与 Flow 策略的执行账本
发布边界:文中的伪代码、延迟项和门限均为工程示例;不得改写为特定机器人实测、实时保证或安全认证。 摘要 Diffusion 或 Flow 策略输出平滑动作,只完成候选轨迹生成。真实闭环还需要动作数据合同、数值求解时限...
从 Issue 到 Merge:把 Coding Agent 任务写成可执行、可回退、可审计的工程合同
发布边界:本文给出工程合同模型和示例,不冒充 GitHub 的正式 Schema;具体 Agent 能力、权限与自动化边界以产品文档和仓库配置为准。 摘要 Issue 不是更长的 Prompt,而是一次可判定的变更授权。
从视频模型到决策世界模型:进入 Agent 与机器人闭环前的证据门槛
发布边界:L0-L5 是作者提出的工程证据梯子,不是论文统一分级;不得把厂商演示或视觉指标改写成规划、控制或安全有效性。 摘要 视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续...