微光实验室 · 标签归档
标签: AI Agent
共 63 篇文章,按主题汇总相关教程、案例、工程实践和阶段性总结。
Cordis 如何让插件可卸载、可依赖、可重组
把一个工具塞进注册表并不难。真正麻烦的是它离开以后发生什么。 假设一个 Workspace 插件注册了文件服务、监听器、Prompt 片段和一个定时任务。用户切换项目时,插件被卸载:监听器有没有解除?
从 Pi 学习设计自己的 Agent Harness:一条可验证的垂直生产线
一个内容团队把研究、写稿、审核、配图和发布串成自动流程。开始几天很顺:模型能写文件,脚本能跑, 图片能上传。后来编辑改了两段正文,旧审核结论仍显示通过;上传图片只改了 Markdown 链接,却又触发 一次全文和逐图复审;
GPT-Live 到底发布了什么:从回合式语音到连续交互循环
一个语音 Agent 可以做到 300 毫秒出声,仍然可能很难用。 用户只是停下来想了半秒,它抢着回答;用户说“等等”,它要到整段 TTS 播完才停;搜索需要十几秒,会话就像断线;后台结果回来时,用户已经换了问题,它却继续念旧答案。
给 Pi 增加能力时,应该写 Prompt、Skill、Tool 还是 Extension?
团队想统一发布流程,于是有人提议“写一个插件”:它要提醒检查清单、读取团队规范、 执行发布命令、拦截危险参数,还要让每个人一键安装。听起来只是一个需求,实际上混合了 五种职责。如果全部塞进一个高权限插件,改一句提示词也要重发代码;
Tool 注册成功,为什么还不等于安全可用
一个工具出现在模型的 Tool 列表里,只能证明一件事:模型可能知道它叫什么、接收什么参数。 它不能证明 Provider 已经装载,不能证明参数经过审批,不能证明 Sandbox 覆盖网络和进程,更不能证明工具执行到一半失败时,外部文件...
Pi 怎样决定模型看见什么:AGENTS.md、SYSTEM.md 与 Skills 的加载边界
你在仓库根目录告诉 Agent:“修改后运行单测。”进入 services/payment/ 后,它又遵循 “禁止运行全量测试”;调用数据库迁移 Skill 时,第三份说明要求先连接生产库做探测。
DeepSeek 把 Agent Core 也插件化了:Harness 的真正赌注
假设同一个团队要做两个 Agent 产品。 一个通过 Web 界面工作,会话存进 SQLite,允许使用 Bash 和文件工具;另一个只跑一次性任务, 会话写入 JSONL,禁止本地 Shell,通过 Python SDK 调用。
回到旧对话为什么没有恢复代码:Pi Session Tree 与上下文投影
你让 Coding Agent 修复登录问题。它先改了 Token 校验,测试失败;你退回到“读取认证模块”那条消息,换成检查数据库时区。对话看起来回到了过去,但工作区里第一次尝试留下的文件改动、已安装依赖,甚至数据库写入,可能仍然存在。
实现 GPT-Live-like:两条路线、一个控制面和六阶段验收
开头:先把“像 GPT-Live”改写成可验收的问题 “我们也做一个 GPT-Live-like 系统”,听起来像一个模型选型任务。团队可能先替换 Realtime 模型,或者把原有 ASR、LLM、TTS 全部推翻...
同一个模型为什么在不同 Agent 里表现不同:模型与 Harness 的责任边界
团队把同一个模型接进两套系统。第一套只把仓库说明和用户问题拼进 Prompt,再提供一个通用 Shell; 第二套会先定位相关文件,按项目规则构造上下文,把读取、修改、执行和验证拆成不同工具,并在测试失败后 把结构化结果送回循环。
GPT-Live 与 GPT-Realtime:产品模型和公开 API 不应混写
开头:把发布页里的名字填进 model,是一次很典型的事故 新模型发布后,团队最容易出现一条看似合理的工作流:产品经理看到了 ChatGPT Voice 的新体验,技术文章写着 GPT-Live-1,开发者便把 model 配置改成同名字符...
Pi 为什么不内置 MCP:工具发现与上下文成本的真实争议
一个 Coding Agent 原来只有 read、write、edit、bash 四个通用工具。团队接入工单、 数据库、监控、云平台和内部知识库后,工具很快增加到几十个。最直接的做法,是把每个 MCP Server 暴露的工具定义都交给模...
前台语音与后台任务为什么要做双循环:从委派到结果新鲜度
一个迟到结果如何变成事故 用户对语音 Agent 说:“帮我找上海周末适合孩子的活动。”系统把搜索交给后台,前台没有卡住,还能自然回应:“好,我查一下,你可以继续补充要求。” 两秒后,用户补充:“不要室外的,最好周日下午。
打断不是听到声音就闭嘴:语音 Agent 的话权状态怎样真正收敛
元信息 文章类型:语音交互状态机与事件协议 目标读者:实时语音 Agent、智能硬件、客服语音和多模态系统的工程师与技术负责人 读者问题:怎样区分打断、附和、旁人语音、环境声和停顿,并让取消、播放与历史最终一致?
让不同大模型共享一个 Agent:Pi 如何统一 Provider 与 Context Handoff
设想一个正在写代码的 Agent:前半段由模型 A 分析日志并发起 Tool Call,中途因为成本或能力切到模型 B。B 不仅要读懂文字,还要知道哪个 Tool Result 对应哪个 Call、此前的 Thinking 能保留到什么程度...
上下文装不下以后:Pi Compaction 怎样压缩历史,又会丢掉什么
一个 Coding Agent 已经连续工作两小时:读过几十个文件,尝试过三条修复路线,跑了多轮测试,还记着用户最早说的“不能改公开 API”。此时上下文接近上限,系统自动生成摘要,然后继续工作。
全双工语音 Agent 如何评测:从首音延迟到事件级验收
元信息 文章类型:Voice Agent 评测方法与验收合同 目标读者:正在开发实时语音、客服、车载、机器人或工具型 Voice Agent 的工程团队 读者问题:除了首音延迟,怎样判断系统真的会倾听、会打断、能恢复并正确完成任务?
一次用户输入到底发生了什么:Pi Agent Loop 源码级解析
从 prompt() 到 Tool Result:Pi Agent Runtime 的完整执行链 Coding Agent 为什么能持续行动:拆解 Pi 的双层 Agent Loop
GPT-Live 可能怎样实现:从公开行为到架构约束的证据梯度
开头:同一种体验,可能来自完全不同的系统 用户在系统说话时插入一句“等等,不是杭州,是青岛”,旧回答迅速停下,新答案沿着纠正后的目标继续。看到这个行为,很容易写出一个看似专业的结论:GPT-Live 一定使用双音频流...
WebRTC 已经双向,语音 Agent 为什么还会抢话?
备用标题 1. 语音 Agent 全双工的三层验收:传输、推理与话权 2. 音频能同时收发之后,真正难的是四份状态保持一致 3. 从 sendrecv 到自然打断:全双工语音系统还缺什么 开头钩子 一个语音 Agent 的 WebRTC 指...
GPT-5.6 Sol 的 ARC-AGI-3 分数为何翻近三倍:Agent 评测必须记录整套运行合同
发布边界:本文依据 2026-07-30 可访问的 OpenAI 与 ARC Prize 第一方资料。
Code Mode 什么时候更省:别只数工具调用,要数模型往返
判断 Code Mode 是否更省,最容易犯的错误,是盯着“工具调用了多少次”。 同样读取 10 个文件,可以是模型发起 10 次串行决策,也可以是模型先写一个有界程序,让程序完成 10 次读取、筛选和聚合,再把一份压缩结果交还模型。
从生成一张图到交付一套资产:怎样验收 AI 图片的连续可编辑性
事实复核截止:2026 年 8 月 1 日;发布前于 2026 年 8 月 8 日重新核对来源可达性与产品状态边界。 生成模型最容易展示的是第一张图,生产团队真正付费的却是第五次修改之后仍然正确。
OpenAI 重置 GPT-5.6 Sol 使用限额:18% 改善到底意味着什么
2026 年 7 月 28 日 21:09(美国太平洋夏令时间),OpenAI Codex 负责人 Tibo Sottiaux 发布了 GPT-5.6 Sol 使用限额调查更新;换算为中国标准时间是 7 月 29 日 12:09。
SWE-1.7 的提升究竟来自哪里?先把 Agent 能力拆成五个变量
一个团队把 Agent 模型从 A 换成 B,任务成功率明显上升,最容易出现的结论是:新模型的权重更强,所以换到任何系统里都能得到同样提升。 这个结论通常越过了最关键的一步:Agent 的表现不是由模型名单独决定的,而是由模型检查点...
开放权重不是唯一控制权:Kimi K3、Hy3 与 Seed 的九项交付比较
企业评估模型时,最容易问错的一个问题是:它到底开放还是闭源? 这个二分法对软件许可证有用,却不足以描述一套 AI 系统真正交给采用团队的东西。拿到权重,意味着可以固定版本、选择部署位置并修改运行时,但不代表已经获得成熟的工作流...
同一画面,两种动作:多模态 Agent 如何验证状态是否足够
先看两个合成工程场景。它们不是公开事故,也不是作者实测。 机械臂在两次测试中看到几乎相同的 RGB 画面:夹爪已经合拢,杯子位于指尖之间。策略都准备“向上抬升”。第一次杯子被稳定拿起;第二次杯子刚离开桌面就滑落。
Prompt 之外,生产级 Agent Harness 到底在控制什么
发布边界:本文的六层控制面是作者工程综合,不是 OpenAI 官方产品架构。预算阈值、权限强度和状态转换必须按具体系统验证。 摘要 “最多搜索五次”“不要浪费 Token”“完成后立刻停止”写在 Prompt 中...
2026 年 7 月 AI 模型发布复盘:真正被比较的是整套工作系统
统计截止:2026 年 7 月 31 日。本文只收录能由官方发布页、模型卡或平台文档确认的模型事件,并区分首次发布、正式 GA、API 开放、权重开放和受限预览。
模型发布可以按天看,生产默认模型不能按天切:一套可回退的 30 天验收流程
证据截止:2026 年 7 月 31 日。本文将厂商直接说明的日期、状态、入口和价格写为事实;厂商公布的性能与客户反馈写为厂商主张;跨厂商解释写为作者推断;30 天验收流程、阈值和回退条件均为工程建议。
GPT-5.6 Luna 降价 80%:Agent 真正该重算的是单次成功成本
事实边界:本文按 2026-07-31 可访问的 OpenAI 公告、Luna 模型卡与 API 价格页核验。降价不代表模型权重改变,也不能推导 OpenAI 的单位推理成本或毛利率。 摘要 Luna Standard 短上下文输入...
GitHub Code Quality GA 后,100 名开发者真的只要每月 1000 美元吗?
事实核验时间:2026 年 7 月 30 日。文中的价格演算均为示例,不是作者账单、客户数据或 GitHub 官方 ROI。 发布边界:公开价、产品支持范围、Runner 单价、AI Credits 与预算行为均为 2026-07-30 快...
同样的 Rate Card,为什么更强的 Sol 反而更快耗尽 Codex 限额
发布边界:模型定位、Rate Card、限额和 reasoning effort 行为可能变化;发布前必须复核官方页面。文中场景和决策表用于说明方法,不代表作者完成了对照实测。 摘要 GPT-5.6 Sol 与 GPT-5.5 的公开 To...
从 Issue 到 Merge:把 Coding Agent 任务写成可执行、可回退、可审计的工程合同
发布边界:本文给出工程合同模型和示例,不冒充 GitHub 的正式 Schema;具体 Agent 能力、权限与自动化边界以产品文档和仓库配置为准。 摘要 Issue 不是更长的 Prompt,而是一次可判定的变更授权。
从视频模型到决策世界模型:进入 Agent 与机器人闭环前的证据门槛
发布边界:L0-L5 是作者提出的工程证据梯子,不是论文统一分级;不得把厂商演示或视觉指标改写成规划、控制或安全有效性。 摘要 视频模型能生成可控画面,只说明它学到部分视觉统计规律。要成为决策世界模型,还需证明动作会改变预测、任务状态可持续...
VLA 已经能输出动作,为什么机器人仍需要多时间尺度闭环
发布边界:控制频率、接口字段和云边分工均为工程量级与示例;须按具体机器人、传感器、网络和风险等级实测校准。 摘要 VLA 能共享视觉、语言与动作表示,却不能取消传感器时钟、动力学、关节限位、网络故障和事故责任。
1M Context 也会失忆:Coding Agent 为什么需要 Context Ledger
发布边界:价格、会员层级、模型 ID、默认 effort、缓存与 compact 行为需在发布前复核;本文不声称已完成本地吞吐或成本实测。 摘要 1M Context 解决容量上限,却不能自动保证约束没有在 compact 中丢失...
权重已到、Recipe 还在变:Kimi K3 发布后该怎样做工程验收
摘要: Kimi K3 的完整权重已经出现在官方仓库,但“权重可获得”不等于 “生产可运营”。本文把一次开放权重发布拆成七道可审计门,并给出可直接落库的 Release Acceptance Ledger,用来约束 Revision...
高能力模型评估为什么需要一份可验证的 Containment Contract
发布边界:本文讨论公开事件与工程控制框架,不声称掌握未公开事故细节,也不把架构建议冒充已经完成的生产验证。 摘要 “禁公网”不等于“没有公网能力”。代理、DNS、身份服务、缓存、共享文件系统和短期凭证都可能形成传递可达路径。
生产模型路由不是一次难度分类:从硬约束可行域到状态检查点升级
发布边界:产品能力和公开案例绑定来源;通用控制面、检查点与副作用账本属于工程设计,不宣称为供应商内部实现。 生产模型路由不能被简化为一次 Prompt 难度分类。
Ask/Allow 不是安全边界:企业 Coding Agent 必须建立四层治理
发布边界:四层模型是工程控制框架;具体产品的权限、隔离和合规能力必须逐项核验。 交互式 Ask/Allow 只能表达一次人机确认,不能承担企业安全边界。
低延迟不是更快地猜:EOU、Barge-in 与 Turn Protocol 为什么必须统一
发布边界:协议、状态机和预算属于工程设计;供应商事件名只在对应产品边界内成立,不冒充作者已完成的线上实测。 摘要 语音 Agent 的低延迟不只是缩短静音阈值。EOU 决定何时允许一轮产生后果,Barge-in 决定旧一代工作何时失去提交资...
Token 单价更低,Agent 任务为什么反而更贵
摘要:IBM 的一次 AppWorld 实验中,纸面 Token 单价更低的模型反而产生 更高任务总成本。多步 Agent 的正确计量单位不是一次调用,而是包含缓存、 工具、重试、升级、失败和人工处理的完整任务轨迹。
1.2GB 离线语音 Agent 真正值得复用的,不是 908ms
摘要:一台 Galaxy S23 Ultra 上的离线语音 Agent 曾测得 908ms 首音频和 1,116MB PSS。但真正值得复用的不是这两个数字,而是四阶段职责、状态感知 Tool Schema...
Pi 真的打赢 Claude Code 和 Codex 了吗?Databricks Harness 基准的正确读法
Databricks 在内部真实代码任务上比较了多种模型与 Coding Agent Harness。 最容易传播的说法是“Pi 打赢 Claude Code 和 Codex”,但公开证据支持的是一个 更窄、也更有工程价值的结论
Shippy 的启示:可靠 Agent 不是“更听话”,而是更少犯错空间
摘要:高风险 Agent 的可靠性不能只押注于模型更强。Shippy 的工程价值 在于用版本化行为工件、确定性 CLI、会话隔离和整套 Agent Eval,持续缩小 动作空间、状态空间与错误后果。
Claude Code 权限分析器为什么必须 Fail Closed
推荐标题:Claude Code 权限分析器为什么必须 Fail Closed 备选标题1:别只看表面:Claude Code 权限分析器为什么必须 Fail Closed真正要验收什么 备选标题2:
Kimi K3 2.8T:超稀疏 MoE、百万上下文与真实部署边界
研究快照:2026-07-21。完整权重、许可证、模型配置和技术报告在该日期尚未公开。本文讨论的是已经确认的架构与部署边界,不是完整本地部署实测。 摘要 Kimi K3 最容易被误读的数字是 2.8T。
vLLM 0.25.1:推理引擎升级的正确性门禁
推荐标题:vLLM 0.25.1:推理引擎升级的正确性门禁 备选标题1:别只看表面:vLLM 0.25.1真正要验收什么 备选标题2:一张工程图拆解 vLLM 0.25.1 备选标题3:vLLM 0.25.1为什么经常被理解错
GitHub Models 7 月 30 日关闭:迁移别只换 Base URL
日期:2026-07-20 状态:完整母稿 时间边界:2026-07-23 第二次 Brownout 与 2026-07-30 全面退役均为未来事件。Brownout 的具体 HTTP 状态码和错误 Body 尚未由官方公告明确...
GPT-Red:自动化红队如何形成 Agent 安全数据飞轮
章节角色:旗舰热点研究母稿 优先级:P0 推荐长度:8,000—12,000 字 验证状态:官方事实已核验;核心指标为厂商内部评测 一句话核心论点:GPT-Red 的意义不在于“AI 会攻击 AI”,而在于把威胁模型、攻击搜索、真实工具后果...
FDE 到底是什么:为什么 AI 时代重新需要前线部署工程师
阅读说明:公司岗位和公开计划按 2026-07-18 的一手页面核对;招聘状态可能变化。本文讨论工程责任边界,不虚构客户采用、ROI 或业务收益。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
从 Java 后端到实时语音 AI:我的工作为什么越来越像 FDE
阅读说明:本文只使用已披露的 Java、Go、Python、实时语音、端云链路和机器人端经历,不虚构客户交付、采用率或 ROI;重点是复盘工程所有权如何变化。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
Hugging Face 入侵后,先检查这 7 个 Dataset Processing 边界
编辑审核(2026-07-18):官方披露能证明攻击链和影响面;攻击者身份、完整入侵细节与所有受影响对象仍不能扩写成定论。 核心结论:这次事件最重要的不是“攻击者用了 AI”,而是 AI 平台把可执行 Loader...
OpenAI 为什么需要 FDE:模型公司正在变成交付公司
阅读说明:OpenAI 公司公告、岗位与产品页面按 2026-07-18 的一手来源核对。本文分析部署战略,不把招聘快照或规划扩写成已经实现的业务结果。 编辑复核(2026-07-18):一手来源支持核心事实;岗位状态为时间快照;
GitHub Copilot for JetBrains 正在形成可组合 Agent Runtime
推荐标题:GitHub Copilot… 备选标题1:生产控制面的五道闸 备选标题2:权限审批灰度怎么连 备选标题3:Agent 上线前需要什么 发布边界:Runtime 是作者工程抽象;Claude Provider 与 Local Sa...
OpenAI 的首款硬件不是“音箱”问题:无屏 AI 伴侣成立的十二个条件
发布边界:无屏、可移动、音箱形态仍来自媒体匿名信源;OpenAI 官方只确认团队与设计合作。 核心结论 1. OpenAI 已确认的是团队与设计能力,不是最终产品规格。[S01] 2. Bloomberg 所述“无屏、可移动...
OpenAI 把 Codex 接进 Claude Code:Coding Agent 开始从单兵走向协作
事实核验: 本稿按 openai/codex-plugin-cc v1.0.6(2026-07-08)与官方 README 核对。插件命令、参数和实现细节属于版本敏感信息,发布前仍需重新检查最新 release。
Claude Code 怎么调用 Codex:拆解 codex-plugin-cc 的四层架构
事实核验: 本稿按 openai/codex-plugin-cc v1.0.6(2026-07-08)与官方 README 核对。插件命令、参数和实现细节属于版本敏感信息,发布前仍需重新检查最新 release。
如何给 Coding Agent 写仓库规则:硬约束、软约束与证据门禁
让模型写出一个函数并不难,难的是让它在一个已经运行多年的仓库里改对三行代码。 同样一句“给订单接口增加重试”,可能牵涉公开 API、事务边界、幂等语义、异常映射、调用方假设和监控口径。一个局部看起来正确的补丁,可能通过语法检查...
Fable 5 的 7 月 19 日不是发布延期:模型可用性正在变成动态资源
发布边界:配额与 7 月 19 日窗口是动态状态,发布当天必须再次核验官方公告。 核心结论 Fable 5 是 Anthropic 的正式模型,不是社区代号或拼写错误;模型 ID 为 claude-fable-5。
GPT-5.6 Sol、Terra、Luna 怎么选:内容仓库为什么默认 Sol + Medium
推荐标题:GPT-5.6 Sol、Terra、Luna 怎么选:内容仓库为什么默认 Sol + Medium 备选标题1:Sol + Medium 为什么适合长期内容仓库 备选标题2:内容仓库如何选择 GPT-5.6 模型与推理档位 备选标...
LingBot 四条路线
LingBot 最近连续发布了 VLA 2.0、Video、World 2.0 和 VA 2.0。名称相似、发布时间接近,又都涉及视觉、视频、世界模型和机器人动作,最容易出现的误解是把它们看成同一模型的连续版本。