7 月模型发布复盘封面

统计截止:2026 年 7 月 31 日。本文只收录能由官方发布页、模型卡或平台文档确认的模型事件,并区分首次发布、正式 GA、API 开放、权重开放和受限预览。

如果只看新闻标题,2026 年 7 月像是一场没有间歇的模型轰炸:OpenAI 发布 GPT-5.6 与 GPT-Live,Anthropic 推出 Claude Opus 5,Google 更新 Gemini Flash 家族,Meta 连续发布 Muse Image 和 Muse Spark 1.1,Kimi K3 开放超大模型权重,SpaceXAI 与 Cursor 联合训练 Grok 4.5,腾讯将 Hy3 推向正式版,Mistral、Cognition、Cohere、ByteDance Seed 和 Reve 也各自补上了专业模型。

但“这个月发布了多少模型”其实是最容易答错的问题。

同一个模型可能先在合作伙伴产品中出现,几天后才由厂商正式宣布;可能 6 月底已经首发,7 月才开放权重;也可能只是展示预览,真正的 API 还没有开放。若按新闻数量相加,Grok 4.5 会被算两次,LongCat-2.0 会被错误归入 7 月,Muse Video 和 Gemini Flash Cyber 会被当成已全面可用的产品。

经过逐项去重,完整 7 月可以确认 18 项具有实质意义的模型或模型家族事件。真正值得关注的不是数字本身,而是它们共同暴露了一件事:AI 行业的竞争单位已经从“一个模型回答得有多好”,变成了“模型能否在一个完整系统里持续完成工作”。

一、先把 7 月的发布边界说清楚

五种发布状态

本次盘点采用五种状态:首次公开发布、预览后的正式 GA、产品内可用、API 可用和开放权重。只有找到一手来源的项目才进入主表。

7 月 2 日,Mistral 发布 Leanstral 1.5,一个面向 Lean 4 形式化证明和代码验证的开放模型。7 月 6 日,腾讯将 4 月预览的 Hy3 推向正式版。7 月 7 日,Meta 发布 Muse Image,Cohere 发布面向阿拉伯语方言与混说的 Transcribe Arabic。7 月 8 日是第一个高密度节点:OpenAI 发布 GPT-Live,Cursor 首发与 SpaceXAI 共同训练的 Grok 4.5,Cognition 发布 SWE-1.7,Mistral 发布 Robostral Navigate,ByteDance Seed 发布 Seedream 5.0 Pro。7 月 9 日,OpenAI 推出 GPT-5.6,Meta 推出 Muse Spark 1.1,Reve 推出 2.1 图像模型。7 月 16 日,SpaceXAI 对 Grok 4.5 做正式市场与 API 发布;Kimi K3 也在这一阶段公布,并在月底前开放权重。7 月 20 日,ByteDance Seed 发布 Seed Audio 1.0。7 月 21 日,Google 发布 Gemini 3.6 Flash 和 3.5 Flash-Lite,并公布受限使用的 Flash Cyber。7 月 24 日,Anthropic 发布 Claude Opus 5。

这里有几个必须排除的干扰项。

Muse Video 在 7 月 7 日只是早期预览,官方写的是“coming soon”;Gemini 3.5 Flash Cyber 与 CodeMender 绑定,主要面向政府和受信合作伙伴试点,不是普通开发者可直接调用的 GA 模型;LongCat-2.0 的首次发布在 6 月 30 日,7 月开放权重属于后续里程碑;Google OmniFlash、Nano Banana 2 Lite 和 Base44 Base 1 也都在 6 月底已经首发。微软 7 月 27 日公布的 MAI-Cyber-1-Flash,随 Project Perception 进入公开预览的日期是 8 月 3 日,仍不计入 7 月广泛可用模型主表。

微软公开预览日期证据

证据图 1:Microsoft 官方文章同时说明 MAI-Cyber-1-Flash 的系统角色与 Project Perception 于 8 月 3 日进入公开预览。它支持“公告日不等于可用日”的边界,而不是证明模型在 7 月已经 GA。

8 月 1 日的增量核查覆盖了 7 月 29—31 日以及原观察项:在本文持续跟踪的厂商和官方来源范围内,没有发现符合主表口径的新事件;GPT-Live 官方页仍写明 API 将于后续开放,Muse Video 仍是预览状态,Gemini Flash Cyber 仍是受限试点。因此主表数量保持 18,而不是为了凑成“完整月报”补入产品退役、未来预览或二手传闻。

这套边界不是文字游戏。它决定我们是在记录模型历史,还是在重复厂商营销节奏。

二、第一条主线:前沿模型开始用“完成工作”定义能力

旗舰与轻量模型进入任务图

GPT-5.6、Claude Opus 5、Muse Spark 1.1、Kimi K3、Grok 4.5、Hy3 的发布材料有一个显著共同点:传统聊天几乎退居次要位置,编码、工具调用、计算机使用、知识工作、长时间执行和多 Agent 协作成为核心叙事。

GPT-5.6 将 Sol、Terra、Luna 三个档位同时推向 ChatGPT、Codex 和 API。最强的 Sol 不只增加 max 推理强度,还提供 ultra:默认协调四个 Agent 并行完成复杂工作。Responses API 中的 Programmatic Tool Calling 允许模型写轻量程序来处理工具结果、筛选中间信息并决定下一步,而不是把每次调用的全部结果重新塞回上下文。

这意味着 OpenAI 不再只出售“更聪明的下一 Token 预测”,而是在出售一种任务运行方式。模型、工具、并行、内存处理和推理预算共同决定结果。

Claude Opus 5 的路线略有不同。Anthropic 将它定位为接近更高档 Fable 5 的能力,但价格约为一半,并强化稳定性、验证和知识工作。它没有把叙事全部压在“最高分”上,而是试图成为可以每天使用的强模型。对企业而言,一个稍弱但能铺到每个复杂工作流的模型,往往比只能偶尔调用的绝对旗舰更有价值。

Meta 的 Muse Spark 1.1 则更直接地把 Agent 运行逻辑写进模型能力:它会在主 Agent 与子 Agent 之间切换角色,能零样本适配新的工具、MCP Server 和 Skill,并主动压缩 100 万 Token 上下文。传统观点认为这些工作应该全部由外部 Harness 负责,但 Meta 正在训练模型自己掌握部分运行策略。

Kimi K3、Grok 4.5 和 Hy3 从不同方向指向同一个结论。Kimi K3 是 2.8T 总参数、原生多模态、100 万上下文的开放权重稀疏模型,重点任务不是聊天,而是长时编程、终端工具、CAD、芯片设计和深度研究。Grok 4.5 使用 Cursor 的真实开发者—Agent 交互数据进行联合训练。Hy3 则把预览版放进腾讯的大规模产品场景,根据真实 Token 使用和反馈打磨为正式版。

这些模型的竞争不再只发生在预训练集上,也发生在真实工作环境中。

三、第二条主线:Flash、Lite、mini 不再等于“缩水版”

过去,小模型常被理解为旗舰的便宜替代品。7 月的发布显示,它们正在获得独立的系统角色。

Gemini 3.6 Flash 被 Google 定位为生产级工作模型,强调编码、知识工作、多模态、低延迟和输出 Token 效率。3.5 Flash-Lite 的卖点则是高吞吐和低成本,官方引用的数据约为每秒 350 个输出 Token,并提供内置计算机使用能力。它更像大规模子 Agent 的执行层,而不是面向所有问题的聊天模型。

GPT-5.6 的 Terra 与 Luna、GPT-Live-1 mini 也采用类似分层。真正成熟的 Agent 系统不会让最贵的模型完成每一个步骤。它会把任务拆分,将搜索结果筛选、结构化提取、仓库分片分析、格式转换和低风险操作交给低成本模型,再把冲突、规划、关键写入和最终评审升级给强模型。

因此,2026 年的模型选型不应再问“哪个模型最好”,而应问“哪个模型在任务图的哪个节点上最合适”。

这也改变了成本计算。一个每百万 Token 很便宜的模型,如果频繁失败、循环或需要强模型重做,总成本可能高于贵模型。一个看起来昂贵的模型,如果减少 40% 工具调用和 30% 重试,反而可能降低单位成功任务成本。

四、第三条主线:开放权重模型的上限和分化同时扩大

Kimi K3 官方模型卡

证据图 2:Moonshot AI 的 Kimi K3 官方模型卡明确写出开放权重、原生多模态、2.8T 总参数和 100 万 Token 上下文。这证明开放权重阵营正在挑战前沿模型的规模上限,但不等于普通开发者能在单机上运行完整权重。

开放权重的两端扩张

Kimi K3 是本月开放权重阵营最醒目的发布。它把总参数推进到 2.8T,采用高稀疏 MoE,896 个专家中激活 16 个,并支持原生视觉和 100 万 Token 上下文。这说明开放权重模型不再只通过 7B、32B、70B 等常见尺寸争夺本地部署市场,也开始挑战前沿闭源模型的规模上限。

但“大规模开放权重”不等于“人人都能本地运行”。完整权重存储、量化、张量并行、专家并行、网络带宽、KV Cache 和推理框架都会构成高门槛。大多数独立开发者更可能通过 API 或托管服务使用 K3,而不是把它部署到单机 GPU。

许可证也需要精确表达。Kimi K3 允许广泛使用、修改、部署和衍生,但对年收入超过 2000 万美元的 Model-as-a-Service 业务有额外协议要求。它应被称为开放权重模型,而不是不附条件的传统开源软件。

腾讯 Hy3 代表另一种开放路线。295B 总参数、21B 激活、256K 上下文,目标是在业务场景中取得可控成本。Leanstral 1.5 则只有 6B 激活参数,却在形式化证明和代码验证中做深;Cohere Transcribe Arabic 是 2B 语音识别模型,解决阿拉伯语方言、阿英混说与企业词汇。

开放生态因此出现两端扩张:一端是超大、原生多模态、长时 Agent;另一端是小而深、可自部署、结果可验证的专业模型。中间大量同质化通用模型反而会面临更激烈竞争。

五、第四条主线:多模态生成开始围绕“怎么改”竞争

可编辑资产生产链

7 月的图像和音频发布不像过去那样只展示审美样片。

Muse Image 会调用搜索和代码工具。需要准确图表、二维码或现实信息时,它可以先检索或写程序,再根据结果生成图像;如果发现局部错误,会选择修改、重做或更换工具。Meta 还把测试时计算引入图像生成:增加的计算不仅用于多采样,也用于推理、工具和自我修正。

Seedream 5.0 Pro 强调复杂信息可视化、点选、套索、草图编辑、材质与颜色替换、图层分离。它面对的是专业设计流程:用户不需要“再生成一张差不多的”,而是要求只改某个区域、保持其他元素、输出可以继续编辑的资产。

Reve 2.1 更进一步,把布局设计成结构化中间表示。每个区域都可以被定位、读取和修改,图像不再只是一块最终像素,而是 Agent 可以操作的对象。

Seedream 5.0 Pro 官方能力说明

证据图 3:ByteDance Seed 官方发布页列出复杂信息可视化与交互式精确编辑。它支持“生产流程开始关注可编辑交付”的判断,不代表所有生成结果都能无损完成多轮修改。

Seed Audio 1.0 则把同样的思想带到声音:对白、音效、环境声和时序在一个场景中联合生成,而不是分别调用 TTS、音效库和混音工具。它强调 100 毫秒级对白时间控制、最长约两分钟生成和续写。

这些变化说明,多模态模型正在从“内容生成器”变成“生产工作台”。未来的关键指标不是某次生成是否惊艳,而是连续编辑五轮是否漂移、文字错误率、局部修改是否破坏其他区域、图层和时间轴能否继续交付、每个可用资产需要多少次重试。

六、实时语音提供了另一种分层:交互与认知分开

GPT-Live-1 和 mini 采用全双工架构,可以同时听和说,支持短反馈、快速来回、打断和沉默等待。对于需要搜索或深度推理的问题,它会把任务委派给后台前沿模型,同时继续维持语音会话。

这种设计把系统拆成两个时间尺度。交互控制层必须低延迟、自然、能处理中断;认知层可以更慢,负责复杂规划和工具调用。机器人、车载、客服和陪伴产品可能沿着这一结构发展。

但它并没有消除语音系统工程。AEC、降噪、VAD、端点检测、网络抖动、首音时延、回声、嘈杂环境和打断恢复仍然决定实际体验。模型越自然,基础音频链路的问题反而越容易被用户感知。

Cohere Transcribe Arabic 也提示,语音市场不会被一个通用模型完全覆盖。方言、混说、行业词汇、设备噪声、地区合规和本地部署仍然为专业模型留下空间。

七、为什么这些模型恰好挤在 7 月

没有证据表明厂商统一约定了发布时间。更合理的解释是多个周期叠加。

第一,Agent 产品和模型在上半年同时成熟。模型必须与工具、安全、配额、上下文、监控和产品界面一起交付,多个团队在相近时间达到可用状态。

第二,真实使用数据缩短了后训练周期。Cursor、Devin、腾讯产品和 OpenAI 内部工作流不断产生工具轨迹和失败样本,使模型可以更快迭代。

第三,性能竞争进入成本—质量 Pareto 前沿。只要能让相同任务更便宜、更快、更稳,即使没有绝对代际突破,也具备发布价值。因此同一个月会同时出现旗舰、Flash、Lite、mini 和正式版优化。

第四,MoE、量化和推理基础设施提高了交付能力。大模型可以通过稀疏激活控制计算,小模型可以通过专门后训练承担高并发任务。

第五,开放权重、IDE、云、社交和企业入口的竞争加快了发布。厂商争夺的不只是排行榜注意力,而是默认调用入口和后续数据反馈。

半年度研发交付、下半年企业项目、竞争性传播窗口也可能放大聚集效应,但这些属于合理推断,不能写成所有公司的已证实动机。

八、7 月最值得警惕的误区:榜单看起来越来越精确,比较却越来越困难

排行榜使用边界

Agent benchmark 的分数高度依赖 Harness。是否允许搜索、是否使用并行 Agent、推理强度、超时时间、工具重试、上下文压缩、采样次数和价格估算都会影响结果。

Grok 4.5 的案例尤其典型。Cursor 主动披露,早期训练数据包含 Cursor 代码库快照,造成 CursorBench 污染。这个披露不意味着模型没有价值,但意味着相关分数不能继续作为无条件领先证据。

Kimi K3 的官方模型卡也在表格脚注中说明,不同模型使用的 Agent 框架和设置并非全部一致。Cognition 的 SWE-1.7 对比同样混合了公开榜单与厂商自报结果。

因此,模型选型不能通过截图排行榜完成。企业至少需要一个包含真实任务、固定工具、固定预算、重复运行、人工接管记录和成本统计的内部回归集。

九、对开发者真正重要的不是记住 18 个名字

模型选型五问

模型会继续快速更替。长期资产不是对某个版本的熟悉,而是以下能力:

第一,定义自己的任务集。把“写得好”变成测试通过、数据核对、文档结构、延迟、成本和人工修复等可测指标。

第二,建设可替换的 Harness。模型负责推理,系统负责状态、工具、权限、检查点、回滚、验证和审计。供应商变化时,不必重写整套业务。

第三,建立分层路由。廉价模型处理大量确定性子任务,强模型处理高风险判断和最终评审,失败时可以升级或重试。

第四,记录失败而不是只保存成功案例。循环、工具参数错误、遗漏约束、上下文压缩丢失、过早停止和虚假完成,才是后续优化最有价值的数据。

第五,把成本算到成功任务上。Token、工具费、重试、人工接管、延迟和基础设施都应进入同一账本。

结语

2026 年 7 月看似是一场模型发布竞赛,实际上更像一次产业结构暴露。

前沿模型正在学习长期执行;Flash 和 Lite 模型正在承接规模化子任务;开放权重向超大稀疏和专业小模型两端扩张;图像、音频和语音开始变成可编辑、可持续交互的生产系统;基础模型公司与 IDE、云、社交平台和企业工具之间的边界不断消失。

从这个角度看,7 月最重要的不是又出现了多少“最强模型”,而是行业已经不再只比较模型。真正被比较的是一整套完成工作的机器。

主要来源