跳转至

AI 每日简报 | 2026-07-10

今日概览

今天是「GPT-5.6 日」——OpenAI 一口气发布 GPT-5.6 家族三款模型和一整套 Agent 产品线(ChatGPT Work、合并版桌面 App、Sites),把竞争主轴从「谁更聪明」拉向「每美元干多少活」。叠加两天前 xAI Grok 4.5 的低价编码模型,以及 Gemini 3.5 Pro 为应战推迟重构,三巨头的价格性能战全面开打。国内侧,蚂蚁灵波一天开源两个具身智能基模,登上 HuggingFace 论文热榜。

今日要点:

  1. ⭐ OpenAI 发布 GPT-5.6 家族(Sol / Terra / Luna)+ ChatGPT Work 工作智能体 + 合并版桌面 App
  2. ⭐ 英国 AISI 在 GPT-5.6 预发布测试中发现「通用越狱」,称其为「迄今风险最高的安全问题」
  3. ⭐ 补录:xAI 发布 Grok 4.5,主打编码与 Agent,价格仅为 Opus 4.8 的四成
  4. ⭐ 蚂蚁灵波开源 LingBot-Video 与 LingBot-World 2.0,具身智能「视频基模 + 世界模型」双发
  5. Google 将 Gemini 3.5 Pro 推迟至 7 月 17 日发布,全面重构架构应战

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。

⭐ OpenAI 发布 GPT-5.6 家族:性价比成为主战场(GPT-5.6: Frontier intelligence that scales with your ambition)

OpenAI 于 7 月 9 日发布 GPT-5.6 家族,从小到大分为 Luna(\(1/\)6 每百万输入/输出 token)、Terra(\(2.5/\)15)、Sol(\(5/\)30)三档,均为 100 万 token 上下文、128K 最大输出,知识截止 2026 年 2 月。官方主打叙事不是单纯的能力提升,而是「每 token 产出更多有效工作」:在长程专业工作流评测 Agents' Last Exam 上,Sol 以 53.6 分超出 Claude Fable 5 达 13.1 分,且中等推理档就能以约四分之一成本领先。第三方 Artificial Analysis 评估 Sol 智能指数 59 分,仍居 Fable 5 之后位列第二,但单任务成本只有其三分之一;编码 Agent 指数则以 80 分登顶。Sol 还在 ARC-AGI-3 上创下 7.8% 的 SOTA(Opus 4.8 为 1.5%),成为首个「通关」ARC-AGI-3 游戏的前沿模型。

同场发布的产品线同样重磅:ChatGPT Work 是由 Codex + GPT-5.6 驱动的新智能体,可跨应用和文件持续工作数小时;Codex 与 ChatGPT 合并为一个桌面 App,支持浏览器集成与更快的 Computer Use;Sites(beta)可把输出变成可分享网页。API 侧新增 Programmatic Tool Calling(模型编写 JS 编排工具调用)、内建多智能体、显式缓存断点等。Simon Willison 上手评价:Sol「非常能干」,但在他常用的复杂编码任务上「尚未觉得比 Fable 更强」。另一个耐人寻味的细节:Fable 5 在 SWE-Bench Pro 上以 80% 大胜 Sol 的 64.6%,而 OpenAI 恰好在发布前一天发文质疑该基准约 30% 任务已损坏(昨日简报已覆盖)。

核心观点:
- 这是一次「成本曲线发布」而非「能力上限发布」:OpenAI 明确回应企业对 AI 成本的抱怨,用「dollars-per-task」重新定义竞争维度——当模型能力趋同,单位任务成本成为新护城河。
- Agent 产品化全面提速:模型(GPT-5.6)、执行体(ChatGPT Work)、载体(合并桌面 App)、分发(Sites)四层同日落地,OpenAI 正在把「模型公司」的故事改写为「工作平台公司」。

来源:OpenAI 官方 | ChatGPT Work | Simon Willison 评测 | smol.ai 汇总

⭐ 英国 AISI:GPT-5.6 存在「通用越狱」,可完成漏洞挖掘与利用开发

在 OpenAI 宣称 GPT-5.6 是其「在网络与生物任务上最强模型」并引入 API 中途拦截审查机制的同时,英国 AI 安全研究所(UK AI Security Institute)披露:在所有轮次的预发布测试中都发现了「通用越狱」(universal jailbreaks),可让模型完成包括漏洞发现和利用程序开发在内的长程 Agent 任务。Anthropic 研究员 Ethan Perez 称之为「迄今所有模型发布中风险最高的安全问题」。值得注意的是,OpenAI 允许第三方在发布前公开这些不利发现,这一透明度获得了安全社区的肯定。

核心观点:
- 「能力最强」与「防护最弱」在同一款模型上同时成立,说明当前的安全护栏技术没有跟上能力扩张速度——尤其在网络攻击这类双重用途领域,越狱的边际危害正随模型能力水涨船高。
- 允许第三方发布负面安全发现正在成为行业规范,这可能是比任何单点防护更重要的制度进步。

来源:UK AISI 测试人员 @alxndrdavies | Ethan Perez 评论 | OpenAI 双重用途说明

⭐ 补录:xAI 发布 Grok 4.5,「Opus 级」模型打到白菜价

xAI 于 7 月 8 日发布 Grok 4.5(因发布时间在昨日简报截稿后,今日补录)。这是 xAI 第一款专为编码和 Agent 工作打造的模型:基于 1.5 万亿参数 V9 底座,在数万张 NVIDIA GB300 上训练,并使用了真实的 Cursor 开发者会话数据。自报基准显示其在 SWE Marathon(长会话真实代码库任务)上以 29.0% 超过 Opus 4.8 和 Fable 5;Terminal Bench 2.1 达 83.3%,介于 Opus 4.8 与 Fable 5 之间。Artificial Analysis 独立评估将其列为智能指数第四,高于所有开源模型和全部 Gemini 型号。最激进的是定价:\(2/\)6 每百万 token,比 Opus 4.8 便宜六成以上,且 token 效率极高(单任务平均输出约 1.4 万 token,Opus 4.8 为 6.7 万)。目前欧盟区暂不可用,预计 7 月中旬开放。

核心观点:
- Grok 4.5 与次日的 GPT-5.6 形成呼应:2026 年中的前沿竞争已从「基准分数军备赛」转向「性价比绞杀战」,主要受益者是 Agent 高频调用场景的开发者。
- 用真实 IDE 会话数据训练(而非合成任务)是差异化关键——评测也随之转向「在真实代码库中长时间干活」,这可能加速 SWE-Bench 类静态基准的边缘化。

来源:xAI 官方 | TechCrunch | Axios

⭐ 蚂蚁灵波一日双发:开源全球首个具身 MoE 视频基模与「小时级」世界模型

蚂蚁灵波(Robbyant)7 月 9 日同时开源两个具身智能基础模型。LingBot-Video 是全球首个面向具身智能的 MoE 视频基础模型:不同于内容创作导向的视频生成模型,它用数据引擎将互联网视频与大量机器人操作、导航、第一视角素材混合训练,并用多维奖励系统对齐物理合理性与任务完成度,主打「视频生成模型作为机器人大脑」。LingBot-World 2.0 则实现了世界模型「小时级」生成:无限交互时域、实时变体可驱动 720p/60fps 视频流、支持攻击/射箭/施法等多样动作,并首创在世界模型中引入 Agent 编排(pilot agent 规划角色行为、director agent 动态生成环境),支持多人同时交互。主模型 14B 配轻量 1.3B 版本,单卡可部署。两篇论文均登上 HuggingFace 当日热榜。

核心观点:
- 「视频生成的下一站是机器人大脑」——当视频模型的评价标准从美学转向物理合理性和任务完成度,视频基模与 VLA 模型的技术栈开始合流,具身智能可能是视频生成真正的商业落点。
- 蚂蚁在具身开源上的激进程度值得关注:模型、世界模拟器、Agent 编排一次性放出,配合此前国内具身赛道的密集融资,开源生态卡位战已从 LLM 蔓延到具身智能。

来源:LingBot-Video 论文 | LingBot-World 2.0 论文 | 量子位报道

⭐ SciReasoner:上海 AI Lab 发布跨学科结构推理基础模型

上海人工智能实验室发布 SciReasoner(Deep Native Structural Reasoning),一个横跨蛋白质、小分子、无机晶体的多模态科学基础模型。其核心思路是把坐标、拓扑、周期性连接离散化为统一的「结构感知词表」,让结构 token 成为推理过程中可寻址的证据单元——模型不仅给出预测,还能展示哪些结构证据支持结论。成绩:低同源蛋白的基因本体注释 F_max 从 0.42 提至 0.55,单步逆合成准确率从 0.63 提至 0.72,86 个基准中 67 个达到 SOTA。双盲专家评估中,其推理链在 98% 的案例中不劣于前沿大语言模型。HuggingFace 当日热榜第一(71 票)。

核心观点:
- 「结构即证据」的设计回应了科学 AI 最大的痛点——可解释性:审稿人和实验科学家需要知道「为什么」,把推理锚定在可检查的结构单元上,比事后归因更可信。
- 科学基础模型正从「单域专精」(AlphaFold 式)走向「跨域通用」,统一词表是关键技术赌注。

来源:HuggingFace 论文页 | 项目主页


OpenAI

  • GPT-5.6 家族发布(详见深度阅读区):Sol / Terra / Luna 三档齐发,ChatGPT Work、合并桌面 App、Sites 同日上线。官方博客
  • ChatGPT Work:面向「最有野心的工作」的智能体:由 Codex + GPT-5.6 驱动,可跨应用与文件行动、在一个项目上持续工作数小时,把目标直接变成成品。OpenAI
  • GPT-5.6 成为 Microsoft 365 Copilot 首选模型:发布当天即接入 Word / Excel / PowerPoint / Chat / Cowork,微软与 OpenAI 的产品耦合进一步加深。OpenAI
  • GPT-5.5 Bio Bug Bounty:OpenAI 为生物安全防护上线漏洞悬赏计划,邀请外部研究者攻击其生物风险护栏。OpenAI
  • OpenAI「首席未来学家」离职:量子位报道,OpenAI 首席未来学家宣布离职,去向与 AGI 安全相关("To safe AGI")。量子位

Google DeepMind / Gemini

  • Gemini 3.5 Pro 推迟至 7 月 17 日,架构全面重构:据报道,Google 放弃在 2.5 Pro 架构上迭代,为对标 GPT-5.6 与 Fable 5 进行完整重建,目标是数学推理、场景生成与图像质量,并引入 200 万 token 上下文与 Deep Think 推理层。发布时间恰与上海 WAIC 同期,下周将是密集发布周。BigGo(注:非官方消息源,以 Google 官宣为准)
  • AlphaEvolve 算法优化 Agent 在 Gemini Enterprise 正式可用(GA):面向企业提供代码优化与算法发现服务,客户端安全执行代码 + 服务端 LLM 探索。Google 发布记录

Anthropic / Claude

  • Claude Cowork 扩展至网页端和移动端:会话远程运行(beta),文件与会话随账号跨设备同步,合上笔记本任务继续执行,定时任务无需设备在线。从 Max 计划开始数周内逐步推送。9to5Mac
  • Anthropic 上线 Reflect 使用回顾仪表盘:可视化用户的 AI 使用习惯(话题分布、活跃时段),并会主动提问「哪件事你想继续自己做,即使 Claude 更快」,同场上线休息提醒与免打扰时段。TechCrunch 评论称这是「不动声色的 AI 使用推销/自省工具」。TechCrunch

国内大厂动态

  • 蚂蚁灵波开源 LingBot-Video / LingBot-World 2.0(详见深度阅读区):具身智能「视频基模 + 世界模型」双发开源。量子位
  • 豆包视频模型 Seedance 2.5 上线在即:字节 6 月下旬官宣、预计 7 月初正式上线的新一代视频模型进入最后阶段:原生 30 秒连贯长镜头、单项目 50 份全模态参考素材、局部主体替换编辑、原生 4K 输出,另有 3D 白膜预览用于分镜模拟。网易科技 | 快科技
  • 智谱 GLM-5.2 训练细节曝光:SAO 异步强化学习:智谱团队论文披露 GLM-5.2(750B-A40B)的 Agent RL 训练管线采用 Single-rollout Asynchronous Optimization,详见研究前沿板块。论文
  • 原力灵机发布具身模型 DM0.5:用 15 万小时数据训练,Zero-Shot 性能提升 31%,团队称「已经出现泛化涌现」。量子位
  • WAIC 2026 下周开幕:世界人工智能大会 7 月 17-20 日在上海举办,180 家企业携成果入驻,与 Gemini 3.5 Pro 发布撞期,下周将是中外新品密集碰撞的一周。量子位
  • 李开复回应「没了李开复,零一万物还有什么」:量子位在活动现场直击这场火药味问答,零一万物转型后的定位问题被摆上台面。量子位

AI 研究前沿

  • SciReasoner(详见深度阅读区):跨蛋白质/分子/晶体的结构推理基础模型,86 基准 67 项 SOTA。HuggingFace
  • SAO:单 rollout 异步强化学习(Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning):智谱团队提出用「每个 prompt 单 rollout + 价值模型 + 严格双侧 token 级裁剪」替代 GRPO 的组采样,解决异步 Agent RL 的稳定性与 off-policy 问题,可稳定训练千步,已用于 GLM-5.2(750B-A40B)的生产训练管线。开源模型的 RL 基础设施细节正变得越来越透明。HuggingFace
  • LaMem-VLA:VLA 模型的双重潜空间记忆(Dual Latent Memory in Vision-Language-Action Models):将历史经验重构为潜空间记忆 token 直接织入 VLA 推理流,短期/长期双记忆库设计,解决机器人长程任务的时序依赖,在 SimplerEnv 和 LIBERO 上超越现有方案。HuggingFace
  • RoboDojo:仿真+真机统一评测基准:42 个仿真任务 + 18 个真机任务,覆盖泛化/记忆/精度/长程/开放指令五个维度,提供可远程云访问的真机评测系统,已集成 30 个策略并建立公开排行榜。通用机器人策略终于有了「可复现的真机考场」。HuggingFace

行业观点与解读


值得关注的视频

  • OpenAI GPT-5.6 发布直播(官方视频已出):含 ChatGPT Work 与合并桌面 App 全程演示,17:50 处有 3D 鹈鹕骑车 demo 彩蛋。重大发布的第一手演示,推荐观看。YouTube
  • Latent Space #213:与 No Priors 联合专访微软 CEO Satya Nadella(7 月 8 日):来自 Microsoft Build 现场的跨播客对谈,微软视角下的 AI 平台战略,GPT-5.6 接入 M365 背景下值得一听。Latent Space
  • B站 AI 日报 07/08 期(灵感港):覆盖 OfficeCLI 走红、DeepSeek 自研 AI 芯片等热点的中文快讯,几分钟过完当日要闻。Bilibili

灵感种子

以下是今日简报中值得进一步思考的灵感种子。

「dollars-per-task」可能取代基准分数成为下一代模型的核心指标:GPT-5.6 和 Grok 4.5 在 48 小时内先后把「单任务成本」放到发布叙事的 C 位,Artificial Analysis 也开始按 per-task cost 而非 per-token 报价。如果这个指标固化下来,对应用层创业者意味着选型逻辑要重写:不是选「最聪明的模型」,而是为每类任务找到成本-质量曲线上的最优操作点——这本身就是一个工具/中间件机会(任务级路由、自动降档、成本审计)。

模型「自我后训练」的边界值得持续追踪:OpenAI 声称 GPT-5.6 Sol「自主后训练了」Luna,虽然社区质疑实际范围比字面窄,但结合内部研究 compute 中编码推理占比半年增长 100 倍的数据,「模型参与训练模型」已经从论文概念变成生产流程。真正的问题不是真假,而是比例:当自动化环节占后训练管线的比重超过某个阈值,迭代速度会脱离人类团队规模的约束——这是比任何单次发布都重要的斜率信号。

世界模型正在「游戏化」,游戏可能是具身智能的中间市场:LingBot-World 2.0 的功能清单(多人交互、攻击/施法动作、director agent 动态生成环境)看起来越来越像一个 AI 原生游戏引擎。在机器人大规模落地之前,「可玩的世界模型」可能先在游戏和虚拟内容领域找到商业闭环,反过来为具身智能积累交互数据——这条「以游戏养机器人」的路径值得关注。

安全披露的「透明度竞赛」是个新变量:OpenAI 允许英国 AISI 在发布前公开「通用越狱」这种不利发现,客观上把安全透明度变成了竞争维度。如果头部实验室开始比拼「谁敢让第三方说真话」,安全评估机构的话语权会快速上升——围绕独立评估、红队服务、安全审计的生态位正在打开。


生成时间:2026-07-10 09:13 | 下次更新:明日 9:00