跳转至

AI 每日简报 | 2026-05-26

今日概览

AI 行业在周二呈现「现实检验」与「资本加速」的双重叙事。一方面,SaaS-Bench 评测撕开了 AI Agent 全自动办公的滤镜,Claude 等模型在真实 SaaS 任务中的完全通过率不到 4%;另一方面,OpenAI 提交 IPO 草案、DeepSeek 启动首轮融资、月之暗面拆除 VIE 冲刺港股 IPO,AI 行业的资本化进程全面提速。具身智能领域也迎来密集信号:蚂蚁灵波论文被顶会接收、华为大脑一号位创业、李飞飞发布空间智能基准。

  • SaaS-Bench:Claude 在真实办公任务中完全通过率仅 3.8%,全自动办公远未落地
  • OpenAI 秘密提交 IPO 草案,目标估值 8500 亿–1 万亿美元,同日宣布巴西媒体战略合作
  • DeepSeek V4 发布 + API 永久降价至 ¼ + 启动首轮融资(估值约 450 亿美元)
  • 月之暗面拆除 VIE 架构冲刺港股 IPO,估值突破 200 亿美元
  • Waymo 大规模召回 3800 辆无人车,自动驾驶安全引发全球关注

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含核心观点提炼。

⭐ SaaS-Bench:Claude 通过率不到 4%,撕碎了 Computer-Use 的「全自动办公」幻想

UniPat AI 发布的 SaaS-Bench 是首个在真实部署的 SaaS 应用中评测 Computer-Use Agent 的基准。它包含 23 个真实 SaaS 系统(CRM、会计、医疗记录、项目管理等)的 106 个长程任务,要求 Agent 在浏览器中通过 UI 交互完成跨应用的专业工作流,不允许调用后端 API。

评测结果触目惊心:即使是最强的 Claude Opus 4.6,在「完全解决」指标(Resolved Score)上也仅达到 3.8%——意味着 96% 以上的真实办公任务无法被当前 Agent 独立完成。Kimi K2.5 和 Gemini 3.1 Pro 的 Resolved Score 甚至为 0%。虽然 Claude 在部分进度指标(Checkpoint Score)上达到 43.2%,但长程执行、跨应用状态管理和错误恢复仍是根本性瓶颈。

核心观点
- SaaS-Bench 揭示了一个被行业刻意回避的真相:当前 AI Agent 的「自动办公」演示大多在受控环境中完成,一旦进入真实企业软件的长链路、多应用、高容错场景,可靠性会断崖式下跌
- 这一结果并不意味着 Agent 没有价值,而是说明「人类在环」的半自动模式(如 Codex / Claude Code 的协作范式)才是当前最务实的落地路径

来源: arXiv | 来源: 量子位

⭐ OpenAI 秘密提交 IPO 草案,目标估值或达 1 万亿美元

OpenAI 于 5 月 22 日向 SEC 秘密提交了 S-1 注册草案,计划在 2026 年下半年(劳工节至感恩节期间)完成 IPO。Goldman Sachs 与 Morgan Stanley 联合承销,预期估值在 8500 亿至 1 万亿美元之间。财务数据显示,OpenAI 年化收入(ARR)已达约 250 亿美元,但每赚 1 美元大约花费 1.22 美元,年运营成本约 300 亿美元。与此同时,Elon Musk 的诉讼被陪审团驳回,不再阻碍 OpenAI 的营利化转型路径。

同月,OpenAI 正式推出了 ChatGPT 自助广告投放平台,美国 Pro 用户还可安全连接金融账户(支持 12000+ 机构),利用 GPT-5.5 进行预算规划和理财分析。商业模式正从纯订阅向「订阅 + 广告 + 金融」多引擎转型。

核心观点
- OpenAI 的 IPO 将是科技史上规模最大的上市之一,但其「烧钱换增长」的财务结构在公开市场将面临更严苛的审视——如果上市后无法快速证明盈利能力,万亿估值可能承压
- 广告平台和金融功能的上线,实质上是将全球最强大的对话界面转化为品牌分发渠道和金融服务入口,对传统搜索广告和理财顾问行业构成结构性威胁

来源: buildfastwithai.com | 来源: aitoolsrecap.com

⭐ DeepSeek V4 发布 + API 永久降价至 ¼ + 启动首轮融资

DeepSeek 在 5 月 23 日正式发布 V4 模型,定价大幅下调,宁德时代、京东、网易等大厂抢着接入。创始人梁文锋明确承诺坚持开源路线,目标是 AGI。V4 深度适配华为昇腾 950PR 等国产芯片,在国产算力适配上建立了先发优势。

更值得关注的是商业化策略:DeepSeek 宣布 V4-Pro API 将永久降至原价的 ¼,调整后每百万 Tokens 输入(缓存命中)仅 0.025 元,创全球大模型 API 价格新低。同时,公司正启动成立以来的 首次外部股权融资,目标规模约 500–700 亿元人民币,投后估值约 450 亿美元,国家大基金正在洽谈领投。

核心观点
- DeepSeek V4 的激进定价策略正在重新定义中国大模型市场的成本基准,迫使竞争对手在「跟随降价」与「坚守利润」之间做出艰难选择
- 梁文锋对开源路线的坚持与国产芯片深度适配,使 DeepSeek 成为「算力自主可控」叙事下的最大受益者;而首轮融资则标志着它从「闭门研发」向「资本化、商业化」全面转型

来源: 量子位 | 来源: 21经济网

⭐ 月之暗面拆除 VIE 架构冲刺港股 IPO,估值突破 200 亿美元

月之暗面(Moonshot AI)正 拆除 VIE(可变利益实体)与红筹结构,目标是为赴港上市扫清监管障碍。公司估值已突破 200 亿美元(约 1400 亿人民币)。本轮约 20 亿美元融资由美团龙珠领投,中国移动、CPE 源峰等参投,国智投、北京人工智能基金等国资机构也已确认入场。

此前在 4 月 20 日,月之暗面发布并开源了 Kimi K2.6 模型,支持 300 个子任务并行的 Agent 集群能力。商业化方面,据 Stripe 数据,2026 年 1–2 月 Kimi 付费用户订单爆发式增长,1 月环比暴增 8280%。此外,Kimi 还参与了国家数据局主办的「词元经济」座谈会,开始参与国家层面的数据经济与 AI 治理政策讨论。

核心观点
- 月之暗面的 IPO 进程标志着中国大模型「六小虎」正从独角兽阶段向公众公司阶段集体跃迁,港股将成为国产 AI 企业资本运作的核心阵地
- 国资和央企巨头(中国移动、国家大基金相关机构)的密集入场,意味着国产大模型已从「风险投资驱动」转向「国家战略基础设施」定位

来源: IT之家 | 来源: 新浪财经

⭐ Waymo 大规模召回 3800 辆无人车,自动驾驶安全引发全球关注

Waymo 于 5 月初向 NHTSA 提交自愿召回报告(编号 26E026),覆盖约 3791 辆配备第 5 和第 6 代自动驾驶系统的无人车。原因是软件缺陷导致车辆在高速公路上检测到可能无法通过的积水时仅减速而未完全停止,最终驶入积水中。触发事件发生于 4 月 20 日圣安东尼奥,一辆无人车被洪水冲入 Salado Creek,4 天后才被打捞。

召回后,Waymo 暂停了圣安东尼奥和亚特兰大等城市的 Robotaxi 服务。这是全球自动驾驶行业迄今为止规模最大的召回事件之一,也反映出 L4 级自动驾驶在极端天气和边缘场景下的可靠性仍未达到大规模商业化要求。

核心观点
- Waymo 召回事件是自动驾驶行业从「技术炫技」向「安全责任」转型的标志性事件——当软件缺陷可能导致车辆驶入洪水时,公众对无人车的信任将经历严峻考验
- 这一事件也暗示,完全无人驾驶的规模化部署可能比预期更慢,「人类在环」的混合运营模式将在未来数年内持续存在

来源: CNBC | 来源: NHTSA


OpenAI

OpenAI 与巴西 Grupo Folha 和 Grupo UOL 达成战略合作
OpenAI 于 5 月 25 日宣布与巴西两大媒体集团达成合作,将权威巴西新闻引入 ChatGPT,所有引用均附带来源归属和透明度说明。这是 OpenAI 在拉丁美洲最重要的内容合作之一。
来源: openai.com

OpenAI 秘密提交 IPO 草案,目标估值或达 1 万亿美元
OpenAI 于 5 月 22 日向 SEC 秘密提交 S-1 注册草案,计划 2026 年下半年 IPO,估值 8500 亿–1 万亿美元。Goldman Sachs 与 Morgan Stanley 联合承销。Elon Musk 的诉讼被陪审团驳回,不再阻碍 IPO 路径。
来源: buildfastwithai.com | ⭐ 深度推荐

GPT-5.5 正式发布
OpenAI 发布 GPT-5.5,增强多步推理、编码、计算机使用和研究能力, reportedly 在关键基准上超越 Anthropic Claude Mythos。同时,Sora 战略出现调整,视频生成功能将更深度地集成到 GPT 生态系统中,而非作为独立消费者产品扩张。
来源: aitoolsrecap.com

ChatGPT 推出自助广告投放平台与个人金融功能
OpenAI 正式在 ChatGPT 中上线自助广告平台,品牌可直接在对话中推广产品。美国 Pro 用户现可安全连接金融账户(支持 12000+ 机构),利用 GPT-5.5 进行预算规划和理财分析。
来源: releasebot.io

OpenAI 被 Gartner 评为企业 AI Coding Agents 领导者
OpenAI 在 2026 年 Gartner Magic Quadrant for Enterprise AI Coding Agents 中被列为领导者,Codex 因在创新性和企业级部署能力方面表现突出而获评。
来源: openai.com

Virgin Atlantic 使用 Codex 快速交付移动应用
Virgin Atlantic 利用 Codex 在固定假日旅行截止日期前交付了改版移动应用,实现了接近 100% 的单元测试覆盖率和零 P1 缺陷。
来源: openai.com

Codex 平台 5 月密集更新
Codex 本月迎来多项更新:支持 GPT-5.5 与 gpt-image-2;新增 Amazon Bedrock 内置模型提供商;Windows 原生支持上线,附带专用 Agent Sandbox 和 PowerShell 支持;--full-auto 标志被弃用,改为显式权限配置。
来源: releasebot.io


Google DeepMind / Gemini

Google I/O 2026 发布 Gemini 3.5 Flash 与 Spark 个人智能体
Google 在 5 月 19–20 日的 I/O 大会上正式推出 Gemini 3.5 Flash,即日起成为 Gemini 应用与搜索 AI 模式的默认引擎。同期发布的 Gemini Spark 是一款 24/7 运行的个人智能体,可自主完成复杂多步骤任务。Magic Pointer 则用 AI 重构了鼠标指针交互。
来源: 163.com | 来源: blog.google

Gemini 应用月活突破 9 亿,AI Overviews 月活达 25 亿
Google 公布数据显示,Gemini 应用月活从 2025 年 5 月的 4 亿增长至 9 亿,覆盖 230 个国家和地区。AI Overviews 月活突破 25 亿。Google 全平台过去一年每月处理 3.2 千万亿 Token,同比增长 7 倍。
来源: sina.com.cn

谷歌 CEO 承认 Coding 落后了
量子位报道,谷歌 CEO 在 I/O 2026 期间承认 Google 在 AI Coding 领域已落后竞争对手,同时宣布搜索 25 年来最大改版,但公司还不敢一脚完全切换到 AI 模式。
来源: 量子位

DeepMind UK 员工 98% 投票支持工会化
英国 DeepMind 员工通过通信工人工会(CWU)和 Unite the Union 投票支持工会化,支持率高达 98%。导火索是传闻中一份涉及美国国防部的机密 Pentagon 合同,授予美军方访问 Gemini 模型的权限。员工要求终止军事合同、恢复不开发武器 AI 的公开承诺,并建立独立伦理监督机制。
来源: thebrightminded.com

DeepMind 收购 Contextual AI 研究团队
DeepMind 以约 8000–9000 万美元的授权交易,从 Contextual AI 引进了 20 余名研究人员。
来源: heygotrade.com


Anthropic / Claude

Anthropic 与 SpaceX 达成算力合作,Claude 平台能力全面升级
Anthropic 租用 SpaceX Colossus 1 数据中心后,Claude Code 速率限制全面翻倍,并取消了高峰时段限流。同月发布了 Claude for Small Business(15 个预置 Agent 工作流)、Claude Platform on AWS、Opus 4.7 Fast 模式、MCP tunnels 研究预览、Prompt Cache 诊断功能等一系列更新。
来源: aitoolsrecap.com | 来源: roborhythms.com

Andrej Karpathy 加入 Anthropic
5 月 19 日,Anthropic 宣布著名 AI 研究者 Andrej Karpathy 加入公司,专注于预训练研究。Karpathy 此前在 OpenAI 和 Tesla 任职,是 AI 教育领域最具影响力的科普者之一。
来源: nerdleveltech.com

Code with Claude London 开发者峰会
Anthropic 于 5 月 19–20 日在伦敦举办了首次欧洲开发者峰会,主题包括自托管沙盒、MCP tunnels、Managed Agents API 等。MCP tunnels 进入研究预览阶段,允许连接私有网络内的 MCP 服务器。
来源: digitalapplied.com

Claude Developer Platform 网页搜索增强
5 月 18 日更新中,Claude 的网页搜索工具增强了 SEC 申报文件数据返回能力,便于金融研究、收益分析和尽职调查工作流直接引用原始来源。
来源: releasebot.io


国内大厂动态

DeepSeek / Kimi / 豆包 / 智谱 等

DeepSeek V4 发布:API 永久降价至 ¼,启动首轮融资
DeepSeek V4 于 5 月 23 日发布,定价大幅下调,宁德时代、京东、网易等大厂抢着接入。梁文锋承诺坚持开源路线,V4 深度适配华为昇腾 950PR 等国产芯片。API 永久降至原价 ¼,每百万 Tokens 输入仅 0.025 元。同时启动首轮融资,估值约 450 亿美元。
来源: 量子位 | ⭐ 深度推荐

月之暗面拆除 VIE 架构冲刺港股 IPO,估值突破 200 亿美元
月之暗面正拆除 VIE 与红筹结构,为赴港上市扫清障碍。本轮约 20 亿美元融资由美团龙珠领投,国资机构及中国移动等央企已确认入场。4 月发布的 Kimi K2.6 支持 300 个子任务并行。
来源: IT之家 | ⭐ 深度推荐

豆包推出分层付费订阅
5 月,豆包在苹果 App Store 更新付费订阅方案,标准版 68 元/月、加强版 200 元/月、专业版 500 元/月。付费功能面向 PPT 生成、数据分析、影视制作等复杂生产力场景,官方承诺永久保留免费基础服务。
来源: CSDN

智谱发布 GLM-5V-Turbo 与 ZCube 推理网络架构
智谱于 5 月初发布多模态编程基座模型 GLM-5V-Turbo,在 Design2Code 基准中获得 94.8 分。5 月 21 日,智谱联合驭驯网络和清华大学发布下一代推理网络架构 ZCube,针对 PD 分离推理拥塞难题,交换机及光模块成本降低 33%,GPU 推理吞吐量提升 15%。
来源: 智谱 | 来源: 机器之心

百度文心 5.1 发布,采用多维弹性预训练
百度于 5 月 9 日发布文心 5.1,采用「多维弹性预训练」架构,总参数压缩至前作约 ⅓(约 0.8T),激活参数减半(约 36B),预训练成本降至业界同规模模型的约 6%。
来源: 163.com

京东 JoyInside:AI 的终极形态不是聊天,是融入你家每一件物品
京东 JoyInside 负责人戴文军在 AIGC2026 产业峰会上表示,硬件不该让人适应,它应该主动适应你。AI 的终极形态是融入每一件物品,而非停留在聊天界面。
来源: 量子位

华为具身大脑一号位创业,用认知科学造世界模型,获亿元级融资
华为具身智能核心团队成员创业成立「具脑磐石」,用认知科学重构具身智能的世界模型,已获得亿元级融资。
来源: 量子位


AI 研究前沿

重要论文、技术突破

SaaS-Bench:真实办公任务完全通过率仅 3.8%
UniPat AI 发布 SaaS-Bench,在 23 个真实 SaaS 系统中评测 Agent。Claude Opus 4.6 的完全解决率仅 3.8%,Kimi K2.5 和 Gemini 3.1 Pro 为 0%。长程执行和跨应用状态管理是核心瓶颈。
来源: arXiv | 来源: 量子位 | ⭐ 深度推荐

李飞飞发布空间智能新基准:具身智能的「ImageNet 时刻」
李飞飞团队于 5 月 22 日发布空间智能新基准(Spatial Intelligence Benchmark),专门用于评测具身空间智能能力,为机器人在三维空间中的理解、推理和行动提供标准化测试框架。
来源: 量子位

蚂蚁灵波 LingBot-VA 论文被机器人顶会 RSS 2026 接收
蚂蚁灵波团队的 LingBot-VA 论文被机器人领域顶级会议 RSS 2026 接收,该工作让机器人边推演、边行动,获得了国际机器人研究共同体的高度认可。
来源: 量子位

苏剑林:MoE 环游记第 8 篇——强制序列级均衡
月之暗面研究员苏剑林于 5 月 22 日发布 MoE 系列最新文章,探讨如何在 Loss-Free 框架下实现序列级负载均衡,这是继全局批次均衡之后的更细粒度优化方向。
来源: 科学空间

HuggingFace 每日论文精选
- Self-Improving CAD Generation Agents with Finite Element Analysis as Feedback:提出利用有限元分析作为反馈信号的 CAD 生成智能体,使 AI 生成的工业设计能够自我迭代优化,更接近真实工程 pipeline

来源: huggingface.co


行业观点与解读

KOL 重要推文、深度分析文章

Simon Willison:评教皇 Leo XIV 的 AI 通谕
Django 联合创始人 Simon Willison 在其博客中详细解读了梵蒂冈发布的《Magnifica Humanitas》AI 通谕,称这是「我所见过的关于将 AI 整合进现代社会的最清晰伦理写作之一」。该通谕选择以 Pope Leo XIII 的《Rerum novarum》(1891 年关于资本与劳动权利义务的通谕)为精神渊源,暗示 AI 时代的伦理挑战与工业革命时期具有同等量级。
来源: simonwillison.net

Ethan Mollick:Sign of the future — GPT-5.5 是一步令人印象深刻的进展
宾夕法尼亚大学沃顿商学院教授 Ethan Mollick 在其 Newsletter 中评测 GPT-5.5,认为它是「曲线上令人印象深刻的一步」,标志着 AI 能力持续稳步提升。
来源: oneusefulthing.org

a16z Big Ideas 2026 系列:Agentic Interface、Physical AI、New Infrastructure Primitives
a16z 在 2025 年底发布的 Big Ideas 2026 系列持续影响行业讨论,核心主题包括:AI 正从「你问的东西」变成「替你做的行动」(Agentic Interface);AI 进入物理经济(工厂、建筑、供应链);以及可编程货币、自主科研等新基础设施原语。
来源: a16z.com

硅谷投资人张璐:未来推理将吃掉 70% 算力,30% 留给训练
AIGC2026 峰会上,硅谷投资人张璐提出,随着推理需求爆发,未来算力分配将向推理倾斜(70% 推理 vs 30% 训练),技术创新只是起点,产业整合速度才是 AI 落地的真正竞争力。
来源: 量子位

蚂蚁灵波沈宇军:VLA 和世界模型都不是终局,会有物理世界独有的模型
蚂蚁灵波 CEO 沈宇军在 AIGC2026 上表示,VLA(Vision-Language-Action)和世界模型都不是具身智能的终局,未来会出现物理世界独有的模型架构。蚂蚁灵波要做「机器人时代的安卓系统」。
来源: 量子位


值得关注的视频

YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。

⭐ The AI Daily Brief — Why Agents Still Need Humans(5/24)
NLW 探讨人机协作的「人类三明治」模型,以及 Codex 和 Claude Code 指向的半同步未来。认为完全自主 Agent 的极限尚未突破,人类在环仍是高价值场景的最优解。
YouTube / Podcast | ⭐ 推荐观看

No Priors — Pax Silica: Inside the Trump Administration's Tech Strategy(5/14)
Sarah Guo 和 Elad Gil 专访美国国务院经济事务副国务卿 Jacob Helberg,讨论 Pax Silica——一个由 14 国组成的经济安全联盟,旨在确保 AI 供应链安全,包括在菲律宾部署前沿工业基地。
Podcast

a16z Show — Big Ideas 2026: The Agentic Interface
a16z 认为提示框(prompt box)作为 AI 主要 UI 的时代正在终结,下一代应用将主动观察用户行为并介入建议操作。
Podcast

Latent Space — Marc Andreessen introspects on The Death of the Browser(4/3)
swyx 与 Marc Andreessen 的对谈,涵盖浏览器之死、Pi + OpenClaw、Agents 作为新「Unix」、自我修改 Agent、编程语言的未来、proof-of-human vs proof-of-bot 等话题。
Podcast


灵感种子

以下是今日简报中值得进一步思考的灵感种子。

SaaS-Bench 的残酷启示:Agent 的「最后一公里」不是技术问题,是可靠性问题
Claude Opus 4.6 在真实 SaaS 上的完全通过率不到 4%,这一数据比任何技术论文都更能说明问题:当前 Agent 的核心瓶颈已从「能不能做」转向「能不能稳定做完」。对创业者而言,与其追逐更强大的基础模型,不如在「错误恢复」「状态管理」「人机交接」等工程细节上建立壁垒——这些才是企业客户真正愿意付费的地方。

AI 公司集体冲刺 IPO:从「技术信仰」到「财务纪律」的成人礼
OpenAI(8500 亿–1 万亿)、月之暗面(200 亿+)、智谱、MiniMax 等都在加速 IPO 进程。这意味着中国和美国的大模型公司几乎同步进入「资本化」阶段。当这些曾经的「科研理想主义」公司开始向公开市场解释每一美元的投入产出比时,它们的战略选择、人才激励和开源承诺都将面临前所未有的压力测试。

具身智能的路线之争:VLA、世界模型、还是专用架构?
蚂蚁灵波沈宇军提出「VLA 和世界模型都不是终局」,华为大脑一号位选择用认知科学造世界模型,李飞飞则发布空间智能基准定义评测标准。三条路径同时推进,意味着具身智能仍处于「范式未定」的早期阶段。对投资者和从业者而言,现在押注任何单一路线都有风险,更稳妥的策略是关注「跨路线的通用基础设施」——比如仿真平台、数据集、评测工具和机器人中间件。

推理算力将超过训练算力:基础设施投资的结构性转向
张璐提出的「70% 推理 vs 30% 训练」算力分配预测,如果成真,意味着数据中心建设、GPU 采购和云厂商的战略重心将发生根本性转移。DeepSeek V4 的 API 永久降价到 0.025 元/百万 Tokens,正是这一趋势的前奏——当推理成本趋近于零,AI 应用的爆发将从「成本敏感型」走向「无所不在型」。


生成时间:2026-05-25 22:50 | 下次更新:明日 9:00