跳转至

AI 每日简报 | 2026-05-22

今日概览

今日 AI 行业的核心叙事是「突破边界」——OpenAI 通用模型首次独立攻克悬置 80 年的数学猜想,Google I/O 全面铺开 Agentic AI 生态,而 Anthropic 与 SpaceX 的算力协议细节曝光则揭示了 infra 层面的激烈军备竞赛。国内方面,月之暗面完成新一轮巨额融资,DeepSeek 传出创纪录募资计划,大模型资本化浪潮正加速。

  • OpenAI 通用模型自主攻破埃尔德什 80 年未解数学猜想,菲尔兹奖主审稿通过
  • Google I/O 2026 收官:Gemini 3.5 Flash、Omni 世界模型、Spark 全天候 Agent 齐发
  • SpaceX S-1 披露 Anthropic 算力协议:每年约 150 亿美元租用 22 万块 GPU
  • 月之暗面完成约 20 亿美元新融资,估值突破 200 亿美元
  • 清华提出 TaH 方法:大模型推理跳过 93% 无效迭代,准确率反升

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。

⭐ OpenAI 通用模型攻破 80 年数学悬案,菲尔兹奖得主背书

OpenAI 一款内部测试的通用推理模型(非专用数学模型)自主完成了原创数学证明,推翻了匈牙利数学家保罗·埃尔德什(Paul Erdős)于 1946 年提出的「平面单位距离猜想」。该问题近 80 年来五代数学家未能取得实质突破,人类此前普遍认为最优排列是正方形网格,单位距离对数增长速度约为线性 O(n)。

AI 出人意料地引入代数数论工具(无限类体塔、Golod-Shafarevich 理论等),构造出全新点排列方式,证明增长速度为超线性 u(n) ≥ n^(1+δ)。随后普林斯顿数学家 Will Sawin 在 AI 构造基础上将下界推进到 δ = 0.014,这是自 1946 年以来该问题下界首次被更新。完整思维链精简后仍长达 125 页。

OpenAI 将证明手稿发送给包括菲尔兹奖得主 Timothy Gowers、组合数学家 Noga Alon 等 9 位顶尖数学家盲审。Gowers 表示:如果这是一篇人类投稿到《数学年刊》的论文,他会建议「直接接收」。Thomas Bloom(曾揭露 OpenAI 上次数学翻车)评价:「这是人工智能目前在数学领域取得的最亮眼成就。」

核心观点:
- 这是 AI 首次独立攻克数学领域核心的著名公开难题,标志着 AI 从「辅助工具」升级为「发现合伙人(Discovery Partner)」
- 通用模型而非专用数学系统完成突破,说明当前大模型的推理能力已跨越某个关键阈值
- 但 7 个月前 GPT-5 「解决埃尔德什问题」的翻车事件表明,外部独立验证仍是 AI 数学成果的必备门槛

来源: 量子位 | 36氪 | Gigazine


⭐ Google I/O 2026 全面进入 Agentic AI 时代

Google I/O 2026(5 月 19-20 日)以「Gemini 智能体新纪元」为主题,发布了一系列模型、Agent 和生态更新。核心发布包括:

Gemini 3.5 Flash:即日起成为 Gemini App 和搜索 AI 模式的默认引擎。输出速度约为其他前沿模型的 4 倍,在编程、智能体任务和多模态理解等基准上超越前代 Gemini 3.1 Pro,而执行成本不到同等级前沿模型的一半。定价为输入 $1.50/百万 tokens、输出 $9/百万 tokens,上下文窗口 100 万 token。

Gemini Omni:世界模型,可根据任意输入模态(文本、图像、音频、视频)生成并输出任意模态内容。首批支持视频输出,首款模型 Gemini Omni Flash 已上线,可模拟重力、动能等物理效果,支持对话式视频剪辑与实时预览。

Gemini Spark:前身为代号 Remy 的 24/7 AI 代理,常驻后台运行于 Google Cloud 虚拟机,可自动处理邮件、扫描信用卡账单识别隐藏订阅费用、整理会议记录等跨应用任务。本周向受邀测试者开放,下周面向美国 Google AI Ultra 订阅用户公测。

其他重要更新:Project Astra 实时视觉 AI 向 Gemini Advanced 用户全面开放;Android 17 将成为首个围绕 AI 核心构建的操作系统;搜索推出全新 AI 模式,支持多模态输入、智能编码和 Ask YouTube 对话式视频搜索;订阅体系新增 $100/月的 Developer 层级,Ultra 从 $250 降至 $200/月。

核心观点:
- Google 正在将 Gemini 从「聊天助手」升级为横跨搜索、办公、硬件、操作系统的「系统级智能层」,与 OpenAI 的 ChatGPT 生态正面对垒
- Spark 作为常驻后台 Agent 的推出,标志着消费级 AI 从「请求-响应」模式向「持续自主运行」模式的范式转移
- 3.5 Flash 的性价比策略(4 倍速 + 半价)是对开发者市场的激进争夺

来源: Tech Startups | Business Today | Moneycontrol | Latent Space


⭐ Anthropic 每年 150 亿美元租用 SpaceX Colossus:算力协议细节曝光

SpaceX 于 5 月初提交的 S-1 招股书披露了与 Anthropic 的算力协议细节:Anthropic 将租用 SpaceX 位于田纳西州孟菲斯的 Colossus 1 超算中心的全部容量(超过 22 万块 NVIDIA GPU、300 兆瓦电力),每月支付约 12.5 亿美元,协议期至 2029 年 5 月,总价值约 450 亿美元。

这笔交易是 Anthropic 应对 Q1 2026 约 80 倍超预期增长的紧急举措——其内部预测为 10 倍增长,实际达到 80 倍。CEO Dario Amodei 承认增长「太难应对」。Colossus 1 是少数能在数周内交付数百兆瓦 GPU 容量的设施,而 Anthropic 的其他大型协议(Amazon 5GW、Google/Broadcom 5GW、Microsoft/NVIDIA $30B Azure)要到 2026 年底或 2027 年才能全面上线。

对 SpaceX 而言,其自有 xAI/Grok 训练已迁至在建中的 Colossus 2(密西西比州),Colossus 1 因此闲置。出租该设施可在 IPO 前(目标估值 1.75-2 万亿美元)创造每年约 30-40 亿美元收入、超 25 亿美元现金利润。值得注意的是,马斯克此前在 2026 年 2 月称 Anthropic 为「邪恶」,但 5 月初会面后态度逆转。SpaceX 还在协议中加入了安全条款:若 Anthropic 的 AI 「做出危害人类的行为」,SpaceX 有权收回算力。

核心观点:
- 这笔交易揭示了 AI infra 层的残酷现实:模型能力受制于「能租到多少 GPU、多快能上线」,算力获取速度已成为竞争壁垒
- Anthropic 每年 150 亿美元的算力支出(仅 Colossus 一项)意味着其年化收入必须快速增长至数百亿美元级别才能支撑财务模型
- 马斯克与 Anthropic 的「和解」表明,在算力稀缺面前,意识形态分歧让位于商业利益

来源: WIRED via LetsDataScience | ByteIota | ThePlanetTools | Implicator


⭐ 月之暗面完成约 20 亿美元融资,估值突破 200 亿美元

据多家媒体报道,月之暗面(Moonshot AI)在 2026 年 5 月初完成新一轮约 20 亿美元融资,投后估值超过 200 亿美元(约合人民币 1400 亿元以上)。领投方为美团龙珠( reportedly 出资超 2 亿美元),参投方包括中国移动、CPE(中信产业基金)等。这使其成为国产大模型赛道估值最高的独角兽之一。

支撑高估值的核心技术是 4 月 20 日发布的 Kimi K2.6:万亿参数级别,支持 200 万+ 超长文档输入,MATH-500 数学推理达 98%,Agent 集群能力支持 300 个子任务并行,代码能力对标 GPT-5.4。此外,月之暗面推出的 Kimi WebBridge 浏览器插件实现了 AI 自动化网页操作。商业化方面,2026 年 1 月 Kimi 个人订阅订单环比暴增 8280%,海外 API 收入已超过国内收入。

核心观点:
- 200 亿美元估值使月之暗面进入全球 AI 独角兽第一梯队,与 OpenAI(千亿美元级)、Anthropic(约 600 亿美元)共同构成中美大模型「三国杀」格局
- 海外收入超过国内收入是一个关键信号:国产大模型的技术竞争力已开始在全球市场变现
- 但高估值也意味着资本市场对 K2.6 后续的迭代速度和商业化落地有极高预期

来源: IT之家 | 新浪财经 | EET-China


⭐ DeepSeek 拟募资最高 500 亿元,创中国 AI 公司纪录

据财联社、界面新闻等多家媒体报道,DeepSeek 正寻求完成一轮最高 500 亿元人民币的外部融资,这将是中国人工智能公司有史以来最大的一轮融资。创始人梁文锋个人或将出资 200 亿元,投后估值可能突破 3500 亿元人民币(约 450 亿美元)。国家集成电路产业投资基金(「大基金」)拟作为核心战略投资方入局,腾讯、阿里等互联网巨头据悉也有意参与。

DeepSeek-V4 预览版于 4 月 24 日发布后持续引发连锁反应:全系支持百万 token 超长上下文,采用 MoE 架构(总参数 1.6 万亿,单次激活约 490 亿),搭载全新 DSA 稀疏注意力机制。API 定价方面,V4-Pro 缓存命中价仅 0.025 元/百万 tokens,V4-Flash 低至 0.02 元/百万 tokens,被业内认为「击穿大模型底价」。国产算力适配方面,华为昇腾、昆仑芯、寒武纪、摩尔线程等均已完成或推进适配,下半年昇腾 950 超节点批量上市后,Pro 版本的吞吐能力和价格还将进一步优化。

核心观点:
- 500 亿元融资若落地,DeepSeek 将从「技术开源+低价」路线升级为「资本化扩张+生态闭环」,与月之暗面形成国产大模型「双寡头」竞争格局
- 深度绑定国产算力(华为昇腾、昆仑芯)的战略选择,在中美科技脱钩背景下具有政策安全边际
- 但 450 亿美元估值对应的收入体量要求极高, DeepSeek 需要在企业服务和消费者订阅上快速起量

来源: 珠海特区报 | 证券时报 | 搜狐


OpenAI

OpenAI 通用模型自主攻破 80 年未解数学猜想(详见上方深度阅读推荐)
深度推荐(详见深度阅读区)

OpenAI 或于本周五秘密提交 IPO 申请
据多个科技媒体报道,OpenAI 最快将于本周五(5 月 22 日)向 SEC 秘密提交 IPO 申请,正式启动上市进程。市场预计其估值将超过千亿美元。
来源

AdventHealth 利用 ChatGPT 改善医疗护理
AdventHealth 正在使用 ChatGPT for Healthcare 简化工作流程,减少行政负担,将更多时间还给患者护理。这是 OpenAI 在医疗垂直领域的又一企业合作案例。
来源

Ramp 工程师使用 Codex 加速代码审查
Ramp 工程师利用基于 GPT-5.5 的 Codex 进行代码审查,能够在数分钟内获得实质性反馈,而非传统流程中的数小时。案例展示了 Codex 在企业工程工作流中的实际落地效果。
来源


Google DeepMind / Gemini

Google I/O 2026 全面铺开 Agentic AI 生态(详见上方深度阅读推荐)
深度推荐(详见深度阅读区)

DeepMind 通过 8000-9000 万美元授权协议招募 Contextual AI 研究团队
2026 年 5 月,DeepMind 通过高额授权协议招募了超过 20 名 Contextual AI 研究人员,加强 AI 智能体与上下文理解方面的研究力量。
来源


Anthropic / Claude

Anthropic 每年 150 亿美元租用 SpaceX Colossus(详见上方深度阅读推荐)
深度推荐(详见深度阅读区)

Anthropic 推出 Claude for Small Business
5 月 13 日,Anthropic 正式推出面向中小企业的 Claude for Small Business,提供 15 个预构建的代理工作流(薪资规划、月末结算自动化、发票催收等),原生连接 QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace、Microsoft 365 等 7 款常用应用。现有 Claude Team 和 Enterprise 许可证用户可直接启用,无需额外付费。
来源

Anthropic 开发者平台密集更新
5 月 19 日,Anthropic 发布多项开发者平台更新:MCP Tunnels(研究预览版)可连接私有网络中的 MCP 服务器;自托管沙盒支持 Claude Managed Agents;支持会话中实时更新 MCP 服务器与工具配置;大型工具输出(超 10 万 token)自动溢出至沙盒文件。5 月 21 日,Claude Compliance API 集成上线,支持与主流安全合规工具对接。
来源

Claude Sonnet 4 和 Opus 4 将于 6 月 15 日停用
Anthropic 提醒用户,Claude Sonnet 4 和 Opus 4 将于 2026 年 6 月 15 日正式停用,官方建议迁移至 Sonnet 4.6 / Opus 4.6 或更高版本。
来源


国内大厂动态

DeepSeek / Kimi / 豆包 / 智谱 等

月之暗面完成约 20 亿美元融资,估值突破 200 亿美元(详见上方深度阅读推荐)
深度推荐(详见深度阅读区)

DeepSeek 拟募资最高 500 亿元(详见上方深度阅读推荐)
深度推荐(详见深度阅读区)

阿里千问 3.7 问鼎国产模型冠军,全球前五
据 Artificial Analysis 最新榜单,阿里千问 Qwen3.7-Max 问鼎国产模型冠军、跻身全球前五。Qwen3.7-Max 即将上线阿里云百炼对外提供 API 服务。
来源

腾讯混元开源全新翻译模型 Hy-MT2
腾讯混元开源全新翻译模型 Hy-MT2,并上线小程序「腾讯 Hy 翻译」。最大提升体现在指令遵循能力上。
来源

豆包大模型正式开启付费订阅
据 EqualOcean 5 月 17 日报道,字节跳动豆包于 2026 年 5 月正式推出付费订阅服务,标志着豆包从「免费获客、烧钱换流量」的扩张期正式进入商业化落地阶段。截至 2026 年中,豆包/Seed 系列已扩展至 19 个生产级 SKU,输出 token 价格地板低至 $0.022/百万。
来源 | Presenc.ai

智谱 GLM-5V-Turbo 发布
2026 年 5 月初,智谱发布多模态智能体基础模型 GLM-5V-Turbo,专为视觉生成代码(Design2Code)场景优化,在 Design2Code 基准测试中取得 94.8 分,可直接解析 UI 设计稿生成前端代码。
来源 | PricePerToken

北大、阿里达摩院研究登上《自然》:AI 首次实现中国风光发电普查
北京大学与阿里达摩院合作的研究利用 AI 首次实现中国风光发电普查,成果登上《自然》杂志。该技术可加快实现「双碳」目标。
来源


AI 研究前沿

重要论文、技术突破

清华等提出 TaH:跳过 93% 无效迭代,大模型推理准确率反升
清华大学等研究团队提出名为 TaH 的方法,针对大模型推理过程中的「过度思考」问题进行优化。该技术能够跳过 93% 的无效迭代,在减少计算消耗的同时反而提升模型推理准确率。
来源

RiT:表征空间中的原生扩散 Transformer
HuggingFace 每日论文推荐。论文提出 Representation Image Transformer (RiT),发现在 DINOv2 等预训练表征空间中进行流匹配(flow matching)比像素空间条件更优:有效秩高 7.3 倍、协方差条件数好 35 倍、峰度低 11.5 倍。这意味无需专用预测头或黎曼传输即可在表征空间中实现高质量扩散生成。
来源

苏剑林解析 DeepSeek V4 的 Hash Routing 策略
月之暗面研究员苏剑林在其博客「科学空间」发文解析 DeepSeek V4 的 tid2eid(token 到 expert 的映射表)生成机制。DeepSeek V4 将 V3/Kimi K2 的「前 k 层用 Dense GLU」策略升级为「前 k 层用 Hash Routing」,通过事先确定的映射表为每个 token 分配 Expert,以解决靠近 Embedding 层 MoE 负载均衡困难的问题。
⭐ 推荐关注:苏剑林系列文章对流式幂迭代、Muon 优化器、谱范数估计等前沿问题的数学解构质量极高,是中文世界少有的从第一性原理出发的技术深度内容。
来源

Simon Willison 发布 Datasette Agent
Django 联合创始人 Simon Willison 发布 Datasette Agent,为其数据探索工具 Datasette 增加可扩展的 AI 助手功能。用户可以用自然语言查询存储在 Datasette 中的数据,配合 datasette-agent-charts 插件还能生成图表。这是 Willison 的 LLM 工具生态(LLM 库 + Datasette)的正式整合。
来源


行业观点与解读

KOL 重要推文、深度分析文章

Ethan Mollick:GPT-5.5 是未来到来的一个令人印象深刻的信号
宾大沃顿商学院教授 Ethan Mollick 在其 Newsletter One Useful Thing 发文评论 GPT-5.5,认为它是「能力曲线上令人印象深刻的一步」。Mollick 通常以审慎乐观著称,此次对 GPT-5.5 的肯定性评价值得关注——意味着该模型在实用场景中的可靠性可能已跨越某个关键阈值。
来源

Import AI 457 期:AI Stuxnet、Muon 优化器与正向对齐
Anthropic 联合创始人兼政策总监 Jack Clark 的每周通讯 Import AI 第 457 期(5 月 18 日)讨论了:AI 版本的 Stuxnet 可能性、Muon 优化器的「诅咒」变体(cursed Muon optimizer)、以及正向对齐(positive alignment)研究。
来源


值得关注的视频

YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。

Latent Space:AI 重塑医疗交付
本期 Latent Space 播客(5 月 19 日发布)邀请 Abridge 创始人,讨论 AI 在医疗领域的近中期影响主要来自行政流程自动化(如 prior authorization、行政开销),而非临床诊断。Abridge 平台已 reportedly 协助超过 1 亿次医生问诊。推荐关注:这是 AI 垂直落地最具确定性的场景之一。
来源

今日无其他重点新视频


灵感种子

以下是今日简报中值得进一步思考的灵感种子。

1. AI 数学突破的「验证悖论」

OpenAI 此次数学成果的核心差异不在于模型能力,而在于验证流程——9 位顶尖数学家的盲审背书。7 个月前 GPT-5 的「埃尔德什问题」翻车正是因为缺乏独立验证。这引出一个深层问题:当 AI 能够产出人类难以在合理时间内验证的成果时,「同行评审」机制本身是否需要 AI 辅助?未来的科学验证体系可能是「AI 生成 + AI 初筛 + 人类专家终审」的三层结构,而中间层目前还是空白。

2. 算力协议的地缘政治化

Anthropic 与 SpaceX 的协议中包含「若 AI 危害人类可收回算力」的条款,马斯克从称 Anthropic「邪恶」到签下 450 亿美元协议仅隔 3 个月。这暗示 AI infra 正在快速地缘政治化:算力不仅是商业资源,更成为施加价值观和安全性条件的杠杆。当各国政府开始将算力出口管制武器化时,「算力主权」可能成为下一个大国竞争的核心议题。

3. 国产大模型的「资本化竞赛」

月之暗面 200 亿美元估值与 DeepSeek 450 亿美元估值传闻,标志着国产大模型从「技术竞赛」进入「资本化竞赛」阶段。但两者的路径差异明显:月之暗面靠 K2.6 的技术领先性和海外收入获取高估值,DeepSeek 则靠开源生态+极致低价+国产算力绑定。哪条路径更具可持续性?当融资潮退去,真正决定胜负的可能是「谁能先把年化收入做到估值的 10%」。

4. Google Agentic AI 的「生态锁定」风险

Spark 作为常驻后台 Agent 深度绑定 Google Workspace、Android 和 Google Cloud,这种「系统级智能层」策略虽然用户体验流畅,但也意味着 Google 正试图将 AI Agent 层变成新的操作系统护城河。对于企业用户而言,选择 Spark 可能意味着更深度的生态锁定——这比选择某个 SaaS 工具的切换成本高得多。企业 IT 决策者在评估 Agent 方案时,需要将「供应商锁定风险」纳入核心考量。


生成时间:2026-05-22 01:04 | 下次更新:明日 9:00