跳转至

AI 每日简报 | 2026-05-24

今日概览

周末的 AI 圈仍在消化本周密集释放的重磅信息。Google I/O 2026 的 Gemini 3.5 全家桶与 Omni 世界模型持续引发讨论;Anthropic 在 Claude Security 公测、Karpathy 加盟和 Q2 首次盈利预期的三重消息下成为焦点;国产大模型则进入「诸神之战」的资本化阶段,DeepSeek 与 Kimi 相继传出巨额融资。与此同时,OpenAI 一则「通用推理模型证明 80 年数学猜想」的消息,让业界对 AI 在基础科学上的潜力重新评估。

今日最值得关注的 5 件事:
1. Anthropic Q2 或首次实现季度盈利,营收预计达 109 亿美元
2. Andrej Karpathy 宣布加入 Anthropic 预训练团队
3. Google I/O 发布 Gemini Omni Flash 世界模型与 Gemini 3.5 系列
4. DeepSeek 首轮融资估值 450 亿美元,国产大模型资本化加速
5. OpenAI 通用推理模型证明 Erdős 平面单位距离猜想


深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。

⭐ Anthropic Q2 预计首次盈利,AI 超级实验室的商业拐点到来

据《华尔街日报》5 月 21 日披露,Anthropic 预计 2026 年 Q2 营收将达到 109 亿美元(环比暴涨 130%),扣除算力成本后运营利润约 5.59 亿美元,有望首次实现季度盈利。算力成本占收入比从 0.71 美元降至 0.56 美元/美元营收,显示出极强的规模效应。这一拐点标志着头部 AI 实验室从「烧钱换增长」进入「自我造血」阶段,对行业资本预期和竞争格局都将产生深远影响。

核心观点:
- Anthropic 的盈利并非来自压缩研发,而是来自 Claude 在企业端的快速渗透(Claude for Small Business、合规 API、安全公测等矩阵式产品释放)。
- 若 Q2 盈利坐实,Anthropic 将成为继 OpenAI 之后第二个证明大模型商业可行性的头部实验室,进一步挤压二三线模型厂商的融资空间。

来源:llmposts.com | WSJ 报道


⭐ Andrej Karpathy 加入 Anthropic 预训练团队

5 月 19 日,Karpathy 在 X 上宣布加入 Anthropic,将在 Nick Joseph 麾下组建新团队,专注使用 Claude 加速预训练研究——即用 AI 来加速 AI 的核心训练过程。这是 2026 年最受关注的人才流动:Karpathy 作为 OpenAI 联合创始人、前 Tesla AI 总监,其转向 Anthropic 不仅是一次个人职业选择,更被解读为对 Anthropic 技术路线和安全文化的投票。

核心观点:
- "用 Claude 加速预训练"本质上是递归自我改进(Recursive Self-Improvement)的工程化尝试。如果 Claude 能显著加速下一代 Claude 的训练,我们将首次在工业界看到 RSi 的闭环。
- Karpathy 此前发布的 autoresearch(630 行 Python 自主实验脚本)和 CLAUDE.md(10 万星 AI 编码规范)都指向同一个方向:让 AI 代理替代研究者完成迭代循环。Anthropic 给了他实现这一愿景的算力和模型资源。

来源:Devflokers | The Prompt Insider


⭐ Google I/O 2026:Gemini Omni Flash 世界模型与 3.5 家族

5 月 19–20 日的 Google I/O 上,DeepMind CEO Demis Hassabis 发布了 Gemini Omni Flash,一个原生多模态的「世界模型」——它将文本、音频、图像和高保真视频生成统一为单一 pipeline,取代了此前分离的 Veo 等架构。Omni 支持对话式视频编辑,用户可用自然语言描述修改画面内容。同时发布的 Gemini 3.5 Flash 宣称输出速度是其他前沿模型的 4 倍,并立即成为 Gemini App 和 Google Search AI Mode 的默认模型。

核心观点:
- Omni 的「统一生成」路线与 OpenAI 的「分模块拼接」路线形成鲜明对照。如果 Omni 能在视频生成的物理一致性和长时序连贯性上达到可用水准,Google 将在多模态 AGI 的赛道上取得显著优势。
- Google 将 Ultra 订阅从 $250/月降至 $200/月,并推出 $100/月的 Developer tier,价格战信号明确。Pichai 声称重度用户每年可节省超 10 亿美元,直接瞄准 OpenAI 的企业客户钱包。

来源:9to5Google | Mashable | MediaPost


⭐ OpenAI 通用推理模型证明 80 年数学猜想

据 5 月 21 日报道,OpenAI 的通用推理模型自主破解了 1946 年由 Erdős 提出的平面单位距离猜想——构造出至少 n^{1+δ}(δ≈0.014)个单位距离对的点集,推翻了 80 年来「网格最优」的经典认知。完整证明长达 125 页思维链,经 Noga Alon、Timothy Gowers 等顶尖数学家验证。这一成果与此前被 Gartner 评为企业编码代理领导者、推出个人理财预览等商业化消息形成有趣对照。

核心观点:
- 125 页思维链的可验证性是关键:它意味着模型的推理过程对人类数学家透明,而非黑箱式的「猜对答案」。这为 AI 在基础科学中的角色提供了新的信任基础。
- 但需警惕「个案成功」与「系统性能力」之间的落差。一个猜想的证明是否意味着模型能持续产出原创数学成果,仍需更多案例验证。

来源:llmposts.com | 机器之心


⭐ Sebastian Raschka:LLM 架构新进展——KV Sharing、mHC 与压缩注意力

Raschka 于 5 月 16 日发布长文 Recent Developments in LLM Architectures: KV Sharing, mHC, and Compressed Attention,系统梳理了从 Gemma 4 到 DeepSeek V4 等开源权重模型在长上下文成本压缩上的最新技术:KV Cache 共享、多头压缩注意力(mHC)等。文章指出,这些架构创新正在将长上下文推理的成本推向「可忽略」区间。

核心观点:
- 长上下文成本的下降将直接解锁企业级知识库全量加载多文档法律审查整代码库级 Agent 推理等此前因成本过高而难以落地的场景。
- 开源权重模型在架构效率上的迭代速度正在超越闭源模型,这可能改变「闭源性能领先、开源成本领先」的旧有格局。

来源:sebastianraschka.com | 机器之心


OpenAI

Gartner 将 OpenAI 评为企业编码代理领导者(5 月 22 日)
OpenAI 在企业编码代理领域获得 Gartner 认可,Codex 的周活跃用户已突破 400 万。与此同时,OpenAI 与 Dell Technologies 达成合作(5 月 18 日),将 Codex 引入混合云及本地企业环境,满足金融、医疗等强合规行业的数据主权要求。
来源:Releasebot | Computerworld

OpenAI 为 ChatGPT Pro 用户推出个人理财体验预览(5 月 22 日)
美国 Pro 用户可安全连接金融账户,通过 GPT-5.5 Thinking 查看支出仪表盘并提问。OpenAI 明确提示「不可替代专业理财建议」,显示出对金融合规的谨慎态度。
来源:Releasebot

Codex 进入 ChatGPT 手机 App(5 月 14 日)
OpenAI 在 iOS 和安卓版 ChatGPT 中开启 Codex preview,定位为远程监控窗口——真正的 Codex 仍在用户的开发机上运行,手机端仅用于查看执行进度、审阅 diff 和批准操作。目前仅支持 macOS 端 Codex 连接,Windows 支持即将推出。
来源:宝玉推文解读

通用推理模型证明 Erdős 平面单位距离猜想(5 月 21 日)
模型构造出推翻 80 年经典认知的点集配置,完整 125 页思维链经顶尖数学家验证。详见⭐ 深度阅读推荐(详见深度阅读区)
来源:llmposts.com


Google DeepMind / Gemini

Gemini 3.5 Flash 与 Omni Flash 世界模型发布(5 月 19–20 日)
Google I/O 2026 核心发布:Gemini 3.5 Flash 成为 Gemini App 默认模型;Gemini Omni Flash 将文本/音频/图像/视频生成统一为单一 pipeline,支持对话式视频编辑。月活用户 reportedly 已达 9 亿。详见⭐ 深度阅读推荐
来源:9to5Google | Mashable

Magic Pointer:Gemini 重新定义鼠标光标(5 月 12 日)
DeepMind 研究人员发布 Magic Pointer,将传统光标升级为具备 Gemini 智能的交互入口——光标能「理解」指向的内容、听取语音指令并直接在页面/图像上执行操作,无需复制文本到聊天窗口。秋季将随 Googlebook(Chromebook 继任者)笔记本电脑原生集成。
来源:pasqualepillitteri.it

DeepMind 大幅扩充研究力量(5 月中旬)
Google 通过约 8000–9000 万美元的授权协议,从 Contextual AI 挖来 20 余名研究人员,显著加强企业级 AI 与基础研究能力。
来源:Devflokers


Anthropic / Claude

Claude Security 进入公开测试(5 月 22 日)
面向 Enterprise 客户,Claude Security 使用 Claude Opus 4.7 扫描代码库漏洞并生成补丁。技术合作伙伴包括 CrowdStrike、Microsoft Security、Palo Alto Networks、SentinelOne、TrendAI 和 Wiz;服务合作伙伴涵盖 Accenture、BCG、Deloitte、Infosys 和 PwC。同日还发布了 20+ 法律 MCP 连接器和 12 个执业领域插件。
来源:Releasebot

Andrej Karpathy 加入 Anthropic 预训练团队(5 月 19 日)
Karpathy 宣布将在 Anthropic 组建团队,用 Claude 加速预训练研究。详见⭐ 深度阅读推荐
来源:Devflokers

Anthropic Q2 预计首次实现季度盈利(5 月 21 日)
营收预计 109 亿美元,运营利润 5.59 亿美元。详见⭐ 深度阅读推荐
来源:llmposts.com

Claude for Small Business 发布(5 月 13 日)
面向中小企业的 Claude Cowork 包装版,内置 15 个预构建 Agent 工作流(薪资规划、月末关账、发票催收、利润率分析等),集成 QuickBooks、PayPal、HubSpot、Canva、Docusign、Google Workspace 和 Microsoft 365,对现有 Team 和 Enterprise 客户不额外收费。
来源:Roborhythms

Claude Developer Platform 多项更新(5 月 18–19 日)
MCP Tunnels(研究预览,连接私有网络内 MCP 服务器)、自托管沙盒(Claude Managed Agents 替代方案)、实时配置更新(会话中无需重启即可更新 MCP 设置)、大输出自动溢出(超过 100K token 的工具输出自动写入沙盒文件)。
来源:Releasebot

Claude Code 连续版本更新(5 月 21–22 日)
v2.1.147 提升后台会话稳定性、重命名 /code-review 流程、增强自动更新可靠性;v2.1.148 修复 Bash 工具返回 exit code 127 的回归问题。
来源:Releasebot


国内大厂动态

DeepSeek 首轮融资估值 450 亿美元(5 月)
深度求索开启首轮融资,估值高达 450 亿美元(约 3000 亿人民币), reportedly 由大基金寻求领投,腾讯等互联网巨头及国资积极接触,此轮融资不对外资开放。创始人梁文锋此前婉拒多批投资人,如今姿态转变,被解读为解决人才流失与结构性问题的资本举措。2026 年 2 月发布 DeepSeek V4 后,公司开始推进商业化与资本化。
来源:每经网 | 腾讯新闻

Kimi 完成 20 亿美元融资,冲刺港股 IPO(5 月)
月之暗面即将完成新一轮 20 亿美元融资,投后估值突破 200 亿美元(约 1400 亿人民币),美团龙珠领投,中国移动、CPE 源峰等参投。累计融资额超 376 亿人民币,为中国大模型创业公司之最。公司已接触中金、高盛,计划 2026 年下半年赴港上市。产品层面,K2.6 正式发布(从 Preview 到发布仅 8 天),API 涨价 58%,聚焦编程与 Agent 能力。
来源:新浪财经 | 证券时报

智谱发布 GLM-5.1-HighSpeed(5 月 22 日)
采用自研 TileRT 推理引擎系统级重构,在 8×H200 环境下输出速度达 400 tokens/s,参数规模 744B,上下文 200K,首令牌延迟约 1 秒,面向实时编码 Agent 与语音交互场景。
来源:llmposts.com

阿里发布 Qwen3.7-Max(5 月 21 日)
阿里闭源旗舰模型,在 Artificial Analysis Intelligence Index 得分 56.6 分,较上版提升 4.8 分。核心提升来自科学推理与代码任务,采用激进保守作答策略降低幻觉率(骤降 21.3 个百分点),上下文窗口从 256K 扩展至 1M tokens
来源:llmposts.com

腾讯混元开源翻译模型 Hy-MT2(5 月 21 日)
支持 33 种语言互译,主打强指令遵循能力,同步上线「腾讯 Hy 翻译」小程序。
来源:量子位聚合

华为 openJiuwen 发布 JiuwenSwarm(5 月中下旬)
开源蜂群智能体,提出「协同工程」新范式,让多个 AI 智能体像蜂群一样高效协作。
来源:量子位聚合

C 端月活格局(2026 Q1)
- 豆包:月活 3.45 亿,稳居第一
- 千问(阿里):月活 1.66 亿,升至第二,下载量环比增 954%
- DeepSeek:月活回落至 1.27 亿,连续四季度下滑
- 元宝(腾讯):月活 5734 万,首次跌出前三
- Kimi:月活仅 833.8 万,跌破千万,连续四季度下滑
来源:每经网


AI 研究前沿

OpenAI 通用推理模型证明 Erdős 平面单位距离猜想
详见⭐ 深度阅读推荐(详见深度阅读区)

Meta 华人团队发布 ATLAS 视觉推理框架
一个词即可驱动可泛化的视觉推理,强调跨场景迁移能力。
来源:机器之心

复旦自进化 Harness Engineering 提升 GPT-5.4 性能 7 个百分点
全球排名前三的方法,通过自进化机制持续优化模型对齐质量。
来源:机器之心

北大 + 阿里达摩院:AI 首次实现中国风光发电普查
绘制中国首张高精度风光设施分布图,覆盖全国 1915 个县,成果发表于《自然》。
来源:量子位聚合

上海 AI Lab 发布 Thoth 8B 生物实验模型(ICLR 2026)
可生成准确的生物实验操作步骤,显著改善了过去大模型在步骤顺序、试剂剂量上的幻觉问题。
来源:量子位聚合

中国信通院 + 清华:联邦学习新框架 FedRE(CVPR 2026)
利用「表征纠缠」技术同时解决联邦学习中的模型性能、数据隐私与通信开销三大难题。
来源:量子位聚合

Cohere 发布 Command A+(开放权重)
加拿大 AI 公司 Cohere 发布 Command A+,开放权重、免费使用,在智能与速度上表现亮眼,支持开发者下载与自托管。
来源:量子位聚合

苏剑林:DeepSeek V4 的 tid2eid 机制溯源(5 月 15 日)
苏剑林在其博客「科学空间」深入解析 DeepSeek V4 中 tid2eid 相关机制的来源与原理,为理解该模型的专家并行策略提供了技术线索。
来源:科学空间


行业观点与解读

Simon Willison:Datasette Agent 与 Vibe Engineering
Willison 于 5 月 21 日发布 Datasette Agent,继续探索 AI 编程代理的应用边界。他在 5 月初的 Vibe coding and agentic engineering are getting closer than I'd like 一文中提出,「氛围编码」(vibe coding)与「代理工程」(agentic engineering)之间的界限正在模糊,开发者需要建立新的工程纪律来管理 AI 生成的代码资产。
来源:Simon Willison 博客 | TraeAI

宝玉(@dotey):AI 编程 Agent 的额度博弈
宝玉在 5 月 13–14 日密集解读了 Anthropic 对 Claude Code 的「先松绑交互式限额(5 小时窗口翻倍 + 每周限额提升 50%)、后收紧程序化额度(6 月 15 日起 Pro 每月仅 20 美元等值 API 额度)」的组合策略。他指出,这实质上是 Anthropic 在留人(交互式用户)与控成本(自动化 Agent)之间的精准取舍,而 OpenAI Codex 向移动端和远程场景的扩张则是「超级 App」路线的延续。
来源:宝玉推文精选

Jack Clark(Import AI):递归自改进概率 >60%
在 5 月 4 日的 Import AI 通讯中,Anthropic 联合创始人兼政策总监 Jack Clark 表示,他现在认为 2028 年底前出现递归自改进的概率超过 60%。作为行业公认质量最高的 AI 周报之一,这一判断值得高度关注——它意味着 AI 安全社区内部对技术奇点临近的评估正在上调。
来源:LinkedIn 摘要

Ethan Mollick:Persona Prompting 效果有限
Mollick 团队在 5 月初的实验表明,为 AI 分配特定角色(如「你是一位伟大的物理学家」)对领域任务准确性的提升微乎其微,甚至负面角色(如「你是一位律师」)也未显著降低表现。这提示:模型更依赖其固有训练而非角色扮演指令,过度工程化的 prompt 设计可能收益递减。
来源:blockchain.news


值得关注的视频

YouTube 条目以标题+链接+一句话推荐理由为主,不做深度摘要。

Dwarkesh Podcast | David Reich(5 月 8 日)
约 2 小时 13 分钟。人类遗传学与古代 DNA 研究领域权威 David Reich 做客,讨论基因数据如何重写人类历史——虽非纯 AI 话题,但基因组学大数据与机器学习方法的交叉值得关注。
YouTube 搜索

Latent Space | Abridge:AI 重塑医疗交付(5 月 11–17 日)
Abridge 创始人访谈,平台已助力超 1 亿次医生访视。核心张力:自动化高容量行政任务(如事先授权)比雄心勃勃的临床诊断应用更先产生价值。
Pod.wave.co 收听


灵感种子

以下是今日简报中值得进一步思考的灵感种子。

1. 「递归自我改进」从理论概念进入工程日程
Karpathy 加入 Anthropic 专注「用 Claude 加速预训练」,Jack Clark 将 RSi 概率上调至 60%+,OpenAI 的数学证明展示了 AI 在原创研究中的潜力。三条线索指向同一个问题:如果 AI 能加速自身训练、能证明人类未解的猜想,那么「对齐」就不再是遥远的哲学议题,而是必须在下一个模型周期内解决的工程约束。对个人而言,理解 RSi 的技术路径和安全研究进展,比追赶某个具体产品的 API 更新更重要。

2. 国产大模型从「技术理想主义」转向「资本现实主义」
DeepSeek 从拒绝资本到 450 亿美元估值,Kimi 从「短期不上市」到冲刺港股 IPO,智谱和 MiniMax 已经上市——2026 年成为国产大模型「IPO 元年」。但 C 端月活数据显示,独立模型公司的用户正在被字节、阿里、腾讯等大厂生态虹吸。一个值得深挖的方向是:在「模型能力趋同 + 流量向超级 App 集中」的双重压力下,独立模型公司的长期护城河究竟在哪里?是 B 端 API、垂直 Agent,还是海外开源生态?

3. 长上下文成本的「可忽略化」将重新定义 Agent 的边界
Raschka 梳理的 KV Sharing、mHC 和压缩注意力技术,加上 Kimi/Qwen 将上下文窗口推至 1M+ tokens,意味着 Agent 很快可以一次性加载整本代码库、整份合同卷宗或整本书籍进行推理。这会催生哪些现在还不存在的产品形态?例如:「读完你公司过去十年所有邮件并生成组织记忆图谱」的 Agent,或者「加载整本医学教科书进行个性化诊疗建议」的临床助手。长上下文不仅是技术参数,它是 Agent 从「工具」进化为「同事」的关键跃迁。

4. 数学证明的 125 页思维链:可验证性作为 AI 可信度的新标准
OpenAI 的猜想证明之所以引人注目,不仅因为结果本身,更因为 125 页的推理过程对人类数学家透明。这与传统黑箱模型的「给出答案即可」形成鲜明对比。如果「可验证的思维链」成为科学研究中 AI 的默认输出格式,那么 AI 论文写作、实验设计、同行评审等学术流程都可能被重构。一个可能的演进方向是:未来的学术期刊是否会出现「AI 辅助证明」专栏,要求作者同时提交人类可读的推理链和机器可执行的验证脚本?


生成时间:2026-05-24 02:56 | 下次更新:今日 9:00