AI 每日简报 | 2026-05-05¶
今日概览¶
GPT-5.5 庆功宴今日在旧金山举行,Sam Altman 向马斯克公开示好但法律战仍在继续;Anthropic 与华尔街巨头成立 15 亿美元 AI 咨询合资公司,同时 Sonnet 4.8 意外泄露展现巨大性能跃升;国产大模型进入「基础免费+高阶付费」新阶段,豆包官宣订阅制引发行业震动;Karpathy 在 Sequoia AI Ascent 发表重量级演讲,用「锯齿状智能」概念精确描述了当前 AI 的真实能力边界。
- ⭐ GPT-5.5 Cyber 模型发布,OpenAI 与微软解除独家合作关系
- ⭐ Anthropic 联手黑石、高盛成立 15 亿美元企业 AI 咨询公司
- ⭐ 豆包宣布付费订阅三档方案,月活 3.45 亿居国产 AI 首位
- ⭐ Karpathy:AI 能重构 10 万行代码,却不知道汽车不会走路
- Google I/O 2026 前瞻:Gemini 4 与 AI 眼镜即将发布
深度阅读推荐¶
⭐ 1. Karpathy「锯齿状智能」——迄今对 AI 能力边界最精准的刻画¶
在 Sequoia AI Ascent 2026 大会上,前 OpenAI/Tesla AI 负责人 Andrej Karpathy 用一个比喻精准描述了当前 AI 的真实状态:顶级模型可以重构 10 万行代码库,但同时会告诉你去让汽车「走着」去 50 米外的洗车店——一个 3 岁孩子都知道汽车不会走路,但模型不知道。
核心观点:
- 「锯齿状智能」不是 bug,是结构必然。可验证的领域(代码能跑通测试)和有大市场买单的领域(编程、客服)被 RL 强化到极致,其他领域则像「在丛林里拿砍刀开路」。
- 从 Vibe Coding 到 Agentic Engineering。Karpathy 修正了自己 2025 年提出的概念:AI 降低了入门门槛,但专业人员仍然需要掌控规格、架构、品味和验证。「你可以外包思考,但不能外包理解。」
- 给创业者的建议:找一个前沿实验室还没优先投入的可验证领域,建立自己的 RL 环境。那才是护城河。
⭐ 2. Anthropic 联手黑石、高盛,成立 15 亿美元 AI 咨询合资公司¶
Anthropic 与 Blackstone、Hellman & Friedman、Goldman Sachs 联合成立了一家新的咨询公司,每家锚定投资约 3 亿美元。新公司将派遣 Anthropic 工程师直接入驻中型企业客户团队,帮助部署 Claude。
核心观点:
- 这是 Anthropic 从「卖 API」向「卖解决方案」的战略转向。15 亿美元体量远超一般合资公司的规模,说明企业级 AI 部署需求远超预期。
- Claude Code 年化收入已超 25 亿美元,侧面验证了 AI 编程工具的付费意愿。据传 Anthropic 正在将 Claude Code 从 Pro 计划(\(20/月)移到 Max 计划(\)100+/月),引发了用户在 Pro 定价上的不安。
来源:Blockchain News | 来源:ECO Sapo
⭐ 3. 豆包官宣付费,国产 AI 进入「免费+订阅」时代¶
字节跳动旗下豆包在 5 月 4 日通过 App Store 更新了付费订阅声明:标准版 ¥68/月、加强版 ¥200/月、专业版 ¥500/月(年付 5,088 元)。官方强调基础功能永久免费,付费仅针对 PPT 生成、数据分析、影视制作等复杂生产力场景。豆包月活已达 3.45 亿,居国产 AI 原生应用首位。
核心观点:
- 中国大模型周调用量 7.94 万亿 tokens(环比+81.7%),再次超越美国。算力成本持续攀升(HBM 涨价、腾讯云 AI 算力涨 5%),「基础免费+高阶付费」已成为行业共识。
- DeepSeek-V4 走极致低价路线(消费端全免费),豆包走分层付费路线,Kimi 中间路线(¥0-399),三种商业模式同时接受市场检验。
⭐ 4. Anthropic Sonnet 4.8 代码泄露,Kairos 自主 Agent 曝光¶
Claude Code 的一次 NPM 更新中意外泄露了源代码映射文件,暴露了 Sonnet 4.8 的巨大性能跃升(图像识别准确率从 54% 跳到 98%)以及「Kairos」(希腊语「关键时刻」),一个能在后台持续运行的自主 Agent,支持「自主夜间模式」,可执行长时间任务。
核心观点:
- 代码泄露无意中展示了一条关键趋势:AI 公司正在从「响应式模型」转向「持久化 Agent」。Sonnet 4.8 的性能跳跃意味着新一轮军备竞赛已经在客户端不可见的地方展开。
- Kairos 的设计指向一个未来:AI 不只是你提问它回答,而是在你睡觉时持续工作,第二天早上交付结果。这与 Karpathy 描述的「Claws」概念完全吻合。
⭐ 5. GPT-5.5 Cyber 安全模型发布,OpenAI-微软解除独家合作¶
OpenAI 发布了专为网络安全设计的 GPT-5.5 Cyber 模型(二进制逆向、恶意软件检测、漏洞分析),直接对标 Anthropic Claude Mythos。同时 OpenAI 与微软宣布重组合作:微软不再独享 OpenAI 产品分发权,OpenAI 可接入多个云平台;微软的 IP 使用权延长至 2032 年但改为非独家;AGI 相关条款被删除。OpenAI 承诺超 2,500 亿美元 Azure 云消费。
核心观点:
- OpenAI 正在从一家与微软深度绑定的公司,转变为一个独立生态平台。解除独家关系是战略独立的关键一步。
- GPT-5.5 Cyber 的推出标志着 AI 安全从「被讨论的议题」变成「可交付的产品」,安全领域的 AI 军备竞赛正式开始。
OpenAI¶
GPT-5.5 Cyber 模型发布,今日旧金山庆功宴¶
GPT-5.5 Cyber 专为网络安全场景设计,具备二进制逆向工程、恶意软件检测和漏洞分析能力。Sam Altman 公开邀请正在与自己打 1340 亿美元官司的 Elon Musk 参加今天的庆功宴,称「世界需要更多爱」。另据财联社报道,OpenAI 已为一新合资企业筹集超 40 亿美元。
微软合作重组:从独家到多云的转折¶
微软保留 OpenAI IP 使用权至 2032 年,但改为非独家;收入分成改为按上限结算至 2030 年。OpenAI 获得多云计算自由,并承诺 2,500 亿美元 Azure 消费。
Google DeepMind / Gemini¶
Google I/O 2026 前瞻(5月19-20日)¶
预计发布 Gemini 4——Deep Think 研究变体在 ARC-AGI2 上达到 84.6%、Codeforces ELO 达 3455(全球前 0.2%)。同时可能推出三星 AI 眼镜、Aluminium OS(桌面操作系统)、以及向免费用户开放 Personal Intelligence。
600+员工联名抗议五角大楼 AI 合同¶
超过 600 名 Google 员工(包括 DeepMind 成员)签署公开信要求拒绝将 Gemini 用于军方机密活动。此前 Pentagon 已于 5 月 2 日确认继续禁止 Claude Mythos 在政府授权场景使用。
未公开 Gemini 模型在 LM Arena 秘密测试¶
被标记为可能的 Gemini 3.1 Flash 或 3.2 Flash 的模型在 LM Arena 悄悄上线测试,用户反馈性能「高出两级」,接近 Gemini 3.1 Pro。Gemini 2 Flash 系列将于 6 月 1 日退役。
Anthropic / Claude¶
Claude Security 公开测试版上线¶
基于 Claude Opus 4.7,可扫描整个代码仓库并自动生成安全补丁。CrowdStrike、Microsoft Security、Palo Alto Networks 以及 Accenture、Deloitte、PwC 等咨询巨头已将其嵌入服务。
Claude 接入 Adobe、Autodesk 创意套件¶
Anthropic 推出连接器,使 Claude 可直接在 Adobe Creative Cloud、Autodesk Fusion、Blender、Ableton Live 等创意软件中通过自然语言操控。
国内大厂动态¶
豆包宣布付费订阅,基础功能永久免费¶
三档方案:标准版 ¥68/月、加强版 ¥200/月、专业版 ¥500/月(年付 ¥5,088)。豆包月活 3.45 亿居国产 AI 首位,远超千问(1.66 亿)和 DeepSeek(1.27 亿)。
DeepSeek-V4 Pro 降价与评测登顶¶
V4-Pro(1.6 万亿参数)API 限时 2.5 折,V4-Flash 每百万 tokens 仅 ¥0.02。SuperCLUE 中文评测以 70.98 分登顶。OpenRouter 全球 Token 消耗占比达 9.0%。
Kimi K2.6 开源,MATH-500 达 97.8%¶
1.2 万亿参数 MoE 架构,数学推理能力突出。OpenRouter 周调用量全球第二。
智谱 GLM-5.1 开源 + 年内三次涨价¶
Agent 能力突出,SWE-Bench Pro 国产第一。年内已三次 API 涨价,推出 GLM Coding Plan($18/月)支持 Claude Code 等开发工具。
AI 研究前沿¶
ICLR 2026 最佳论文:LLM 在多轮对话中平均性能下降 39%¶
研究发现主流 LLM 在欠指定的多轮对话中,使用 Sharded Simulation 框架测量出平均 39% 的性能损失。这揭示了当前模型在保持对话一致性上的根本缺陷。
AI 生成代码快于人类理解——「理解债务」危机¶
HackerNoon 综合 Karpathy、Willison 和 Google 工程师 Addy Osmani 的观点:代码正以超出人类理解能力的速度被生成。稀缺资源已不再是代码生产力,而是理解力、品味和监督能力。
GPT-5.5 参数争议:从 10T 缩水到 1.5T¶
一篇病毒式论文声称 GPT-5.5 有约 9.7 万亿参数,但 UC Berkeley 研究者数日内就指出了该方法的缺陷,修正后估计仅为约 1.5 万亿。该事件被广泛视为「AI 辅助科研」的风险警示案例。
行业观点与解读¶
Simon Willison:模型能力差距正在制造公众误解¶
Willison 指出 OpenAI 免费语音模式仍在使用过时的 GPT-4o 级别模型(知识截止 2024 年 4 月),而付费 Codex 模型可以自主重构整个代码库。用户根据不同的接入点获得完全不同的 AI 能力体验,加深了公众对 AI 能力的误解。
中国大模型周调用量再超美国¶
本周中国达到 7.94 万亿 tokens(环比+81.7%),美国降至 3.26 万亿。全球综合排名 GPT-5.5 登顶,豆包 Seed 2.0 Pro 进入前五,国产模型与美国的差距缩至 2.7%。
灵感笔记¶
生成时间:2026-05-05 | 下次更新:明日 7:00