AI 每日简报 | 2026-05-06(晚间更新版)¶
今日概览¶
今日三条主线清晰浮现:OpenAI 的 Workspace Agents 从今天起转为付费模式,企业 AI 工具化进入新阶段;Google Gemini 以 Deep Research Max 与 Robotics-ER 1.6 双线推进,研究代理和具身智能两翼齐飞;Anthropic 以 Claude Opus 4.7 + 金融代理模板 + Microsoft 365 全面攻企业。国内方面,Kimi K2.6 开源引发的代码代理能力讨论持续发酵,阿里千问 Qwen3.6-Max-Preview 在 Agent 编程上加速追赶。
今日最值得关注:
- OpenAI Workspace Agents 今日转为按量收费,企业 AI 落地进入付费验证期
- Google Deep Research Max:首个可接私有数据的 API 级自主研究代理正式开放预览
- Claude Opus 4.7 正式发布,同价位显著提升 Agent 编程能力
- Kimi K2.6 开源:万亿 MoE + 300 个并行 Agent,代码代理能力超越 GPT-5.4
- OpenAI 2026 年算力支出将达 500 亿美元,Brockman 法庭作证
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ OpenAI Workspace Agents 今日开始收费
⭐ Google Deep Research Max 公开预览
⭐ Claude Opus 4.7 发布 + 金融代理模板
⭐ Kimi K2.6 开源
⭐ Karpathy:你可以外包思考,但无法外包理解
OpenAI¶
⭐ Workspace Agents 今日起转为按量收费(免费期结束)¶
(Workspace Agents in ChatGPT)
OpenAI 于 4 月 22 日推出 Workspace Agents,今日(5月6日)结束免费预览期,正式转为信用点计费模式。Workspace Agents 是 GPTs 的进化版——由 Codex 驱动,可接入 Slack、Salesforce、Gmail 等企业工具,在云端后台独立运行长流程任务(准备报告、写代码、处理邮件),在用户不在线时也能持续工作。管理员可控制工具权限、审批流程和访问级别。目前面向 Business、Enterprise、Edu、Teachers 计划开放。
⭐ 深度推荐
核心观点:今天是 OpenAI 企业战略的一个真正考验时刻——从"免费尝鲜"到"真金白银买单"。Workspace Agents 的本质是把 AI 从"对话工具"升级为"企业员工",能持续工作、有权限管控、可集成现有系统。付费转化率将是检验企业 AI 落地深度的第一个硬指标。这也倒逼竞争对手(Anthropic、Google)加快类似产品的商业化节奏。
来源:OpenAI 官方 | The New Stack | Reworked
⭐ Brockman 法庭作证:2026 年算力支出将达 500 亿美元¶
(OpenAI to Spend $50 Billion on Computing in 2026)
在 OpenAI 与 Musk 诉讼案庭审第二天,Greg Brockman 作证披露,OpenAI 2026 年算力支出预计达 500 亿美元,相比 2017 年约 3000 万美元已暴增千倍以上。CFO Sarah Friar 同时纠正了 Altman 此前声称的 1.4 万亿美元算力义务,实际约为 6000 亿美元(至 2030 年)。公司 3 月完成 1220 亿美元融资,估值 8250 亿美元,但部分内部营收目标未能达成。
⭐ 深度推荐
核心观点:500 亿美元年度算力支出意味着 OpenAI 平均每天约 1.37 亿美元在买算力。这个数字背后是一个极端的融资 → 烧算力 → 保能力领先 → 继续融资的飞轮。IPO 前夕出现 CFO 纠正 CEO 夸大承诺的细节,值得关注——对上市路演而言,财务数据的准确性比故事的宏大性更关键。
OpenAI AI 手机加速计划:目标 2027 年上半年量产¶
(OpenAI's new phone being fast-tracked)
分析师 Ming-Chi Kuo 披露,OpenAI 正在加速首款 AI Agent 手机计划,目标 2027 年上半年启动量产。MediaTek 可能成为独家处理器供应商(Dimensity 9600 定制版),Jony Ive 参与设计。Altman 表示"是时候认真重新思考操作系统和用户界面的设计方式了"。手机核心概念是:用 AI Agent 替代传统 App,持续理解用户上下文。
来源:9to5Mac
OpenAI x AWS 扩大合作,GPT-5.5 上架 Amazon Bedrock¶
OpenAI 将 GPT-5.5 和主要模型上架 Amazon Bedrock,同时将 Codex 引入 AWS,并支持由 OpenAI 驱动的 Bedrock Managed Agents。AWS 企业客户可在自己的 AWS 环境内直接使用 OpenAI 前沿模型。此举让 OpenAI 绕过自身算力瓶颈,借道 AWS 触达更广泛的企业客户群。
Google DeepMind / Gemini¶
⭐ Deep Research Max 公开预览:首个可接私有数据的 API 级自主研究代理¶
(Deep Research Max: a step change for autonomous research agents)
Google 于 4 月 22 日发布基于 Gemini 3.1 Pro 的双层研究代理:Deep Research(速度优先,~20 分钟内完成,约 $1.22/次)和 Deep Research Max(质量优先,最多 60 分钟,约 $4.80/次)。核心亮点:①通过 MCP 接入企业私有数据库和专业数据流(金融、医疗等),②原生生成图表和信息图,③支持协作式研究计划——用户可在 Agent 开始执行前审阅并修改研究方向。深度研究版可执行 ~160 次搜索、处理 ~90 万 token。
⭐ 深度推荐
核心观点:Deep Research Max 代表了"研究代理"的产品化成熟——不再是 Demo,而是有定价、有 API、可接私有数据的生产工具。MCP 支持是关键差异化因素:能连私有数据的研究代理,才能真正进入企业核心业务流程(投资尽调、药物研究、竞争情报)。$4.80 每份报告的定价极具竞争力,与雇佣研究员相比 ROI 明显。
来源:Google Blog | Google AI Docs | SiliconANGLE
Gemini Robotics-ER 1.6:机器人能读仪表盘了¶
(Gemini Robotics ER-1.6 enhances reasoning)
Google 发布 Gemini Robotics-ER 1.6,专注推理优先的机器人模型升级,大幅增强空间逻辑和多视角理解能力。新增能力亮点:机器人可识别复杂仪表盘和视窗(与波士顿动力合作中发现的需求)。模型专注视觉与空间理解、任务规划和成功检测三大维度。
来源:Google Blog
Google DeepMind 英国员工 98% 赞成票工会化(持续发酵)¶
DeepMind UK 员工工会化投票(1000+ 人参与,98% 赞成)仍是本周最受关注的 AI 行业事件之一。今日更多细节浮出:员工核心诉求除停止军事 AI 合作外,还包括设立独立伦理监督机构、个人有权基于道德拒绝参与特定项目。Google 管理层有 10 个工作日回应期限,目前未见公开表态。与此同时,600 名员工联名反对 $2 亿五角大楼合同(Gemini 模型用于机密军事网络,"可用于任何合法目的"),Google 态度显示不会像 2018 年 Project Maven 那样妥协。
来源:Fortune | Dataconomy | Fortune(背景分析)
Gemini 市场份额:从 6% 飙升至 25%¶
据 Similarweb 数据,Gemini 目前占全球 AI 流量的 25%,一年前仅为 6%。Time100 最具影响力企业榜单将 Google/Alphabet 列为 AI 竞赛领跑者之一,归因于 Demis Hassabis 领导下的多项技术突破。
来源:TIME
Anthropic / Claude¶
⭐ Claude Opus 4.7 正式发布,附 10 个金融代理模板¶
(Introducing Claude Opus 4.7 + Finance Agent Templates)
Anthropic 于 5 月 5 日正式发布 Claude Opus 4.7,定位"Opus 4.6 与 Claude Mythos 之间"的跨越式升级,特别增强了复杂长任务的执行稳定性和指令遵循精度,并新增"输出自我验证"能力(在回报告前自动检查结论)。定价与 Opus 4.6 相同:\(5/百万输入 token,\)25/百万输出 token。同步发布 10 个金融行业预制代理模板(覆盖项目建议书、KYC 审查、信用备忘录、月末结账、保险理赔等),集成进 Claude Cowork、Claude Code 和 Claude Managed Agents。Claude 现已支持 Microsoft 365 全套集成(Excel、PowerPoint、Word、Outlook),上下文跨应用贯通。
⭐ 深度推荐
核心观点:Anthropic 的打法越来越清晰——不卖"最强模型",卖"行业嵌入深度"。10 个预制金融代理 + Jamie Dimon 站台 + 合资公司,是一个系统性的行业攻坚战略,而非单纯的模型发布。"自我验证输出"能力对企业采用的意义被低估:监管行业(金融、医疗)最怕的不是 AI 不够聪明,而是 AI 不够可靠。Opus 4.7 把可靠性作为卖点,是精准打了行业痛点。
来源:Anthropic | Anthropic 金融代理 | Fortune
Claude Code 重大更新:Auto Mode 开放研究预览¶
Anthropic 为 Claude Code 推出 Auto Mode——一种面向长时运行任务的更安全权限模式,Claude 可以在有护栏的前提下自主做决策、减少中断。目前对 Team 用户开放研究预览,Enterprise 和 API 版本即将推出。同批更新还包括:更智能的模型选择、项目清理工具、更强的权限处理、OAuth 登录优化、Windows/PowerShell 修复等。
Claude 移动端新增交互式 Apps + 哈佛采用 Claude¶
Anthropic 为 iOS 和 Android 客户端添加 Interactive Apps 功能,支持在对话中直接渲染实时图表、草图和可分享视觉素材。此外,哈佛大学文理学院(FAS)宣布将 Claude 纳入官方 AI 平台,同时停止 ChatGPT Edu 访问权限,并计划采用 Claude Code 工具包。
来源:Releasebot - Claude | Harvard Crimson
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 千问 / 文心 / 智谱
⭐ Kimi K2.6 开源:万亿 MoE,300 个并行 Agent,SWE-Bench 超越 GPT-5.4¶
月之暗面开源 Kimi K2.6,采用万亿参数 MoE 架构(384 专家,每次激活 8 个,激活参数 32B),在 SWE-Bench Pro 取得 58.6%,超越 GPT-5.4(57.7%)和 Claude Opus 4.6(53.4%)。支持 256K 上下文窗口,原生多模态(400M 参数视觉编码器)。Agent 集群从 K2.5 的 100 个扩展至 300 个并行子代理,支持 4000 步工具调用,可连续自主运行 12+ 小时。已在 vLLM、OpenRouter、Cloudflare Workers AI 上实现 Day-0 适配。公司 ARR 突破 1 亿美元,Stripe 全球支付榜升至第 9 位。
⭐ 深度推荐
核心观点:K2.6 的"300 个并行 Agent"不只是参数上的竞争,更代表了 Agent 架构范式的演进——从单模型推理到群体协作执行。SWE-Bench Pro 58.6% 意味着在软件工程代理这个最有商业价值的赛道,Kimi 已经突破了顶级闭源模型的封锁线。这对 Agent 时代的中国公司是一个重要信号:开源路线 + 专项能力突破,可能是对抗闭源巨头的最优策略。
来源:smol.ai AINews | 什么值得买
阿里 Qwen3.6-Max-Preview:Agent 编程能力显著提升¶
阿里千问发布 Qwen3.6-Max-Preview,在 agentic coding 方面实现突破,尤其在复杂代码仓库问题求解和前端开发领域树立新标杆。默认支持百万 token 超长上下文窗口,在 Code Arena 榜单排名上升。模型正在向"具备高度自主性的超级智能体"演进方向加速迭代。
智谱 GLM-5.1:港股 3 个月涨 700%,市值超 4000 亿港元¶
智谱 4 月发布 GLM-5.1,可连续工作 8 小时,各项评测超越 DeepSeek-V3.2。更引人注目的是资本市场表现:智谱港股上市后三个月内涨幅超 700%,市值突破 4000 亿港元,已超越京东和百度。公司 2026 年 3 月模型 API ARR 达 17 亿元,同比增长 60 倍;但 2025 年净亏损 31.8 亿元,增收不增利的压力仍在。
DeepSeek:沉默中的等待与期待¶
DeepSeek 目前主力版本 V3.2 在 OpenRouter 月调用量仍达 5.35 万亿(全球第 3),市场份额维持 5-10%。但进入 2026 年,当行业全面转向 Agent 和编程能力竞赛,DeepSeek 坚守的"推理模型"路线出现错位迹象。V4 发布预期升温——DeepSeek 到底是继续研究创新路线,还是开始商业化转型,答案可能很快揭晓。V4-Pro API 2.5 折优惠已延长至 5 月 31 日。
来源:36kr
AI 研究前沿¶
UniVidX:视频扩散先验驱动的统一多模态视频生成框架¶
UniVidX 通过随机条件遮蔽、解耦门控 LoRA 和跨模态自注意力机制,利用视频扩散模型先验,统一支持文生视频、图生视频、视频编辑等多类任务。发布于 2026 年 5 月 1 日,在 HuggingFace 趋势论文中获 77 票,是本周最受关注的生成模型论文之一。
AI-Trader:首个 LLM 金融决策自动化真实基准¶
AI-Trader 提出首个完全自动化的 LLM 金融决策实时基准,覆盖多个市场,支持自主信息处理和交易执行评估。随着 AI Agent 向金融核心业务渗透,这类基准的出现标志着"金融 AI 代理"正从概念走向可量化评估。
Tequila:无陷阱的三值量化 LLM 方法¶
Tequila 提出一种改进的三值量化方法,通过将量化死区中的"被困权重"重新用作动态偏置,同时提升精度和推理速度。对 1B~7B 规模模型的边缘部署有实用价值。
行业观点与解读¶
⭐ Karpathy(Sequoia Ascent 2026):你可以外包思考,但无法外包理解¶
Karpathy 在 Sequoia Ascent 2026 峰会分享的核心洞察(摘要):
- 我们正从软件 2.0(学习权重)迈入软件 3.0(提示/上下文/编排 Agent),上下文窗口是新时代的程序
- "锯齿状智能"——今天的模型能重构 10 万行代码,却可能在"我该走路去洗车吗"这种常识问题上失败
- 最重要的一条:你可以把思考外包给 AI,但你无法外包理解——他意识到自己"正在成为瓶颈,连我们在尝试构建什么都快不清楚了"
⭐ 深度推荐
核心观点:Karpathy 在重新定义 AI 时代知识工作者的核心价值——不是"思考速度",而是"理解深度"。工具可以让你更快,但只有理解让你走对方向。这个框架对产品经理、研究员、任何知识工作者都有直接指导价值:用 AI 扩大"思考带宽",但通过主动学习、记笔记、深读来守住"理解护城河"。
来源:Karpathy Blog - Sequoia Ascent 2026 | 53AI
Simon Willison:Workspace Agents 定价改变的不只是价格¶
Willison 指出,Workspace Agents 从免费转为付费的今天,是一个重要的"压力测试"时刻——真正愿意为 AI 协作工具付费的企业才会留下,这将快速筛选出 AI 工具的真实商业价值。他此前的观点(95% 代码从手机写出,AI 编程已过拐点)与今天的节点相互印证。
来源:simonw on X | Dev.to - Vibe Coding 2026
Anthropic 发布 Claude 新宪法:23000 字的 AI 价值观文档(1月发布,近期持续讨论)¶
Anthropic 于 1 月 21 日发布了 84 页、约 23000 字的 Claude "新宪法"——详细说明 Claude 的价值观、行为规范和训练原则,以 CC0 协议完全开放。文档以"为何如此行事"为核心,而非列出规则清单。值得关注的是:文档末尾承认"Claude 的道德地位深度不确定",并认为 AI 意识问题"值得严肃对待"。该文档在学界和法学界持续引发讨论。
来源:Anthropic | TechCrunch | The Register
灵感笔记¶
用户自行记录灵感、想法、待写文章的素材
生成时间:2026-05-06 22:05 CST(晚间更新版)| 下次更新:明日 7:00