AI 每日简报 | 2026-05-28¶
今日概览¶
今日AI行业的核心叙事是Agent商业化拐点的到来。Simon Willison提出Anthropic和OpenAI已通过编码智能体找到产品市场契合点(PMF),企业客户开始为API用量支付真金白银;OpenAI密集发布Codex企业案例,从思科到税务代理全面铺开;国内蚂蚁集团高调入场Agent生态,DeepSeek研究员用AI在6天内完成46页论文。与此同时,SQLite明确拒绝"智能体代码"、开源社区被AI生成报告淹没等信号,暗示AI对软件工程本身的改造已进入深水区。
- Simon Willison:Anthropic和OpenAI已找到产品市场契合点,企业编码智能体正在重塑AI商业模式
- OpenAI与思科合作,用Codex重新定义企业工程开发流程
- OpenAI员工亲授Codex自我蒸馏玩法,复制粘贴即可消灭重复劳动
- 蚂蚁集团1400亿Agent入场,大厂押注Agent生态新方向
- DeepSeek研究员陈德里开发自动研究Skill,6天迭代出46页论文,人类只动脑2小时
- SQLite新增AGENTS.md明确拒绝智能体代码,但接受带复现测试的AI生成漏洞报告
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ Simon Willison:Anthropic 和 OpenAI 已找到产品市场契合点¶
Django 联合创始人 Simon Willison 于 5 月 27 日发布长篇分析,提出一个判断:Anthropic 和 OpenAI 已经通过编码智能体(Coding Agents)找到了产品市场契合点(PMF)。
核心论据:
- 企业定价策略剧变:2026年4月,OpenAI和Anthropic先后将企业版编码智能体定价从"包月制"改为"API按量计费"。此前Anthropic企业版"Claude seats"号称包含足够典型工作日用量,现在改为\(20/人/月+API按量付费。OpenAI的Codex也在4月2日和4月23日分两批完成同样调整。
- **用户实际消耗远超订阅费**:Willison以自己为例,过去30天Claude Code和OpenAI Codex的API等值费用分别为\)1,199和\(980,而他仅支付\)200月费。当企业客户开始按API实际用量付费时,头部用户单月成本可达\(1,000+/人。
- **招聘印证战略重心**:OpenAI现有703个开放职位中32.6%(229个)是企业销售和支持岗;Anthropic 390个职位中26.9%(105个)为企业向岗位。AI实验室正在大规模组建人类销售团队。
- **SpaceX合同揭示推理成本规模**:Anthropic与SpaceX签订每月\)12.5亿的算力合同(总额$450亿至2029年),用于扩充Claude Code和API的推理容量——这仅是Anthropic众多算力供应商之一。
- 4月成为新拐点:GPT-5.5(4月23日)和Opus 4.7(4月16日)的发布不仅提升了模型能力,还同步提高了API单价。OpenAI和Anthropic在一个月内完成"涨价+锁死企业按API付费"的组合拳,标志着从"烧钱获客"转向"变现收割"。
Willison认为,2025年11月是"能力拐点"(编码智能体变得真正可用),而2026年4月是"收入拐点"(企业开始为Agent用量支付真金白银)。他还指出,Uber"AI预算几个月就用完全年额度"、Microsoft取消部分Claude Code授权等新闻,表面看是"AI失败故事",实则是产品太有价值导致需求超出预期。
核心观点:
- 编码智能体不是又一个"酷炫功能",而是第一个让AI实验室能真正赚钱的产品形态。ChatGPT有9亿周活但付费率仅5.6%,而编码Agent能让单个用户月消费从\(20飙升至\)1,000+。覆盖1万亿美元基础设施投入需要的不是20亿订阅用户,而是200万重度企业用户。
- Anthropic和OpenAI正在"剪掉中间商"——Claude Code直接竞争Cursor和GitHub Copilot。这解释了为什么Cursor紧急投资自研模型。API收入曾经依赖少量大客户(Cursor+Copilot曾占Anthropic \(40亿收入中的\)12亿),而现在实验室想把这笔钱直接装进自己口袋。
⭐ DeepSeek 研究员开发自动研究 Skill,6 天产出 46 页论文¶
据量子位 5 月 27 日报道,DeepSeek 研究员陈德里使用自研工具 DeliAutoResearch,与 DeepSeek-V4-Pro 合作完成了一篇 46 页的研究综述论文。整个项目迭代 6 次(V1: 4次, V2: 1次, V3: 1次),耗时 6 天,约 108 轮 Agent 调用,消耗 64.8 万 token,产出 2234 行 LaTeX 代码和 103 个已验证参考文献。
陈德里的自述:"1%是我写的,99%是Agent写的。"他的"碳基大脑"处理这个问题的总CPU时间不到2小时。
论文核心贡献:
- 提出 L1-L5 自主研究智能体分级体系(类比自动驾驶SAE级别):
- L1:自动补全(GitHub Copilot早期)
- L2:任务执行(ChatGPT/Claude + 工具,每步需人类批准)
- L3:多步骤执行(Claude Code、Cursor Agent,自主执行10-100步)
- L4:受限领域全自主(当前行业前沿,人类仅提供目标和评估成果)
- L5:完全自主研究(智能体自主选题、分配资源、长期积累,尚未实现)
- 总结 4 种主流架构模式:单智能体循环、多智能体协作、分层调度、工具增强执行
- 横向对比 17 个主流自主研究系统,提出 6 大开放问题:认知循环陷阱、上下文限制、创新性评估、可复现性、安全伦理、成本问题
核心观点:
- 这篇论文本身就是它研究主题的最佳例证——当AI能在6天内完成原本需要1个月的文献综述时,学术生产的门槛和节奏将被彻底改写。但论文也坦承,当前瓶颈不是模型能力,而是"持续知识积累"和"可靠自我评估"。
- L4级自主研究已初步实现,但迈向L5的核心障碍在于:智能体缺乏长期记忆积累机制、无法自主判断研究原创性、以及单任务$50+的成本对科研公平性的冲击。
⭐ OpenAI × 思科:Codex 重新定义企业工程¶
OpenAI 于 5 月 27 日发布与思科(Cisco)的战略合作案例。思科正在用 Codex 实现三大目标:规模化AI原生开发、加速AI Defense安全产品线、以及自动化缺陷修复(automated defect remediation)。这是OpenAI在企业级代码智能体落地方面的又一标杆案例。
同日发布的还有 OpenAI × Thrive × Crete 的税务智能体案例——三方合作构建了一个自我改进的税务申报Agent,能够自动完成报税、提升准确率并加速工作流。
核心观点:
- Codex正在从"程序员辅助工具"演进为"企业基础设施",覆盖网络安全(Cisco AI Defense)、财税合规(税务Agent)、开发运维(Warp开源)等关键业务线。OpenAI的ToB叙事正从"用ChatGPT提效"升级为"用Codex重构业务流程"。
- "自我改进"(self-improving)是关键词——当Agent不仅能执行任务,还能在运行中自我优化时,企业部署AI的ROI将从"人力替代"跃迁到"系统进化"。
⭐ SQLite 明确拒绝"智能体代码":AGENTS.md 文件的标志性意义¶
SQLite 项目于 5 月 22 日在代码库中新增了 AGENTS.md 文件,明确声明:
"SQLite does not accept agentic code. However the project will accept agentic bug reports that include a reproducible test case."
5 月 27 日的最新提交甚至删除了 "(currently)" 一词,提交信息为 "Strengthen the statement about not accepting agentic code"。与此同时,SQLite 论坛被大量AI生成的漏洞报告淹没,以至于不得不将其分流到独立的 SQLite Bug Forum。
Simon Willison 在 5 月 27 日的博客中详细报道了这一事件。curl 作者 Daniel Stenberg 此前也观察到了类似现象:AI辅助的安全报告正以每天超过1份的速度涌入curl项目。
核心观点:
- SQLite的AGENTS.md是开源社区对AI冲击的第一份"正式回应文件",其意义远超单个项目。它揭示了一个被忽视的结构性矛盾:AI能批量生成高质量的漏洞报告和代码补丁,但开源项目依赖少数人类维护者来审阅和处理。当输入端被AI放大100倍时,消费端的"人类带宽"成为硬瓶颈。
- "不接受智能体代码,但接受带复现测试的智能体漏洞报告"——这一策略可能成为全球开源项目的标准模板。它承认了AI在"发现bug"方面的超人类能力,但坚守了"代码质量最终由人类负责"的底线。
⭐ 蚂蚁集团 1400 亿 Agent 入场,"流量"护城河要塌了¶
据量子位 5 月 27 日报道,蚂蚁集团高调押注Agent生态,提出1400亿Agent的入场规模。报道认为,大厂正在将Agent视为下一代流量入口,传统"流量护城河"逻辑面临根本性挑战。Agent不再是被动的工具等待用户调用,而是主动完成任务、直接触达结果的新交互层。
核心观点:
- 当Agent能够自主完成"订票-比价-支付-改签"全链条时,用户不再需要打开OTA App对比价格——Agent本身成为新的流量分配中心。这对依赖搜索和推荐算法的传统互联网商业模式构成 existential threat。
- 蚂蚁的1400亿Agent规模如果属实,意味着其野心不仅是做一个Agent平台,而是要将整个金融服务链条Agent化。但"流量护城河倒塌"的叙事可能过于激进——在Agent可靠性尚未完全验证的当下,用户是否愿意将高价值决策完全委托给Agent仍是未知数。
OpenAI¶
OpenAI 与思科合作,用 Codex 重新定义企业工程
OpenAI 于 5 月 27 日宣布与 Cisco 建立战略合作,帮助思科实现AI原生开发规模化、加速AI Defense产品线、以及自动化缺陷修复。
OpenAI、Thrive 和 Crete 构建自我改进税务 Agent
三方合作开发了能够自动完成报税、提升准确率并加速工作流的自改进税务智能体。
Warp 用 GPT-5.5 建设开源
OpenAI 5 月 27 日发布的案例研究显示,Warp 正在用 GPT-5.5 推进开源建设。Warp 是一款基于Rust的现代化终端,正在利用GPT-5.5的能力加速其开源生态发展。
OpenAI 挖来前 Salesforce 营销高管
据量子位 5 月 27 日报道,OpenAI 聘请了曾在 Salesforce 工作 13 年的资深营销高管,被形容为"F1级别车手搞公关"。这标志着 OpenAI 正在加强其企业品牌和市场推广能力。
Codex 自我蒸馏玩法火了,OpenAI 员工亲授
据量子位 5 月 27 日报道,OpenAI 员工分享了 Codex 自我蒸馏(self-distillation)技巧,只需一段提示词和复制粘贴即可让 AI 自动消灭重复劳动。这种玩法正在开发者社区快速传播。
Google DeepMind / Gemini¶
谷歌 DeepMind 一口气解决 9 道埃尔德什数学难题
详见 5 月 27 日简报深度阅读推荐。
Anthropic / Claude¶
Andrej Karpathy 加入 Anthropic pre-training 团队
详见 5 月 27 日简报深度阅读推荐。
Anthropic 估值突破 9000 亿美元
据 5 月报道,Anthropic 正在完成 300 亿美元融资,估值超过 9000 亿美元,预计 Q2 2026 营收达 109 亿美元并首次实现季度运营盈利。
Claude Code 5 月更新
Claude Code 在 5 月迎来跨设备远程会话持久化、Auto mode 权限管理、worktrees 隔离分支处理、以及 Opus 4.7 Fast mode 支持等更新。
国内大厂动态¶
DeepSeek 研究员陈德里开发自动研究 Skill
详见上方 ⭐ 深度阅读推荐。
蚂蚁集团 1400 亿 Agent 入场
详见上方 ⭐ 深度阅读推荐。
快手 Keye 2.0:将 DSA 注意力引入多模态,开启强化推理新范式
据量子位 5 月 26 日报道,快手发布 Keye 2.0,将 DSA(Dynamic Sparse Attention)注意力机制引入多模态模型,开启强化推理新范式。
触觉具身智能"梦之队"成立,天使轮近亿元
据量子位 5 月 27 日报道,一支由复旦系背景的触觉具身智能团队获得近亿元天使轮融资,团队核心成员来自 Meta、华为、阿里等。其目标是让机器人真正学会"触摸"。
面壁智能实现全球首例"AI 自己造 AI"
详见 5 月 27 日简报深度阅读推荐。
北大 & 港中文 & 上海 AI Lab 推出 VGGT-Edit,5 秒完成 3D 场景编辑
据量子位 5 月 27 日报道,三方联合推出的 VGGT-Edit 实现了 5 秒完成 3D 场景编辑,较传统方法加速 120 倍,且无需绕回 2D 处理流程。
AI 研究前沿¶
苏剑林:MoE 环游记第 8 篇——强制序列级均衡
月之暗面研究员苏剑林于 5 月 22 日发布博客,探讨如何在 Loss-Free 负载均衡框架下实现序列级均衡。这是其 MoE 系列深度技术博客的最新一篇。
Raschka:LLM 架构新进展——KV Sharing、mHC 与压缩注意力
Sebastian Raschka 于 5 月 16 日发布文章,梳理了从 Gemma 4 到 DeepSeek V4 的新开源模型如何通过 KV Sharing、多头压缩注意力(mHC)等技术降低长上下文成本。
来源: magazine.sebastianraschka.com
行业观点与解读¶
Simon Willison:Anthropic 和 OpenAI 已找到产品市场契合点
详见上方 ⭐ 深度阅读推荐。
Simon Willison:SQLite 明确拒绝"智能体代码"
详见上方 ⭐ 深度阅读推荐。
Ethan Mollick:Choosing to Stay Human
Ethan Mollick 在最新通讯中讨论了 AI 生成内容泛滥对社交媒体的影响。他指出,如果你现在打开任意社交平台,会发现大量帖子开始看起来"可疑地相似"——这正是 AI 生成内容渗透的迹象。他呼吁在 AI 时代主动选择"保持人性"。
Import AI 458:Reckoning with the future; and a singularity story
Anthropic 联合创始人 Jack Clark 于 5 月 26 日发布 Import AI 第 458 期,主题围绕"与未来算账"和奇点叙事展开。
值得关注的视频¶
- The AI Daily Brief(5 月 23 日):AI's New Acceleration Phase —— 讨论 AI 行业进入新加速阶段的信号。aidailybrief.beehiiv.com
- Karpathy:Sequoia Ascent 2026 总结(4 月 30 日):Karpathy 在 Sequoia Ascent 的炉边谈话文字整理,他用 Codex 5.5 生成了完整的摘要和清理后的 transcript。⭐ 对于想了解他对 AI 研发前沿最新判断的人值得阅读。karpathy.bearblog.dev
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
1. 编码智能体的"PMF拐点"是否已经到来?
Simon Willison的论证非常有力:当OpenAI和Anthropic同时把企业定价从"包月制"改为"API按量计费",且大力招聘企业销售时,说明他们确认客户愿意为Agent用量支付真金白银。Uber几个月烧完全年AI预算、Microsoft因成本取消部分Claude Code授权——这些"负面新闻"恰恰证明产品太有价值。但一个问题悬而未决:这种高价值是否仅限于软件工程师?当Agent扩展到非技术岗位时,$1,000+/人/月的成本是否还能被接受?
2. 开源社区的"AGENTS.md"模式会扩散吗?
SQLite是第一个明确发布AGENTS.md的主流开源项目,其"不接受智能体代码,但接受带复现测试的智能体漏洞报告"策略具有示范效应。随着AI生成代码和报告的质量持续提升,Linux Kernel、Python、React等核心项目是否会跟进?如果会,开源协作的边界将被重新定义——AI成为"超级贡献者"但不被赋予"提交权限",人类维护者从"写代码"转向"定义规则和仲裁争议"。
3. 自动研究智能体的L4级能力,对学术生产意味着什么?
陈德里用6天完成46页综述论文,103个参考文献全部验证。如果这种能力普及,学术出版的节奏将从"月"变为"周",文献综述的门槛将趋近于零。但更深层的问题是:当AI能自动完成"整理已知"的工作后,人类研究者的价值是否将完全集中在"提出新问题"上?而L5级(完全自主选题)的实现瓶颈——"持续知识积累"和"可靠自我评估"——恰好也是人类顶尖研究者最核心的竞争力。
4. Agent作为新"流量入口",互联网商业格局会如何重构?
蚂蚁集团1400亿Agent的入场规模如果属实,意味着大厂不再把Agent当作"功能插件",而是当作下一代"操作系统"。当Agent能够自主完成"搜索-比价-决策-执行"全链条时,传统依赖广告和推荐的商业模式(搜索引擎、电商、OTA)将面临根本性质疑。但Agent本身的"注意力分配"(用户信任哪个Agent、Agent优先调用哪个服务)将成为新的权力中心——这会是更集中还是更分散的格局?
生成时间:2026-05-28 10:38 | 下次更新:明日 9:00