跳转至

AI 每日简报 | 2026-08-13(周四)

今日概览

今天的资讯被两条主线贯穿:一是中国大模型的 Agent 能力正式逼近全球最前沿——DeepSeek 在深夜上线 V4-Pro 正式版,DeepSWE 得分 62.7 一举超越 Claude Opus 4.8、在 Cybergym 等多项 Agentic 基准上逼近甚至反超 Claude Fable 5,把"Agent 是下一战场"的竞争从闭源巨头扩展到了国产开源阵营;二是巨头权力与格局的再洗牌——Google DeepMind 正式换帅,研究出身的 Demis Hassabis 退居二线、CTO 出身的 Koray Kavukcuoglu 上位执行层;腾讯 Q2 财报披露资本开支暴增 176%、预告混元 Hy4;Manus 与 Meta 正式"分手"恢复独立运营,标志 20 亿美元 AI 并购被国家力量改写。具身智能侧,自变量机器人以 30% 成本跑出超 Figure AI 45% 的分拣效率,国产"具身大脑"路径再下一城。

今日五大关注:

  • DeepSeek V4-Pro 正式版深夜上线:DeepSWE 62.7 超越 Claude Opus 4.8,多项 Agent 基准逼近/反超 Fable 5
  • Google DeepMind 换帅:Koray Kavukcuoglu 接替 Demis Hassabis,Gemini 同日宣布突破 10 亿月活
  • 腾讯 Q2 财报:资本开支 528 亿、同比增 176%,混元 Hy3 调用量增 68 倍,预告 Hy4
  • Manus 与 Meta 分拆、恢复独立运营:发改委否决的 20 亿美元并购正式终结,部分用户数据将被删除
  • 自变量机器人 1816 件/小时:以 30% 成本跑赢 Figure AI 45% 效率,国产具身大脑创纪录

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。

⭐ DeepSeek V4-Pro 正式版深夜上线:DeepSWE 62.7 超越 Claude Opus 4.8,Agent 能力逼近 Fable 5

来源澎湃新闻 | IT之家 | 智东西 | 东方财富

8 月 13 日凌晨,DeepSeek 正式上线 V4-Pro 正式版 API(版本号 DeepSeek-V4-Pro-0813,调用模型名仍为 deepseek-v4-pro),核心卖点是大幅增强 Agent 能力,并新增对 Responses API 与 Codex 接入的支持。在 AI 编程智能体基准 DeepSWE 上,V4-Pro-0813 得分 62.7,较预览版(V4-Pro-Preview 12.8、V4-Flash-Preview 7.3)实现跨越式提升,一举超越 Claude Opus 4.8(58.0),仅次于 Claude Fable 5(70.0)。在多项 Agentic 评测中已逼近或反超 Fable 5:Cybergym 得 83.3(Fable 5 为 83.1)、AutomationBench (Public) 得 31.8(Fable 5 为 29.1)、Terminal Bench 2.1 得 87.9(逼近 Fable 5 的 88.0)。定价方面延续低价策略:输入 3 元/百万 tokens、输出 6 元/百万 tokens、缓存命中输入 0.025 元/百万 tokens;支持 1M 上下文、最大 384K 输出、JSON 输出与 Anthropic API 兼容。

核心观点:

  • 这是国产开源模型第一次在 Agentic 能力上正面"摸到"全球最贵闭源模型(Fable 5)。此前 DeepSeek 靠低价与推理能力抢下大量调用量,而 Agent 一直被视为闭源巨头的最后护城河——现在 V4-Pro 用 62.7 的 DeepSWE 分数证明,"会自主干活"这件事不再只有天价闭源模型能做到。当 DeepSWE 62.7 对应的定价是输入 3 元/百万 tokens,护城河叙事被实打实的性价比削弱。
  • 值得注意的细节:"Fable 5"本身已成为行业新的对标锚点。Cybergym 反超、Terminal Bench 逼近、DeepSWE 尚差 7.3 分——这个"差一点点"的格局,意味着 Agent 能力竞赛已经从"聊天/知识"彻底转向"能否在真实环境中自主完成任务",而这恰恰是评测最难造假、也最接近 AGI 实用价值的维度。

⭐ Google DeepMind 换帅:研究出身的 Hassabis 退居二线,CTO 出身的 Kavukcuoglu 上位"执行"

来源CNBC | HPCwire | Yahoo Finance | 量子位

8 月 12 日,谷歌宣布 Koray Kavukcuoglu 接任 Google DeepMind 负责人,接替 Demis Hassabis——后者转任 DeepMind 主席兼 Alphabet 首席科学家,同时继续领导 Isomorphic Labs。Kavukcuoglu 此前是 DeepMind CTO 与 Google 首席 AI 架构师,将直接向 Alphabet CEO Sundar Pichai 汇报,统管 Gemini 模型开发、前沿 AI 研究以及 Gemini app 与开发者团队。分析普遍将这次调整解读为从"研究导向"转向"执行与产品交付":此前 Gemini 3.5 Pro 因编码能力不达标一再延期、叠加 Jeff Dean、Sanjay Ghemawat、Oriol Vinyals、Quoc Le 等核心科学家出走,Google 亟需一个能"把产品推上线"的人。同日,Pichai 宣布 Gemini AI 助手月活突破 10 亿,称其为谷歌"史上增长最快产品"、第 14 个达到 10 亿里程碑的产品。此外,联合创始人布林被曝敦促 AI 人才"全力投入 Gemini 与递归自我改进"。消息公布后谷歌股价收跌约 3.84%。

核心观点:

  • 换帅是"布林接管 Gemini"之后的制度性延续:研究天才退居二线、工程执行者上位。当一家实验室连续两年在"旗舰模型延期 + 人才出走 + 竞争对手用自家芯片反打"的三重困境里挣扎,换帅本质上是在承认——问题不在"研究不够强",而在"研究没有转化为产品"。
  • 一个刺眼的并存状态:Gemini 月活 10 亿(用户规模赢了)与旗舰模型延期(前沿能力输了)同时发生。这暴露了 Google 的"规模陷阱"——它擅长把 AI 铺进 90% 的财富 100 强,却不再能证明自己在造"下一个更好的模型"。当同一天 DeepSeek V4-Pro 在 Agentic 基准逼近 Fable 5,Google 面临的是"上面有闭源天花板、下面有开源追兵"的前后夹击。

⭐ 腾讯 Q2 财报:资本开支 528 亿暴增 176%,混元 Hy3 调用量增 68 倍,预告 Hy4

来源腾讯新闻 | 财联社 | 东方财富 | 钛媒体

8 月 12 日腾讯发布 2026 年二季度财报:营收 2048 亿元(同比 +11%),研发投入 273 亿元(同比 +35%),资本开支 528 亿元(同比 +176%),主要用于算力采购以支撑混元升级与 AI 应用。混元 Hy3 正式版上线一周,调用量较上一代增长超 68 倍,按 OpenRouter token 消耗量计持续位列全球前三,日均 token 用量是 preview 版的 7 倍;在 WorkBuddy 中把任务解决率从 72% 拉到 90%,元宝文档生成综合分提升 7%,ima 知识库问答推理质量净提升近 19%。总裁刘炽平在电话会透露,参数规模更大的混元 Hy4(混元 4)将于今年晚些时候发布,"不仅能战胜体量更大的模型,实用性上也会远超混元 3"。马化腾则用"智能层(Hy3)、应用层(WorkBuddy/CodeBuddy)、基础设施层(算力采购)"概括"构建一个全新的、AI 赋能的腾讯"。WorkBuddy 电脑端 6 月访问量突破 2000 万,居国内办公智能体平台首位。

核心观点:

  • 腾讯 528 亿季度资本开支(+176%)是这轮算力军备的又一实锤,与英伟达 5000 亿"GPU 金融化"、谷歌把 TPU 商业化卖钱形成呼应——全球算力投入正在从"年"尺度加速到"季"尺度,而中国大厂的军备竞赛已进入真金白银的报表阶段。
  • 腾讯的策略与 DeepSeek 相反:不追求参数第一,追求产品落地。Hy3 的价值主张是"任务解决率 72%→90%"这类产品指标,而非榜单分数;把模型塞进 WorkBuddy、元宝、搜狗输入法等国民级入口,让调用量(68 倍增长)而非参数规模证明自己。这是"模型-应用双螺旋"的典型样本,也说明国内大模型竞争已分化成"拼模型"与"拼场景"两条路线。

⭐ Manus 与 Meta 正式"分手":发改委否决的 20 亿美元并购终结,恢复独立运营

来源量子位 | 网易 | 香港文汇报 | 湖北日报

8 月 11 日,Manus 发布《致 Manus 用户的一封信》,宣布即将恢复以独立公司形式运营。这一调整是 Manus 与 Meta 分拆安排的一部分:2025 年 12 月 29 日,Meta 宣布以约 20 亿美元收购 Manus 母公司蝴蝶效应;2026 年 4 月 27 日,中国国家发展改革委外商投资安全审查工作机制办公室依法作出禁止该投资的行政决定、要求撤销收购,此后 Manus 推进与 Meta 的拆分。数据安排上(均为新加坡时间),部分用户在 Meta 收购当天及之后产生的数据将于 8 月 23 日 08:00 起至 8 月 24 日被删除,受影响用户需在 8 月 23 日 07:59 前备份、8 月 25 日 08:00 起恢复;官方强调此举并非数据泄露或安全事件,而是独立运营过渡与合规需要。独立后用户数据将存储于美国与新加坡,公司表示正筹备一系列新功能,并为受影响用户提供备份工具、过渡期免收费及回归奖励。

核心观点:

  • 这是国家力量直接改写一桩 20 亿美元 AI 并购的罕见样本——发改委外商投资安全审查首次公开否决海外科技巨头收购中国 AI agent 公司,标志"AI Agent"作为关键基础设施被纳入国家安全审查视野。对行业而言,这实质收紧了中国 AI 公司被海外巨头收购的通道,也让"出海并购"的资本路径蒙上政策阴影。
  • 对 Manus 本身,"恢复独立"只是起点:脱离 Meta 的算力、渠道与资本支持后,它需要靠自身在 Agent 这条最卷的赛道上重新证明自己。用户数据的删除与迁移是一次高风险的手术——处理不好信任危机,处理好了则是"去 Meta 化"的干净转身

⭐ 自变量机器人 1816 件/小时:以 30% 成本跑赢 Figure AI 45% 效率,"具身大脑"路径再下一城

来源量子位

国产通用具身智能公司自变量机器人在公开直播实测中,以"双机械臂+夹爪"方案完成物流分拣,一小时分拣 1816 件形态、大小、材质各不相同的异形包裹,超过美国 Figure AI 此前公开的 1248 件/小时平均效率纪录,分拣效率提升超 45%;而该硬件方案相比 Figure AI 的"人形机器人+五指灵巧手"路线,硬件成本大幅下降(约 30% 成本)。关键在于"具身大脑"而非本体:模型实时理解随机包裹并调整动作策略,面对形态、重量、姿态不断变化的包裹仍能"见招拆招"。自变量此前已把机器人 WALL-B 带进真实家庭环境持续迭代,据称是大湾区首个 200 亿具身大脑、两个月内连融四轮。

核心观点:

  • 这场实测最有分量的不是"快",而是用"更便宜的硬件 + 更聪明的模型"击败"更贵的硬件":夹爪 + 双机械臂的成本只有人形 + 灵巧手的约三成,却靠模型泛化把效率反超 45%。这直接挑战了"人形本体是具身智能必经之路"的主流叙事——当"大脑"足够强,本体的形态可能只是成本问题而非能力问题
  • 自变量走的是"真实场景 + 模型驱动"的路线:把机器人丢进家庭与真实仓储,让模型在真实交互里迭代,而非在仿真里刷分。这与前一天蚂蚁领投戴盟(触觉世界模型)的信号一致——资本与技术的焦点正从"造一个会走的人"转向"造一个真正会干活、且便宜到能规模化的系统"

OpenAI

今日无更新。

(8 月 12 日 OpenAI 无重大新发布;70 亿美元员工回购、Brad Lightcap 离职、Daybreak 安全模型上 AWS 等均为前日已报道事项。)


Google DeepMind / Gemini

1. Google DeepMind 换帅,Gemini 月活突破 10 亿
⭐ 深度推荐(详见深度阅读区)

Koray Kavukcuoglu 接替 Demis Hassabis 出任 DeepMind 负责人,标志 Google 从研究导向转向产品交付导向;同日 Pichai 宣布 Gemini 月活破 10 亿。叠加布林敦促"全力投入 Gemini"、Jeff Dean 等核心科学家出走,Google AI 进入重整期。

来源:CNBC | HPCwire


2. Jeff Dean 上顶会自曝离职现场:被 1500 人围堵

量子位报道,刚离开谷歌的 Jeff Dean 在顶会现场自曝离职细节,引发 1500 人围观,并回应消息到凌晨 2 点半。Jeff Dean 与 Sanjay Ghemawat 离开工作 27 年的谷歌,共同创办聚焦"AI for science"的公益公司 Discovery Loop,Oriol Vinyals、Quoc Le 随行。这波离职被外界解读为谷歌 AI 人才流失的又一标志。

来源:量子位


Anthropic / Claude

3. Claude 出现大面积服务中断:多模型"降级"

8 月 12 日,Anthropic 状态页标记 Claude 服务异常,claude.ai、Claude API、Claude Code、Claude Cowork 四个核心服务出现"性能降级"(degraded performance),Claude Console 与 Claude for Government 未受影响,官方未给出恢复时间线。此前 Anthropic 曾将类似中断归因于需求超过算力供给。

来源:MacRumors


4. Anthropic CEO Dario 被投资人质疑"整天神神叨叨"

量子位报道,有投资人公开表达对 Anthropic CEO Dario Amodei 的不满,称其整天"神神叨叨"、过度渲染 AI 风险吓唬人,希望"少吓唬点人"。这一声音折射出 AI 安全叙事与商业期望之间的张力——当 Dario 一面推进前沿模型、一面频繁发出安全警告,部分资方开始担忧这种叙事是否在抑制产品与商业化节奏。

来源:量子位


国内大厂动态

DeepSeek / Kimi / 豆包 / 智谱 / 阿里 / 字节 / 腾讯 / 蚂蚁 等

5. DeepSeek V4-Pro 正式版上线:Agent 能力逼近 Fable 5
⭐ 深度推荐(详见深度阅读区)

DeepSeek 深夜上线 V4-Pro-0813,DeepSWE 62.7 超越 Claude Opus 4.8、多项 Agent 基准逼近或反超 Fable 5,定价维持输入 3 元/百万 tokens 的低价策略,新增 Responses API 与 Codex 接入。

来源:澎湃新闻 | IT之家 | 智东西


6. 腾讯混元 Hy4 预告 + Q2 财报资本开支暴增
⭐ 深度推荐(详见深度阅读区)

腾讯 Q2 资本开支 528 亿(+176%),混元 Hy3 调用量增 68 倍,刘炽平预告参数更大的 Hy4 将于今年晚些时候发布,马化腾称要"构建一个全新的腾讯"。

来源:腾讯新闻 | 财联社 | 东方财富


7. Manus 恢复独立运营,与 Meta 分拆落地
⭐ 深度推荐(详见深度阅读区)

Manus 发布致用户信,宣布恢复独立公司运营,终结被发改委否决的 20 亿美元 Meta 收购;部分收购后产生的用户数据将于 8 月 23-24 日删除。

来源:量子位 | 网易 | 香港文汇报


8. 自变量机器人 1816 件/小时创纪录,30% 成本跑赢 Figure AI
⭐ 深度推荐(详见深度阅读区)

自变量机器人以"双机械臂+夹爪"在物流分拣直播中一小时分拣 1816 件异形包裹,效率超 Figure AI 公开纪录 45%、硬件成本仅约三成,靠"具身大脑"驱动泛化。

来源:量子位


9. 智谱 ZCode 用户突破 100 万,上线四项新功能

智谱 AI 编程产品 ZCode 宣布全面升级,上线 Goal、Subagents、Remote Control 及闲时任务四项新功能,用户数突破 100 万。官方数据称 GLM-5.2 搭配 ZCode 后,任务整体通过率较搭配 Claude Code 高 2.39%。同期,智谱下一代旗舰 GLM-5.3 已进入发布前曝光阶段,创始人唐杰回应"发布在即",报道称其参数规模有望从 GLM-5.2 的七千亿级别跃升至万亿以上。

来源:上海证券报 | 证券之星


10. 字节被曝讨论训练超 5 万亿参数模型

在腾讯 Q2 财报引发国内大参数竞争讨论的背景下,有报道称字节跳动正在讨论训练参数规模超 5 万亿的模型,超过阿里 Qwen3.8-Max(2.4 万亿)与月之暗面 Kimi K3(2.8 万亿)。此前字节 CEO 梁汝波刚表示"接受大语言模型短期落后、坚持自研与长期优化"。

来源:钛媒体


11. 擎羽科技:把"身体"变成具身智能的新变量(大疆系)

量子位报道,出身大疆体系的擎羽科技提出从"柔性本体"走向"跨本体基础智能"的思路,主张让任务与世界知识在更换身体形态后仍可延续——把"身体"本身作为具身智能的新变量,而非固守单一本体形态。这一思路与自变量"大脑优先、本体可降级"的实践形成呼应。

来源:量子位


AI 研究前沿

重要论文、技术突破

12. 紫东太初推出 GMC 核心集剪枝方法:少 80% Token 仍满血保真多模态能力

中国科学院自动化研究所的紫东太初团队提出 GMC(核心集剪枝)方法,通过免训练、开箱即用的方式对多模态输入的冗余 Token 做剪枝,可在削减约 80% Token 的情况下保持多模态能力"满血"保真。这一技术对多模态大模型的推理成本与效率优化有直接价值。

来源:量子位


13. 论文:Mendel Gödel Machine——用"比较式进化"训练递归自我改进的编码 Agent

HF 每日论文收录《Mendel Gödel Machine: Recursive Self-Improving Coding Agents via Comparative Evolution》,提出一种让编码 Agent 通过"比较式进化"递归自我改进的框架。与当下主流的"单一 Agent 自我迭代"不同,它引入种群比较机制,让 Agent 在竞争中筛选更优的改进方向,尝试回答"自我改进的 Agent 如何不陷入退化"这一开放问题。

来源:Hugging Face Papers


14. 论文:VibeLifeBench——你的"生活 Agent"能否在开放世界里主动且持久?

HF 每日论文收录《VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?》,提出一个评测"生活型 Agent"主动性与持久性的新基准。它针对 LLM Agent 从"单次任务"走向"长期陪伴"的趋势,考察 Agent 能否在动态、开放的生活场景里主动发起交互并保持长期一致性,为 Agent 从工具走向"数字生活助手"提供度量标尺。

来源:Hugging Face Papers


行业观点与解读

KOL 重要推文、深度分析文章

15. Ethan Mollick:一份"用哪个 AI 干活"的意见指南(2026 夏季版)

Ethan Mollick 发布新一期深度文章《An opinionated guide to which AI to use to do stuff》(Summer 2026 Edition),延续其一贯的"AI 实战派"视角,对不同任务场景下该选哪类模型/工具给出主观但具体的建议。作为 AI 对工作与教育影响领域最有影响力的观察者之一,这份"夏季版"指南是其对当下模型格局(闭源旗舰、开源、Agent、多模态)的一次快照式盘点。

来源:One Useful Thing


16. Simon Willison 引 Florian Herrengt:AI 正在消除软件工程的"中间阶层"

Simon Willison 8 月 12 日转引软件从业者 Florian Herrengt 的观点:AI 正在侵蚀软件工程的能力"中间阶层",团队越来越依赖 AI 来理解自己写的代码,从而累积"认知负债"(cognitive debt)。这与 Willison 此前反复强调的"meat proxy"(不过脑照抄 AI 输出)风险一脉相承——当工程师失去对代码的第一手理解,AI 的"效率红利"可能在组织层面转化为长期的理解断层。

来源:Simon Willison(经 e-ink 转引)


17. 分析:Anthropic 的 80% Prompt 削减,制造了 AI 自己的"技术债"

Futurum 的一篇分析指出,Anthropic 近期把 Claude Code 系统提示从约 800 token 砍到 164 token(削减超 80%)虽未影响内部编码评测,却给客户带来了迁移成本;配合 Claude Sonnet 5 移除采样参数与手动思考预算、更换 tokenizer,客户被迫返工 prompt 与 memory 文件。文章用"AI 创造自己的技术债"来概括:模型厂商为提效所做的激进简化,会把复杂度转嫁给下游生态。

来源:Futurum Group


值得关注的视频

1.【a16z Show】The CISO Playbook for AI Agents(Datadog)

一句话推荐:a16z 与 Datadog CISO Emilio Escobar 对谈,讲一家 4000+ 工程师都在用编码 Agent 的公司如何做安全——角色化 MCP 服务器、临时凭证、以及自建"AI 裁判"评估代码意图,和当日 Claude 中断、Agent 越权话题高度呼应,是"企业如何在拥抱 Agent 的同时守好安全"的实操参考。

链接:a16z Show

2.【B站】AI 每日早报 2026.08.12|八大 AI 领域一日速览

一句话推荐:中文快讯类早报,8 月 12 日版本覆盖当日八大领域要闻,适合与本周 DeepSeek V4-Pro、Google 换帅等热点结合快速扫读。

链接:B 站


灵感种子

🌱 "Fable 5 对标"现象:模型竞争的坐标系正在整体上移

DeepSeek V4-Pro 的宣传口径是"比肩/逼近 Fable 5",Cybergym 反超、DeepSWE 差 7.3 分、Terminal Bench 逼近——当一家国产开源模型把最贵闭源模型当作唯一对标物,说明 Agent 能力已经成为整个行业的共同标尺。值得深挖:如果再过两个季度,开源模型在 DeepSWE 这类 Agentic 基准上追平甚至反超闭源旗舰,那么"闭源旗舰 = 能力天花板"的定价逻辑还成立吗?会不会出现"闭源卖上限、开源卖性价比"之外的第三种格局——比如"Agent 能力本身成为通用商品、差异化转向数据与场景"?

🌱 国家力量进场之后:AI 公司的"身份"开始影响其商业命运

Manus 与 Meta 的 20 亿美元并购被发改委否决,是"AI 公司归谁所有"第一次成为国家级博弈的筹码。这与更早的 TikTok 叙事、以及当下欧盟 AI 法案、美国出口管制形成一张更大的网。值得延伸:当"一家 AI 公司能不能被收购、被谁收购、数据存哪儿"都由主权审查决定,"AI 无国界"的叙事还剩多少?对创业者而言,这会不会反过来加速"从一开始就按地缘安全架构设计股权与数据"的做法——也就是 AI 公司的"合规前置"?

🌱 具身智能的"大脑优先"正在动摇"人形优先"

自变量用三成成本 + 夹爪反超 Figure AI 的人形 + 灵巧手,擎羽主张"身体是可替换变量",前一天蚂蚁又押注触觉世界模型——三件事指向同一个信号:具身智能的胜负手正在从"本体形态"转向"模型泛化能力"。值得深挖:如果"大脑"足够强,人形是否只是营销叙事而非技术必然?当硬件成本能被模型能力部分替代,"做具身智能"到底是该先造脑还是先造身?这条路线若成立,对动辄押注人形本体的资本会是一次残酷的重新定价。

🌱 巨头"换帅经济学":研究天才 vs 执行者的钟摆

Google 用 CTO 出身的 Kavukcuoglu 替换研究出身的 Hassabis,与 OpenAI、Anthropic 等实验室近年"产品化"的转向同频。值得延伸:当 AGI 的竞争从"能否发论文"变成"能否按时交付旗舰模型",实验室的管理者是否需要从"首席科学家"换成"首席交付官"?但反过来,若执行者上位彻底挤压了长期研究,会不会重演"大公司创新者窘境"——短期交付赢了、长期突破输了?这把钟摆的平衡点,可能是决定这一代 AI 公司终局的关键变量之一。


生成时间:2026-08-13 00:41 | 下次更新:明日 9:00