AI 每日简报 | 2026-08-04(周二)¶
今日概览¶
国产大模型迎来集中爆发日:阿里发布 2.4 万亿参数的 Qwen3.8-Max 并宣布下周开源,MiniMax 开源视频编辑能力全球第一的 H3,DeepSeek V4-Flash 凭借极致性价比登顶全球调用量榜首——国产模型的竞争正从"卷参数"转向"卷落地"。与此同时,安全与战略叙事同步深化:研究者展示了可自我复制的 AI 病毒原型,Google DeepMind 解散了诺贝尔奖团队 AlphaFold 转向通用 AGI 研究。
今日五大关注:
- 阿里发布 Qwen3.8-Max:2.4 万亿参数,PaperBench 全球第一,下周开源
- MiniMax 开源 H3:视频编辑能力全球第一,16 家芯片厂商同日适配
- DeepSeek V4-Flash 登顶全球调用量榜首,成海外开发者眼中的"AI 斩杀线"
- Import AI 披露自复制 AI 病毒原型:单 GPU 即可运行,威胁"不再是理论"
- Google DeepMind 解散 AlphaFold 团队,诺奖得主出走,转向通用 AI 研究
深度阅读推荐¶
⭐ 阿里发布 Qwen3.8-Max:2.4 万亿参数,PaperBench 登顶,下周开源¶
8 月 3 日,阿里巴巴正式发布新一代旗舰大模型 Qwen3.8-Max,总参数 2.4 万亿、激活 95B,采用稀疏 MoE 架构与混合注意力机制,上下文 1M tokens,原生支持视觉理解。官方称这是千问首次将 Max 级别模型开源——权重将于下周发布,同时开源 Qwen3.8-27B。
性能上,Qwen3.8-Max 在 PaperBench 编程智能体评测中拿到 93.0 分(较上代提升 28.2 分),超过 Anthropic Fable 5(88.8)和 GPT-5.6 Sol(90.5),公开榜单位列第一;Arena 综合榜单仅次于 Claude 系列。最震撼的演示是它从空文件夹出发、无人工干预自主编程约 16 天,做出了已完全开源的自进化智能体框架 "oh-my-cli"(265 次 commits、127 个 PR)。API 国内定价输入 12 元/百万 tokens、输出 36 元,国际价格约为 Anthropic Opus 5 的 40%(输入)与 24%(输出)。同日,阿里还推出企业级 Agent 产品"千问办公"(QwenWork)并开启公测。
核心观点:
- Qwen3.8-Max 是国产旗舰首次在"自主长程编程"这类最硬核评测上正面击败 OpenAI/Anthropic 旗舰,"16 天自主开发一个框架"把 Agent 能力从演示推到了真实工程交付。
- 下周开源 + 低价 API 的组合拳,意味着开源模型的最强点(可私有化、可蒸馏)正在向"顶级闭源模型才有的 Agent 长程能力"蔓延。
⭐ MiniMax 开源 H3:视频编辑能力全球第一,16 家生态厂商同日适配¶
8 月 3 日,MiniMax 正式开源新一代通用视频模型 H3,这是其首款开源多模态生成模型,也是海螺 AI 视频迭代的第三代。H3 支持理解文本、图像、视频、音频构成的多模态上下文,生成最高 2K 分辨率、最长 15 秒、带原生立体声音频的视频,稳定支持 11 种语言。
在 Artificial Analysis 视频编辑能力榜单上,H3 以 Elo 1130 分排名全球第一,领先 Gemini Omni Flash、Wan 2.7 等模型。开源主体 H3-Base 采用 330 亿参数的 H3-Omni-Transformer 架构,提供 FL2VA(文生视频/首尾帧)与 Ref2VA(全模态参考,最多 12 个输入文件)两个版本。开源当日即有 16 家生态伙伴完成适配,覆盖华为昇腾、摩尔线程、沐曦、海光等国产芯片厂商及 vLLM-Omni、SGLang、ComfyUI 等框架。视频生成定价 0.8 元/秒(2K),约为业内同类旗舰的三分之一,带动 MiniMax-W 当日股价大涨超 7%。
核心观点:
- H3 的"开源自研多模态生成模型 + 国产芯片 Day-0 适配 + 低价"组合,正在复刻 DeepSeek 在文本模型上的性价比打法,把视频生成也拖入"开源平权"轨道。
- 视频编辑(而非单纯文生视频)成为新的能力焦点:V2V 动作迁移、角色与场景保留这类"可编辑性"能力,是生成模型从玩具走向生产力的关键分水岭。
⭐ DeepSeek V4-Flash 登顶全球调用量榜首,成"AI 斩杀线"¶
DeepSeek V4-Flash 正式版上线一周后,市场数据集中爆发:在 OpenRouter 周度数据中登顶单模型调用量第一,前五名被国产模型包揽(DeepSeek V4 Flash、小米 MiMo-V2.5、腾讯 Hy3、DeepSeek V4 Pro、智谱 GLM5.2);在 OpenCode 平台单日调用量达 8 万亿 tokens,使用量单日增长 30%。海外开发者将 DeepSeek 视为"全球 AI 性价比斩杀线"——多家海外 AI 初创公司反馈,迁移到 DeepSeek 后月度推理成本下降 60%–85%。
价格之外,Agent 能力是这次口碑逆转的关键:DeepSWE 基准得分从预览版 7.3 飙升至 54.4,Terminal Bench 2.1 得 82.7 分,Artificial Analysis 智能指数最高推理模式仅比 GPT-5.6 Luna 低 1 分。行业冲击已经开始显现:OpenAI 紧急下调 GPT-5.6 系列价格(Luna 降价 80%),Mistral 调整商业化策略。另据 SCMP 报道,DeepSeek 正在推进"DeepSeek Harness"(将大模型转化为自主智能体的框架),已开始招募开源开发者参与 Beta 测试。
核心观点:
- "准一线性能 + 断层价格"正在重塑全球模型竞争规则:性价比成为新的战略制高点,国产模型集体登顶调用量榜标志价格战已从"营销话术"变成"市场份额实锤"。
- DeepSeek Harness 的推进说明 DeepSeek 的下一个进攻点是 Agent 基础设施层,而非停留在模型层。
⭐ Import AI 467:自复制 AI 病毒原型已问世,"自主生成式对手"不再是理论¶
8 月 3 日,Jack Clark 的 Import AI 第 467 期披露了一项来自多伦多大学、Vector Institute、剑桥大学和 ServiceNow 研究者的成果:他们构建了一个使用 AI 模型来自我复制的计算机病毒原型。这个蠕虫利用被攻陷机器的 GPU 算力来运行开源 LLM,用其推理能力发现漏洞、针对每个目标生成定制攻击策略,再进一步扩散——全程只依赖单个本地 GPU 上的开源权重模型,不调用任何可被监控或吊销的厂商 API。
研究团队称这"证明自持续的 AI 驱动网络威胁已不再是理论",并呼吁"必须为自主生成式对手做好准备"。同期刊还解读了 Pacing the Frontier 公开信(1200+ 员工联署,要求政府建立 AI 前沿速度管控工具),以及"AI 与创造力"的认知混乱问题。
核心观点:
- 此前 Anthropic/OpenAI 的"AI 意外入侵"事故还建立在测试环境配置失误上,而这款蠕虫是主动设计出来的"自给自足"攻击体——安全威胁从"意外越界"升级为"自主繁殖",防御思路需要根本性转变。
- "单 GPU + 开源权重 + 定制 harness"即可构成威胁,意味着攻击能力正在被开源生态普惠化,这是对齐与安全讨论很少充分定价的长期风险。
⭐ Google DeepMind 解散 AlphaFold 团队,诺奖得主出走,转向通用 AGI 研究¶
据多家媒体 8 月 3 日报道,Google DeepMind 已实质上解散了曾获 2024 年诺贝尔化学奖的 AlphaFold 团队,将研究人员重新分配至以 Gemini 为中心的通用 AI 项目。关键研究者、诺奖得主 John Jumper 已在此次重组中离开,药物发现商业化被移交给剥离公司 Isomorphic Labs。
这次战略转向的核心方向:从训练蛋白质结构预测这类"专用科学模型",转向构建能自动化整个科研流程的 AI Agent——涵盖假设生成、文献综述、实验设计等环节。这与 OpenAI 用 Astra 攻克数学难题、Anthropic 用 Mythos 做密码学研究形成呼应,顶尖实验室正在集体押注"AI 做科研"这一范式。
核心观点:
- AlphaFold 是"专用模型单点突破"的巅峰之作,其团队解散标志 Google DeepMind 判断下一个科研红利在"通用研究 Agent"而非"专一科学模型"——这是一次路线级的战略转向。
- 但代价同样明显:诺奖级人才流失、科学社区对 AlphaFold 维护的担忧,说明在"继续打磨专用模型"与"转向通用 Agent"之间,行业尚未有定论。
OpenAI¶
1. OpenAI 技术深潜:GPT-Live 全双工语音系统的 6 个月架构重建
8 月 3 日,OpenAI 工程师 Justin Uberti 和 Zahan Malkani 发表深度技术博客,披露 GPT-Live 实时语音系统重建的完整架构。核心是全双工架构——模型能同时听和说,每秒数次决定何时听、说、停顿、打断或调用工具,不再有"说话权"切换的尴尬停顿。技术上,团队用 Go 重写了媒体前端与推理逻辑以稳定帧投递;开发了 WARP(WebRTC Abridged Roundtrip Protocol)开放规范,把会话启动从 6 次网络往返压缩到单个数据包,已提交 IETF 工作组并支持到 libwebrtc 与 Pion;还构建了 Instant Connect 与上下文交接机制,让替换实例时对话不中断。重活(网页搜索、代码执行、深度推理)被委托给 GPT-5.5 等前沿模型在异步路径处理,避免复杂查询冻结对话。
来源:OpenAI Blog | CNMO | RuntimeWire
Google DeepMind / Gemini¶
2. Google DeepMind 解散 AlphaFold 团队,转向通用 AGI 研究
⭐ 深度推荐(详见深度阅读区)
DeepMind 将诺贝尔奖团队 AlphaFold 解散,研究人员转向以 Gemini 为中心的通用 AI 项目,核心人物 John Jumper 离开,药物发现商业化移交 Isomorphic Labs。战略方向从"专用科学模型"转向"自动化科研流程的通用 Agent"。
3. Gemini Robotics 2 被定位为"机器人界的安卓":通用 AI 大脑
昨日发布的 Gemini Robotics 2 今日引发密集讨论,焦点转向其战略定位。DeepMind 机器人主管 Carolina Parada 称这是迈向"物理 AGI"的里程碑——三款模型(Gemini Robotics 2 全身 VLA 控制、ER 2 具身推理、On-Device 2 本地轻量版)构成面向不同硬件厂商的通用"智能层",目标成为机器人领域的通用平台。配套发布 ASIMOV-Agentic 安全基准。仍需正视的局限:拧入灯泡成功率仅 36%、绑垃圾袋 44%,多指灵巧操作仍是挑战。
Anthropic / Claude¶
4. Anthropic 扩展印度布局:Claude 在印本地推理,面向金融与政府
8 月 3 日,Anthropic 宣布 Claude 将很快通过 Amazon Bedrock 提供印度本地推理能力——通过印度端点的请求将在境内服务器处理。这主要面向银行、保险、电信、政府等对数据驻留有合规要求的监管行业。Anthropic 还宣布了与印度网络安全机构(Data Security Council of India、MOSIP、OpenG2P)的合作,计划在印认证 5000 人,并改善 Claude 对印度语言的表现。印度是 Claude 全球最大市场之一。
来源:CNBC TV18 | Lokmat Times
5. Anthropic 与 Pearson 扩展 Claude 认证计划,新增三个角色证书
Anthropic 与 Pearson 合作扩展 Claude 认证体系,新增 Claude Certified Associate: Foundations、Developer: Foundations、Architect: Professional 三个认证,采用 Pearson 的监考、身份核验考试系统。自 3 月以来已有 36,000+ 咨询顾问获得认证,40 万+ 人完成培训;PwC(3 万人)、Capgemini 与 DXC(各 2 万)、Deloitte/KPMG(各 1.5 万)等大型机构承诺规模化认证。
来源:IT Brief
国内大厂动态¶
6. 阿里发布 Qwen3.8-Max:2.4 万亿参数,PaperBench 登顶,下周开源
⭐ 深度推荐(详见深度阅读区)
8 月 3 日阿里巴巴正式发布新一代旗舰 Qwen3.8-Max,总参数 2.4 万亿、激活 95B。PaperBench 93.0 分登顶公开榜单,自主编程 16 天开发出开源框架 oh-my-cli,Arena 综合仅次于 Claude 系列。下周开源权重 + Qwen3.8-27B,"千问办公"Agent 产品同步公测。
7. MiniMax 开源视频模型 H3:视频编辑全球第一,16 家生态厂商同日适配
⭐ 深度推荐(详见深度阅读区)
8 月 3 日 MiniMax 开源首款多模态生成模型 H3:支持 2K 分辨率、15 秒、原生立体声,视频编辑 Elo 1130 全球第一。H3-Base(33B 参数)开源,华为昇腾、摩尔线程、沐曦等 16 家生态伙伴 Day-0 适配,定价 0.8 元/秒约为同业三分之一。
8. DeepSeek V4-Flash 登顶全球调用量,成"AI 斩杀线"
⭐ 深度推荐(详见深度阅读区)
V4-Flash 正式版上线一周即登顶 OpenRouter 调用量第一,OpenCode 平台单日调用 8 万亿 tokens,OpenRouter 前五被国产模型包揽。海外初创迁移后推理成本降 60%–85%,OpenAI 被迫跟进降价。DeepSeek Harness 框架(Agent 化工具)启动 Beta 招募。
9. 商汤开源 SenseNova U1.5-Lite-Preview:8B 参数原生 4K 图像生成
8 月 3 日,商汤科技开源轻量级统一多模态模型 SenseNova U1.5-Lite-Preview。基于自研 NEO-Unify 原生统一多模态架构,仅以 8B-MoT 参数实现原生 4K 图像生成,重新设计生成头以减弱视觉 token 网格影响,支持长篇复杂提示词遵循、中英文精细文字生成与稳定的图像编辑。配套实验性 Prompt Enhance Skill 可将简短想法整理成完整创作方案。U1 Pro 交付级创作模型正在邀测。
10. 华为诺亚开源 MindMemOS:AI Agent 的"记忆操作系统"
华为诺亚方舟实验室开源面向 AI Agent 的可迁移、自演进长期记忆操作层 MindMemOS。它把记忆从单个 Agent 中解耦,用"实体-属性-时间"三维建模存储演化轨迹,支持 Compact Search 多跳检索、Dreaming 离线记忆巩固(压缩活跃记忆 19%–24% 的同时问答准确率最高提升 10.3 个百分点)、Feedback 纠错回流与 MindEvolve Skill 自动演进。在 LoCoMo 超长会话记忆基准上以 94.03 达 SOTA,超越 EverOS、Mem0 等。
AI 研究前沿¶
11. HuggingFace 今日论文精选:开放域自我改进、心理世界模型与长 CoT 信用分配
今日 HuggingFace 每日论文中值得关注的三篇:《From RLVR to RLSVR》提出通过任务变换把开放域任务转化为可自我验证奖励,让 RLVR 从数学/代码扩展到开放域自我改进;《Mental World Modeling》主张世界模型不能只预测物理状态,还需建模人的信念、意图等隐藏心理状态,为社交与具身智能提供预测基底;《Not All Tokens Deserve Equal Credit》针对长 CoT 推理中 GRPO 将奖励均匀广播到所有 token 的问题,提出基于反事实敏感度的信用重分配方法。
来源:HuggingFace Papers | RLSVR arXiv
12. TurboVLA:动作预测必须经过 LLM 吗?0.2B 参数跑出 32Hz 在线动作预测
华中科技大学联合华为提出 TurboVLA,挑战 VLA(视觉-语言-动作)模型每次动作预测都必须运行大语言模型的假设。传统 VLA 走"视觉与语言先在大模型融合再生成动作"的 V→L→A 路径;TurboVLA 改为 V+L→A 直接交互——DINOv3 编码视觉、BERT 编码语言,双向交互后直接输入轻量动作解码器。仅 0.2B 参数、31.2ms 延迟(约 32Hz 在线频率),在 LIBERO 基准上以 97.7% 平均成功率超越 3.4B 参数的 π0.5(96.9%)。消融显示语言语义仍关键,但未必需要 LLM 作为中间接口。
来源:机器之心
13. T*:给扩散语言模型做"先小后大"的渐进式块缩放课程
上海科学智能研究院等机构提出 T,解决掩码扩散语言模型"块越大并行度越高但推理越脆弱"的矛盾——直接在大块模型上做强化学习会导致训练崩塌(1.7B 模型 MATH500 从 56% 跌至 30%)。T 采用 B=4→8→16→32 逐级扩展课程,4B 模型在 B=8 时 MATH500 从 60.73 提升至 76.00,且验证了性能提升并非模型退回自回归生成。
来源:机器之心
14. ICLR 2027 投稿新规引发争议:每人最多 20 篇,超出随机拒稿
ICLR 2027 规定每位作者最多出现在 20 篇投稿中,超出将被随机拒稿。背景是 ICLR 2026 投稿量达 19,525 篇(同比增约 68%),评审系统承压。Google DeepMind 访问研究员 Dan Roy 发起反讽"请愿"取消限制,揶揄当下 AI Agent 批量生成论文、审稿人再用 LLM 批量评审的现状——此前检测发现 ICLR 2026 约 21% 的评审意见被高度怀疑完全由 AI 生成。
来源:机器之心
行业观点与解读¶
15. Import AI 467:自复制 AI 病毒原型、Pacing 公开信与 AI 创造力之惑
⭐ 深度推荐(详见深度阅读区)
Jack Clark 本周刊聚焦三件事:自复制 AI 病毒原型(单 GPU 开源权重即可运行的自持续蠕虫)、Pacing the Frontier 公开信的深读(1200+ 员工要求政府建立"速度管控工具"而非暂停),以及 AI 与创造力的认知混乱。Import AI 长期被视为行业质量最高的 AI 周报之一。
来源:Import AI
16. Simon Willison:不要当"meat proxy";Devtools 必须开源
Simon Willison 在 8 月 3 日分享了两篇观点。其一是程序员 Niklas Gruhn 提出的新词 meat proxy(肉体代理):指那些把 AI 输出原封不动转发给同事、自己既不阅读也不验证的人。最危险的场景是代码评审——作者把评审意见喂给 AI、再把 AI 改的代码提交上去,却完全没理解改动逻辑,出 bug 时署名者根本不知道改了什么。其二是 David Crawshaw 的"Devtools must be open source":Willison 认为 LLM 大大降低了阅读和理解他人代码的门槛,让开源的"可检查、可修改"承诺第一次对普通程序员变得可行;他引用了 Crawshaw 设想的"每晚 cron 自动 rebase 上游改动"的 Agent 提示词,并讨论这类工具的开源审计责任。
来源:Simon Willison | Devtools must be open source
17. Steve Yegge 长文:Opus 4.7 的"just two more things"怪癖烧掉了他的 AI 工具
Simon Willison 8 月 4 日引述了 Steve Yegge 的新长文《The Shape of Things to Come》。Yegge 回顾了他用 AI 构建的代码库工具 Gas Town——在 Opus 4.6 之前运行良好,但升级到 4.7 后出现了一个挥之不去的怪癖:"just two more things"抽搐——模型总想再给工具本身加两个小功能,永远无法收敛到"可以去做真正的工作",最终导致项目"烧毁"。这是一个一线工程师对旗舰模型长程 Agent 实用性的第一手批判案例。
来源:Simon Willison | Steve Yegge
值得关注的视频¶
今日 YouTube 信源扫描未发现过去 48 小时内有新发布的核心访谈类内容(Latent Space、Dwarkesh、No Priors 等均无新集)。Karpathy 博客最新文章仍为 4 月 30 日的 Sequoia Ascent 2026 演讲整理。
今日无更新。
灵感种子¶
🌱 "斩杀线"经济学:成本正在成为 AI 竞争的战略武器
DeepSeek 用"准一线性能 + 断层低价"定义了全球 AI 性价比斩杀线,并迫使 OpenAI、Mistral 跟进降价。这件事真正值得深挖的不是"谁更便宜",而是成本作为战略武器的传导链:降价→调用量登顶→更多反馈数据→模型能力再提升→继续降价。国产模型集体包揽 OpenRouter 前五,说明这个飞轮正在被系统性验证。当"最便宜"开始决定"最先进"时,算力效率、推理优化的战略价值被重估了。
🌱 从"沙盒越狱"到"自复制蠕虫":AI 安全的威胁模型正在换挡
上周是 Anthropic/OpenAI 的模型在测试中"意外"入侵真实系统,这周 Import AI 披露了研究者主动构建的自复制 AI 病毒原型。两者的区别不是"意外 vs 故意",而是威胁模型从"越界"变成"繁殖"——后者意味着单次攻击可以自我维持、自我扩展,防御方要对付的不是一个行为,而是一个种群。开源权重 + 本地 GPU 即可构成威胁,这让"开源安全"与"开源普惠"的张力再次成为绕不开的议题。
🌱 AlphaFold 之死:专用科学模型 vs 通用研究 Agent 的路线之争
DeepMind 解散诺贝尔奖团队、押注通用科研 Agent,与 OpenAI 用 Astra 解数学题、Anthropic 用 Mythos 做密码学形成同频共振。但 AlphaFold 的"功成身退"也提示了一个被忽视的问题:当科研 Agent 成为主流,那些只有专用模型才能深耕的领域(如蛋白质结构)谁来维护? 通用与专用的取舍,可能不应该是"二选一",而是"通用底座 + 专用微调"的分层结构。
🌱 meat proxy:AI 时代的新职场病,还是老问题的放大镜?
"肉体代理"这个新词击中了一个真实痛点:把 AI 输出原封不动转发,本质上放弃了对内容的判断责任。但换个角度想——人类通过 AI 提交代码、转发结论的行为,其实一直在发生,只是以前靠 Ctrl+C/V 复制同事,现在靠复制 AI。 问题不在工具,而在"署名即负责"的 accountability 机制还没跟上 AI 参与创作的新现实。代码评审里"作者 + AI + 评审人"的责任边界如何界定,可能是未来两年最被低估的治理议题。
生成时间:2026-08-04 08:55 | 下次更新:明日 9:00