AI 每日简报 | 2026-07-08¶
今日概览¶
今日主线由「模型可解释性」与「开源大规模 MoE」两条叙事牵引:Anthropic 用 Jacobian 方法在 Claude 内部找到一块类似全局工作空间的「J 空间」,业内讨论骤起;腾讯次日开源 295B 参数、21B 激活的 Hy3 MoE 模型,Apache 2.0 授权、256K 上下文,为国产开源阵营再添重量级选手。Anthropic 同期把 Claude Cowork 从桌面推向 Web/移动端,把 Fable 5 重新全球部署;国内一线则围绕具身智能视觉基模、Kimi K2.7 Code 高速版持续放量。
- 🧠 Anthropic 论文《全局工作空间》:Claude 内部长出可自省的「J-Space」
- 🚀 腾讯开源 Hy3:295B MoE,21B 激活,Apache 2.0
- 📱 Claude Cowork 扩展至 Web 与手机,Max 用户可跨设备接力
- 🤖 蚂蚁灵波开源首个「空间原生」具身视觉基模 LingBot-Depth 2.0
- 📊 HuggingFace 高票论文:OmniOpt 系统梳理 100+ 优化器谱系
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ Anthropic 发现 Claude 内部的「全局工作空间」(J-Space)¶
Anthropic 在 7 月 6 日发布论文《Verbalizable Representations Form a Global Workspace in Language Models》,用一种名为 J-lens(基于 Jacobian 矩阵)的分析方法,在 Claude 神经网络中定位到一小块「J-Space」——模型能在其中储存和操纵它可以自我报告、可推理、可主动引用的概念,与心理学「全局工作空间理论(GWT)」下的意识雏形高度相似。Anthropic 明确避开「意识」定性,但认为这是首次在前沿模型上以数学手段读取并可能塑造其私有内部状态的关键一步。量子位、Axios、VentureBeat、IBTimes 均有跟进解读。
核心观点:
- 把「可言说」当作坐标轴,用 Jacobian 反向识别哪部分内部激活能被模型主动调用,这是可解释性研究的一次结构性突破——不是找一个「意识神经元」,而是找到承载「可访问信息」的低维子空间。
- 这条路线让 AI 安全从「行为审计」走向「内部状态审计」:如果 J-Space 是可编辑的,那么欺骗、隐藏推理、伪装对齐都有了可测量的抓手。
来源:Anthropic 官方新闻页 · Axios 报道 · VentureBeat 解读 · 量子位中文报道
⭐ 腾讯开源 Hy3:295B MoE,21B 激活,Apache 2.0,256K 上下文¶
腾讯 Hunyuan 团队 7 月 6 日正式发布 Hy3——295B 总参、21B 激活参数、3.8B MTP 层的 MoE 模型,同步开源到 HuggingFace,采用 Apache 2.0 授权,无地域限制,OpenRouter 上 7 月 21 日之前免费开放。这是 4 月「Hy3 Preview」之后的正式版:官方称收集了 50+ 产品的反馈并放大后训练数据,幻觉率从 12.5% 降到 5.4%,常识错误从 25.4% 降到 12.7%,同时深度整合 Agent 能力。Simon Willison 在博客中把它列为「本月最值得本地跑的开源模型」。
核心观点:
- 21B 激活 + 256K 上下文 + Apache 2.0,是当前唯一可以放心自托管做全球商业产品的超大 MoE,比早期国产开源模型的地域约束更彻底。
- 「先发预览、再吸产品反馈、再放正式版」的节奏,正在成为中国头部大厂的开源标准动作(DeepSeek V4、Kimi K2、Hy3 皆遵循此路径)。
来源:MarkTechPost 详解 · Tencent 官方新闻稿 · HuggingFace 模型页 · Simon Willison 笔记
⭐ 苏剑林新文:让炼丹更科学一些(七)——步长调度与权重平均¶
苏剑林 7 月 6 日在「科学空间」发布系列新作,从理论上分析学习率调度(Warmup-Decay)与权重平均(如 Schedule-Free、EMA)的等价关系。他给出统一的收敛界,说明「在何种条件下权重平均可以替代 LR schedule」,并给出更严格的可替换边界。这是继 MoE 环游记、Muon 系列之后,Kimi K2 出品的又一篇高质量优化理论文章。
核心观点:
- Schedule-Free 之所以有效,本质是 SGD 收敛界中出现的「加权平均项」被外化到了权重空间;换句话说,LR 调度和权重平均是同一个数学问题的两种表述方式。
- 对工程师意味着:若 warmup-decay 已充分调好,再叠 EMA 收益边际递减;反之,用 EMA 可以省掉一部分调 LR 的成本。
来源:科学空间原文
OpenAI¶
- 澳大利亚支付平台 AP+ 用 ChatGPT + Codex 加速支付合规改造:Australian Payments Plus 部署 ChatGPT Enterprise 与 Codex,缩短交付时间、提高质量,同时保留人工审核。来源
- 日本 MUFG 迈向「AI 原生」组织:日本三菱 UFJ 金融集团用 ChatGPT Enterprise 改造工作流,规模化推出 AI 金融服务。两条均为客户案例,非模型/产品发布。来源
(本周官方博客尚无新模型或功能发布,主要围绕行业落地叙事。)
Google DeepMind / Gemini¶
- Gemini 3.5 Pro 再度延期至 7 月 17 日:Google 承认放弃 2.5 Pro 架构重构,聚焦数学推理、SVG 场景生成与图像质量,直接对标 GPT-5.6 和 Claude Fable 5。新模型据称配备 200 万 token 上下文与「Deep Think Reasoning Layer」。延期同时伴随高管流失——包括 Transformer 共同作者 Noam Shazeer 和诺奖得主 John Jumper 陆续加盟 OpenAI 和 Anthropic,市场单日抹去 Alphabet 约 2250 亿美元市值。BigGo Finance · The Agent Report
- Gemini 3.5 Flash 已上架:作为 Pro 延期前的过渡,Flash 版在编码、Agent 与长文档任务上号称超越了内部 3.1 Pro,是当下测试首选。Google Cloud 博客
- 机器之心速报:本周 DeepMind 新增 Gemini 3.1 Flash-Lite Image(Nano Banana 2 Lite)与 Gemini Omni Flash 视频模型,均已开放 API。量子位/机器之心汇总
Anthropic / Claude¶
- ⭐ 全局工作空间论文(详见深度阅读区):J-lens 与 J-Space 引发意识/可解释性大讨论。
- Claude Cowork 扩展到 Web 与移动端:Max 订阅用户可以在桌面发起任务、手机查看进度、跨设备接续输出。7 月 7 日 TechCrunch 报道,Anthropic 押注「编码 Agent 之外的更多办公场景」。TechCrunch
- Claude Fable 5 全球恢复部署,Mythos 5 面向美国部分组织重启:出口管制指令解除后,Anthropic 于 7 月 1 日起分阶段恢复访问,并叠加更严格的网络安全防护。Releasebot 汇总
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 / 阿里 / 腾讯 等
- 腾讯 Hy3 ⭐ 深度推荐(详见深度阅读区):国产阵营新的开源王牌。
- DeepSeek API 7 月 24 日下线旧模型:
deepseek-chat和deepseek-reasoner将于 7 月 24 日停用,用户须迁移至deepseek-v4-pro或deepseek-v4-flash。价格与上下文均有调整。DeepSeek 更新日志 - Kimi K2.7 Code 高速版上线:月之暗面 6 月 15 日推出 K2.7 Code 高速版,编码任务平均输出 ~180 tokens/s、峰值近 260 tokens/s,是标准版的约 6 倍。中关村在线
- 蚂蚁灵波开源「空间原生」具身视觉基模:LingBot-Depth 2.0 面向机器人视觉,主打「空间感知作为第一性输入」。量子位报道其在深度估计、跨场景泛化上均刷新 SOTA。量子位
- 阿里 Qwen Chat 大版本更新:7 月 11 日晚间即将上线,主打「登录首页直接开聊」+ 深度研究/图像生成/网页开发/深度思考/搜索多模块集成,新增桌面端并支持一键唤起 MCP。阿里云
- 字节豆包日调用量突破 180 万亿 tokens/日:6 月披露的数据显示较去年增长超 10 倍。同期 Doubao-Seed-2.1 Pro/Turbo 上线,主打 Coding 与 Agent。IT 之家
- DeepSeek 招聘小插曲:一名「华为天才少年」在社交平台吐槽 DeepSeek 招聘流程「面到最不专业的」,引发关于国内头部 AI 公司组织能力的讨论。量子位
- 理想具身创业团队破百台交付纪录:三名前理想员工创业的具身机器人公司创下最快百台交付纪录。量子位
AI 研究前沿¶
重要论文、技术突破(HuggingFace 每日高票榜)
- ⭐ OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers(arXiv 2607.04033,7/3,64 票):系统梳理 100+ 优化器,把每次更新抽象为「五阶段元流水线」下的结构化变换,并引入范数约束的线性最小化 oracle 作为共同语言。给出跨领域的基准测试指南,是想理解「AdamW vs Muon vs Shampoo vs Lion 到底不同在哪」的必读综述。链接
- ⭐ UI-MOPD: Multi-Platform On-Policy Distillation for Continual GUI Agent Learning(arXiv 2607.04425,7/4,62 票):提出 Uni-GUI 跨平台数据集 + 多教师 On-Policy 蒸馏方法,解决多平台 GUI Agent 训练中平台特有能力互相退化的问题。是「跨设备 Agent」这一年的技术底座之一。链接
- ResearchStudio-Reel & Idea 两篇姊妹作(arXiv 2607.04438/04439,7/4,48/40 票):从论文自动生成海报/视频/博客(Reel)+ 从会议录用记录反推「有依据的研究选题」(Idea),把「学术传播自动化」拆成一整套「Skill」组件。Reel · Idea
- PixWorld: Unifying 3D Scene Generation and Reconstruction in Pixel Space(arXiv 2607.05373,7/5,46 票):在像素空间同时做扩散生成与几何重建,绕开 VAE/RAE 潜空间导致的信息损失。链接
- OrbitQuant: Data-Agnostic Quantization for Diffusion Transformers(arXiv 2607.02461,7/1,33 票):为 DiT 提出无需重新校准的旋转基量化方案,是扩散模型端侧部署的关键工程进展。链接
- GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation(arXiv 2607.02642,7/1,31 票):系统研究「用世界模型替代真实世界评估机器人策略」的可行性,指出长时序一致性和机器人可控性比视觉真实感更重要。链接
行业观点与解读¶
- ⭐ 苏剑林《步长调度与权重平均》(详见深度阅读区):优化器理论的最新一课。
- Simon Willison 发布 sqlite-utils 4.0,含 schema 迁移:Django 联合创始人的经典 CLI 工具时隔 5 年做出第一个 major 版本升级,主要引入 database schema migrations,同时把 3.x 的部分行为设为破坏性升级。他在博文中详细披露了升级过程中依赖 Claude Fable 做代码审查的细节。博客
- Simon Willison 试玩 GPT-5.5 生成的 Web Component:用一条 prompt 让 GPT-5.5 生成
<github-code>Web Component 用于嵌入 GitHub 代码片段,作为 Vibe Coding 的实际范例。链接 - Ethan Mollick《The twilight of the chatbots》(6/30 发布,但本周持续被引用):论证「聊天机器人时代正在落幕」——AI 的核心形态正在从「问答窗口」变成「多小时自主 Agent + 生成式界面」,工作流会沿着指数级增长的能力曲线被反复重构。链接
- AI Daily Brief 7/6 期:Alex Karp 谈前沿开源权重的地缘政治学、Nvidia 力挺 Neocloud、Tesla 削减 token 支出。核心观点:AI 正在制造「单人千万美元公司」的黄金年代。Apple Podcasts
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。
- The AI Daily Brief(7/5)| The Job Positions of the AI Future:NLW 提出未来的 Agentic 工作原型——prototyper / builder / sweeper / grower / maintainer,强调「成为你所在职能的 maker」。适合任何想给自己重新定位的 IC。Apple Podcasts
- Latent Space Ep. 212(7/1)| 71 分钟:本周唯一新增 AI Engineer 深度访谈。原播客页尚未同步节目单,等待更新。官方博客
(其他常扫播客本 24 小时内无新集,或仍在处理中。中文播客 AI Next、十字路口、B 站 AI 日报本轮未捕捉到新集。)
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
从「行为审计」到「内部状态审计」:Anthropic 的 J-Space 让「AI 内心世界」第一次有了数学坐标。想一想——如果每一个前沿模型都要被要求「披露自己的 J-Space 布局」,AI 安全评估体系将会被彻底重画:不再是问模型 100 道对齐问题,而是直接读它的 Jacobian。是不是也意味着「AI 心理学」会从哲学问题变成一门可以做实验的学科?
开源 MoE 的新常态:预览-反馈-正式版:Hy3 的发布节奏(4 月 Preview → 收集 50+ 产品反馈 → 7 月正式版)越来越像成熟软件公司的产品迭代,而不是学术论文。DeepSeek、Kimi、Hy3 都在这么做。国产开源正在从「一次性放模型」转向「持续经营开源资产」,这套 SOP 或许才是中国 AI 供应链真正的护城河。
「跨设备 Agent」而非「跨设备 App」:Claude Cowork 从桌面推到 Web 和手机的意义,不是加了个 App,而是让「任务本身」变成可跨设备迁移的第一公民。想象未来的操作系统单位不是应用,而是「未完成的 Agent 任务」——从 Notion 的文档到 Cursor 的代码库,跨端同步的是状态而非界面。这条路线的赢家可能不是今天最会做 App 的公司。
炼丹越来越像应用数学:苏剑林把学习率调度与权重平均在数学上等价化,是「深度学习工程」正在被理论收敛的又一个信号。它的隐含结论是——很多我们以为的经验参数,其实是同一个数学结构的不同表面。工程师能不能开始少调参、多推公式?如果能,AI 工程可能会像 EE 一样,从「玄学」走向「教科书」。
生成时间:2026-07-08 09:05 | 下次更新:明日 9:00