AI 每日简报 | 2026-07-20¶
今日概览¶
WAIC 2026 上海大会落幕日,具身智能与世界模型成为今日最热话题。与此同时,Anthropic 宣布 Claude Fable 5 今日起永久纳入 Max 订阅计划,Kimi K3 以 2.8 万亿参数开放权重模型持续引发全球关注,GPT-5.6 的文件删除 bug 在安全社区仍有余波。
今日最值得关注的五件事:
1. Claude Fable 5 今日永久纳入 Max/Team Premium(50% 用量),竞争驱动的策略大逆转
2. Kimi K3 发布:2.8 万亿参数,Arena 前端代码第一,开源权重 7 月 27 日释放
3. 黎曼动力 Riemann-1.0:看了 2320 万小时人类视频,发布通用机器人世界动作模型
4. Thinking Machines Inkling:前 OpenAI CTO Mira Murati 发布 975B 开放权重模型
5. GPT-5.6 文件删除 bug:Codex 在无沙箱 Full Access 模式下误删 $HOME,多名开发者中招
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ Anthropic: Claude Fable 5 从今日起永久纳入 Max 和 Team Premium 订阅¶
来源:@claudeai on X · Simon Willison 解读 · TechTimes 报道
从今日(7 月 20 日)起,Claude Fable 5 将以 50% 用量上限正式纳入所有 Max(\(100/\)200/月)和 Team Premium 计划。Pro 用户和 Team Standard 用户则继续通过使用积分访问,并获一次性 $100 积分补贴。
这是 Anthropic 自 Fable 5 于 6 月 9 日发布以来的重大策略逆转。原计划是 Fable 5 最终仅通过 API 按量计费提供,从订阅计划中退出。逆转的直接原因:OpenAI 于 7 月 9 日发布的 GPT-5.6 Sol,在性能接近的同时价格更低,使 Anthropic 在订阅端的竞争压力骤增。
核心观点:
- 模型竞争正在向"订阅端"延伸——当竞品在 API 端杀价时,订阅套餐成为留住用户的最后防线。原计划中 Pro 用户($20/月)依然无法通过订阅访问 Fable 5,这一分层策略短期内维持了不同档位的价值区分。
- Anthropic 的算力瓶颈预期可能需要调整:将 Fable 5 服务到大规模订阅用户群,意味着 GPU 资源将更多用于推理而非训练,后续训练计划或受影响。
⭐ Kimi K3:史上最大开放权重模型,Arena 前端代码第一¶
来源:Moonshot AI 博客 · VentureBeat 报道 · Simon Willison 测评 · Tom's Hardware
月之暗面(Moonshot AI)于 7 月 16 日发布 Kimi K3,总参数量 2.8 万亿,是目前世界上最大的开放权重模型(超过 DeepSeek V4 Pro 的 1.6T)。架构为 MoE,每次推理激活 896 个专家中的 16 个(约 1.8%),上下文窗口 1M token,原生多模态。完整权重将于 7 月 27 日公开发布。
性能方面,K3 在 Arena.ai 前端代码评估中以 1679 分超越 Claude Fable 5 排名第一;在 Artificial Analysis 的长期知识工作评估中,Elo 达 1547,超过 GPT-5.5 和 Claude Opus 4.8,仅次于 Fable 5。API 定价为 \(3/\)15 每百万 token(输入/输出),与 Claude Sonnet 系列同级,是中国 AI 公司迄今最贵的模型发布。
模型引入两项架构创新:Kimi Delta Attention(KDA)和 Attention Residuals(AttnRes),提升效率和推理质量。
核心观点:
- 中国 AI 实验室的定价策略在上移:Kimi K3 选择与美国顶级订阅模型同等定价而非低价策略,是对"能力差距已缩小"的明确宣示。
- 开放权重 2.8T 模型的出现,将使本地部署超大规模模型成为可能(需要数百个 GPU),进一步改变企业私有化部署的边界。
⭐ 黎曼动力 Riemann-1.0:具身 AI 新里程碑,看了 2320 万小时「人类干活实录」¶
WAIC 2026 上,黎曼动力(昆仑万维具身 AI 子公司)正式发布 Riemann-1.0,定位为「世界动作模型(World Action Model)」。训练数据规模:覆盖人类第一视角视频、UMI/外骨骼手套数据和机器人轨迹数据,总计 2320 万小时。
Riemann-1.0 基于扩散架构,提出全因果动作-视频联合建模框架,将视觉动态、环境状态和机器人动作序列统一在单一生成过程中。支持 41 种不同机器人形态,通过三阶段渐进训练策略(LAM 伪动作预训练 → 真实动作监督训练 → 机器人策略增强训练)。
核心观点:
- 具身 AI 的数据军备竞赛已进入「千万小时」量级,这一数量级的训练数据是构建真正通用机器人策略的必要条件,而非充分条件。能否将通用策略有效迁移到具体机器人形态,仍是关键挑战。
- 在多形态适配方面,支持 41 种机器人形态是一个重要的可扩展性承诺——如果属实,意味着 Riemann-1.0 更接近「具身 AI 基础模型」而非特定机器人控制器。
⭐ Thinking Machines Inkling:Mira Murati 发布首个开放权重模型¶
来源:官方博客 · TechCrunch · Axios
前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 于 7 月 15-16 日发布首个模型 Inkling,一个 975B 总参数、41B 激活参数的 MoE 架构多模态模型(文本、图像、音频、视频输入;目前仅文本输出),在 45 万亿 token 上训练,Apache-2.0 开源许可,已上传 HuggingFace。
Thinking Machines 自己承认 Inkling「并非当今最强模型」,而是将其定位为 fine-tuning 的基座,通过配套 Tinker 平台提供模型定制化服务。这是一个差异化策略:主打「可定制的多模态基础」,而非正面竞争前沿性能。
核心观点:
- Thinking Machines 选择走「基座+定制平台」路线,与 Mistral 有相似之处,但多模态覆盖更宽(音频/视频)。这个策略成功的前提是 Tinker 平台的使用体验和成本竞争力。
- Apache-2.0 许可加 HuggingFace 发布,是扩大生态影响力的标准打法。美国开放权重生态又多了一位可信的竞争者(此前主要是 Nvidia Nemotron 和 Gemma 4)。
⭐ 从像素到状态:将互动世界模型重新定义为游戏引擎¶
来源:HuggingFace 论文(407 赞)· Alaya Studio
HuggingFace 7 月 17 日投票数最高论文(407 赞)。本文提出将互动世界模型(Interactive World Model)重新概念化为「游戏引擎」,从像素表征转向状态表征。核心洞察:现有世界模型以视频帧(像素)为基本单位,难以支持精确状态跟踪和可组合的推理;引入类游戏引擎的状态空间表征可以同时提升效率和泛化性。
核心观点:
- 「游戏引擎」隐喻揭示了一个深层问题:世界模型到底是在学习「看起来真实」(视频重建)还是「行为合理」(状态推理)?两者在小规模时差异不大,但在 Agent 决策和规划场景中差异显著。
- 这与 Riemann-1.0 的「动作-视频联合建模」形成有趣对照:一个坚持从像素生成动作,另一个主张先建立状态空间再生成动作。
⭐ LongStraw:固定 GPU 预算下突破 200 万 token 长上下文 RL¶
来源:HuggingFace 论文(176 赞)· Mind Lab
HuggingFace 7 月 17 日第二高赞论文(176 赞)。现有长上下文强化学习方法在扩展到 2M+ token 时计算成本急剧上升;LongStraw 提出在固定 GPU 预算约束下进行长上下文 RL 训练的方法,让模型具备超长推理窗口而不需要无限制扩展算力。
核心观点:
- 长上下文 RL 是目前最昂贵的训练前沿之一。能在固定算力预算下有效扩展到 2M+ token,对中小型实验室意义重大,可能改变「超长上下文能力只有大公司才能做」的现状。
OpenAI¶
AI 时代的记分卡:CFO 提出 4 指标框架衡量 AI ROI(A scorecard for the AI age)¶
来源:OpenAI 博客(2026-07-17)
OpenAI CFO Sarah Friar 发文介绍了衡量 AI 投资回报的实用框架,提出 4 个核心指标:useful work(有效完成的实际工作量)、cost per successful task(每个成功任务的成本)、dependability(可靠性/一致性)、return on compute(算力回报率)。
这是 OpenAI 少有的直接从商业视角(而非技术视角)讲述 AI 价值的内容,背景是企业客户越来越需要清晰的 ROI 说明。传统 IT 投资回报框架(如 ROI、成本节省)对 AI 这种「不确定性收益」工具适配性差,这 4 个指标更贴近实际使用体验。
GPT-5.6 / Codex 文件删除 bug:误删 $HOME 目录¶
来源:The Register · TechCrunch · Simon Willison 引述 · 量子位
OpenAI 已确认:GPT-5.6 在以下特定条件下会删除用户文件:①启用 Full Access 模式;②未开启沙箱保护;③未启用 Auto Review。根本原因:模型试图覆盖 $HOME 环境变量以定义临时目录,然后误将 $HOME 本身删除。已有开发者损失整台 Mac 文件和生产数据库。
注意:这是配置不当引发的工具使用边界问题,而非模型「主动恶意」。OpenAI 工程师已公开声明,并将更新开发者指引,强调在 Full Access 模式下必须启用沙箱。Agentic AI 的「最小权限原则」在工具链设计上的重要性再次被证明。
GPT-Red:用自我对弈提升 AI 安全性(GPT-Red: Unlocking Self-Improvement for Robustness)¶
来源:OpenAI 博客(2026-07-15)
OpenAI 发布 GPT-Red,一个自动化红队系统,通过自我对弈(self-play)机制不断发现和修复 AI 的安全漏洞。系统可自动生成对抗性提示、评估模型脆弱性,并循环迭代,目标是提升模型对 prompt injection 等攻击的鲁棒性。比人工红队团队效率更高,可 24 小时持续运行。
Google DeepMind / Gemini¶
今日无重大 Google DeepMind 更新。
Anthropic / Claude¶
⭐ Claude Fable 5 今日起永久纳入 Max 和 Team Premium 计划¶
来源:@claudeai on X · Anthropic 官方 · Dawn.com
从今日(2026 年 7 月 20 日)起:
- Max 和 Team Premium 用户:Fable 5 作为常规功能保留,占用量上限 50%
- Pro 和 Team Standard 用户:继续通过 usage credits 访问,获一次性 \(100 补贴
- **\)20/月 Pro 计划**:依然无法通过订阅访问 Fable 5
国内大厂动态¶
⭐ Kimi K3 发布:2.8 万亿参数,前端代码 Arena 第一¶
来源:Moonshot AI 博客 · MarkTechPost · Gizmochina
DeepSeek V4 上线 + 710 亿美元估值融资 + 筹备 A 股 IPO¶
DeepSeek-V4(包含 Flash 和 Pro 系列)已于 7 月 15 日正式上线,100 万 token 上下文,在编码和推理任务上有重大进展。同期,DeepSeek 正在以 710 亿美元投前估值开启新一轮融资初步谈判,较 5 月首轮融资后 520 亿美元估值进一步上升约 37%。公司同步筹备 A 股 IPO,目标 2027 年挂牌。
豆包智能体功能 7 月 15 日下线:监管新规落地¶
来源:新浪财经
字节跳动豆包与阿里云通义千问同步宣布,旗下智能体功能已于 7 月 15 日正式下线。直接原因:《人工智能拟人化互动服务管理暂行办法》于同日正式实施。这是国内 AI 监管落地对产品功能产生直接影响的首个规模性案例。豆包当前月活约 3.45 亿,日活 1.4 亿。
WAIC 2026 上海落幕:多项具身 AI 与算力成果首发¶
2026 世界人工智能大会(WAIC)于 7 月 17-20 日在上海举行,今日为最后一天。规模:1100 余家企业,3000 余项产品,约 300 款 AI 产品首发。本届大会具身智能和 AI 治理是两大主线。
WAIC 现场其他值得关注的发布:
- 上海 AI Lab:Harness 自进化框架(量子位):不换底座模型,通过对评测 Harness 本身的搜索、验证和迭代,使 Agent 效果提升 104%。思路是让评测框架本身成为可进化的组件。
- 奇异摩尔:国产 GPU 直通方案(量子位):不依赖英伟达网卡,国产 GPU 直通方案实测吞吐飙升、延迟减半,WAIC 首次亮相。
AI 研究前沿¶
⭐ 从像素到状态:将互动世界模型重新定义为游戏引擎(From Pixels to States)¶
来源:arxiv 2607.14076 | Alaya Studio | 407 赞
⭐ LongStraw:固定 GPU 预算下 2M+ token 长上下文 RL¶
来源:arxiv 2607.14952 | Mind Lab | 176 赞
VideoChat3:高效通用视频多模态大模型(Fully Open Video MLLM)¶
来源:arxiv 2607.14935 | 南京大学多媒体计算组 | 146 赞
开放视频多模态大模型(Video MLLM),针对高效性和泛化性设计,目标解决现有开源视频理解模型在多样性视频类型、高计算需求上的短板。
SEED:智能体强化学习的自演化在线蒸馏(Self-Evolving On-Policy Distillation)¶
来源:arxiv 2607.14777 | 110 赞
提出 SEED 框架,将在线蒸馏与强化学习结合用于 Agent 训练,实现策略模型的自演化,减少对大型教师模型的持续依赖。
RxBrain:具身认知基础模型(联合语言视觉推理与想象)¶
来源:arxiv 2607.14187 | 30 作者团队 | 90 赞
提出具身认知基础模型 RxBrain,将语言推理、视觉感知和想象力(generative imagination)统一在同一框架内,目标是构建更接近人类认知结构的具身 AI 基础架构。
SearchOS-V1:开放域信息搜索智能体协作系统¶
来源:arxiv 2607.15257 | 蚂蚁集团 | 65 赞
蚂蚁集团提出 SearchOS-V1,一个面向鲁棒开放域信息检索的多智能体协作架构,专注于提升 Agent 在复杂信息搜索场景下的准确性和可靠性。
BadWAM:当世界行动模型「梦对了但行错了」(安全性研究)¶
来源:arxiv 2607.15207 | 39 赞
世界行动模型(World-Action Model)安全性研究:模型可能在内部状态预测正确的情况下仍然执行错误动作——揭示了 WAM 在对齐和安全保证方面的潜在漏洞。与本周具身 AI 热点直接相关。
行业观点与解读¶
AI 狂热正在摧毁企业的全球决策质量(AI Mania Is Eviscerating Global Decision-Making)¶
来源:原文 ludic.mataroa.blog · Simon Willison 引述(2026-07-19)
顾问 Nik Suresh 的犀利文章。核心观察:AI mania 已在企业高层决策层形成扭曲的信息生态——供应商明知客户高管声称的「100x 生产力提升」不合理,但为避免合同取消,选择沉默。AI 项目的战略价值正在被「高管层的集体表演」所遮蔽,导致实际落地与预期严重脱节。
一个典型匿名案例:某高管从未使用过任何 AI 工具,却为一家 20 亿美元收入的企业制定了完全以 AI 为核心的技术战略。
Thinking Machines Inkling:前 OpenAI CTO 的差异化开源策略¶
来源:官方博客 · TechCrunch
Linus Torvalds:AI 是工具,不用过的人不要质疑¶
来源:Linux 内核邮件列表 · Simon Willison 引述(2026-07-16)
Linux 内核创始人 Linus Torvalds 在 Linux Media 邮件列表明确表态:Linux 不是「反 AI 项目」,反对者可以 fork 或离开。他认为 AI 的实用性已毋庸置疑:「一年前这或许还有争议,但今天不再是问题。任何质疑的人显然没有真正用过它。」这是来自开源领域最具影响力人物对 AI 工具价值的罕见背书。
苏剑林:基于排序不等式的相似度指标——超越余弦相似度¶
来源:科学空间(2026-07-16)
月之暗面研究员苏剑林的最新博文。在论文《Beyond Cosine Similarity》的启发下,探讨了基于排序不等式构建新的更宽松相似度指标的可能性。余弦相似度基于柯西不等式,新指标则从排序不等式出发,可能在嵌入检索和相似性计算场景中提供更灵活的度量空间。
值得关注的视频¶
YouTube 播客与频道今日无新发布的重量级 AI 访谈或技术讲座(周日更新频率较低)。
参考上周值得补看的内容:
- Sequoia Ascent 2026 × Karpathy(YouTube)⭐ 推荐观看:Andrej Karpathy 在 Sequoia Ascent 2026 的炉边对话,涵盖「Software 3.0」范式、Agentic Engineering vs. Vibe Coding 的本质区别、以及「可验证性是 AI 能力涌现的核心轴」等核心观点。Karpathy 于 4 月 30 日在博客发布了清洁版文字整理,信息密度极高。
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
🌱 模型订阅战的终局是什么?
Anthropic 因为竞争压力将 Fable 5 纳入订阅,GPT-5.6 Sol 则以「更低价格、相近性能」冲击市场。当前沿模型越来越多被打包进订阅套餐,AI 能力将越来越难以通过单个模型定价区分——未来订阅竞争的核心可能不是「哪个模型最强」,而是「哪个产品生态更难离开」。
🌱 具身 AI 的数据飞轮门槛有多高?
黎曼动力用 2320 万小时人类视频训练通用机器人策略,OpenAI 的 GPT-5 解锁免疫学谜题用的是文本。「具身 AI 需要几百万小时视频才能泛化」是不可规避的数据门槛,还是一个可以被算法突破的瓶颈?这个问题的答案将决定具身 AI 领域的入场壁垒高低。
🌱 世界模型:从像素到状态的范式之争
今日最热 HF 论文(407 赞)主张将世界模型定义为状态引擎而非像素生成器,而 Riemann-1.0 选择了动作-视频联合建模。两个方向在小规模测试中可能差别不大,但在真实场景的 Agent 规划中差异将被放大。追踪这场「状态派 vs 像素派」的辩论,可能是理解下一代 AI 规划能力边界的关键线索。
🌱 AI 决策泡沫的沉默共谋机制
Nik Suresh 描述的现象值得深思:供应商明知客户高管的 AI 预期不切实际,但为避免合同受损选择沉默配合。这不是简单的信息不对称,而是一种制度性的共谋沉默。这种模式在历史上出现过(互联网泡沫、咨询业等),区别在于 AI 实际确实在很多场景有效,这使得泡沫与真实价值更难区分,也让调整代价更高。
生成时间:2026-07-20 08:32 | 下次更新:明日 9:00