AI 每日简报 | 2026-07-01¶
今日概览¶
Anthropic 迎来「解禁 + 上新」的大日子:Fable 5/Mythos 5 出口管制全面解除的同时,一口气发布 Claude Sonnet 5 和全新科研产品 Claude Science。国内战场则是钱和定价的较量——Kimi 估值跳增至 315 亿美元,DeepSeek V4 正式版曝光峰谷定价机制。
- Anthropic 单日三连发:Sonnet 5 上线 + Fable 5/Mythos 5 出口管制解除 + Claude Science 科研工作台发布
- DeepSeek V4 正式版定价机制曝光:引入峰谷定价,高峰时段价格翻倍
- 月之暗面 Kimi 新一轮融资将至,估值跳增至 315 亿美元,ARR 突破 3 亿美元
- OpenAI 发布 ChatGPT 全球采用数据报告与 GeneBench-Pro 生物学基准
- Google 发布 Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image),主打速度与低成本
- NVIDIA ENPIRE 让编程 Agent 的「写代码-测试-修复」范式搬进物理机器人训练
深度阅读推荐¶
⭐ Anthropic 单日三连发:Sonnet 5 上线、出口管制解除、Claude Science 发布¶
6 月 30 日对 Anthropic 是密集的一天。美国商务部正式解除对 Claude Fable 5 和 Mythos 5 的出口管制令——这两款模型 6 月 9 日发布后仅三天就因政府认定存在国家安全风险(第三方发现越狱漏洞)被迫全球下线,如今访问权限将从当天起逐步恢复。与此同时,Anthropic 发布了新的 Sonnet 级模型 Claude Sonnet 5:性能接近 Opus 4.8,但价格更低(标准定价 \(3/\)15 每百万 token,8 月 31 日前优惠至 \(2/\)10),并且系统卡明确说明其网络安全能力刻意保持在较低水平,安全防护标准与 Opus 4.7/4.8 相当而非对标高风险的 Mythos 5——这被外界解读为 Anthropic 主动为新模型避开政府审批门槛的策略。同日还发布了 Claude Science,一款面向科研(尤其是生物、化学、药物研发)的工作台产品,整合了 60 多个科学数据库,但官方特别强调这「不是新模型」,跑的还是现有 Claude Opus 4.8,价值在于工作流整合而非模型能力本身。
核心观点:Anthropic 这一天的动作是一次精心编排的组合拳——用「克制」(Sonnet 5 主动限制网络能力)换取政府解禁,同时用新产品线(Claude Science)开辟不受出口管制直接影响的科研市场。当前沿模型的访问权限越来越取决于政府审批,"选择性弱化模型能力以换取合规"可能成为未来 AI 公司的常规操作,而不再是例外。
来源:Anthropic 官方公告 | Sonnet 5 系统卡 | CNBC:出口管制解除 | Claude Science 官方公告 | TechCrunch:Claude Science 分析
⭐ DeepSeek V4 正式版定价机制曝光:引入峰谷定价,高峰时段翻倍¶
DeepSeek 官宣 V4 正式版将于 7 月中旬上线,并首次为大模型 API 引入「峰谷定价」机制:每日 9:00-12:00 和 14:00-18:00 为高峰时段,价格较平时翻倍。以 V4-Pro 为例,输入价格(缓存未命中)平时 3 元/百万 token,高峰时段涨至 6 元;V4-Flash 平时输出 2 元/百万 token,高峰涨至 4 元。DeepSeek 表示涨价目的是「更合理配置资源、提升服务稳定性」,价格调整前会提前 24 小时邮件通知用户。
核心观点:这是国产大模型 API 首次系统性引入分时定价,本质是把电力/云计算的资源调度逻辑搬到了模型推理上——说明头部厂商的算力已经紧张到需要用价格杠杆来削峰填谷。如果这一模式被其他厂商效仿,开发者未来做成本工程时,「错峰调用」可能会成为架构设计的标配考量。
⭐ 月之暗面 Kimi 估值跳增至 315 亿美元,ARR 破 3 亿美元¶
6 月 30 日消息,月之暗面上一轮 200 亿美元估值的融资已完成交割,新一轮融资已启动,投前估值涨至 315 亿美元。商业化数据同样亮眼:继 3 月 ARR 破 1 亿美元、5 月破 2 亿美元后,6 月中旬 ARR 已突破 3 亿美元。API 收入占比超七成且持续提升,海外付费用户和 API 收入均增长 400%,产品已进入 200 多个国家和地区。
核心观点:Kimi 半年内估值从不到百亿美元跳增至 315 亿美元,融资节奏明显加快,与 DeepSeek 近期完成超 510 亿元融资的动作形成呼应——中国头部大模型公司正在进入「囤弹药」阶段,为即将到来的更激烈的模型竞赛和算力军备做准备。ARR 增长曲线(1亿→2亿→3亿美元,间隔均为约一个月)显示其商业化正处于加速期,而非线性增长。
⭐ NVIDIA ENPIRE:把「编程 Agent 范式」搬进物理机器人训练¶
NVIDIA 研究团队发布 ENPIRE,一套让物理机器人像编程 Agent 一样自主完成「尝试-验证-改进」闭环的框架。系统包含环境重置与验证模块、策略改进模块、多机并行执行模块和「进化」模块(由编程 Agent 分析日志、查阅文献、改进训练代码)。在 PushT、整理大头针、用剪线钳剪扎带等任务上,前沿编程 Agent(GPT-5.5/Codex、Opus 4.7/Claude Code)驱动的机器人成功率可达 99%,且多机协作(如 8 台机器人并行)比单机更快找到更优解。目前瓶颈在于机器人数量扩大后,编程 Agent 读日志、写代码、调试的时间无法很好地与物理执行并行。
核心观点:ENPIRE 的关键不是机器人硬件突破,而是把"可验证、可重置"这套让编程 Agent 突飞猛进的强化学习范式,成功复制到了物理世界任务上。这提示具身智能规模化的路径未必是砸更多算力和数据,而是找到更多"有经济价值但尚未被充分验证"的物理任务场景——这与 Karpathy 提出的"可验证性决定 AI 能力上限"的框架高度吻合。
来源:NVIDIA 研究页面 | arXiv 论文 | Import AI 463
OpenAI¶
ChatGPT 全球采用数据报告¶
OpenAI 发布最新 Signals 数据,展示 ChatGPT 采用率在全球范围内持续增长——用户使用频率提升、探索更多功能,且在不同地区和语言间的增长趋势各异。
来源:OpenAI 博客
GeneBench-Pro:面向基因组学的新基准¶
OpenAI 推出 GeneBench-Pro,一个使用真实复杂数据集测试 AI 在基因组学、生物学和科研任务表现的新基准,并同步发布了配套案例研究。
用大规模 Core Dump 分析揪出 18 年历史的老 bug¶
OpenAI 工程团队分享了如何通过大规模 core dump 分析排查罕见的基础设施崩溃问题,最终发现了一个硬件故障和一个存在 18 年之久的软件 bug。
来源:OpenAI 博客
Google DeepMind / Gemini¶
Nano Banana 2 Lite(Gemini 3.1 Flash Lite Image)发布¶
Google 发布 Nano Banana 2 Lite,即 Gemini 3.1 Flash Lite Image(API 中为 gemini-3.1-flash-lite-image),定位为「最快最便宜」的 Gemini 图像模型,主打速度和规模化调用。Simon Willison 实测认为图像质量优于此前的 Nano Banana 系列,但仍存在文字拼写错误的问题。
来源:Google DeepMind | Simon Willison 实测
Anthropic / Claude¶
Claude Sonnet 5 正式发布¶
详见深度阅读区,Sonnet 5 是当前最擅长自主执行任务的 Sonnet 级模型,性能对标 Opus 4.8。值得注意的是新版分词器(tokenizer)导致相同英文文本的 token 数增加约 30%-42%,相当于变相涨价;而中文文本的 token 数几乎不受影响。⭐ 深度推荐(详见深度阅读区)
来源:Anthropic 官方公告 | Claude 开发者文档:新特性说明
Fable 5 / Mythos 5 出口管制全面解除¶
美国商务部正式解除对 Claude Fable 5 和 Mythos 5 的出口管制令,Anthropic 宣布将从即日起逐步恢复访问权限。⭐ 深度推荐(详见深度阅读区)
来源:Anthropic 官方推文(经 Simon Willison 转引) | CNBC
Claude Science 科研工作台上线¶
面向科研人员和药物研发场景的新产品,整合 60 多个科学数据库,可自动化蛋白质结构预测等生物化学任务。目前处于 Beta 阶段,向 Pro/Max/Team/Enterprise 用户开放,并提供最高 50 个「Claude Science 项目」名额和最高 3 万美元额度支持,申请截止 7 月 15 日。⭐ 深度推荐(详见深度阅读区)
国内大厂动态¶
DeepSeek:V4 正式版峰谷定价机制曝光¶
详见深度阅读区。7 月中旬上线的 V4 正式版将首次引入分时段定价,高峰时段(9-12点、14-18点)价格翻倍。⭐ 深度推荐(详见深度阅读区)
月之暗面/Kimi:估值跳增至 315 亿美元¶
详见深度阅读区。新一轮融资启动,ARR 一个月内从 2 亿美元冲上 3 亿美元。⭐ 深度推荐(详见深度阅读区)
来源:新浪财经
豆包/字节:付费订阅体系落地¶
豆包已启动付费订阅模式,推出标准版(68 元/月)、加强版(200 元/月)、专业版(500 元/月)三档方案,基础聊天仍免费,付费点集中在 PPT 生成、数据分析、视频制作等高算力场景。豆包月活跃用户已达 3.45 亿,为国内 AI 应用月活之首。
来源:极客时间 AI 前线
智谱:GLM-5.3 面向全球征集意见¶
智谱首席科学家唐杰就下一代 GLM-5.3 的方向向全球用户公开征集意见,评论区呼声集中在「视觉能力」方向。此前 GLM-5.2(754B/A40B,MIT 协议)已开源登顶开源模型榜首。
来源:量子位
阿里千问、MiniMax:今日无重大更新¶
Qwen3.7 系列(5 月发布)和 MiniMax 海螺 AI 近期无新的重大动态,维持此前已披露的产品和融资进展。
AI 研究前沿¶
NVIDIA ENPIRE:具身智能的自我改进闭环¶
详见深度阅读区。⭐ 深度推荐(详见深度阅读区)
来源:NVIDIA 研究页面 | arXiv
腾讯 ARGUS:万卡级 GPU 集群的生产级追踪系统¶
腾讯公开了 ARGUS,一套低开销、细粒度、常驻运行的大规模训练追踪与实时分析系统,已在超过 1 万张 GPU 的生产集群上稳定运行 6 个多月,涵盖 4096 卡视频语言模型训练、512 卡音频模型训练和 12960 卡 MoE 训练等场景,用于诊断算力掉队、通信链路退化、流水线气泡放大等问题。
来源:Import AI 463 | arXiv
苏剑林(科学空间):今日无更新¶
最新文章仍为 6 月 25 日发布的《矩阵函数近似中的暴力美学》,已在此前简报中介绍,暂无新文章。
来源:科学空间
行业观点与解读¶
Simon Willison:Sonnet 5 新分词器实测——英文变相涨价 30%-42%¶
Simon Willison 用自己的 Claude Token Counter 工具实测发现,Sonnet 5 的新分词器让同样的英文文本消耗的 token 数比 Sonnet 4.6 多出约 42%(《世界人权宣言》英文版),Python 代码多出约 27%-28%,而简体中文文本的 token 数几乎不受影响(仅增加约 1%)。按官方标称价格计算,这相当于英文用户被变相涨价了 30% 以上,补充说明了上方 Sonnet 5 深度报道中提到的分词器变化。
Fernando Borretti:《没有人能逃脱永久底层阶级》¶
科幻作家 Fernando Borretti 撰写了一篇对 AI 事业的悲观批判,探讨超级智能可能导致人类整体丧失自主权的逻辑链条:经济活动完全由 AI/机器人完成后,人类决策权将被架空成「礼仪性」角色,且在国家间的生存竞争压力下,"减少人类参与决策"本身会成为一种军备竞赛式的优势,而非选择。Jack Clark 在 Import AI 463 中重点转引了这篇文章。
来源:Fernando Borretti 博客 | Import AI 463
Jack Clark:人类一直很不擅长预测技术的影响¶
Import AI 463 引用犹他大学法学教授 Matthew Tokson 的论文,回顾了爱因斯坦、玻尔曾怀疑核裂变可行性、克鲁格曼曾认为互联网影响不会超过传真机等历史案例,提醒无论是对 AI 影响的悲观论者还是乐观论者,历史都不站在他们一边。
值得关注的视频¶
今日未发现符合筛选标准的新发布视频内容(核心播客 G1、B站资讯频道 G6 近 48 小时内暂无可确认的新一期节目)。
灵感种子¶
「合规式克制」可能成为 AI 公司的常规策略:Anthropic 用刻意限制 Sonnet 5 的网络安全能力来换取政府免审批发布,这提示未来受监管国家可能会诞生一种新的产品策略——主动阉割部分能力以降低监管风险,再用另一条产品线(如 Claude Science)去覆盖被限制的商业价值。这对创业公司是个信号:与其等监管明确,不如主动设计"合规版"和"旗舰版"的能力分层。
Tokenizer 是隐藏的定价杠杆:Sonnet 5 挂着和 Sonnet 4.6 相同的标价,实际英文成本却涨了 30% 以上,中文几乎不受影响。这说明比较模型价格时,光看官方每百万 token 报价是不够的,还需要用实际语料测算 tokenizer 效率——这个维度过去被严重低估,尤其是对英文为主的重度用户。
峰谷定价会成为大模型 API 的标配吗:DeepSeek V4 引入分时定价,本质是把电网和云计算的资源调度逻辑搬到了模型推理层。如果头部厂商跟进,"错峰调用"未来可能要被纳入 AI 应用的架构设计标准流程,就像现在的云函数冷启动优化一样。
验证闭环 > 算力堆砌,可能是具身智能规模化的真正路径:NVIDIA ENPIRE 证明了物理机器人也可以复制编程 Agent 的"尝试-验证-改进"范式,前提是任务可自动评估、可自动重置。这暗示具身智能创业公司的护城河,可能不在于买了多少机器人或多少算力,而在于能否把自己的细分场景改造成一个"可验证"的强化学习环境。
生成时间:2026-07-01 09:10 | 下次更新:明日 9:00