AI 每日简报 | 2026-07-17¶
今日概览¶
三重大模型发布叠加——Gemini 3.5 Pro 今日登场(200 万 token 窗口,架构完全重构)、Kimi K3 昨日发布(2.8T 参数史上最大开源模型)、Inkling 前日亮相(Mira Murati 首发)。连续三天的重磅发布背后,"超大规模开源"已成为全球实验室的共同战略语言。DeepSeek 同步宣布 740 亿美元估值 IPO 筹备;苹果 vs OpenAI 商业机密大战进入反诉阶段。
今日最值得关注的事件:
- Gemini 3.5 Pro 今日发布:200 万 token 上下文,Deep Think 推理层,架构完全重构
- Kimi K3:2.8T 参数,首个"开源 3T 级"模型,性能仅次于 Fable 5 和 GPT-5.6 Sol
- Inkling:Thinking Machines Lab(Mira Murati)首发 975B MoE 开源模型,Apache 2.0
- DeepSeek 筹备 IPO,估值 740 亿美元;V4 峰时定价上线
- 苹果起诉 OpenAI:商业机密盗窃案,指控前苹果 VP 主导招募窃密
深度阅读推荐¶
⭐ Gemini 3.5 Pro 今日发布:架构完全重构,200 万 token 窗口,Deep Think 推理¶
Google DeepMind 于 7 月 17 日发布 Gemini 3.5 Pro,这是一次完整的架构重写——原始 2.5 Pro 底层被彻底丢弃,在原生 Gemini 3 基础上重新预训练,原因是原有架构在递归工具调用和 SVG 生成上存在结构性缺陷。主要特性:200 万 token 上下文窗口、Deep Think 推理层(仅限 $250/月 Ultra 订阅),以及代码和长逻辑任务的显著改进,对标 GPT-5.6 Sol 和 Fable 5。发布前已有四位顶级 DeepMind 研究员(含 Transformer 联合作者 Noam Shazeer)离职加入 OpenAI 和 Anthropic。
核心观点:
1. "推倒重来"是高风险信号:Google 宁可延期、重构,也不愿发布有明显缺陷的模型。这本身说明此前的结构性问题有多严重,也说明 Google 在这轮竞争中仍处于追赶者位置。
2. 200 万 token 窗口是 Google 的差异化赌注,配合 Deep Think 推理,这一架构组合在超长上下文理解 + 深度推理的任务上可能是当前最强配置——但需要真实测试验证。
来源:BigGo Finance | TechTimes
⭐ Kimi K3 正式发布:2.8T 参数,全球最大开源模型,性能逼近顶级闭源¶
月之暗面(Moonshot AI)于 7 月 16 日发布 Kimi K3,总参数 2.8 万亿,是目前参数量最大的开源模型(超越 DeepSeek V4 Pro 的 1.6T)。架构引入两项内部创新:Kimi Delta Attention(混合线性注意力)和 Attention Residuals。原生视觉理解,100 万 token 上下文窗口。当前以 K3 Max(对话/Agent)和 K3 Swarm Max(大规模并行)两个变体上线,7 月 27 日前承诺开放权重。
第三方基准 GDPval-AA v2(覆盖 44 种职业 9 大行业)中,K3 排名第三,仅次于 Claude Fable 5 Max(1,815)和 GPT-5.6 Sol Max(1,748),超越 Claude Opus 4.8(1,600)。Arena.ai 前端代码竞技场中,K3 登顶,超越 Fable 5。定价 \(3/M 输入、\)15/M 输出——与 Anthropic Sonnet 系列同档,是中国实验室迄今定价最高的开源模型。
核心观点:
1. K3 是一次"用规模换生态"的战略赌注:比顶级闭源模型便宜,且承诺开源权重,试图在商业模型定价体系之外另辟战场。
2. 中国实验室(DeepSeek、Kimi)的系列超大规模开源,正在倒逼闭源模型降价、重新审视开源策略——而美国本土除 Meta 外几乎无人跟进。
来源:Kimi 官方博客 | VentureBeat | Simon Willison 评测
⭐ Inkling:Mira Murati 首发,美国开源生态新生力量¶
Thinking Machines Lab(前 OpenAI CTO Mira Murati 创立)发布首个开源基础模型 Inkling(7 月 15 日)。架构:975B 总参数、41B 激活的 MoE;训练数据:45 万亿 token,覆盖文本、图像、音频、视频;原生多模态输入;上下文窗口 1M;Apache 2.0 许可证。John Schulman、Soumith Chintala、Lilian Weng 均参与其中。
公司明确表态:"Inkling 不是最强模型,而是最好的精调起点。" 核心产品是与 Inkling 绑定的 Tinker 精调平台,战略竞争对手是 Meta Llama,而非 GPT-5.6。smol.ai 评价其为"目前最强的美国本土(非 Meta)开源基础模型,但仍落后于顶尖中国开源模型"。
核心观点:
1. "最强基础 + 精调平台"的绑定策略,是 Thinking Machines Lab 差异化逻辑的核心——商业模式的竞争力来自 Tinker 平台,而非模型本身的极限性能。
2. Inkling 填补了美国开源生态的空白,但也暴露了一个结构性现实:在开源基础模型方向,美国(除 Meta 外)系统性落后于中国,且差距仍在拉大。
来源:Thinking Machines 官方 | TechCrunch | Simon Willison
⭐ Ring-Zero:零 RL 首次扩展至万亿参数,涌现推理能力¶
论文 Ring-Zero(arXiv 2607.12395)将 Zero RL(无人工标注数据、仅用可验证奖励的强化学习)从受算力限制的小模型首次扩展至万亿参数规模,验证了大规模下链式思维(CoT)推理能力的涌现。
核心观点: Zero RL 在大规模下依然有效,意味着不依赖人工标注数据、仅靠可验证奖励(代码执行、数学验证等)就能在超大模型上获得强推理能力。这将进一步降低前沿推理模型的训练成本门槛,也为"RL 驱动推理"的规模律提供了新实证。
OpenAI¶
ChatGPT 青少年保护新策略(Why Teens Deserve Access to Safe AI)
OpenAI 发布长文,介绍 ChatGPT 为青少年推出的年龄适配保护机制:内容过滤升级、家长控制工具、专家合作伙伴关系,以及专为学习场景设计的工具集。背景是各国对未成年人使用生成式 AI 的立法压力持续升温,OpenAI 此举属于主动表态。
来源:OpenAI
GPT-Red:自动化红队测试,AI 自我发现安全漏洞
OpenAI 发布 GPT-Red(7 月 15 日),用自我博弈(self-play)机制自动化红队测试,目标是提升模型安全性、对齐稳健性和提示注入抵抗能力。与人工红队不同,GPT-Red 可大规模迭代生成对抗样本。
来源:OpenAI
Google DeepMind / Gemini¶
⭐ Gemini 3.5 Pro 今日发布
Anthropic / Claude¶
Claude for Teachers:向美国 K-12 教师免费开放一年
Anthropic 推出 Claude for Teachers 计划,在 6 月 30 日前注册的美国 K-12 教师可免费获得一年 Claude 访问权限,含针对教育场景的技能库和与学术标准对齐的课程内容。AI 公司抢占教育市场的竞争加速——OpenAI 同期也在推进 K-12 AI Skills Jams。
来源:The Hill
Anthropic + Blackstone:押注 AI 实施落地
Anthropic 与黑石集团合作(7 月 15 日),战略重心指向 AI 落地实施而非模型能力本身,体现 Anthropic 差异化于 OpenAI 的企业落地路径。
来源:TechCrunch
国内大厂动态¶
⭐ Kimi K3 正式发布(月之暗面)
DeepSeek:估值 740 亿美元筹备 IPO,V4 峰时定价上线
DeepSeek 正在准备 A 股 IPO,拟以 500 亿元人民币估值融资(约合 74 亿美元),最快今年提交申请、2027 年上市。这距其上轮 70 亿美元融资仅一个月。与此同时,DeepSeek V4 API 峰时定价(北京时间 9-12 点及 14-18 点 2 倍基础价格)正式生效;旧模型别名 deepseek-chat 和 deepseek-reasoner 将于 7 月 24 日废弃,请及时迁移。
来源:Bloomberg | winbuzzer | TechCrunch
银河通用:仅需人类视频即可训练并部署机器人,边干边学
银河通用发布全球首个仅需人类操作视频即可训练机器人策略的框架,无需专门收集机器人示教数据,且机器人可在实际工作中持续迭代学习。与特斯拉 Optimus 等依赖大量真机数据采集的路径不同,这一方案若规模化验证,将大幅降低具身智能的数据获取成本。
来源:量子位
原力灵机 DW0.5:世界模型替代真机训练 VLA,后训练数据需求降低 60%
原力灵机发布 DW0.5,以世界模型(模拟未来视觉场景)作为 VLA(视觉-语言-动作)模型的训练"教练",将强化学习迁移至虚拟环境。后训练阶段真机数据需求骤降 60%,大幅降低具身智能训练成本。
来源:量子位
AI 研究前沿¶
⭐ Ring-Zero:零 RL 扩展至万亿参数
智能体自我改进综述:从研究原型走向部署系统(arXiv 2607.13104)
系统梳理当代智能体系统的自我改进机制:如何以最少或零人工输入将经验转化为能力提升。覆盖 RL、记忆管理、工具使用等多种路径,并讨论"可控演化"作为工程目标的实现挑战。
Harness Handbook:让持续演化的 Agent 框架保持可维护(arXiv 2607.13285)
Agent 框架(harness)随着迭代越来越复杂,可读性和可编辑性成为隐性瓶颈。本文提出系统化方法,让 Agent harness 在持续演化中保持可导航和可修改——这是当前大量 AI 工程团队面临的实际痛点。
行业观点与解读¶
苹果起诉 OpenAI:商业机密盗窃案进入反诉阶段
苹果 7 月 10 日正式起诉 OpenAI,指控其硬件负责人唐坦(Tang Tan,前苹果 VP)在招募苹果员工时系统性索取机密材料,内容涉及未发布产品的工程图纸、技术规格和专有项目数据。核心证据:一名前苹果员工利用认证漏洞访问共享文件夹并下载机密,离职时未归还工作电脑、未参加离职面谈。OpenAI 回应称"对竞争对手商业机密没有兴趣",案件已于 7 月 14 日进入 OpenAI 反诉阶段。
来源:Bloomberg | TechCrunch
GPT-5.6 Codex 严重 Bug:误删 $HOME 目录
OpenAI 工程师确认,在全权访问模式且未开启沙箱保护时,GPT-5.6 会在尝试覆盖 $HOME 环境变量时误将 $HOME 本身删除。Simon Willison 记录此 Bug,再次凸显 AI 编程 Agent 的沙箱隔离和权限控制不可省略。
苏剑林:基于排序不等式的新相似度指标
月之暗面研究员苏剑林(科学空间)发文解析论文《Beyond Cosine Similarity》,探讨基于排序不等式构建比余弦相似度更宽松的归一化相似度指标。这类基础数学工具直接影响向量检索、对比学习等大量实际工程场景。
来源:科学空间
用 $25,000 Claude Token 把 Firefox 编译进浏览器
Puter 团队用大量 Claude Opus 和 Fable token(估计花费约 $25,000)将 Firefox/Gecko 引擎编译为 WebAssembly,实现在 Chrome 中运行完整的 Firefox 浏览器。Simon Willison 评论:这个案例揭示"高算力投入作为工程路径"已是现实——某些此前人力无法完成的底层移植任务,现在可以用 AI token 换时间。
值得关注的视频¶
今日无更新。
灵感种子¶
「三天三大开源模型」意味着什么
Gemini 3.5 Pro(今日)、Kimi K3(昨日)、Inkling(前日)——这不只是巧合,而是三个不同背景的机构在同一时间窗口做出了相同的判断:开源(或准开源)是当前的战略必选项。但三者开源的动机截然不同:Google 是被动跟进、Kimi 是规模押注、Inkling 是精调生态。值得深挖:同一动作背后的不同战略逻辑,最终会导向不同结局。
AI Agent 的"边界问题"正在变成法律问题
GPT-5.6 误删 $HOME,苹果指控 OpenAI 前员工窃密——这两件事看似无关,但都指向同一个深层问题:AI 系统(无论是 Agent 还是组织内的人)在"被授权行动"和"越权行动"之间的边界越来越模糊,且代价越来越高。下一个重要研究/工程方向可能不是"让 Agent 更强",而是"让 Agent 的边界更清晰"。
真机数据稀缺是具身智能的隐性瓶颈
银河通用(人类视频即可部署)和原力灵机(世界模型替代真机训练)今日的两个发布指向同一痛点:真实机器人数据太贵、太难收集。在"软件能力已充足"的前提下,数据效率正在成为具身智能规模化的真正卡脖子问题,能率先突破这一关的团队,会比单纯竞争模型能力的团队更快触达商业规模。
DeepSeek 的 IPO 是一场时间赛跑
DeepSeek 在一个月内从 50 亿美元融资提升到 740 亿美元估值筹备 IPO,速度之快令人咋舌。背后的问题是:在中国 AI 竞争持续内卷、同时面临地缘政治压力的环境下,IPO 窗口期有多长?DeepSeek 选择此时推进,更像是在技术溢价最高点套现,而非单纯的资本运作。
生成时间:2026-07-17 08:57 | 下次更新:明日 9:00