AI 每日简报 | 2026-07-09¶
今日概览¶
今日主线是「模型能力叙事」向「工程与评测基础设施」的一次集体回摆:OpenAI 上线全双工语音模型 GPT-Live 的同时,罕见地自我否定了自己力推的 SWE-Bench Pro 评测基准;翁荔(Lilian Weng)万字长文提出「自进化应从 Harness(脚手架)工程开始」,把行业注意力从模型参数拉回到围绕模型的工具链;DeepSeek 被曝已秘密自研推理芯片一年有余,国产 AI 全栈自主的暗线浮出水面。Anthropic 则连出三笔企业级合作,把 Claude 铺得更深更广。
- 🎙️ OpenAI 发布 GPT-Live:全双工语音模型,边听边说
- 🔬 OpenAI 撤回 SWE-Bench Pro 推荐:30% 任务被判定「已损坏」
- 🪜 翁荔万字长文《Harness Engineering》:自进化先从脚手架开始,DeepSeek 崔添翼转发附议
- 🇨🇳 DeepSeek 秘密造芯一年:专攻推理,摆脱英伟达/华为依赖
- 🤝 Anthropic 一日三连发:UST 培训 2 万员工、Claude for Government 公测、Microsoft Foundry 全量上线
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ OpenAI 发布 GPT-Live:全双工语音模型,能一边听一边说¶
OpenAI 于 7 月 8 日发布 GPT-Live,是新一代语音模型家族,采用全双工(full-duplex)架构——模型可以同时听和说,对话中会用「嗯哼」「好的」这类语气词表达在倾听,也能在用户思考时保持安静,让语音交互第一次更接近真人对话的节奏感。GPT-Live 同时具备「智能委托」能力:遇到需要联网搜索、深度推理或复杂任务的问题时,会在后台调用最新的前沿模型处理,再把结果带回对话中。首批上线 GPT-Live-1 与 GPT-Live-1 mini 两个版本,面向全球 ChatGPT 用户推送,后台默认调用 GPT-5.5。发布时暂不支持语音配合视频/共享屏幕,官方称正在开发。
核心观点:
- 「全双工」是语音交互的关键分水岭——此前的语音模式本质是「回合制」ASR+TTS 拼接,GPT-Live 把打断、附和、沉默这些人类对话的微观信号变成了模型的一等公民能力。
- 「语音模型负责交互节奏,后台模型负责智力」的分层架构,可能成为未来多模态产品的标准范式:前端交互层要快而自然,后端推理层要慢而深,两者解耦而非融合。
来源:OpenAI 官方发布 · Simon Willison 试评 · CNBC 报道 · Let's Data Science 解读
⭐ OpenAI 撤回对 SWE-Bench Pro 的推荐:审计发现 30% 任务已「损坏」¶
OpenAI 在博客文章《Separating signal from noise in coding evaluations》中披露,此前他们发现 SWE-bench Verified 存在设计缺陷和数据污染问题后,曾力推社区改用 SWE-Bench Pro 作为衡量 Agent 编码能力的标准。但最新审计显示,SWE-Bench Pro 本身也「不再可靠地衡量前沿编码能力」——30% 的任务被判定为已损坏,OpenAI 因此正式撤回此前的推荐。OpenAI 在 X 上同步发布了审计细节。
核心观点:
- 这是评测基准「保质期」问题的一次公开示范:一个基准从「社区标准」到「过时/污染」的周期正在急剧缩短,而不是模型能力发展的问题——是评测基础设施本身在被模型的进化速度反噬。
- OpenAI 主动自我否定此前的推荐,比闷声不吭更值得关注:这暗示头部实验室内部已经把「评测可信度审计」当成和模型训练同等优先级的工程投入,而不是发布后就不再维护的一次性工具。
来源:OpenAI 官方博客 · OpenAI 官方 X 帖 · Hacker News 讨论
⭐ 翁荔万字长文:AI 自进化,应该先从 Harness Engineering 开始¶
前 OpenAI 安全研究副总裁、现 Thinking Machines Lab 联合创始人翁荔(Lilian Weng)7 月 4 日发布长文《Harness Engineering for Self-Improvement》。她提出:递归自我改进(RSI)的近期起点,很可能不是模型直接改写自己的权重,而是先把模型外部的「Harness」(工作流、上下文管理、工具调用、评估机制等脚手架层)打磨到位,再逐步过渡到自动化研究与更强模型。她同时坦承当前面临的难题:评估标准模糊、上下文记忆退化、奖励黑客(reward hacking)、负样本难以保留、如何嵌入人类监督等。文章发布后,DeepSeek 研究员崔添翼公开转发附议,称这个方向「很容易出成果」。
核心观点:
- 「我们可能高估了模型,却严重低估了脚手架」——这句话本身就是对过去一年「唯参数论」叙事的一次纠偏:Agent 能力的边际提升,越来越多来自 Harness 层的工程打磨,而非底层模型的重新训练。
- 把 RSI 拆解为「先进化脚手架、再进化模型」两阶段,给了整个行业一个可操作的中间态目标——不需要等到「模型自己改自己」的科幻场景,现在就可以通过打磨工具链、评估器和记忆系统,提前进入自我改进的爬坡区。
来源:Lil'Log 原文 · Lilian Weng 官方 X 帖 · 量子位中文报道 · Latent Space 论文梳理
⭐ DeepSeek 秘密造芯一年:专攻推理,招聘全程不公开¶
据量子位等多方报道,DeepSeek 已秘密自研 AI 芯片约一年,主攻推理任务而非大模型训练,目前已与芯片设计公司、晶圆代工厂和存储器供应商展开接洽,并通过非公开渠道大举招聘芯片设计工程师。业内人士认为,DeepSeek V3.1 采用的 UE8M0 FP8 数据格式,是算法团队提前为自研硬件特性做适配的信号。6 月完成的约 510 亿元人民币首轮外部融资(估值 520-590 亿美元),明确将资金用途之一列为「自研 AI 芯片」。
核心观点:
- DeepSeek 的路径是「先用算法优化把成本打下来,再用自研芯片把供应链锁死」——这是对英伟达出口管制和华为产能瓶颈的双重对冲,而不是单纯的国产替代口号。
- 「推理优先于训练」的芯片选择很务实:训练芯片需要对标最强算力,风险和投入都极高;推理芯片只需在自家模型的特定算子上做深度优化,更容易在短周期内跑出成本优势。
OpenAI¶
- ⭐ GPT-Live 发布(详见深度阅读区):全双工语音模型上线 ChatGPT。
- ⭐ 撤回 SWE-Bench Pro 推荐(详见深度阅读区):评测基准审计引发行业关注。
- 《我们对政府与国家安全合作的立场》:OpenAI 发文阐述与各国政府、国防部门合作的原则边界,未涉及具体新签约项目。来源
- 面向 K-12 教育者的 AI 技能培训计划:OpenAI 推出面向中小学教师的实用 AI 技能项目,聚焦课堂场景落地而非产品发布。来源
Google DeepMind / Gemini¶
今日无实质性新发布。Gemini 3.5 Pro 仍按 7 月 6 日披露的计划推迟至 7 月 17 日发布(架构重构、200 万 token 上下文、Deep Think Reasoning Layer),暂无新增细节。BigGo Finance 追踪
Anthropic / Claude¶
- UST 与 Anthropic 达成战略合作:IT 服务商 UST 宣布将 Claude 引入其平台、工程与运营体系,并计划在全球培训 2 万名员工使用 Claude。Morningstar/PR Newswire
- Claude for Government 公测 Claude Code 与 Claude Cowork:面向美国公共部门团队的 FedRAMP High 认证版本新增桌面端文件级工作、更强管理员控制、防篡改审计日志与支出治理功能。Releasebot 汇总
- Claude 登陆 Microsoft Foundry 并全量可用:Claude Opus 4.8 与 Claude Haiku 4.5 现已在 Azure 原生环境的 Messages API 中提供,复用微软既有的身份认证、计费与治理体系,可选美国数据区。Releasebot 汇总
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 / 阿里 / 腾讯 等
- ⭐ DeepSeek 秘密造芯(详见深度阅读区):国产 AI 全栈自主的暗线浮出水面。
- 字节豆包智能体功能将于 7 月 15 日下线:豆包发布下线通知,称因产品功能调整,智能体功能停止服务,具体替代方案未披露。相关报道汇总
- 阿里斩获国际 AI 顶会最佳资源论文奖:阿里团队提出 Agent 评测新范式,获评本届顶会最佳资源论文。量子位
- 智源「悟界·Orca」世界模型登顶 HuggingFace 论文月榜:智源研究院发布 Orca,主张先让模型理解「世界如何变化」,再进入具体任务执行,而非让 AI 一上来就「进厂打螺丝」。量子位
- 具身智能新基准 RoboDojo 上线,人类 100 分、最强模型仅 12.8 分:新发布的具身智能评测集 RoboDojo(含 RoboTwin)显示当前最强模型与人类水平仍有巨大差距,被称为「具身测评界的珠峰」。量子位
- 华为、联想投资魔芯科技 MoWorld:魔芯科技发布全球首个超高帧率交互式世界模型 MoWorld,可在国产 NPU 上实现 50FPS 实时推理,成本较此前方案下降 70%。量子位
- Kimi 新一轮融资,估值飙升至 300 亿美元:月之暗面开启新一轮融资,投前估值达 300 亿美元,较 2025 年底 43 亿美元估值半年内提升近 6 倍。证券时报
AI 研究前沿¶
重要论文、技术突破(HuggingFace 每日高票榜)
- ⭐ Gemma 4 Technical Report(arXiv 2607.02770,7/2,30 票):Google 发布 Gemma 4 技术报告,新一代开源多模态模型家族,参数覆盖 2.3B-31B(含 MoE 版本),31B 稠密模型登顶开源榜单,256K 上下文并内置思考模式。链接
- AlayaWorld / RynnWorld-4D / RynnWorld-Teleop 世界模型三连发(均 7/6-7,60+ 票):三篇高票论文分别探讨长时序可玩视频世界生成、4D 具身世界模型用于机器人操作、以及面向数字遥操作的动作条件世界模型,共同指向「世界模型」正成为具身智能训练与评估的核心底座。AlayaWorld · RynnWorld-4D · RynnWorld-Teleop
- Vision as Unified Multimodal Generation(arXiv 2607.06560,7/6,31 票):探索将视觉理解与生成统一到同一套框架下的路径,是多模态基础模型架构收敛的又一例证。链接
- HunyuanOCR-1.5: Making Lightweight OCR VLMs Faster and Better(arXiv 2607.04884,7/5,3 票):腾讯混元团队发布轻量级 OCR 视觉语言模型升级版,兼顾速度与精度,面向端侧文档理解场景。链接
行业观点与解读¶
- ⭐ 翁荔《Harness Engineering for Self-Improvement》(详见深度阅读区):自进化的近期起点,是打磨脚手架而非模型本身。
- ⭐ OpenAI 撤回 SWE-Bench Pro 推荐(详见深度阅读区):评测基准的保质期正在急剧缩短。
- Simon Willison 试评 GPT-Live:认为全双工架构是语音助手今年最实质性的体验升级,同时提醒开发者其 API 尚未开放,目前只在 ChatGPT 消费端可用。博客
- The AI Daily Brief ⅞ 期焦点:联合国呼吁全球禁止「杀手机器人」、AI 实验室儿童安全承诺、Mercor 数据标注业务年化收入破 20 亿美元、NVIDIA 开源 Nemotron 系列下载量破 1 亿,以及对 Anthropic「J-Lens」可解释性工具的延伸讨论。Apple Podcasts
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。
- The AI Daily Brief(⅞)| UN 呼吁禁止杀手机器人 + J-Lens 可解释性延伸讨论:一集打包本周监管、商业化与可解释性三条线索,适合快速补课。Apple Podcasts
(Latent Space、Dwarkesh Podcast 本 24 小时内无新集,最新一期分别停留在 7/1 与 6/30。中文播客 AI Next、十字路口、B 站 AI 日报/AI 前沿日报/TAI 快报本轮未捕捉到符合时间窗口的新集。)
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
脚手架比模型更重要,可能是被低估的共识:翁荔的文章把「Harness Engineering」从工程细节提升到战略议题的高度。如果自我改进的近期路径真的是「先进化脚手架」,那么今天决定投入做上下文管理、工具编排、评估器设计的团队,可能比单纯追逐更大参数量的团队更早摸到 RSI 的门槛。这对创业公司是个机会窗口——脚手架层的护城河不需要千卡集群。
评测基准的「保质期」正在缩短到以月计:OpenAI 半年内两次自我否定评测基准(先弃 SWE-bench Verified,再弃 SWE-Bench Pro),这不是评测团队水平问题,而是模型进化速度本身在污染评测。如果每个基准的可信窗口只有几个月,行业是否需要一套「评测基准的评测基准」——某种持续审计机制,而不是发布即定型?
语音交互的分层架构,或是多模态产品的下一个标准范式:GPT-Live 把「交互节奏」和「智力深度」拆成两层——前台快而自然,后台慢而深,通过委托机制解耦。这个思路其实可以推广到任何实时 Agent 产品:不是让一个模型既快又聪明,而是设计一套「快模型负责体验、慢模型负责决策」的调度层。谁能把这层调度做得足够丝滑,谁就赢得用户对「AI 反应速度」的感知。
造芯不是终点,是算法团队的自我验证:DeepSeek 用 UE8M0 FP8 这种数据格式选择,提前为自研芯片的硬件特性铺路,这种「算法先行、硬件跟进」的打法,某种程度上是对自家模型团队算法判断力的一次终极验证——如果芯片流片成功且真的比现有方案便宜,等于官方证明了他们对自己模型特性的理解比通用硬件厂商更深。这条路径如果跑通,会不会成为下一批国产大模型公司的标配打法?
生成时间:2026-07-09 09:26 | 下次更新:明日 9:00