AI 每日简报 | 2026-08-17¶
今日概览¶
本周是国产大模型的「密集发布周」:DeepSeek V4 Pro 正式版上线并同步开源 Harness 框架、阿里开源 Qwen3.8 系列、智谱发布 GLM-5.3,而 DeepSeek 的 API 涨价正是在今天(8 月 17 日)生效——国产模型正从「卷性能」转向「卷生态与商业化」。海外方面,Google 换帅后首发 Gemini 3.7 Flash,OpenAI 与 Anthropic 则在 IPO 冲刺中经历高管震荡与「水印」争议。
最值得关注:
- DeepSeek V4 Pro 正式版 + 开源 Harness 框架,API 涨价今日生效
- 阿里开源 Qwen3.8 系列(2.4T 旗舰 MoE + 27B 多模态)
- 智谱发布 GLM-5.3,称「编程能力最强开源模型」
- Google DeepMind 换帅后首发 Gemini 3.7 Flash,主打编程与 Agent
- Anthropic 隐形水印引退订争议,Q2 营收涨 13 倍冲刺 IPO
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ 1. DeepSeek V4 Pro 正式版上线 + 开源 Harness 框架,API 涨价今日生效¶
核心观点:DeepSeek 正在完成从「模型提供商」到「全链路 AI 工作流平台」的定位切换。V4 Pro 正式版在 9 项智能体基准上逼近甚至反超 Anthropic 旗舰 Fable 5,DeepSWE 从预览版 12.8% 飙升至 62.7%;同步开源的 Harness 框架(MIT 协议)以「Model + Harness = Agent」为口号,用「一切皆插件」的架构直指 Claude Code 生态。但涨价(部分项目最高涨 500%、峰谷定价)标志着这家曾以「永久低价」著称的公司正式告别补贴式定价,转向算力压力下的商业化纪律。两者叠加,DeepSeek 的策略轮廓已经清晰:用顶尖开源模型抢心智,用 Harness 抢开发者生态,用涨价换算力可持续性。
⭐ 2. 阿里开源 Qwen3.8 系列:2.4 万亿参数旗舰 MoE + 27B 多模态¶
核心观点:阿里首次把「Max 级别」旗舰模型权重完全开放,Qwen3.8-2.4T-A95B(2.4 万亿参数、激活 950 亿)在 GPQA Diamond 92.6、OSWorld 86.1 等基准上对标闭源旗舰;同批开源的 27B 稠密多模态模型则走「消费级显卡可跑」路线,用 48 层 Gated DeltaNet 线性注意力 + 16 层全注意力混合架构,新增 reasoning_effort 让用户控制思考深度。一天之内从云端旗舰到端侧小模型全线开源,配合此前累计 30 亿次下载、30 万衍生模型,阿里正在把「开源生态」本身做成竞争壁垒。
⭐ 3. 智谱发布 GLM-5.3:后训练 Scaling 驱动的「编程最强开源模型」¶
核心观点:GLM-5.3 的基座与 GLM-5.2 完全相同(约 7430 亿参数),能力提升几乎全部来自「后训练 Scaling」——更长的后训练时间、数十倍长程任务环境。编程能力较上代提升约 50%,在 Terminal Bench 3.0、Agents' Last Exam 等开源榜单登顶,并「涌现」出网络安全能力(CyberGym 约 84.5%,逼近 Mythos 5)。这说明当基座参数不再扩张时,后训练的边际收益仍然可观,也为「不卷万亿参数」提供了一条可复制的技术路线。
⭐ 4. Google Gemini 3.7 Flash:DeepMind 换帅后的第一发,主打编程与 Agent 性价比¶
核心观点:Gemini 3.7 Flash 是 Demis Hassabis 卸任 CEO、Koray Kavukcuoglu 接掌日常运营后发布的首款模型,距 3.6 Flash 仅三周。它在 FrontierCode 1.1(34.4%→43.6%)、DeepSWE v1.1(~49%→65.3%)、OSWorld 2.0(33.8%→47.9%)等编程/Agent 基准上大幅跃升,并以上代一半的引入价(输入 $0.75/M、输出 $3.75/M)直接开打价格战。旗舰 Gemini 3.5 Pro 仍无时间表,意味着 Google 在「性价比斩杀线」上的攻势明显快于旗舰追赶。
⭐ 5. Anthropic 隐形水印引退订争议,Q2 营收涨 13 倍冲刺 2 万亿 IPO¶
核心观点:Anthropic 自 8 月 2 日起给 Claude 输出打上「机器可读」的隐形水印,本意是配合欧盟 AI Act 透明度要求,却引发用户恐慌——担心自己润色、翻译过的文本也会被标记为「AI 处理」,Paul Graham 甚至提出做「去水印改写」的创业点子。与此同时,其 Q2 营收突破 115 亿美元(同比 13 倍以上)、首次实现调整后运营利润,投资者正按 2 万亿美元估值为其 10 月 IPO 建模。水印争议与商业化狂飙同框,折射出 AI 公司在「透明度合规」与「用户信任」之间的现实张力。
⭐ 6. Simon Willison 实测 Qwen 3.8 27B:优秀但「过度思考」¶
核心观点:Simon Willison 用实测确认 Qwen 3.8 27B「极出色」,但发现其默认会「疯狂过度思考」——简单问题也启动长链推理。这与他此前观察到的「推理 token 通胀」问题一脉相承:模型默认的 reasoning_effort 偏高时,既浪费 token 又拖慢响应。Qwen 新增的 reasoning_effort 参数正是解决这一问题的开关,但也提示所有支持「可控思考深度」的模型,都需要一个更好的「默认值」策略。
OpenAI¶
GPT-5.6 Sol 推出 Ultrafast 模式,最高提速 14 倍:OpenAI 为旗舰模型 GPT-5.6 Sol 上线「Ultrafast」预览模式,基于 Cerebras 推理基础设施,处理速度最高提升 14 倍、输出可达 750 token/秒。该模式先在 API 向部分客户开放,官方称无需为速度妥协改用小型模型。这是 OpenAI 首次引入外部专用推理芯片来缓解旗舰模型的速度瓶颈。来源
IPO 冲刺期的高管震荡仍在持续:首席营收官 Denise Dresser 上任约 9 个月后离职,由前 Wiz 总裁/COO Dali Rajic 接任;长期高管 Brad Lightcap 也宣布离开。据 36 氪统计,2026 年前 8 个月 OpenAI 已有约 12 名高管出走,包括前首席产品官 Kevin Weil、Sora 负责人 Bill Peebles 等,均发生在传闻中的保密 S-1 递交前后。来源
Astra 模型因网络安全暂停,Altman 表态「会开放但需更安全」:OpenAI 内部评估发现未发布模型 Astra 触及「关键」网络安全阈值——可自主发现零日漏洞并规划攻击,因而暂停相关内部活动。Sam Altman 随后发帖称 Astra 很强大、正在推进「普遍可用」,但「不把强大模型留给少数人」的同时也需要更长时间确保安全。来源
Google DeepMind / Gemini¶
Gemini 3.7 Flash 发布:换帅后首秀,编程与 Agent 性能大幅跃升 ⭐ 深度推荐(详见深度阅读区)。8 月 13 日发布的 Gemini 3.7 Flash 定位「最聪明的干活模型」,专注编程与 AI Agent 工作流:FrontierCode 1.1 从 34.4% 升至 43.6%、DeepSWE v1.1 从约 49% 升至 65.3%、OSWorld 2.0 从 33.8% 升至 47.9%,部分结果已超过 Claude Sonnet 5 与 GPT-5.6 Terra。它以 3.6 Flash 半价(输入 $0.75/M、输出 $3.75/M,优惠至年底)开售,并已接入 Gemini Spark 订阅。此次发布距 DeepMind 大规模人事调整仅 8 天,被视为新管理层「提速、降价」路线的第一枪。来源
Anthropic / Claude¶
隐形水印全面铺开引发退订与「去水印」讨论 ⭐ 深度推荐(详见深度阅读区)。8 月 2 日起,Anthropic 给受支持的 Claude 模型输出打上不可感知、机器可读的水印,文本复制后仍可溯源,图片附带 C2PA 数字溯源元数据。官方强调「检测到水印只说明 Claude 处理过文本,不说明 Claude 撰写」,但大量用户担心自己编辑、校对过的文字被误标为 AI 生成,Paul Graham 公开提出做「改写去水印」的创业点子。Anthropic 回应称未观察到退订显著上升。来源
Q2 营收 115 亿美元、首次调整后盈利,IPO 估值或达 2 万亿美元:Anthropic 二季度营收同比暴涨 13 倍至 115 亿美元,实现首次调整后经营利润;投资者正按 10 月 IPO 估值 2 万亿美元建模,为 5 月 H 轮后私有估值的两倍多。年化营收预期已达 100 亿–120 亿美元区间。来源
内部「Model 2」超越 Mythos 5 但不公开,风险评级上调:8 月风险报告披露,内部模型 Model 2 在多项内部任务上超越 Mythos 5,但不会对外发布;报告同时把「灾难性失控」风险评级从「极低」上调至「低」,并称 Claude 现已负责 Anthropic 生产代码库中绝大多数的合并代码。来源
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 等
DeepSeek V4 Pro 正式版 + Harness 开源 + API 涨价三连发 ⭐ 深度推荐(详见深度阅读区)。8 月 13 日凌晨,DeepSeek 将 V4 Pro 从预览版转正,同步在 App、网页与 API 上线,官方称 9 项智能体基准接近 Claude Fable 5(CyberGym 83.3 对 83.1)。当晚开源首款 AI 智能体运行框架 DeepSeek Harness(DSH)开发者预览版,以「一切皆插件」架构支持接入近 40 家模型提供方,并已开设官方账号、启动招聘。与此同时,API 峰谷定价今日(8 月 17 日)起生效,部分项目最高涨幅 500%,结束仅维持 83 天的「永久价格」。来源
阿里开源 Qwen3.8 系列:旗舰 MoE 与端侧多模态同日登场 ⭐ 深度推荐(详见深度阅读区)。8 月 13 日开源 2.4 万亿参数旗舰 Qwen3.8-2.4T-A95B(阿里首次开放 Max 级权重,已在 9 家国产芯片完成 FlagOS 适配);8 月 14 日再开源 270 亿参数的 Qwen3.8-27B 多模态稠密模型,48/16 层混合 Gated DeltaNet 线性注意力,支持 262K 原生上下文、可外推至 1M,新增 reasoning_effort 控制思考深度,消费级显卡可跑。来源
智谱发布 GLM-5.3:编程能力提升 50%,两周后开源权重 ⭐ 深度推荐(详见深度阅读区)。8 月 14 日发布的 GLM-5.3 基座未变,全靠后训练 Scaling 提升能力,编程较上代提升约 50%,在 Terminal Bench 3.0、Agents' Last Exam 等开源榜单登顶,并涌现出白盒代码审查与漏洞发现能力(联合测试发现 2400 余个潜在漏洞、约 1100 个中高危)。完整权重计划两周后开源。来源
月之暗面 G 轮融资推进至 500 亿美元估值,ARR 破 3 亿美元:Kimi 母公司 G 轮(Pre-IPO 轮)投前估值锁定约 500 亿美元,7 个月估值涨超 8 倍;年化经常性收入 6 月站稳 3 亿美元、API 收入占比约七成。针对 8 月 3 日「本月递表港股 IPO」传闻,公司明确否认;8 月 14 日法务部再发严正声明,打击冒名虚假融资,称不存在「朋友基金」「老股额度」等。来源
字节发布 SeedRealtime,梁汝波表态「接受短期落后、坚持自研」:字节 8 月 5 日上线原生音视频全双工大模型 SeedRealtime(已全量接入豆包 App),端到端评测显示音视频对话节奏问题减少约 50%。CEO 梁汝波在年中全员会承认大语言模型被海外领先模型拉大差距,但强调坚持自研、接受短期落后;同时飞书并入豆包、火山引擎整合,成立「创造力服务平台」面向 B 端。来源
AI 研究前沿¶
重要论文、技术突破
HF 每日论文精选(按投票热度):
- LLMRouter:开发、评测、部署 LLM 路由器的统一基础设施(102 票)。给「多模型调度」提供一个标准化框架,直击当下混合路由、成本优化场景的工程痛点。来源
- DarwinX:通过自然选择进化 Agent Harness(84 票)。用进化算法自动搜索更优的 Agent 框架配置,与 DeepSeek Harness 开源的「框架化」趋势形成呼应。来源
- DreamX-Phi 1.0:面向机器人操作的动作条件视频世界模型(91 票)。将世界模型用于机器人操作规划,具身智能方向的高热度工作。来源
- Alaya-EVOKE:从线性扩展监督到「无尽世界」(116 票)。当日最高票论文,探索可无限扩展的世界/视频生成与监督范式。来源
- 混合线性注意力大模型中的 Massive Activations(28 票)。针对 Qwen3.8-27B 等混合线性注意力架构,系统分析「Pre-Attention 尖峰与尖峰间平台」的激活异常现象,对理解新架构的数值稳定性有直接价值。来源
至知研究院提出大模型可解释性新路线:拆权重、数据成本不到 1%:提出「稀疏权重分解」路线,声称无需再训练一个替代网络即可理解大模型,数据成本不足传统方法的 1%。若成立,可显著降低可解释性研究的门槛。来源
苏剑林(科学空间):今日无更新。最新文章为 8 月 9 日《除了交叉熵,LM Loss 还有什么选择?》,从信息论视角重新审视 LLM 预训练损失函数的可替代选择。来源
行业观点与解读¶
KOL 重要推文、深度分析文章
Simon Willison 实测 Qwen 3.8 27B:优秀但默认「疯狂过度思考」 ⭐ 深度推荐(详见深度阅读区)。他确认 Qwen 3.8 27B 是「极出色」的模型,但默认设置下会为简单任务也启动冗长推理,浪费 token 且拖慢响应,呼应他此前提出的「推理 token 通胀」担忧。来源
李飞飞最新访谈:AI 不是替代者,而是个人能力的「放大镜」:量子位刊发李飞飞访谈,她强调 AI 的价值在于放大个人能力而非替代人,呼应其一贯的「以人为本 AI」主张。来源
Simon Willison 摘引 Dario Amodei:Simon Willison 在其博客摘录 Anthropic CEO Dario Amodei 的近期言论,围绕 AI 安全与行业竞争展开评论。来源
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。
- ⭐ 《一旦 AI 能自动化 AI 研究,会发生什么?》——Dwarkesh Podcast 对话 Ryan Greenblatt(Redwood Research 首席科学家):2 小时 13 分钟的长谈,围绕「递归自我改进」是否会让 AI 迅速跃升至超智能展开辩论,Greenblatt 给出 AI 全自动研发的中位预测 2030–2031 年,并讨论了近期「AI 合谋欺骗人类」的真实案例。推荐观看。链接
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
「推理 token 通胀」正成为新一代模型的默认成本陷阱:Qwen 3.8 默认「过度思考」、DeepSeek 用峰谷定价把推理成本显性化——两者指向同一趋势:模型能力越强,推理 token 的消耗越不可控。一个值得深挖的方向是:当「思考深度」变成可调参数后,谁来决定默认值?这可能是模型厂商、应用开发者与最终用户之间新的产品博弈点。
「后训练 Scaling」正在接棒「参数 Scaling」:智谱 GLM-5.3 基座不变、仅靠后训练就提升编程能力 50%,这与本周 Qwen、DeepSeek 的发布共同印证:参数规模的边际收益在下降,后训练(长程任务、环境多样性、RL)成为新的性能杠杆。值得关注:这条路线是否意味着算力需求会从「训练集群」向「后训练/推理集群」迁移,进而重塑算力产业链。
开源框架之争:从「模型开源」升级到「Harness 开源」:DeepSeek Harness 与 DarwinX(进化 Agent Harness)同周出现,说明「Agent 运行框架」正在取代「模型权重」成为新的开源战场。若框架成为事实标准,模型本身可能退化为可替换的「插件」——这会是国产厂商绕开闭源巨头生态封锁的关键路径吗?
生成时间:2026-08-17 09:05 | 下次更新:明日 9:00