跳转至

AI 每日简报 | 2026-08-25

今日概览

今天的叙事主线是"价格战从模型层蔓延到智能体开发平台"。OpenAI 把 GPT-5.6 三档模型(Sol/Terra/Luna)以大幅降本引入 AWS 的智能体开发环境 Kiro,Luna 的 credits 低至 0.1x,Terra 号称完成同类任务成本降 82%——模型 API 的价格竞争正在下沉为"每任务成本"的竞争。国内这边,月之暗面官宣第一代万亿参数多模态模型 Kimi K2.5 月底退役、K3 全面接棒,字节则整合 TRAE、扣子入豆包、即将推出统一办公品牌"豆包工作",大厂进入产品线收敛与办公场景争夺阶段。研究前沿,智能体"环境生成"成为当天最热主题——EnvHarness 以 258 票登顶 HF 论文榜,Jack Clark 同日在 Import AI 470 里也把 SPADE(自适应合成环境自我博弈)列为头条,两条线相互印证。

最值得关注:

  • OpenAI GPT-5.6 三档模型正式登陆 AWS Kiro,Terra/Luna 大幅降价
  • 月之暗面官宣 Kimi K2.5 月底退役,2.8 万亿参数 K3 全面接棒
  • 字节整合 TRAE、扣子入豆包,将推独立办公品牌"豆包工作"
  • Jack Clark Import AI 470:METR 揭示 AI 加速"不均匀",SPADE 实现环境自博弈生成
  • 智能体环境生成成热点:EnvHarness 258 票登顶,FACET 115 票紧随

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。


⭐ 1. OpenAI GPT-5.6 三档模型正式登陆 AWS Kiro

核心观点:OpenAI 与 AWS 8 月 24 日官宣,把 GPT-5.6 系列(Sol / Terra / Luna)正式接入亚马逊的智能体软件开发环境 Kiro(7 月已实验性上线)。三档定位清晰——Sol 旗舰(编码智能体指数 80、Terminal-Bench 2.1 达 88.8%)、Terra 均衡(77.4)、Luna 低价高频(74.6),三款均带 272K 上下文与隐藏思维链。真正值得注意的是定价:Kiro 的 credits 乘数中 Terra 从 1.2x 降到 1.0x、Luna 从 0.6x 直降到 0.1x,官方称 Terra 完成同类任务成本下降约 82%。这标志着价格战从"API 每 token 单价"下沉到"智能体完成一个任务的总成本",也把 Kiro 这类智能体开发平台推到了大模型商业化的前沿阵地。

来源 · Kiro 官方定价说明

⭐ 2. 月之暗面官宣 Kimi K2.5 月底退役,K3 全面接棒

核心观点:月之暗面 8 月 24 日通过官方渠道宣布,第一代万亿参数多模态模型 Kimi K2.5 将于本月底结束服役,API 8 月 31 日下线,同期下线的还有更早的 moonshot-v1 系列,官方建议开发者迁移到 kimi-k3、kimi-2.6 等新模型。K2.5 今年 1 月推出、采用原生多模态架构,服役仅约 7 个月即退役;接棒的 K3 拥有 2.8 万亿参数、100 万 token 上下文,在 AAII 综合评测与智谱 GLM-5.3 并列 60 分(国产第一),Arena 全带代码榜仅次于 Claude Opus 5。这种"退役—接棒"节奏印证了开源大模型迭代周期已压缩到以月计,也把模型快速退役带来的企业迁移成本问题摆上台面。

来源 · 来源

⭐ 3. 字节整合 TRAE、扣子入豆包,将推"豆包工作"

核心观点:字节跳动 8 月 24 日整合旗下 AI 办公产品——编程平台 TRAE 与智能体搭建工具扣子(Coze)团队整体并入豆包体系,统一向豆包产品负责人汇报;并最快本周内推出独立 AI 办公品牌"豆包工作"(Doubao Work),正面挑战国内第一的腾讯 WorkBuddy(6 月月访问量 2100 万)。此前字节已把飞书并入豆包团队、原"Aily 智能伙伴"更名"豆包工作伙伴"。CEO 梁汝波在 8 月全员会上把 AI 列为三项核心业务之一,豆包以 3.82 亿月活居 AI 原生应用第一。这是国内大厂从"多线试错"转向"收敛到单一主干 App + 统一办公品牌"的标志性动作。

来源 · 来源

⭐ 4. Jack Clark Import AI 470:AI 加速"不均匀",SPADE 实现环境自博弈生成

核心观点:Anthropic 联合创始人 Jack Clark 的周报本期两条主线。其一,METR 一项研究指出 AI 对科学技术的加速是"块状不均匀"的——网络安全领域重大加速(2026 年漏洞报告率较 2025 年大幅上升),数学轻微加速(arXiv 提交量部分领域一年内翻倍、Smale 名单上的 Jacobian 猜想等难题被解),而 AI 研究自身的算法进步"难以测量、无明显加速"。其二,多校合作提出 SPADE(Self-Play in Adaptive Synthetic Executable Environments),一个"通过自我博弈协同进化环境合成与智能体能力"的通用框架,用强模型自举生成游戏式合成环境作为训练数据——这正是当日 HF 论文榜"环境生成"主题(EnvHarness、FACET)的产业级呼应。

来源

⭐ 5. 论文 EnvHarness:可编程插件动态重塑静态环境训练智能体

核心观点:EnvHarness 与配套的 EnvRigger 提出一种新范式——不再静态喂给智能体固定环境,而是通过可编程插件动态改造环境、主动针对智能体的弱点制造"考点",让环境与智能体在强化学习中协同进化。这与 SPADE、AgentMercury 等同日论文共同指向一个方向:当预训练数据逼近瓶颈,可合成、可编程、可针对弱点的"环境"正在成为智能体能力的新杠杆。以 258 upvotes 登顶当日 HF 论文榜,是当天社区关注度最高的技术工作。

来源 · arXiv

⭐ 6. 论文 FACET:保留源意图的终端任务合成

核心观点:FACET 面向智能体训练的"任务数据"瓶颈,提出在共享的修复后环境中,把指令、参考解法、验证器三者对齐(grounding)以保留源意图与可执行状态,从而批量构造可执行的终端任务,用于规模化训练编码智能体。115 upvotes 紧随 EnvHarness 之后,是"环境/任务合成"这条当日主线的又一代表性工作——它把重点放在"合成任务要能被真实执行和验证"这一质量门槛上。

来源 · arXiv


OpenAI

GPT-5.6 三档模型正式登陆 AWS Kiro ⭐ 深度推荐(详见深度阅读区)。Sol/Terra/Luna 三档定价与能力分层,Terra 降本约 82%、Luna credits 低至 0.1x,智能体开发的每任务成本显著下降。来源


Google DeepMind / Gemini

今日无更新。Gemini 3.7 Flash 已于 8 月 13 日发布、前期简报已覆盖;8 月 24 日 DeepMind 无新模型或重大动态,仅媒体对 3.7 Flash 的集中解读,无新增信息量。


Anthropic / Claude

Claude 多模型故障后恢复:8 月 24 日 Anthropic 状态页报告 Claude Mythos 5、Fable 5、Opus 5、Opus 4.8 等多个模型错误率升高,Claude、API、Claude Code、Claude Cowork 均受影响;随后 Anthropic 表示已定位原因并修复,所有系统恢复正常。这是 8 月以来的又一次多模型故障(此前 8/6 为重大故障),持续的稳定性问题与"旗舰模型遇冷"的叙事叠加,值得持续关注。来源 · 来源


国内大厂动态

DeepSeek / Kimi / 豆包 / 智谱 等

Kimi K2.5 月底退役,K3 全面接棒 ⭐ 深度推荐(详见深度阅读区)。第一代万亿参数多模态模型 K2.5 官宣月底结束服役,API 8 月 31 日下线,官方建议迁移至 k3 / 2.6。来源 · 来源

字节整合 TRAE、扣子入豆包,将推"豆包工作" ⭐ 深度推荐(详见深度阅读区)。编程平台与智能体工具并入豆包体系,统一办公品牌挑战腾讯 WorkBuddy。来源

法律 AI 独角兽 Harvey 基于 Kimi K3 推出模型 Tenet:估值 110 亿美元的美国法律 AI 龙头 Harvey 宣布,用 Kimi K3 后训练出法律专用模型 Tenet,仅约 150 块英伟达 B300 GPU、耗时两个月即达到"最先进"性能。这是中国开放权重模型首次进入美国头部垂直 AI 公司的训练体系,是"中国开源模型出海"的一个标志性节点。来源


AI 研究前沿

重要论文、技术突破

EnvHarness:可编程插件动态重塑静态环境训练智能体 ⭐ 深度推荐(详见深度阅读区)。当日 HF 论文榜最高票(258 upvotes),环境与智能体协同进化。来源 · arXiv

FACET:保留源意图的终端任务合成 ⭐ 深度推荐(详见深度阅读区)。指令/解法/验证器三者对齐,规模化构造可执行终端任务(115 upvotes)。来源 · arXiv

4DAnyone:从随手拍的单目视频重建 4D 人物:通过生成多视角一致视频并提升到 4D Gaussian Splatting,用参考/目标上下文设计突破缩放瓶颈(73 upvotes)。来源 · arXiv

WithEveryone:最多十人的群体图像身份保持生成:把身份 grounding 到布局规划、用区域级身份损失,实现可靠的多人合影生成(39 upvotes)。来源 · arXiv

Let's Scale Step by Step:大规模 MoE 的计算高效超参迁移:两步式框架跨宽度与 token 预算预测最优学习率,免去昂贵的超参扫描即可预训练大规模混合专家模型(34 upvotes)。来源 · arXiv


行业观点与解读

KOL 重要推文、深度分析文章

Jack Clark Import AI 470:AI 加速"不均匀"与 SPADE 环境自博弈 ⭐ 深度推荐(详见深度阅读区)。METR 研究 + SPADE 框架,环境生成与智能体能力协同进化。来源

宝玉实测 DeepSeek V4 Flash 四大 Agent 框架,Pi Agent 最便宜且通过任务最多:宝玉(@dotey)8 月 25 日分享 DeepSeek V4 Flash 在 4 个代理框架上的测试结果,其中 Pi Agent 成本最低、通过任务数最多,引发社区对轻量 Agent 框架"性价比"的讨论——在模型能力趋同的背景下,框架层的调度效率正成为成本差异的关键来源。来源


值得关注的视频

YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。

今日无更新。过去 24 小时未见核心访谈播客(Latent Space、No Priors、Dwarkesh、Lex Fridman、The AI Daily Brief 等)发布 8 月 24—25 日的新集;Latent Space「Simulation is the new Scaling Law」一期已在 8 月 24 日简报推荐。


灵感种子

以下是今日简报中值得进一步思考的灵感种子。

智能体"环境生成"会不会成为下一个 Scaling 叙事:EnvHarness(258 票)、FACET(115 票)、AgentMercury 同日登榜,Jack Clark 的周报头条也是 SPADE。多条线同时指向"可合成、可编程、可针对弱点的环境"。值得深挖:当预训练数据逼近天花板,环境的合成与自我博弈,是否就是继"推理时计算""RLHF"之后的下一块能力杠杆?谁在押注这一方向?

价格战的下半场是"每任务成本":OpenAI 把 Luna 降到 0.1x credits、Terra 号称降本 82% 引入 Kiro,已经不是在比"每百万 token 多少钱",而是在比"完成一个真实任务多少钱"。值得思考:当智能体开发平台(Kiro、豆包工作、WorkBuddy、Harness)成为竞争主体,"模型能力"和"任务级经济性"哪个才是护城河?模型厂商会不会因此被迫把最便宜的一档模型做成默认选项?

开源模型"退役—接棒"的商业代价:Kimi K2.5 服役仅 7 个月即退役,迭代周期已压缩到以月计。值得关注:企业级用户如何在"永远用最新"与"稳定不迁移"之间权衡?快速退役会不会反过来成为开源阵营相对闭源的隐性成本,进而催生"长期支持版(LTS)模型"这种新物种?

中国开源模型出海的分水岭:Harvey 用 Kimi K3 训练出法律模型 Tenet,是头部美国垂直 AI 公司首次采用中国开放权重模型做后训练。值得深挖:如果"开放权重 + 本地后训练"成为美国垂直厂商的常规路径,中国开源模型的全球竞争力叙事是否到了从"下载量第一"转向"进入生产训练流水线"的转折点?


生成时间:2026-08-25 09:05 | 下次更新:明日 9:00