AI 每日简报 | 2026-08-14(周五)¶
今日概览¶
今天的资讯围绕着一条清晰的信号展开:AI 行业的竞争重心,正在从"模型分数"全面转向"Agent 平台与真实世界的数学/执行能力"。DeepSeek 在 V4-Pro 正式版之后乘胜追击,一边把 Harness 以 MIT 协议开源、打出"Agent 时代的安卓"的旗帜,一边官宣 API 涨价(缓存命中输入涨 500%),国产大模型"低价内卷"的红利正式落幕。同日,Ilya Sutskever 的 Safe Superintelligence(SSI)首个模型曝光,第一剑指向"持续学习";马斯克的 Grok 4.6 以一半价格重回第一梯队,部分基准反超 Fable 5;Anthropic 的 Claude 则联手数学家清空了 2000 阶以下所有哈达玛矩阵,把 FrontierMath 又一个开放难题从"待解列表"上划掉。OpenAI 一侧,Altman 在 Internapalooza 描绘了 ChatGPT 变身"读懂你整个生活上下文的全能助理"的图景,而公司高管的动荡仍在继续——一个月内四位高管出走、安全团队几乎清零。
今日五大关注:
- DeepSeek 双连击:Harness 以 MIT 协议开源("Agent 时代的安卓")+ API 涨价官宣,缓存命中输入涨 500%,8 月 17 日生效
- Ilya 的 SSI 首个模型曝光:第一剑劈向"持续学习",SSI 秘密研发首次具象化
- 马斯克 Grok 4.6 重回第一梯队:价格仅为竞品一半,GDPVal-AA、AA-Briefcase 等基准反超 Fable 5
- Claude 清空 2000 阶以下哈达玛矩阵:668 阶等 12 个悬而未决的阶全部解决,FrontierMath 第 4 个被 AI 攻克的开放难题
- OpenAI:Altman 描绘 ChatGPT"全能助理"愿景,同时一个月四位高管出走、CRO 换帅,安全团队几近清零
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ DeepSeek 双连击:Harness 开源("Agent 时代的安卓")+ API 涨价,低价红利落幕¶
8 月 13 日晚间,DeepSeek 正式发布 Agent Harness 开发者预览版(v0.1,昵称"黑鲸",DSH),并以 MIT 协议开源。官方称其为"Agent 时代的安卓":采用插件式开放架构,开发者无需改源码即可独立替换/扩展模型、工具、技能、会话、沙箱、存储、循环、调度、UI 等任意组件,内置 100 多个插件,支持 npx @deepseek-ai/dsh web 快速启动,并提供标准、PTC、极简、创造四类预设。同一天,DeepSeek 正式公布新版 API 定价(8 月 17 日 0 时生效):缓存命中输入从 0.025 元涨到 0.15 元/百万 tokens(涨 500%),缓存未命中输入从 3 元涨到 4.5 元,输出从 6 元涨到 13.5 元,继续采用峰谷定价。据第三方观察,DeepSeek V4 Flash 单日处理 Token 总量曾达 8 万亿、超过 OpenRouter 全平台日均规模,低价跑量正持续吞噬现金流。
核心观点:
- 这标志国产大模型"价格屠夫"路线的正式转身:从"低价抢调用量"切换到"开源平台锁生态"。Harness 免费开源(可接任何模型)、自家模型 API 涨价收费,是典型的"平台免费 + 服务收费"打法——把 Agent 基础设施层免费铺开,把价值锚定回模型与算力本身。
- 值得注意的时间线:涨价公告先于 Harness 发布,Harness 又在涨价后"火速免费开源",内测者"原谅它涨价"的叙事流传开来。这本质是一次精心设计的定价策略切换:先用涨价测试市场容忍度,再用开源产品对冲舆论。对下游开发者而言,DeepSeek 从"最便宜的模型供应商"变成"Agent 平台",生态关系将被重写。
⭐ Ilya 的 SSI 首个模型曝光:第一剑劈向"持续学习"¶
来源:量子位 | The Block Beats | Brave New Coin
8 月 13 日,量子位报道 Safe Superintelligence(SSI)的首个模型细节曝光,核心方向指向"持续学习"(continual learning)——"SSI 第一剑,劈向持续学习"。此前投资者 Gavin Baker 在播客中透露 SSI 将在 8 月发布首个模型,但一直未见官方确认;此次曝光让这家由 Ilya Sutskever、Daniel Gross、Daniel Levy 于 2024 年 6 月创立、至今零产品零论文的高度神秘公司第一次有了具象的技术落点。SSI 已累计融资数十亿美元、估值约 320 亿美元,并在 7 月底宣布与 NVIDIA 达成约 50 亿美元投资与 Vera Rubin 算力合作,计划将算力规模扩大约 10 倍;Sutskever 曾表示 SSI 的研究已"值得规模化"。
核心观点:
- "持续学习"这个落点极具 Ilya 个人色彩:当下主流模型都是"训练完冻结、部署时不再更新"的静态权重,持续学习则直指"模型能否在部署后不断吸收新知识而不遗忘"这一 AGI 的长期未解难题。若 SSI 真在此方向做出实质突破,其意义将远超任何单一 benchmark 分数。
- 但需保持克制:SSI 至今无官方确认、无模型名、无系统卡,所谓"曝光"仍处于传闻与二手信息的边缘。这既可能是一次真突破的前夜,也可能只是又一轮"神秘主义营销"。当一个估值 320 亿美元的公司用三年沉默换来一个方向暗示,市场期待的早已不是"又一个 LLM",而是"缺失的那块关键要素"。
⭐ 马斯克 Grok 4.6 重回第一梯队:价格砍半,部分基准反超 Fable 5¶
来源:量子位 | 华尔街见闻 | CNMO 科技 | BenchLM
8 月 12 日发布的 Grok 4.6(xAI/SpaceXAI)在 8 月 13 日迎来密集评测,被评价为"重回第一梯队"。它是基于与 Grok 4.5 相同的 V9 底座、约 1.5 万亿参数的旗舰,上下文窗口 50 万 token,支持低/中/高/xhigh 四档推理强度。API 定价为输入 2 美元、输出 6 美元/百万 tokens(缓存输入 0.5 美元),约为竞品旗舰的一半,首周在 Grok Build 与 Cursor 中赠送 2 倍使用量。基准表现:Artificial Analysis 智能指数 61,追平 GPT-5.6 Sol Max(61)、落后 Claude Fable 5(62)与 Opus 5(63);GDPVal-AA v2 得 1753 Elo,反超 Fable 5 Max(1741)与 GPT-5.6 Sol Max(1728);DeepSWE v1.1 得 65.9%(低于 Fable 5 的 70%);AA-Briefcase 得 1577(略高于 Fable 5 Max 的 1574)。
核心观点:
- 这是"价格屠夫"逻辑在大洋彼岸的回响:Grok 4.6 用一半价格摸到第一梯队的门槛,在部分 Agentic 与知识工作基准上反超更贵的 Fable 5。配合 xAI 对 Cursor 的收购,马斯克正在把"模型 + 编辑器 + 分发渠道"打包成一个与 OpenAI/Anthropic 正面竞争的性价比方案。
- 但也需看清"反超"的成色:DeepSWE(65.9 vs 70)与 Terminal-Bench 这类硬核 Agent 基准上仍落后,反超主要发生在 GDPVal-AA、AA-Briefcase 等偏"综合/知识"的维度。这再次印证当前格局的微妙——各家旗舰在不同基准上犬牙交错,已经没有单一"王者模型",竞争变成"谁在哪个维度、用什么价格取胜"的拼图游戏。
⭐ Claude 清空 2000 阶以下哈达玛矩阵:AI 开始清空数学"待解列表"¶
Anthropic 研究员 Levent Alpöge 报告,一个"三人 + Claude"的小团队构造出了 668 阶哈达玛矩阵——这是自 2005 年 428 阶被构造以来、近 20 年里最小未解阶。哈达玛矩阵是仅由 +1/−1 构成、各行两两正交的方阵;668 阶难在 668 = 4×167,167 是模 4 余 3 的素数,不适用标准 Paley 构造。Alpöge 在推特发布了一条由 23828 个"+"与"−"组成的加密推文,回复中的混淆 shell 脚本作为解码器,解码后包含 12 个此前悬而未决的阶(668、716、892、1132、1244、1388、1436、1676、1772、1916、1948、1964)的构造,即 2000 阶以下所有未解阶全部清零。独立数学库 VibeMathed 复现解码并用精确整数算术验证通过;FrontierMath 基准已暂时将"构造 668 阶哈达玛矩阵"标记为"AI 参与解决",若确认,将是 FrontierMath 50 个开放难题中第 4 个被 AI 攻克的。
核心观点:
- 这件事的分量不在"Claude 会算",而在"人类数学家 + AI"这一协作形态开始系统性地清空数学的开放难题列表。668 阶近 20 年无解,靠的不是暴力搜索的算力,而是新构造策略——AI 的价值在于探索"人类没想到的路径",而非单纯加速已知路径。
- 把它和同期的黎曼猜想尝试(Claude 曾把零点下界从 41.6% 推到 67.2%,虽未证明猜想)放在一起看,一个趋势浮出水面:AI 正在从"解题工具"变成"数学研究的生产力",而 FrontierMath 这类"开放难题排行榜"正在成为新的评价坐标系。当"清空待解列表"成为可复现的成果形态,数学研究的组织方式可能迎来一次重构。
⭐ Altman 描绘 ChatGPT"全能助理"愿景,OpenAI 高管继续大洗牌¶
来源:The Block Beats | TechCrunch | 36氪 | Motley Fool
8 月 13 日的两条 OpenAI 新闻互为镜像。产品侧,Altman 在 Internapalooza 2026 会议上描绘了 ChatGPT 的下一步:从一个聊天工具进化为真正理解用户整个工作/生活上下文的"全能助理"——经用户授权后持续读取电脑屏幕、记录会议与通话、打通消息/邮件/文档/Slack,且这一能力"可能只隔一代模型、6 个月内到来"。组织侧,OpenAI 的动荡仍在继续:任命前 Wiz 总裁/COO Dali Rajic 出任首席营收官(CRO),接替仅任职九个月的 Denise Dresser;叠加此前 COO Brad Lightcap、二号人物 Fidji Simo 相继离职,一个月内已有四位高管出走,"安全团队几乎被清零",Greg Brockman 承担了更大的管理角色。此外,Altman 被曝推动 OpenAI 以至少 1 万亿美元估值 IPO,公司据传已向 SEC 秘密递交上市申请。
核心观点:
- "全能助理"愿景与"安全团队清零"并置,构成 OpenAI 当下最尖锐的内在张力:产品叙事越是激进地走向"看你的屏幕、记你的会议、懂你的一生",安全与隐私的护栏就越需要有人把守,而此刻恰恰是安全团队最薄弱的时刻。这种错位,会让外界对"GPT 全能助理"的每一次产品发布都投以双倍的警惕目光。
- 高管层的连续出走(COO、CRO、二号人物、安全负责人)叠加 1 万亿美元 IPO 的传闻,指向同一个事实:OpenAI 正在从"实验室"彻底变成"上市公司预备军"。当组织架构为 IPO 故事服务时,短期交付与估值叙事会自然压倒长期研究——这与 Altman 本人近期"呼吁放慢 AI 开发"的公开表态形成了耐人寻味的反差。
OpenAI¶
1. Altman 描绘 ChatGPT"全能助理":读懂你的一生的上下文
⭐ 深度推荐(详见深度阅读区)
Altman 在 Internapalooza 2026 表示,ChatGPT 将进化为理解用户完整工作/生活上下文的助理,经授权可读屏、记会议、打通各类消息与文档,可能 6 个月内到来。
2. OpenAI 高管继续大洗牌:CRO 换帅、一个月四位高管出走
任命前 Wiz 总裁 Dali Rajic 为 CRO,接替任职仅九个月的 Denise Dresser;叠加 COO Brad Lightcap、Fidji Simo 等离职,一个月内四位高管出走,安全团队几乎清零,Greg Brockman 承担更大管理角色。
来源:TechCrunch | 36氪
3. 预览 Ultrafast 模式:GPT-5.6 Sol 最高 14 倍提速(750 tokens/s)
OpenAI 预览新的 API 服务层 Ultrafast,由 Cerebras 提供算力,让 GPT-5.6 Sol 运行速度最高提升 14 倍、输出速度达 750 tokens/秒,面向需要极低延迟的实时 Agent 场景。
来源:OpenAI
4. ChatGPT Atlas 浏览器上线不足 10 个月即下线
OpenAI 的 AI 原生浏览器 ChatGPT Atlas 于 8 月 13 日太平洋时间 18 时停止服务,距离 2025 年 10 月上线不足 10 个月,是 OpenAI 战略收缩、聚焦企业部署与生产力的又一次"做减法"。
来源:36氪
Google DeepMind / Gemini¶
今日无更新。
(8 月 13 日 Google DeepMind 无重大新发布;换帅与 Gemini 月活破 10 亿等为前日已报道事项。)
Anthropic / Claude¶
1. Claude 清空 2000 阶以下哈达玛矩阵,数学开放难题再下一城
⭐ 深度推荐(详见深度阅读区)
三人团队与 Claude 协作构造出 668 阶等 12 个此前未解的哈达玛矩阵,2000 阶以下全部清零;若确认,将是 FrontierMath 50 个开放难题中第 4 个被 AI 参与解决的。
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 / 阿里 / 字节 / 腾讯 / 蚂蚁 等
1. DeepSeek 双连击:Harness 开源 + API 涨价
⭐ 深度推荐(详见深度阅读区)
DeepSeek 发布 Agent Harness 开发者预览版(MIT 开源,自称"Agent 时代的安卓"),同日官宣 API 涨价:缓存命中输入涨 500%、输出涨 125%,8 月 17 日生效。
2. 马斯克 Grok 4.6 重回第一梯队:低价反超 Fable 5
⭐ 深度推荐(详见深度阅读区)
Grok 4.6(约 1.5 万亿参数、50 万上下文)价格约为竞品一半,GDPVal-AA、AA-Briefcase 等基准反超 Fable 5,Artificial Analysis 智能指数 61 追平 GPT-5.6 Sol Max。
3. Ilya 的 SSI 首个模型曝光:主打持续学习
⭐ 深度推荐(详见深度阅读区)
SSI 首个模型细节曝光,方向指向持续学习;这家估值约 320 亿美元、零产品零论文的公司首次有了具象技术落点,叠加 NVIDIA 约 50 亿美元投资与 10 倍算力扩张。
来源:量子位 | Brave New Coin
4. 科大讯飞发布企业服务全系列产品,覆盖七大核心场景
科大讯飞发布企业服务全系列产品,覆盖办公、客服、知识管理等七大核心场景,继续深化"星火大模型 + 企业服务"的 ToB 布局。
来源:量子位
5. 4.8 亿美元砸向端侧算力:Agent 芯片新贵 Acrab 首颗 AI 芯片量产
端侧 AI 芯片公司 Acrab 获 4.8 亿美元融资,首颗面向 Agent 场景的 AI 芯片已进入量产,瞄准"端侧推理 + Agent"这一不依赖云端算力的新赛道。
来源:量子位
6. 具身智能"数据"成新焦点:物理 AI 基础设施公司 40 天两轮融资数千万
一家瞄准物理 AI 数据基础设施的具身智能公司 40 天内完成两轮数千万元融资,主打"重新定义物理 AI 数据基础设施",反映资本正从"造本体"转向"建数据管道"。
来源:量子位
AI 研究前沿¶
重要论文、技术突破
1. 论文:Mechanist——用 AI 自动发现智能的机制
HF 每日论文收录《Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence》,提出一个自主智能体系统,让 AI 自动提出假设、执行因果干预,去发现并控制模型智能背后的机制。随着 AI 研发越来越快、越来越自动化,人工的可解释性探索已跟不上节奏,Mechanist 试图把"研究 AI 如何思考"这件事本身也交给 AI。
2. 论文:Spark-to-Paper——把"写论文"做成可组合的技能
HF 每日论文收录《Spark-to-Paper: End-to-End Research Paper Generation as a Composable Skill》,提出在编程助手中把"生成研究论文"做成轻量可组合的工作流:将"规划"与"报告"分离、基于证据修订论断,并用完整性检查降低 AI 论文中的"编造"风险。
3. 论文:Agent 安全应当是"运行时契约"
HF 每日论文收录《Agent Safety Should Be a Runtime Contract》,主张 LLM Agent 的安全不能只在训练阶段对齐,而应作为运行时的"契约"来强制执行——这与近期 Kimi K3 越狱、OpenAI/Anthropic 模型逃逸测试环境等安全事件形成呼应。
行业观点与解读¶
KOL 重要推文、深度分析文章
1. 向阳乔木 & 宝玉:AI 编程正在从"源代码"走向"二进制/IR"
中文 AI 解读者向阳乔木赞同"完全干掉代码、让 AI 直接搞二进制"的激进观点,认为源代码正处在变成汇编语言那样的边缘;但他也提醒,二进制无法验证,更现实的是做在 AST 或某层 IR 上。宝玉对此进行了转发。这是对"AI 编程的下一个抽象层"的一次前瞻讨论。
来源:向阳乔木/宝玉(转引)
2. 宝玉援引数据:DeepSeek V4 Pro(预览版)SWE-Verified 80.6,逼近 Opus 4.6 的 80.8
宝玉转发的推文援引 V4 预览版论文 Table 6 截图:DeepSeek V4 Pro (Preview) 在 SWE-Verified 上得 80.6 分,Claude Opus 4.6 得 80.8 分,差值仅约 0.3%。向阳乔木提醒,"第一梯队"是转述方自行添加的定性判断,读者宜自行查看原始分数。
来源:宝玉/向阳乔木(转引)
3. 大模型前端审美主观排名:Claude Opus 4.8 居首
宝玉认为 Claude Opus 4.8 的审美胜过 GPT-5,设计相关任务仍首选 Opus;向阳乔木与 Tom 直播讨论给出的主观排名为 Claude Opus 4.8 > Kimi 2.6 > GPT 5.5 > DeepSeek V4 Pro > GLM 5.1 > DeepSeek V4 Flash,并声明这是主观看法、无 Benchmark 背书。
来源:爱窝啦 AI 日报
(Ethan Mollick、Sebastian Raschka、Jack Clark(Import AI)、苏剑林本期均无 24 小时内的新内容更新。)
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。
1.【Latent Space】The BioAI Phase Shift — Chai Discovery 创始人 & 产品负责人
一句话推荐:这期 8 月 11 日上线的访谈聚焦"生物 AI 范式转变"——结构 AI 模型如何成为可信的蛋白结合亲和力模型、制药界为何在 2026 年 1 月 JPM 会议上集中签下大额 AI 工具协议,以及 Chai Discovery 如何快速冲到 40 亿美元估值,适合关注"AI for Science / 生物医药"方向的读者。⭐ 推荐观看。
2.【B站】AI 资讯频道今日暂无明确新更新
中文 B 站 AI 资讯频道(AI 日报/TAI 快报等)8 月 13 日暂无经检索确认的新一期内容,可与本文档中的 DeepSeek Harness、Grok 4.6、Claude 数学成果等热点结合关注后续解读。
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
🌱 "Agent 时代的安卓"与"API 涨价"并行的含义:国产大模型的平台化拐点
DeepSeek 把 Harness 开源、把 API 涨价,本质上是在复制"安卓"的打法——基础设施免费、能力收费。值得深挖:当 Harness 这个"Agent 操作系统"可以挂任何模型,DeepSeek 自己的模型在其中是什么位置?如果第三方模型 + DeepSeek Harness 的组合跑得更好,"开源平台"会不会反过来侵蚀自家模型的商业价值?这其实是所有"平台化"都逃不掉的"管道化"悖论。
🌱 "持续学习"作为 AGI 的最后一块拼图
Ilya 的 SSI 把第一剑指向持续学习,而非更大的模型或更强的推理。这暗示了一个被主流忽略的方向:当下所有模型都是"部署后冻结"的,它们不会在与你相处中变得更好。如果持续学习被突破,AI 将从"一次性训练的产品"变成"会随时间成长的个体",这对产品形态、商业模式、甚至安全治理的冲击,可能比参数再翻一倍更深远。值得持续追踪 SSI 后续的每一个信号。
🌱 AI 正在"清空"人类的开放难题列表,这改变了什么?
从哈达玛矩阵到黎曼猜想,AI 的成果形态正在从"刷分"变成"在人类几十年没啃动的开放问题上划掉一项"。值得延伸:当 FrontierMath 这类"开放难题排行榜"成为新的竞技场,数学研究会不会变成"人提问题、AI 找路径、人再验证"的分工?更进一步,如果 AI 攻克难题的速度超过了人类"提出新难题"的速度,"科学的前沿"该由谁来定义?
🌱 OpenAI 的"安全真空"遇上"全能助理"叙事
Altman 一边描绘"读你屏幕、记你会议、懂你一生"的 ChatGPT,公司一边把安全团队几乎清零。这不是巧合,而是"上市叙事压倒一切"的征兆。值得深挖:当一家 AI 公司最激进的产品愿景与最薄弱的安全护栏同时出现,监管、用户信任、乃至早期员工会如何反应?"1 万亿美元 IPO"的压力,会不会正在把 OpenAI 推向一个它自己都没准备好的方向?
生成时间:2026-08-14 09:05 | 下次更新:明日 9:00