AI 每日简报 | 2026-09-07¶
今日概览¶
过去一个周末,AI 行业沿两条主线推进:一边是"密集迭代"带来的疲劳与话语权之争——黄仁勋喊出"AGI 已经到来"、科技巨头一周内连发多款模型让"模型疲劳"成为真问题;另一边是"深度能力"的实质突破——Claude 完成费马大定理首个计算机可验证的形式化证明、GPT-6 Astra 带火循环 Transformer 架构、阿里 11 个月前的前瞻布局被翻出。数学形式化与架构创新,成为这个周末真正值得记住的两件事。
- Claude 完成费马大定理首个完整形式化证明(约 1300 万行 Lean)
- OpenAI 首席科学家 Pachocki 发长文《An Alien Mind》回应对齐争议
- 黄仁勋称"AGI 已经到来",Gary Marcus 公开反驳
- GPT-6 Astra 带火循环 Transformer,阿里 MeSH/SpiralFormer 早已布局
- 陶哲轩警示:AI 抢答数学难题反而可能阻碍数学发展
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ Claude 攻克费马大定理:首个可被计算机完整检查的证明¶
Anthropic 宣布 Claude 完成了费马大定理的首个端到端、可由计算机逐行检查的形式化证明。工程规模约 1300 万行 Lean 代码、超过 3 万个中间定理(最终证明使用其中约 29500 个),规模超过 Lean 核心数学库 Mathlib 的 5 倍。主导者 Tianyi Peng 是清华姚班校友、MIT 博士、哥伦比亚大学助理教授兼 Anthropic 研究员,长期聚焦强化学习与 AI Agent。值得注意的是,Claude 并没有发现一个全新的证明,而是把人类数学家能读懂的证明,彻底翻译成计算机能"一行一行检查、没有一句『这里显然』"的形式化证明——这件事数学界原本按"多年工程"来规划(帝国理工 Kevin Buzzard 团队 2024 年才启动多年社区项目,仅第一阶段蓝图就写了 86 页),Claude 用约 11 天干到了终点。
核心观点:形式化证明是"AI 做数学"的另一条高价值路线——不求新定理,而把已有证明变成机器可 100% 验证的代码。这正是安全关键系统、金融、法律等对"可靠性"要求极高的场景最缺的能力。
来源:量子位
⭐ An Alien Mind:OpenAI 首席科学家的对齐反思¶
OpenAI 首席科学家 Jakub Pachocki 发文《An Alien Mind(异星心智)》,反思越来越强的 AI 与"让它保持对齐"之间的挑战,呼吁更强保障与国际协调。这正是此前 GPT-6 Astra 因"循环深度"技术被 AI 安全专家集体讨伐后,Pachocki 承诺要写的"完整解释"。
核心观点:当模型能力逼近甚至超越人类在特定任务上的表现,对齐问题正从工程问题升级为治理问题——单靠一家公司的安全措施不够,需要国家层面的协调。
来源:OpenAI
⭐ 黄仁勋:AGI 已经到来¶
英伟达 CEO 黄仁勋在 X 上祝贺 OpenAI 发布 Astra,称"从 ChatGPT 到 o1 再到 Astra 只用了 4 年,AGI 已经到来"。OpenAI 总裁 Brockman 此前也喊出"欢迎来到 AGI 时代"。批评者 Gary Marcus 则认为为时过早,指出黄仁勋没有提供科学定义、也没有给出证据,并附上自己的 10 项 AGI 定义标准,Astra 目前只能满足其中一部分。
核心观点:AGI 的定义权正在成为行业话语权之争——一方用"能力里程碑"叙事(发布会话语),一方坚持"科学定义"标准。这场争论背后是"该不该现在就按 AGI 尺度监管"的政策分歧。
来源:IT之家
⭐ GPT-6 带火循环 Transformer,阿里早已布局¶
The Information 爆料 GPT-6 Astra 使用"循环深度"(recurrent depth)技术:让同一组 Transformer 层反复运行,用计算深度换参数规模,不必继续堆参数也能"多算几轮"。阿里早在 11 个月前就发了两篇顶会论文直指循环架构两大痛点:MeSH 解决循环内部信息管理("循环空转"),SpiralFormer 死磕循环间"以什么精度计算"的粒度问题。此前 Claude Mythos 也曾带火循环架构——在 GraphWalks BFS 的 256K 至 1M 上下文测试中,Mythos Preview 拿到 80.0%,而 GPT-5.4 只有 21.4%。
核心观点:循环架构让大模型获得一种新的"变强方式"——过去 Scaling 靠堆参数(24 层要 24 套参数),现在 8 层参数跑 3 遍也能完成 24 层深度计算。若"用计算深度换参数规模"这笔账算得过来,下一代高效大模型的竞争格局将被重写。
来源:量子位
⭐ 陶哲轩:AI 抢答数学难题反而可能阻碍数学发展¶
一向拥抱 AI 的陶哲轩罕见发出 AI 告警:AI 解题太快、过程又太黑盒,可能掩盖数学研究过程中宝贵的"失败"。GPT-6 Astra 刚发布就把孪生素数猜想中连续素数间距的上界从 246 推到 186,但他指出"一旦提前知道答案,就很容易抑制对其他路线的探索——那些表面看是死胡同的路线,它们为什么失败本身往往极具启发性"。他担心 AI 生成的答案会"污染"开放问题(如纳维-斯托克斯方程),使其不再成为推动后续数学进展的源泉。
核心观点:对科学而言,过程可能比答案更有价值。AI 工具若"提前剧透"最终拟设,会破坏研究生态的探索多样性——这对开源、论文评审甚至科研激励设计都有深远影响。
来源:量子位
⭐ 苏剑林《让炼丹更科学一些(九)》:进入自适应梯度算法世界¶
月之暗面研究员苏剑林的"炼丹"系列第九篇,正式从 SGD 及其学习率转入自适应梯度算法。他回溯指出,现在所有自适应梯度算法都有一个共同源头——2011 年的经典 AdaGrad(《Adaptive Subgradient Methods》),后续的 RMSProp、Adam 等都是在它的思路上演进。
核心观点:理解优化器演进的源头脉络,是把"炼丹"经验科学化的关键路径——从"调什么参数"上升到"为什么这么调"。
来源:科学空间
⭐ 星尘智能 SmoothRL:让强化学习对齐机器人的"真实执行"¶
星尘智能(Astribot)基座模型团队发布异步执行下的在线强化学习框架 SmoothRL。核心问题:现在 VLA、World-Action Model 一次生成未来一段动作序列(action chunk),模型越来越大、推理越来越慢,机器人不能隔几百毫秒就停下来等模型,于是部署中普遍采用"异步推理"(手上做 A、模型已在算 B)。但这就导致"模型计划过的动作"和"机器人真正做过的动作"不再完全一致。SmoothRL 的核心思想是:机器人真正执行了什么,就只对什么做强化学习——只让梯度穿过 execution region(执行区域),不让"来不及改"或"根本没发生"的动作被记功或背锅。
核心观点:当"模型计划"与"机器人实际执行"出现系统性偏差,RL 的优化目标必须对齐真实执行轨迹。这是具身智能从实验室走向真实高动态任务(如投掷)的关键工程问题。
来源:量子位
⭐ "模型疲劳":科技巨头密集更新,用户开始跟不上¶
据 CNBC 报道,本周 AI 行业迎来密集更新——Anthropic 更新了 Fable 和 Mythos 模型,Meta 和谷歌相继推出模型升级,OpenAI 紧接着发布 GPT-6 Astra。奥特曼在接受 CNBC 采访时称"我们都在加快迭代节奏",部分原因是"大家都结束暑假回来了"。但对用户而言,这种速度带来了复杂性和混乱——企业 CEO 和 IT 管理者不得不投入大量时间比较不同产品的价格与能力。AI 初创公司 Runpod CEO 直言"模型疲劳"已成真问题:"我们现在所处的环境有太多泡沫,企业不得不不断制造声量。"
核心观点:模型更新从"事件"变成"常态"后,注意力与评估成本成为新瓶颈。"密集发布"对厂商是竞争需要,对用户却是认知负担——这是否会倒逼行业从"堆发布频率"转向"拼差异化与稳定性",值得观察。
来源:IT之家
OpenAI¶
An Alien Mind(异星心智) ⭐¶
Research acceleration:OpenAI 内部的研究加速观¶
OpenAI 发文展示内部数据:coding agents 正在重塑 AI 研究本身,公开了 agent 使用情况、实验速度、任务复杂度等方面的早期数据。这是一篇理解"AI 如何加速 AI 研究"的一手材料。
来源:OpenAI
Google DeepMind / Gemini¶
今日无更新。
Anthropic / Claude¶
Claude 完成费马大定理首个完整形式化证明 ⭐¶
Anthropic 15 亿美元版权和解金开始发放,分配争议不断¶
Anthropic 就版权集体诉讼达成和解:法院裁定其用受版权保护材料训练模型属"合理使用",但通过盗版方式获取的近 50 万部作品需赔偿原作者,标准为每部 3000 美元,合计 15 亿美元。和解方案今年 7 月获最终批准,赔偿金近期进入发放流程。但按协议"传统出版图书由作者与出版社各分 50%",近期有作者公开质疑部分出版社申领了超过应得比例的赔偿金。
来源:IT之家
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 等
GPT-6 带火循环 Transformer,阿里早已布局 ⭐¶
星尘智能发布 SmoothRL ⭐¶
押中 SpaceX 的硅谷老将,把票投给了一家中国世界模型公司¶
量子位报道,一位曾押中 SpaceX 的硅谷投资老将,近期投资了一家中国世界模型公司。文章以"AI 预演一场暴雨"切入,论证大模型缺的是"物理世界通路"——它能读懂语言却看不懂物理世界,面对洪涝等极端场景无法回答"水往哪流、几分钟后到哪、会淹没谁"。量子位智库提出框架:世界模型是空间智能发展的终局状态,是"AI 的下半场"。
来源:量子位
具身 ICL 来了创业玩家:上下文成 Scaling 新赛道¶
量子位报道具身智能领域出现新方向——具身 ICL(In-Context Learning),让机器人学会利用更长的多模态 Context,上下文长度正在成为继参数、数据之后具身智能的又一条 Scaling 维度,并已有创业玩家入局。
来源:量子位
趋境科技与摩尔线程达成战略合作¶
双方围绕国产异构算力展开合作,宣称在"高品质 AI Token"上实现生产级性能、性价比超越国际先进算力。这是国产 GPU 在推理侧商业化的又一进展信号。
来源:量子位
AI 研究前沿¶
重要论文、技术突破
陶哲轩:AI 抢答数学难题反而可能阻碍数学发展 ⭐¶
苏剑林《让炼丹更科学一些(九)》 ⭐¶
这个世界模型训练完就"退场",机器人反而更能干了¶
量子位介绍一种"反骨"的世界模型训练思路:训练完就"退场"(不在推理时被调用),却让下游机器人策略更鲁棒。这类方法指向一个趋势——世界模型的价值未必是"直接决策",而是作为训练期的"世界模拟器"来提升策略泛化。
来源:量子位
Post-Training Science for Supervised Fine-Tuning¶
一篇系统化研究 SFT 的论文:每次 SFT 都要重新决定学习率、batch size、LoRA 还是全量微调、训练多少 epoch、用哪个优化器、喂什么数据,而这些决策通常每次从头试错。论文用"一次只变一个杠杆"的大规模扫描,在稠密与 MoE 模型上度量了这些选择的影响,试图把 SFT 从"炼丹"变成"科学"。(注:HuggingFace 每日论文直源本周不可用,本条目来自备用源 Takara,最新榜滞后约 3–4 天)
来源:Takara
行业观点与解读¶
KOL 重要推文、深度分析文章
黄仁勋:AGI 已经到来 ⭐¶
"模型疲劳"问题凸显 ⭐¶
AI 短剧爆发带火"人脸授权",普通人肖像约每部 100 元¶
据央视财经报道,AI 短剧、数字广告快速扩张催生"人脸授权"这门新生意——普通人无需出镜、试镜,靠面部形象即可收费,数字肖像按每部短视频约 100 元计,专业演员则按使用范围和剧集长度定价 500 元到数千元。行业机构 DataEye 估算,今年前 5 个月 AI 短剧市场规模已突破 220 亿元,全年有望冲击 400 亿元;一季度上线的微短剧中 AI 占比超 95%。
来源:IT之家
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。
今日无更新。
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
循环架构会不会成为"第二 Scaling Law"的支点?
从 Astra 到 Mythos 再到阿里 MeSH/SpiralFormer,"循环深度"用计算换参数,让模型"不必一直长肉也能变强"。如果这条路线成立,算力定价、模型存储、推理成本、甚至开源权重的大小都会被重估——过去以"参数量"为核心的竞争叙事,可能要切换到"等效深度"。这值得持续跟踪各家的实测数据,而不是只看发布会话术。
"形式化证明"正在成为 AI 能力的可信度底座
Claude 把费马大定理翻译成 1300 万行 Lean,说明"机器可逐行验证"正成为高价值 AI 应用的门槛。安全关键系统、金融、法律等领域对"可审计"的刚性需求,可能催生一批围绕形式化验证的新工具链与创业机会——这条赛道目前还远未拥挤。
AI 时代的科研"污染"问题
陶哲轩的警示值得深挖:当 AI 能直接吐出答案,研究过程的价值如何保留?这不仅是数学界的问题——它可能改变开源策略(要不要隐藏关键中间结果)、论文评审(如何证明过程独立于 AI 的"剧透")、乃至科研激励设计(如何奖励"有价值的失败")。这个方向目前几乎无人系统讨论,是潜在的空白点。
生成时间:2026-09-07 08:37 | 下次更新:明日 9:00