AI 每日简报 | 2026-09-22¶
本期覆盖窗口:9 月 21 日 09:00 至 9 月 22 日 18:36(约 34 小时)。本日为二次执行:上午已生成一版覆盖至 09:00 的简报,午后云栖大会、Grok 4.7、小米开源模型等重磅集中在 09:00 之后落地,故本期重写为全天版,上午条目一并保留。
今日概览¶
今日真正的分水岭在下午:杭州云栖大会一次性把「模型 — 芯片 — 云」三件事同时抬到 ASI 叙事上(Qwen3.8 + 真武 V900 + 2032 年 20GW),小米用 300 万美元训出登顶开源榜的 MiMo-V2.6-Pro,SpaceXAI 用「价格不变、跑分平庸」的方式发布 Grok 4.7。加上腾讯混元生图、华为 openJiuwen 智能体资产平台、穹彻 RoboRSI,国内厂商在同一天把「能力供给」和「系统层基础设施」两条线同时推了一格。研究侧,清华与斯坦福在 LLM 内部定位出奖励子系统,腾讯混元给出了 RL 训练 Batch 规模的临界边界。
- 阿里云栖大会:发布 Qwen3.8,预告 5–10T 参数模型与真武 V900 芯片,2032 年数据中心目标超 20GW
- 小米 MiMo-V2.6-Pro(1T-A42B)登顶开源权重榜,训练成本约 300 万美元
- SpaceXAI 发布 Grok 4.7:价格与上代持平、长任务显著提升,但跑分被网友评为「差到不该发布」
- 清华 + 斯坦福在 LLM 内部定位「奖励子系统」:价值神经元与多巴胺神经元
- 华为 openJiuwen 发布 Agentic Hub,把 Agent 能力做成可发布、可安装的资产
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ 阿里云栖大会:把 ASI 叙事拆成模型、芯片、云三张账单¶
9 月 22 日,2026 杭州云栖大会开幕。阿里同时公布三件事:新一代基座大模型 Qwen3.8 发布(官方称整体性能处于全球第一梯队),Qwen3.8-Max 预计下周开源,同时开源 Qwen3.8-27B;世界模型 HappyOyster 2.0 Preview 亮相,主打智能实时交互、记忆、实时响应与物理规律遵循;平头哥发布新一代 AI 芯片 真武 V900,算力提升至真武 M890 的 3 倍,单一集群可扩展至 50 万卡;阿里云目标到 2032 年全球运营数据中心规模超过 20GW。吴泳铭在演讲中给出判断框架:机器思考总量未来将达人类的 1000 倍以上,而今天这一比例不到 3%,「机器智能时代的三大基石是 AI 模型、AI 芯片和 AI 云」。(来源:量子位、量子位)
核心观点:这场演讲最值得记的不是任何一个数字,而是它把「ASI」从愿景词换成了三张可核对的账单:模型的参数规模(5–10T)、芯片的集群上限(50 万卡)、云的电力和机房(20GW)。吴泳铭用 1900 年全世界一年发电量只够今天用两小时来类比,实际是在说一件事——当智能变成按量供给的商品,瓶颈就从「谁的模型更聪明」转移到「谁能把每 token 的成本压到最低、把供给铺到最广」。这也是阿里与其他国内厂商最清晰的战略分歧点:别人在卷模型榜单,阿里在卷「发电站 + 电网」。对企业采购方,这意味着未来两年的议价空间可能来自「模型可替换性」而不是单点性能:当 Qwen3.8-Max 下周开源、Qwen3.8-27B 可本地部署,闭源旗舰的定价权会被进一步稀释。
⭐ 小米 MiMo-V2.6-Pro:300 万美元训出开源权重第一,训练成本本身成了卖点¶
9 月 22 日,Latent Space 的 AINews 日更以「crowning a new Chinese frontier lab」为题报道小米发布 MiMo-V2.6 系列:MiMo-V2.6-Pro(1T 总参数 / 42B 激活)、MiMo-V2.6-Flash,以及输出速度最高 20 倍的 MiMo-V2.6-Pro-UltraSpeed。MiMo-V2.6-Pro 在 Artificial Analysis Intelligence Index 上取得 46 分,登顶开放权重模型;每个智能指数任务的成本为 0.13 美元,落在「智能 vs 单位任务成本」的帕累托前沿上。报道强调其训练成本约 300 万美元,并同时开源了技术报告、verl 的 code/ARVO/general/webdev/music 等训练配方、agent 配置与 mimoagent 环境;配套的环境数据工厂论文描述了「从开放仓库生成 RL 任务、并在回路中放入 agent 以保证鲁棒性与反作弊」的方法。(来源:Latent Space)
核心观点:这条最值得注意的不是 1T/42B 的稀疏结构——那是 2026 年的标准动作——而是「训练成本」第一次被当作开源发布的核心指标来打。300 万美元这个量级意味着:前沿开源模型的入场券,已经从「有没有万卡」变成「有没有一套能把开放代码库自动转成可验证 RL 环境的流水线」。这与上周 CodeMidas(从开源代码库构造编码 Agent RL 环境)是同一件事的两个侧面:一个提供方法论,一个提供工程实现和成本证明。对国内团队,这里有一个可以立刻抄的作业——小米选择开源的不只是权重,还包括环境与奖励配方(ARVO、webdev grading、music scorer)。当环境比权重更稀缺时,谁开源环境,谁就在定义下一轮训练的默认起点。
⭐ Grok 4.7:一场「价格不变、长任务提升、跑分平庸」的发布¶
9 月 22 日,SpaceXAI 发布 Grok 4.7。定位语极具攻击性:「面向编程与知识工作的最强模型,速度达到可比模型的两倍,价格只有一半。」实际升级点在于更大的基础模型 + 更长的强化学习周期 + 自我检查与长上下文管理。官方数据:CursorBench 4.0 从 40.4% 提升到 46.3%,DeepSWE v1.1 高推理强度 71.0%,Terminal-Bench 4.0 从 20.3% 跃升到 38.0%;专业任务上 AA Briefcase v1.1 从 1546 升到 1657,GDPval Elo 从 1605 升到 1695(官方图表中接近 Fable 5.1 的 1735,高于 GPT-6 Astra 的 1542);生物安全 LatchBio 基准以 62.4% 登顶,HackerBench v0.3 仅放行 3.3% 高风险双重用途提示。标准版定价维持每百万输入 2 美元、输出 6 美元不变。模型被训练为原生理解 Grok Bot 的运行框架。但社区反应冷淡,有评论直言「这种模型居然也敢发布」。(来源:机器之心、x.ai)
核心观点:Grok 4.7 是一次「定价策略比能力提升更激进」的发布。把 Terminal-Bench 从 20.3% 拉到 38.0% 是实打实的进步,但 GDPval 上仍落后 Fable 5.1、AA 指数上被小米的开放权重模型追平,导致「最强」的自我定位与第三方评测之间出现落差。真正值得记的是它验证了一个正在成型的市场结构:前沿模型的能力差距在收窄,价格差距在放大。当开源侧(MiMo-V2.6-Pro 每任务 0.13 美元)和半价旗舰(Grok 4.7)同时挤压,「用最强模型做每一步」的默认配置会越来越站不住脚——这正是基元律动今天在云栖大会讲的那件事(见下文),也是 BestBlogs 周刊第 113 期「模型之外的尺子」反复强调的判断。
⭐ 清华 + 斯坦福定位 LLM 内部的「奖励子系统」¶
9 月 22 日,机器之心报道清华与斯坦福的联合研究。此前的工作只能说明隐藏状态里「存在」与答案正确性、置信度、奖励相关的信息;这项研究进一步定位到一小部分神经元,并称之为 reward subsystem。两类神经元被区分出来:价值神经元(value neurons)编码当前状态继续推理下去最终答对的预期概率;多巴胺神经元(dopamine neurons)编码逐步的时序差分误差(TD error),即某一步推理让成功概率发生了多大变化。剪枝实验显示,只保留不到 1% 的神经元仍能较好预测状态价值;而在 Qwen-2.5-7B-SimpleRL-Zoo 上,把某一层排名前 1% 的价值神经元置零后,MATH500 准确率从 75.2% 掉到 20.3%,随机置零同样比例则几乎无影响——这提供了因果证据。应用上,价值神经元可作轻量置信度估计器(MATH500/ARC 平均 AUC 0.67,高于完整隐藏状态探测器),多巴胺神经元可作流程奖励模型,让模型每步生成 4 个候选再择优,MATH500 准确率 77.8%(贪心解码 72.2%,论文中隐式 PRM 75.0%)。(来源:机器之心、arXiv:2602.00986)
核心观点:这项研究把「模型能不能自我评估」从一种行为观察变成了可定位、可干预、可利用的机械结构。如果奖励信号真的集中在不到 1% 的神经元里,那么至少有三件事会变简单:一是置信度估计不必再训一个外部探测器,直接从初始隐藏状态读即可;二是过程奖励模型可以内生化,不必额外训练;三是安全与可解释性有了新的抓手——如果一次推理的「信心低谷」可以在神经元层面看见,那么「模型在什么时候开始不确定」就变成一个可监控信号,而不是只能等输出变坏。它与上周「思维链可监控性正在下降」的担忧正好构成一对张力:外部叙述越来越不可信,内部信号却越来越可读。这条线索值得作为接下来一个月的持续观察对象。
⭐ 华为 openJiuwen 发布 Agentic Hub:把 Agent 能力做成可流通的资产¶
9 月 22 日,openJiuwen(由华为 2012 实验室、华为云、终端、计算、算力先遣队等联合高校与企业共建的开源 AI Agent 平台)发布 Agentic Hub,称其为首个开源智能体资产平台。核心设计是把 Agent 周边能力拆成五类资源:技能(沉淀方法,以 SKILL.md 为入口)、连接器(接入外部系统,含认证与状态管理)、插件(打包提示词/工具/Rail/技能/MCP)、专家(可安装的角色模板)、专家团队(Leader + Members 的协作配置),并让它们走完「创建/获取 → 安装 → 装配使用 → 发布/共享 → 再次获取」的完整生命周期。openJiuwen 还提供本地技能自动演进:Agent 完成任务后根据执行过程、失败信号或用户反馈生成经验记录,不直接覆盖原始技能,而是沉淀到本地经验文件与技能索引中供下次读取。值得注意的是,平台明确支持把 WorkBuddy、千问办公等第三方平台已沉淀的专家资产转换为 openJiuwen 专家资源。(来源:机器之心)
核心观点:这是 BestBlogs 周刊第 113 期「模型之外的尺子」在工程侧的一次正面回应。当模型能力本身在商品化,「能力从哪里来、如何被复用」就成了新的竞争面。openJiuwen 的判断——单次 Prompt 和临时 MCP 调用无法沉淀为下一次可用的资产——与字节 OpenViking、Vercel 的 Eve 是同一个方向。但真正有信号价值的是最后那句「支持把第三方平台的专家资产转换过来」:这说明国内 Agent 生态已经开始出现「资产可迁移性」的诉求,谁定义资产格式,谁就掌握了迁移的枢纽位置。对做 Agent 产品的团队,这是一个需要现在就回答的问题:你们沉淀的能力是锁在自己产品里的功能,还是能被别人安装、导出、复用的资源?
⭐ 穹彻 RoboRSI:给具身智能补上「Harness」¶
9 月 22 日,机器之心刊出对穹彻智能 RoboRSI 的报道。文章的起点是一个尖锐的对照:GPT-6 Astra 在机器人控制任务中成功率达 95%(Fable 5.1 为 40%),输出 Token 仅为后者的约 ⅙.2、成本约 ½.3,Robocurve 称如果趋势持续,LLM 最早今年年底、最晚 2029 年可实现对机械臂的实时控制;但 RoboDojo 团队在官方评测中指出,「Astra 在真机测试中反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏」,出于安全考虑提前停止测试,Astra 未能完成原定 18 项任务的 RoboDojo-Real 评测。RoboRSI 的方案是四类智能体(Manager / Planner / Engineer / Reviewer)协作闭环 + 四层技能树 TSR(任务族 → 复合技能 → 原子任务 → 基础技能)+ 代码固化(把反复验证过的调用链固化为代码技能)。实测:LIBERO 零样本适配累计通过率从 32/120 提升到 95/120,RoboTwin 从 9/50 到 36/50(多智能体配置比单 Engineer 基线通过率提升 4 倍);代码固化让 LIBERO 通过率从 21.5% 升到 29.0%,中位 Token 消耗下降 29.4%、VLM 调用次数下降 27.2%、执行时间下降 17.0%;LIBERO-Plus 的 840 个扰动实例中通过率从 31.1% 升到 47.4%。作者称同类家庭清理 Demo 在 2024 年需两名工程师约一个月、2000–3000 行代码,而 RoboRSI 框架下一天走完完整闭环。(来源:机器之心、技术博客)
核心观点:这篇和昨天那条「150 美元机械臂」是同一场辩论的两端。昨天的结论是「壁垒在模型大脑」,今天这条补上了被漏掉的另一半:模型能理解任务,但不能负责现场恢复、不判断执行是否成功、不决定从哪个节点继续——这些恰好是物理世界里代价最高、也最需要系统层能力的地方。RoboDojo 那句「反复发出物理上不合理或不安全的动作」是整篇最有价值的一句实话:95% 的成功率与「损坏硬件」可以并存,因为平均值掩盖了尾部。对具身团队,这意味着竞争维度要重排:模型能力是入场券,行为约束框架、经验的结构化复用、部署后的持续迭代才是护城河。穹彻自己给出的三条也值得直接借用——经验管理、安全约束、部署后迭代,注意这三条全都与模型权重无关。
⭐ 腾讯混元:RL 训练的 Batch 到底能开到多大¶
9 月 22 日,机器之心刊出腾讯混元团队论文《When Do Larger Batches Help Scale LLM Reinforcement Learning?》(arXiv:2608.29296)的解读。核心框架是把「达标时间」(time-to-target)拆成两种效率的乘积:样本效率(每条回答带来多少学习进展)与系统效率(每秒能生成并处理多少回答)。结论是一个可操作的两步法:先对齐学习效果,再优化吞吐。具体发现包括:GRPO 在 16 倍 prompt batch 范围内(P=64 至 1024,G=8)经学习率平方根调整后近似 Batch Size Invariance,到 P=2048/4096 开始偏离;PPO 中 actor 与 critic 的梯度尺度不同,可能拥有不同的有效 Batch;GRPO 的 Batch 单位更应看总回答数(PG)而非单独的 prompt 数或 group size;保持学习率不变会破坏不变性——固定学习率把 Batch 翻倍后,达标需要参考配置 1.50–1.67 倍的样本消耗。实测最优配置(P=1024,G=8)不增加 GPU 就把达标时间从 11.90 小时降到 8.42 小时(缩短 29%),但 P=2048/4096 反而升至 1.23/1.18 倍;P=256 若固定学习率则变为 1.42 倍。(来源:机器之心)
核心观点:这是今天信息密度最高的一篇工程论文,因为它推翻了一个非常流行的默认操作。「加卡 → 扩大全局 Batch」在实践中几乎是反射动作,而这篇论文用实验说明:训练稳定 ≠ 不变性成立,大 Batch 可以因为梯度噪声变小而显得更平稳,同时悄悄消耗更多样本。对训练团队,可立即执行的动作是把「改 Batch 必先调学习率」写进流程;对评估团队,则是那句提醒——只比较相同更新步数后的分数,会把「看过更多样本」误当成「学得更好」。论文自己划的边界也很诚实:换模型、换奖励、换任务分布、换推理引擎后,已测的有效 Batch 范围不能照搬。
⭐ OpenAI 把「上下文」做成资产:V7 的机构记忆与数学顾问组的一百道题¶
9 月 21 日,OpenAI 在官方博客上集中发布三则内容。《How V7 gives AI agents institutional memory》:V7 使用 GPT-5.6,把散落的企业文件转成 Agent 可用、可溯源的工作上下文。《Expanding OpenAI Academy with new learning paths》:面向员工、开发者、领导者、教育者和学生推出新的学习路径,用于建立和展示实用 AI 技能。此外,机器之心对 9 月 21 日公布的数学顾问组给出了更多细节:在一道千禧年大奖难题的解答仍在接受数学界审视的同时,超过 100 道长期开放问题已被内部模型解决,这些结果正等待顾问组审查。(来源:OpenAI、OpenAI、机器之心)
核心观点:「100+ 已解决的开放问题」这个数字,比「成立顾问组」这件事本身重要得多。它把 OpenAI 昨天的《Building standards》和《Advisory Group on Mathematics》从「治理姿态」拉回到「能力事实」:如果模型真的产出了上百个待审的数学结果,那么顾问组的首要任务不是挑选题目,而是建立一套能承受批量结论的审查流水线——分层处理猜想、证明草稿与可验证结论。这与 V7 那条「机构记忆」是同一条逻辑的两面:一个处理企业内部散落的文件,一个处理数学界散落的证明。两者都在做同一件事:把「上下文」变成可核验、可追溯的资产。对做企业 Agent 的团队,V7 那条尤其值得拆解——它说明卖点已经从「模型能读你的文件」转向「模型读完还能说清这句话出自哪一页」。
⭐ Import AI 473:RAND 的超级智能战略、鼠脑人组织、以及 RSI 的四阶段模型¶
9 月 21 日,Jack Clark 发布 Import AI 第 473 期。三条主要内容:其一,RAND 发布长文讨论美国应如何「在通往超级智能的不确定路径上确保地缘政治优势」,核心结论是保持「行动自由」(Freedom of Action)策略,因为最优解未知,应花钱保留选项;文章梳理了共存(支配/共同开发/预备)、拒止(暂停/威慑/社会延续)、加速三类共七种原型策略,以及五个关键不确定性(危险临近度、共存可行性、约束可行性、决定性战略优势、压制可行性)。Clark 的评论很直接:美国目前的实际策略基本等同于「加速」,好比把全部资源投在让车跑得更快,而不装安全带、车灯或刹车。其二,有研究团队把人类干细胞来源的皮层类器官移植进故意耗竭谷氨酸能神经元的小鼠大脑,生成「异种皮层小鼠」(XCX),人类皮层神经元与小鼠神经系统整合并形成有组织的活动模式,迷宫测试中对照组与 XCX 组表现高于随机水平,而脑组织被耗竭的组没有。其三,Toby Ord 尝试为 RSI 建立动力学模型,认为递归自我改进最终会受资源与时间约束(生成时间不可能趋近于零),并把智能爆炸拆成四个阶段。此外还有「无审查模型」生态的地图(HuggingFace 上 3471 个无审查模型仓库,中国来源模型占 38%,中国在新增无审查模型产出中的份额从 2024 Q1 的 1% 升到 2025 Q2 的 55%)。(来源:Import AI 473)
核心观点:这期周报里最值得带走的是 Clark 对「加速」策略的那个比喻——因为它是今天所有治理讨论里最不需要背景知识就能理解的一条。 把它与今天 OpenAI 的标准提案、Anthropic 的「度量研发节奏」放在一起,会发现前沿实验室和政策圈正在形成一个不太常见的共识:问题不是要不要继续,而是有没有人在造仪表盘。 另外两条也有实用价值:鼠脑人组织实验提示「可构建的智能形态」的空间比通常假设的大得多;而无审查模型生态的数据——中国来源模型占 38%、新增产出份额两年内从 1% 到 55%——是理解「开源权重治理」争论时绕不开的量化背景。
⭐ 小米之外的另一条线:云栖大会上的模型路由与 RSI 飞轮¶
9 月 22 日,在云栖大会企业级 Agent 实践峰会上,基元律动联合创始人兼 CTO 韩凯发表演讲《从 Harness 到 RSI 飞轮》。他给出的产业判断是:多模型长期异构并存、算力资源多元供给将成为长期结构;据国家数据局披露,2026 年 3 月我国日均 Token 调用量已超过 140 万亿,较 2024 年初增长超千倍,而一次复杂 Agent 任务往往涉及十余次乃至数十次模型调用。公司以开源项目 OpenSquilla 探索模型路由:在特定端到端 Agent 评测配置下,保留了固定旗舰模型基线 99.96% 的任务质量,同时成本降低 88.9%;在 DRACO 深度研究评测中,多模型协同得分超过该组最强单模型基线,成本约为其三分之一。反馈闭环方面,9 月发布的 NeoHorse-1 基于通义 Qwen3.5 底座后训练,4B 版本宏平均从 58.94 提升到 64.87,9B 版本从 65.60 提升到 69.04;其中 4B 后训练版在 VitaBench、τ²-Bench、PinchBench、QwenClawBench、HumanEval 五项上超过 Qwen3.5-9B 底座。基础设施侧由阿里云提供云服务、无问芯穹提供算力与优化。(来源:量子位)
核心观点:这条与 Grok 4.7 是同一天、同一个问题的两种回答。 Grok 4.7 的答案是「用半价提供接近最强的能力」,基元律动的答案是「让每一步任务用对模型」。两者都指向同一个结论:当模型能力收敛、价格发散,路由层会从工程细节升级为独立的商业层。 更值得注意的是最后那组 NeoHorse-1 的数据——它把「模型路由」和「模型迭代」接成了一条回路:路由过程中积累的任务经验,反过来用于改进模型本身。这正是「模型之外的尺子」在商业上最直接的一种变现方式:你不必拥有最好的模型,你可以拥有最好的「判断该用哪个模型」的证据。
OpenAI¶
V7 用 GPT-5.6 给 AI Agent 装上「机构记忆」¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
OpenAI Academy 新增学习路径¶
9 月 21 日,OpenAI 扩展 Academy,面向员工、开发者、领导者、教育者与学生推出新的学习路径,目标是建立并展示实用的 AI 技能。属于教育侧产品更新,本身信息量有限,但可视为 OpenAI 在企业培训场景的持续投入。(来源:OpenAI)
数学顾问组细节补充:100+ 开放问题待审¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
上午三条(共享标准 / 数学顾问组 / Higgsfield 案例)¶
9 月 21 日,OpenAI 发布《Building standards for the next phase of AI》,主张为 AI 建立更具协作性的全球标准体系,重点是共享评测、统一报告方式以及与治理机制衔接,承认单家公司自报能力与风险已不足以支撑产业协作;同日宣布与独立的 Mathematics and Artificial Intelligence Advisory Group 合作,指导 AI 数学成果的审查与传播;并以 Higgsfield AI 为案例,介绍其借助 GPT-6 Astra 在一天内把新的视频创意功能推向产品。(来源:OpenAI、OpenAI、OpenAI)
Google DeepMind / Gemini¶
今日无更新。
DeepMind 官方博客页面可以访问,但页面不含可靠的窗口内日期字段,无法确认 9 月 21 日至 9 月 22 日是否有新增文章;
ai.google.dev/gemini-api/docs/changelog本次抓取仍返回Redirect was cancelled,Gemini 版本变更无法从官方变更日志核实。为避免把无日期页面内容当作新动态,本期不新增 DeepMind 条目。
Anthropic / Claude¶
今日无更新。
Anthropic
/news列表页最新条目仍为 9 月 18 日的《Partnering with Accenture on embedded evaluation》,9 月 17 日的《Introducing the Life Sciences Verification Program》次之,窗口内无新增。Anthropic 官方 YouTube 频道最新视频仍为 9 月 1 日的 Claude Fable 5.1 系列,无新增。本期不新增 Anthropic 条目。
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 等
阿里云栖大会三连发:Qwen3.8、真武 V900、20GW¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
阿里研究员:Qwen4.5 之后模型将扩展至 5–10T 参数¶
9 月 22 日,量子位另发一条短讯,称阿里研究员透露未来 Qwen4.5、Qwen5 等版本将扩展至 5–10T 参数规模。该口径与吴泳铭演讲中「计划训练 5–10T 参数规模的全新模型」一致,属同一战略表述的补充。(来源:量子位)
腾讯混元发布 Hy Image3.5 preview:2K 图 0.15 元/张¶
9 月 22 日,腾讯混元发布混元图像 3.5 预览版。在腾讯内部组织数百名专业设计师的 GSB 盲测中,Hy Image3.5 preview 与 Seedream 5.0 pro 持平,略优于 Nano-Banana Pro 与 Qwen-Image-3.0 Pro,综合胜率比 Hy Image3.0 高 30%。支持文生图与图生图、单次最多 5 张参考图、多轮对话创作、最高 2K 分辨率输出。腾讯云 API 2K 图像定价 0.15 元/张(国际版 0.024 美元/张),且仅对输出图片收费。模型已上线元宝、WorkRally、OnSolo、Miora、WorkBuddy、ima 等应用;元宝灰度测试期间生图整体请求量提升超过 50%。(来源:机器之心)
值得注意:这条与昨天 Qwen-Image-2.1「开源生图第一」形成直接对照。国产生图模型这轮竞争的落点已经清晰——不是画质,而是「进稿」:盲测比的是设计师能不能直接用,定价比的是每张图的边际成本。
华为 openJiuwen 发布 Agentic Hub¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
穹彻智能 RoboRSI 开源¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
基元律动:从 Harness 到 RSI 飞轮¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
虎鲸文娱推出「鲸锐AI」影视制作与管理平台¶
9 月 22 日,在 2026 云栖大会「AI+文化传媒」技术发展论坛上,虎鲸文娱集团推出行业首个 AI 影视制作与管理平台「鲸锐AI」,主打减少 AI 生成视频的无效抽卡、实现制作全程精准可控,并支持大型团队、多工种协作。CTO 杜颜龙透露计划 10 月开启内测。(来源:量子位、机器之心)
华为云码道上线鸿蒙编码大模型¶
9 月 21 日,华为云码道 CodeArts 代码智能体面向鸿蒙开发者升级,上线「鸿蒙编码大模型 + 码道鸿蒙智能体 + 鸿蒙开发者实践中心」三大能力,宣称打造全球首个专为鸿蒙生态打造的 AI 编码智能体。(来源:机器之心)
长鑫存储量产第五代 DRAM 平台 G5¶
9 月 20 日,长鑫存储宣布第五代 DRAM 技术平台 G5 正式量产,同时量产两款基于该平台的 24Gb LPDDR5X。G5 用四重曝光(SAQP)把存储阵列有源区半间距缩至 11.95 纳米,按 8Gb 颗粒统一计算,每片晶圆毛裸片数量较第四代至少增加 50%。背景是 AI 服务器大量消耗 HBM 与高容量服务器 DRAM,三星、SK 海力士、美光把先进产能投向高价值产品,挤压了手机、PC 与普通服务器内存供给:IDC 预计 2026 年全球智能手机出货量同比下降 16.7%,但均价上涨 27.6% 至 581 美元。长鑫二季度 DRAM 营收份额约 9.5%(一季度 7.6%),位列全球第四。(来源:机器之心)
为什么放进 AI 简报:这是「AI 抢产能」第一次以消费电子价格的形式传导到普通人身上,也是国产存储从「替代」变成「全球第四个变量」的一个节点。
其他窗口内动态¶
- 大晓机器人与中国石油上海销售公司达成战略合作,启动试运营首个加油站便利店场景的全闭环具身智能机器人项目。(机器之心)
- 扫描全能王在云栖大会展示文档处理能力,主打解决办公 Agent 在模糊、歪斜、手写文档上的「看不清、读不准」问题。(机器之心)
- 华超神控(BCI-Sonics)完成 2 亿元 Pre-A 轮融资,红杉、云启领投,押注非侵入式 AI 脑机接口。(机器之心)
- 昆仑万维 SkyProduction 抢先首发短剧质检功能,从字幕、音画、内容底线三个维度逐集输出可下载、可回填的质检报告。(量子位)
AI 研究前沿¶
重要论文、技术突破
HuggingFace 每日论文(9 月 22 日批次)¶
本期 API 返回 9 月 22 日批次(submittedOnDailyAt: 2026-09-22)。按点赞数排列,最受关注的几篇是:Transferring the Intelligence of VLMs to Robotic Control(92 赞,arXiv:2609.22966)、WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory(86 赞,arXiv:2609.24984,从单张图或文本提示出发做流式场景探索,长时程一致性与相机控制精度显著提升)、RRSI: Regularized Recursive Self-Improvement of Agent Harnesses(66 赞,arXiv:2609.24972,在演化所用切分上最多提升 14.1 分,五个分布外基准上最多 4.7 分)、GameHorizon Suite: Multi-Horizon Data and Evaluation in Gameplay(62 赞)、Document Retrieval-Aware Chunking (D-RAC)(37 赞,面向企业文档的检索感知摄取)、Harness-Zero: Harness Distillation via Agent-as-Harness(11 赞,把基础模型宏平均任务成功率从 23.3% 提升到 44.3%)。(来源:Hugging Face Daily Papers)
本期趋势:这一批里出现了一个明显的聚集——RRSI、Harness-Zero、Jev-Mem 三篇都在处理「Agent 运行框架如何被学习、被蒸馏、被记忆」。加上今天华为 openJiuwen 的资产平台和基元律动的 RSI 飞轮,可以看到「Harness 本身成为研究对象」已经从个别论文变成一个小方向的雏形。
腾讯混元:LLM 强化学习的 Batch 规模临界边界¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
清华 + 斯坦福:LLM 内部的奖励子系统¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
复旦 + Wan:首篇 Agentic 视觉生成综述¶
9 月 22 日,机器之心报道复旦、Wan、港中文 MMLab 的综述《Agentic Visual Generation: From Generative Models to Agentic Control》(arXiv:2609.06758)。论文按「控制器能够影响的最远决策」把系统分为 L0–L4:L0 固定支撑、L1 条件控制、L2 执行控制、L3 结果自适应控制、L4 经验自适应控制。对 300 多份工作的统计显示,L1 至 L4 分别收录 49、33、202、25 条,2025 年后的增长主要集中在 L3(根据结果修正当前任务),而能够跨任务复用经验的 L4 仍然稀少。论文还提出按控制级别对齐比较条件的评估方法——评测 L3 时让两个版本使用相同的初始计划、工具与总预算,一个读取中间结果并修改,另一个按既定路线执行。(来源:机器之心)
值得注意:这篇综述给「Agent 化」提供了一把可量化的尺子,而它测出来的结果与 BestBlogs 周刊的判断一致:结果级反馈已经普及,跨任务经验复用还处在早期。L4 只有 25 条,而它恰好是所有「经验复利」叙事的技术底座。
其他窗口内研究条目¶
- 梅努斯大学 SDC 登上《Nature》:一滴盐水即可作为 DNA 计算机,无需持续供电完成 100 比特加法。(机器之心)
- ICLR 2027 摘要提交量冲到 6 万+,超过 ICLR 从 2013 到 2026 年历年投稿总和(首届 67 篇,ICLR 2026 为 19525 篇)。(机器之心)
行业观点与解读¶
KOL 重要推文、深度分析文章
Import AI 473:RAND 的超级智能战略与 RSI 四阶段¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
Latent Space 播客:Jev 主创 Diogo Almeida 谈「为生产而生,不为神迹而生」¶
9 月 21 日,Latent Space 发布与 TypeSafe AI CEO Diogo Almeida 的对谈《Jev: System One models for Prod, not God》。这期被描述为「与 Jev 主创的权威一期」,内容覆盖 Jev 的 API 设计、在编码 Agent、分析、作为 judge 等场景的用例、JevBench,以及 Almeida 反复强调的一个愿景:Jev 应当「消失在背景里」——像正则表达式一样不引人注意。节目还收集了 Jev 与 LLM 能力对比、Jev vs GLiNER 等材料。(来源:Latent Space)
一句话判断:如果只读一篇关于 Jev 的材料,是这期而不是任何二手解读——「像正则一样消失在背景里」这句话,比所有「系统一 vs 系统二」的类比都更能说明这个产品的目标形态。
Simon Willison 与 Sebastian Raschka 的 Jev 双评¶
9 月 21 日,Simon Willison 发布《Jev introduces a new shape of LLM - System One, aka Decision Models》,指出 Jev 仍接受文本输入,但输出不是文本,而是对应分类、是非问题、评分及置信度的浮点数,并强调它「非常快,而且真的很便宜」。同日,Sebastian Raschka 发布《It's Easy to Dismiss Jev as Just a Classifier》,讨论 Jev 这类模型为何不能简单归类为传统分类器,核心问题是模型能否从开放式文本中抽取足够丰富的潜在状态,再压缩为带有不确定性的结构化决策。(来源:Simon Willison、Sebastian Raschka)
其他 KOL 直源状态¶
本期直源情况:Andrej Karpathy 的 RSS 最新仍为 4 月 30 日的 Sequoia Ascent 总结;苏剑林 最新为 9 月 21 日《排序不等式及其推广》(数学基础,非 AI 动态,不纳入);Ethan Mollick 与 Raschka Substack 窗口内无新文。BestBlogs 周刊 最新一期仍为第 113 期《模型之外的尺子》(9 月 18 日发布,周五更新,已在上期周末汇总中处理)。搜索类信源(WebSearch、DuckDuckGo Lite、Mojeek、Brave、Ecosia)本期全线不可用,中文 KOL(宝玉 @dotey、向阳乔木 @vista8)与知乎作者(toyama nao、李沐、季宇)本期未能完成扫描。
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的重点推荐。
「A Staff Engineer Collaborator」|Notion 团队首次试用 GPT-6 Astra("A Staff Engineer Collaborator" | Notion's First Look at GPT-6 Astra) | OpenAI 官方频道,9 月 21 日。Quinn Johnson 在 Codex 中给 Astra 一个目标加背景,让它排查团队一直没解决的问题——Astra 在一次缓存复用审计中连起了 Notion 团队此前忽略的模式:旧消息被用 agent 已知的信息重新生成,悄悄改变了 prompt 历史并破坏了缓存复用。所有东西看起来都还在正常工作,只是在大规模下变得更慢更贵。这类「隐性退化」是当前 Agent 工程里最难自动化发现的一类问题,值得一看 | YouTube | ⭐ 推荐观看
Figma 给了 GPT-6 Astra 一个登月任务(Figma Gave GPT-6 Astra a Moonshot. Here's what happened.) | OpenAI 官方频道,9 月 21 日。任务是为新型个人飞行器设计飞行控制体验。视频的价值在于演示了从「生成界面」到「设计系统」之间的差距:Astra 先推理受众、待办任务、飞行员与乘客的权衡、关键界面状态,再通过 Figma MCP Server 把思考接到真实设计系统上产出品牌一致的完整原型 | YouTube | 值得一看
一句话 + 一个功能,构建并自测(One Prompt. A Feature Built and Tested. | Ramp × GPT-6 Astra) | OpenAI 官方频道,9 月 21 日。给 Astra 一句需求「为单个 API key 加路由控制」,它自己找到配置、完成修改,并用 computer use 检查自己的工作——包括未被要求地验证了移动端体验。12 分钟实现 + 15 分钟验证。Ramp 的 Veeral 把变化总结为:给一个高层目标,让它自己推进,回来时看可审查的改动 | YouTube | 值得一看
本期说明:本板块条目来自 OpenAI 官方 YouTube 频道的 RSS 直源(
youtube.com/feeds/videos.xml),这是本期唯一能可靠核实「发布日期 + 标题 + 描述」的视频来源。Anthropic 官方频道窗口内无新增(最新仍为 9 月 1 日 Fable 5.1)。B 站资讯频道与中文播客(AI 日报(灵感港)、AI 前沿日报、TAI 快报、十字路口、AI Next)本期未能完成扫描——B 站搜索接口自第二次请求起触发风控,常规检索通道全线不可用;YouTube 结果页虽可访问,但排序噪声大、无法稳定区分频道与发布时间,故不作为条目来源。
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
同一天里,「能力」被两次重新定价
阿里预告 5–10T 参数模型并开源 Qwen3.8-Max,小米用 300 万美元训出开源权重第一,Grok 4.7 维持原价发布,基元律动报告路由可省 88.9% 成本——四件事挤在同一个 24 小时里。值得追问的是:当「接近最强的能力」同时以开源、半价、路由三种方式变得可得,模型厂商的定价权还剩多少? 一个可能的答案是:定价权会从「每 token 价格」转移到「完成一项任务的总成本」,而总成本里包含重试次数、人工审核、返工与失败——这些恰好是模型厂商无法单独控制的变量。对采购方,这意味着评估模型的方式要改:不要比单价,要比「同一个任务的端到端成本」。
「Harness 成为研究对象」正在从个别论文变成一个小方向
今天同时出现:华为 openJiuwen 把 Agent 能力做成可发布可安装的五类资产;穹彻 RoboRSI 给具身智能补上 Harness 与技能树;HuggingFace 当日批次里 RRSI、Harness-Zero、Jev-Mem 三篇都在研究运行框架如何被学习、蒸馏与记忆;腾讯混元则给出 RL 训练 Batch 的临界边界。这些工作的共同前提是:模型能力的边际收益在下降,而模型之外的系统层还有大量未被开采的收益。 值得深挖的问题不是「下一个 Harness 该怎么做」,而是「不同厂商的 Harness 之间能不能迁移」——openJiuwen 那句「支持把 WorkBuddy、千问办公的专家资产转换过来」,可能是这个方向上第一个值得跟踪的信号。
具身智能的辩论今天补齐了另一半
昨天那条 150 美元机械臂的结论是「壁垒在模型大脑」;今天 RoboDojo 的评测给出了反面证据——Astra 在真机上「反复发出物理上不合理或不安全的动作,部分事故甚至造成了硬件损坏」,测试被提前叫停。95% 的平均成功率与损坏硬件可以并存,因为平均值掩盖了尾部。 对具身团队,这是一个非常具体的提醒:如果你的安全论证建立在「平均成功率」上,那它还没有开始。 真正需要建设的是失败模式的可枚举性、异常恢复的自动化、以及「什么时候必须停下来」的判定权——这些全都在模型权重之外。
「100+ 已解决的开放问题」把治理问题变成了流水线问题
OpenAI 一边提共享标准、一边成立数学顾问组,机器之心补充的细节是:超过 100 道长期开放问题已被内部模型解决,正在等待审查。当结论的产出速度超过审查速度,瓶颈就从「能不能做出来」变成「能不能承受住批量结论」。 这与企业内部 Agent 面临的处境完全同构——V7 那条「机构记忆」解决的是同一类问题:把散落的信息变成可溯源、可复核的上下文。值得深挖的方向是「批量结论的审查基础设施」:分层处理猜想、证明草稿与可验证结论;对数学是形式化验证,对企业是数据血缘,对 Agent 是证据链。这三件事今天还没有人把它们当成同一个问题来做。
生成时间:2026-09-22 18:58 | 下次更新:明日 9:00