AI 每日简报 | 2026-09-23¶
本期覆盖窗口:9 月 22 日 18:58 至 9 月 23 日 08:45(约 14 小时)。昨日为全天版简报(生成于 18:58),故本期聚焦傍晚之后落地的事件;另补入昨日全天版遗漏的 1 条(OpenAI 第三方评测原则,发布于 9-22 上午)。
今日概览¶
昨夜今晨的主线只有一条:价格战。北京时间 00:30 前后 Anthropic 发布 Claude Opus 5.5(Fable 5.1 级性能、运行成本降 40%),不到两小时后 OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna(同档价格直接腰斩),两家的发布间隔被 TechCrunch 记为 90 分钟。与此同时,阿里在云栖大会的全模态深稿把「5–10T 参数」和「原生全模态统一模型」明确写成路线图,商汤把生图模型的竞争指标从「画质」改写成「可交付性」,英特尔则给出「Agent 时代 CPU:GPU 趋近 1:1」的硬件判断。
- Anthropic 发布 Claude Opus 5.5:多数工作上达到 Fable 5.1 水平,运行成本比 Opus 5 低 40%,输出速度提升 30%+
- OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna:同档价格减半,Luna 输入价降至 $0.10/百万 token
- 阿里云栖大会全模态深稿:Qwen3.8-Max「自己训练自己」,Qwen4 已在训练,下一代视频模型 11 月发布、方向为 Agentic Video
- 商汤 SenseNova U1 Pro 正式发布:多轮连续修改与自检索素材,主打「可交付性」
- 英特尔:Agent 时代 CPU 与 GPU 配比从 1:4 趋近 1:1,公司股价单日涨 12%
深度阅读推荐¶
以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。
⭐ Claude Opus 5.5:Dario「放慢前沿」之后的第一次发布¶
9 月 23 日 00:30 前后(美东 9 月 22 日中午),Anthropic 发布 Claude Opus 5.5,官方称其为 Claude 5.5 家族的第一个模型,「在多数工作上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%」。定价为输入 $4 / 输出 $20 每百万 token(Opus 5 为 \(25 输出),官方称默认设置下典型工作负载成本降 40%,输出速度提升 30% 以上,Claude Code 与 Claude Platform 上提供最高 2.5 倍速通道(\)8/$40)。评测上,Terminal-Bench 4.0 得 66.4%(Fable 5.1 为 55.8%,Opus 5 为 52.3%,GPT-6 Astra 为 57.9%);FrontierCode v1.1 默认中等努力下 54.6%,高于所有其他模型(Astra 最高 53.3%)且每任务成本约为其五分之一;GDPval-AA v2.1 得 1846 Elo(Fable 5.1 为 1735,Opus 5 为 1708,GPT-6 Astra 为 1542);OSWorld 2.0 为 81.8%。官方同时披露了两个「软」变化:写作风格明显更少术语、把重要信息放在开头;以及它在自动行为审计(数千个模拟场景)上取得迄今最好成绩,更少采取难以回滚的动作。Anthropic 明确表示,鉴于基准分差已不足以指导真实差异,Opus 5.5 与 Fable 5.1 的实际差距「比分数看起来的更小」。Sonnet 5.5 与 Haiku 5.5 将在「未来几周」发布。另据 TechCrunch,这是 Amodei 公开主张「放慢前沿」之后的首个模型发布——他在本月的文章里写道「已确信完全应对风险需要更多审慎,不只是投入风险预防,还要放慢能力推进的速度,让风险预防有时间跟上」。(来源:Anthropic、TechCrunch)
核心观点:这次发布最值得记的不是分数,而是它把「放慢前沿」这句话翻译成了一个具体动作:在旗舰之上加档位,而不是加能力。 Opus 5.5 的定位是「Fable 5.1 的水平、低得多的成本」——换句话说,Anthropic 选择用同样的能力做更便宜的供给,而不是把能力再推高一截。这与它自己「给风险预防留时间」的表述是自洽的。但代价是它在旗舰层让出了「最强」的位置:GPT-6 Astra 与 Fable 5.1 同价(\(10/\)50),而 Opus 5.5 落在下一档。对采购方,这意味着一件很实际的事:如果你过去把 Opus 当默认档,现在需要重新做一次「能力 vs 单位任务成本」的评估——官方给出的口径是 FrontierCode 上以约 ⅕ 成本超过 Astra,但 Terminal-Bench 上 Astra 仍略高。第二个值得注意的细节是「写作风格」被当作发布重点之一:模型厂商开始把「可读性、重要信息前置」当成产品指标来宣传,这与 BestBlogs 周刊第 113 期「检查、约束和责任往往并不住在模型权重里」是同一个方向——输出的可用性正在成为和输出质量并列的竞争维度。
⭐ OpenAI 发布 GPT-6 Sol 与 Luna:同档价格直接腰斩¶
9 月 23 日 02:00 前后,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna 的更新版。定位上,Sol 面向编程等复杂任务,Luna 面向「目标明确的高吞吐文书工作——摘要文档、抽取信息、回答快问」。官方口径有三点:价格降至 5.6 系列的约一半(OpenAI 归因于缓存与推理优化);事实性更好,在基于真实用户标记错误的内部事实性评测中,GPT-6 Sol 的错误约为前代的一半,「以低得多的成本达到 Astra 级可靠性」;以及编码错误率更低。可用性上,Sol 与 Luna 已进入 ChatGPT Work、Codex(多数付费档)与 ChatGPT API,Luna 同时进入桌面端及 Free/Go 用户。TechCrunch 特别指出,这次发布发生在 Anthropic 发布 Opus 5.5 之后仅 90 分钟,反映两家竞争的激烈程度。(来源:OpenAI、TechCrunch)
同日,OpenAI 另发两条:《Better prompt caching for GPT-6》 介绍 GPT-6 在缓存命中率、诊断能力、显式断点与成本控制上的改进——这正是官方把价格减半归因的机制之一;以及 《Parallel cut research time and cost in half with GPT-6 Astra》,以 Parallel 的劳动力市场数据研究为例,称其研究 Agent 的时间与成本都减半。(来源:OpenAI、OpenAI)
核心观点:把这条和上一条并读,昨夜发生的其实是一次「同档重定价」,而不是两次能力升级。 Anthropic 把 Opus 拉到 \(4/\)20,OpenAI 把 Sol 也定在 \(2/\)10 并把 Luna 压到 \(0.10/\)0.50——注意 Luna 这个价位已经低于很多团队的心理锚点(Haiku 4.5 为 \(1/\)5,是它的十倍)。这意味着「用最强模型做每一步」的默认配置正在从经济上失效,而失效的方式不是旗舰降价,是中间档变便宜。 对做产品的团队,可立即执行的动作有两个:一是重新算一遍「每成功任务成本」而不是每 token 价格,把重试、审核、返工算进去;二是检查你的 prompt 缓存命中率——OpenAI 把降价的一半归因于缓存,说明这是他们希望你优化的地方,也是你能自己拿到的那部分收益。一个需要留意的细节是 Simon Willison 指出的:GPT-5.6 系列在 11 月有 25% 的预定涨价,所以「减半」是对促销价而言的——真实降幅要到 11 月才完全兑现。
⭐ 阿里云栖大会全模态深稿:Qwen3.8-Max「自己训练自己」,路线图指向 5–10T 与原生全模态¶
9 月 22 日深夜,量子位刊出云栖大会全模态长文,把昨日简报中分散的模型发布串成了一条完整路线。核心信息:Qwen3.8-Max 开始「自己训练自己」(自我进化方向),Qwen3.8-Flash 提前放出下一代架构,Qwen3.8-Omni 为大模型开辟全新的思考分区,Qwen4 已经开练,Qwen4.5、Qwen5 在路上,参数规模瞄准 5 万亿–10 万亿。同日集体亮相的还有:图像生成模型 Qwen-Image-3.1、音乐生成 Happy Shrimp 1.1、世界模型 HappyOyster 2.0 Preview、语音家族 Qwen-Audio-3.1、同传模型 Qwen3.8-LiveTranslate;下一代视频模型预告 11 月发布。文章给出的产业判断来自淘天首席科学家郑波:「三年之内会出现一个原生的全模态统一生成模型,未来体验将不再受限于模态边界」,并把下一代视频方向命名为 「Agentic Video」——从理解创作目标出发,自动拆剧情、做分镜、组织角色与场景。落地案例包括导演陆川用 5 天重建 400 年前明代灾难现场(传统影视工业需数月与千万级投入,单场爆炸戏过去要 19 天)、演员王珞丹分享「抽卡抽到凌晨 4 点」的创作困境、以及小旭音乐 6 人团队孵化十多个 AI 歌手 IP(部分账号 4 个月涨粉 20 万,全网播放破 2 亿)。(来源:量子位)
核心观点:这篇的价值在于它把「多模态」从能力清单变成了一个具体的失败模式描述。 王珞丹那句「单镜头越来越强,但故事一长,人物的状态、情绪和气质很难一直保持」是全篇最有信息量的一句——它精确指出了当前多模态系统的真实瓶颈:不是单点生成质量,而是跨模态、跨时间的任务上下文一致性。 阿里把它命名为「原生全模态」,逻辑是今天的多模态系统像一场接力(图像模型做图 → 视频模型接着生成 → 音乐模型负责声音 → Agent 去调工具),每一次交接都可能丢上下文;原生方案要让不同模态从底层共享同一个任务与同一份世界理解。这与昨天那批论文(RRSI、Harness-Zero、Jev-Mem)以及华为 openJiuwen 的资产平台是同一个问题的三种表述:当单项能力都够用了,收益就从「把能力做强」转移到「让能力不丢上下文地连续工作」。对做多模态产品的团队,一个可操作的检查项是:你的 pipeline 里有多少次「模态交接」,每次交接丢掉了什么信息。
⭐ 商汤 SenseNova U1 Pro:把生图竞争指标从「画质」改成「可交付性」¶
9 月 22 日晚,量子位刊出商汤 SenseNova U1 Pro 正式版的深度实测。U1 Pro 此前以「今年 WAIC 最惊艳的图」被提及,此次为正式上线,已可在商汤小浣熊平台使用,API 向企业客户开放,支持 2K 起步、最高 4K。实测重点不在单张画质,而在连续修改的稳定性:局部调整(只改 T 恤而不动其他区域)、多参考图信息融合、以及连续多轮修改后仍不发生畸变。文章给出的判断是 U1 Pro 已经「具备可交付性」。另有一个更值得注意的能力:在不给任何素材的情况下,模型自己去网络检索资料再与 prompt 匹配,生成信息量丰富的科普图与可直接商用的信息海报。(来源:量子位)
核心观点:「可交付性」这个词值得单独拎出来,因为它把生图模型的评价体系换掉了。 过去两年生图榜单比的是单次生成的观感,而真实生产环境的考题是另一组:能不能只改局部、能不能连续改十轮不崩、能不能吃进多张参考图、能不能自己找素材。U1 Pro 与昨天腾讯混元 Hy Image3.5 的「设计师盲测 + 0.15 元/张」是同一件事的两个侧面:一个证明「设计师愿意直接用」,一个证明「每张图的边际成本足够低」。国产生图模型这轮竞争的落点已经很清晰——不是谁画得更好看,而是谁能进稿。 顺带一提,U1 Pro 那个「自己检索素材再生成海报」的动作,本质上就是把 Agent 能力装进生图模型里,这与阿里给视频模型起的名字「Agentic Video」是同一个方向。
⭐ Simon Willison:一场新的价格战,以及 Opus 5.5 max 的「思考到崩溃」¶
9 月 23 日 07:46,Simon Willison 发布《Claude Opus 5.5, GPT-6 Sol, GPT-6 Luna, and a new price war》,是昨夜两次发布后第一份有实测的横评。要点有四:其一,他整理了一张价格表,并指出「GPT-6 Sol 与 Luna 是 5.6 同档的一半」,但强调 GPT-5.6 在 11 月有 25% 的预定涨价,所以是「促销价的一半」;其二,他认为 GPT-6 Luna 的 \(0.10/\)0.50 是 OpenAI 史上最便宜的模型之一,仅次于更弱的 GPT-4.1 Nano(\(0.10/\)0.40)与 GPT-5 Nano(\(0.05/\)0.40),而当前 Haiku 4.5 是 \(1/\)5——贵十倍;其三,他指出 Grok 4.7 定价 \(2/\)6,本来是 GPT-5.6 Sol 的半价,现在在输入上已与 GPT-6 Sol 持平,价格优势基本消失;其四,也是最有价值的一条实测:Opus 5.5 在 max 努力档会「思考到崩溃」——在一个 SVG 生成任务上,它一直推理到 128,000 输出 token 上限仍未收敛,Willison 的判断很直接:「如果它在一个愚蠢的 SVG 提示上都能思考到崩,我不相信它在更有意思的工作上不会。」他因此把 max 档排除出日常使用,改用 GPT-6 Sol 与 Opus 5.5 作为 Codex / Claude Code 的默认模型。(来源:Simon Willison)
核心观点:「思考到崩溃」这条比价格表重要得多,因为它暴露了一个正在被忽视的失效模式。 推理预算可以调到 max,但模型并不知道什么时候该停——当推理长度成为可配置项,就必然出现「想得越多、结果越差」的区间,而这一区间目前没有任何厂商在公布。对使用方,这直接给出一个操作建议:不要默认把 effort 拉满。 Anthropic 自己在 Opus 5.5 的文档里也说「默认中等努力下 FrontierCode 分数高于其他模型」,Willison 的实测是这句话的一个注脚。另外值得注意的是他反复用「pelican 测试」做横向对比——这类个人化的、非官方的、可复现的小测试,正在成为模型评测生态里对官方基准的重要补充。最后,价格战的时间线值得记住:Grok 4.7(\(2/\)6)→ Opus 5.5(\(4/\)20)→ GPT-6 Sol(\(2/\)10)→ GPT-6 Luna(\(0.10/\)0.50),48 小时内四次重定价。
⭐ Sebastian Raschka:MiMo-V2.6 Pro 的架构与训练笔记——简单架构 + 数据配方¶
9 月 22 日晚,Sebastian Raschka 发布小米 MiMo-V2.6 Pro 的技术笔记。他的核心判断是:这个当前开放权重榜单(加权平均)第一的模型,架构「简单得过分」——经典 GQA + 128 token 窗口的滑动窗口注意力(SWA)。他借此重申自己近几个月反复讲的一个观点:大部分进步仍来自数据与后训练配方的改进,花哨的注意力变体大多只是效率调整。 他从小米技术报告中挑出三个值得注意的点:(1)Agent 任务增加,并且跨不同 harness 训练——在留出 harness 上 DeepSWE pass@1 从约 50% 提升到 66%;(2)更好的奖励信号——把简单的正确性验证器换成会看执行轨迹的 agentic grader;(3)大 RL 批次——1,568 prompt × 16 rollout = 25,088 条轨迹,每次更新 2.7–3.7 亿训练 token。(来源:Sebastian Raschka)
核心观点:这三条里最有价值的是第二条「用 agentic grader 替换正确性验证器」和第一条的「跨 harness 训练」。 把它们和昨天腾讯混元那篇 RL Batch 论文放在一起看,会得到一个很具体的工程结论:RL 的瓶颈正在从「算力够不够」转向「奖励信号准不准」。正确性验证器只能判断答案对不对,而 agentic grader 能看执行轨迹——这等于把「过程奖励」工程化了。第一条同样关键:跨 harness 训练意味着模型被训练成「在多种运行框架下都能干活」,而不是绑定某一种工具调用格式。这与昨天那批 Harness 论文(RRSI 研究 harness 自演化、Harness-Zero 做 harness 蒸馏)拼起来,是一条正在成形的共识:harness 既是训练环境,也是被训练的对象。对做 RL 的团队,可抄的作业是:先问你的奖励信号能不能看见过程,再问你的训练环境是不是只有一种。
⭐ 英特尔:Agent 时代,CPU 与 GPU 配比从 1:4 趋近 1:1¶
9 月 22 日深夜,量子位报道英特尔在苏州技术创新与产业生态大会(Intel Connection)给出的判断:AI 系统的 CPU:GPU 配比正在从一颗 CPU 配四颗 GPU(1:4)走向一颗配一颗(1:1)。理由是 Agent 开始调用工具、执行任务之后,模型计算之外的执行、调度与数据处理量大幅上升,这些工作更适合 CPU 承担。英特尔数据中心事业部副总裁陈葆立用「整理新闻」这个日常任务做例子拆解了哪些环节落在 CPU 上。官方同时给出两条配套方案:利用至强内置加速能力做 KV Cache 无损压缩(缓存规模增大后只靠 GPU 的 HBM 装不下,需要系统内存与 SSD 参与),以及加快数据传输、与国内软件伙伴共建高性能存储系统。端侧则由 CPU(计划、决策等需及时响应的工作)、GPU(矩阵计算)、NPU(低功耗长时运行的音视频与 CV)三方协同。文章提到英特尔股价在前一日上涨 12%。(来源:量子位)
核心观点:这是「Agent 改变硬件配比」这条线索第一次被一家芯片厂商公开量化,而 1:1 这个数字的含义比它看起来更大。 如果它成立,意味着过去几年数据中心「GPU 堆叠 + 少量 CPU 配比」的采购模型需要重算——被重估的不是 CPU 的性能,是 CPU 在 Agent 工作流里的位置。更有意思的是那条 KV Cache 压缩:它把「上下文变长」这件事从软件问题变成了硬件问题。这与昨天阿里讲的多模态上下文一致性、以及 Anthropic 的 prompt caching 是同一件事的三个层次:应用层要复用上下文、模型层要缓存上下文、硬件层要装得下上下文。对基础设施团队,值得跟踪的指标是「每 token 的 CPU 时间」——它过去不是瓶颈,在 Agent 场景下可能会变成瓶颈。
⭐ Latent Space:John Platt 谈 AI for Science——自动化科学、气候与「下一代如何参与」¶
9 月 23 日 05:07,Latent Space 发布与 John Platt 的对谈《An Oscar, Two Asteroids, and the Algorithm in Your sklearn》。Platt 是 Google 的「Giganerd」,拥有奥斯卡奖(技术成就奖)、两个以他命名的教科书算法(SMO、Platt Scaling)与两颗命名小行星。节目主题是 AI for Science:自动化科学、解决气候变化,以及在超级智能 AI 时代下一代人如何参与科学。(来源:Latent Space)
一句话判断:这期值得听的原因不在话题热度,而在嘉宾的位置——Platt 是少数同时具备「做出过被广泛使用的算法」与「在 Google 内部长期做科学自动化」两段经历的人。在所有人都谈 AI for Science 的当下,一个真正把算法写进 sklearn 的人怎么判断「什么该自动化、什么不该」,是稀缺视角。
OpenAI¶
GPT-6 Sol 与 Luna 发布¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
GPT-6 的 prompt caching 改进¶
9 月 23 日 05:00,OpenAI 发布《Better prompt caching for GPT-6》,介绍更高的缓存命中率、新的诊断工具、显式缓存断点与降低延迟和成本的控制项。这是官方把「同档价格减半」归因的两大机制之一(另一个是推理优化),也是使用方可以直接优化的部分。(来源:OpenAI)
Parallel 用 GPT-6 Astra 把研究时间与成本减半¶
9 月 22 日 20:00,OpenAI 发布 Parallel 的案例:其 Agent 用 GPT-6 Astra 研究与综合劳动力市场数据,时间和成本相比前代模型都减半。属于客户案例类内容,信息量中等,但与「单位任务成本」这条主线相关。(来源:OpenAI)
第三方评测的原则与优先级(补入:昨日全天版遗漏)¶
9 月 22 日上午,OpenAI 发布《Priorities and principles for effective third party assessments》,为前沿模型与防护措施的严格、安全、独立第三方 AI 安全评测提出优先级与原则。这条与 9 月 21 日的《Building standards for the next phase of AI》构成一组:一个讲标准,一个讲由谁来验。值得注意的是它出现的时点——在 Dario Amodei 公开主张「放慢前沿」的同一周,OpenAI 提出第三方评测框架,两家在「需要有外部尺子」这件事上方向一致。(来源:OpenAI)
Google DeepMind / Gemini¶
今日无更新。
本期首次通过 DeepMind 官方 RSS(
deepmind.google/blog/rss.xml)核实窗口内条目:最新一篇仍为 9 月 15 日的《Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking》,其后为 9 月 8 日 AlphaGenome Atlas、9 月 3 日 WeatherNext 3。这条 RSS 直源比此前使用的/blog/页面可靠——它带<pubDate>,可准确判断窗口内是否有新增,此前「页面无日期字段、无法确认」的问题由此解决,后续应固定使用。另:BestBlogs 周刊第 113 期把 Gemini 3.8 Live 列为「本周最硬的一手发布」,对应的是 9-15 那篇,非本窗口。
Anthropic / Claude¶
Claude Opus 5.5 发布¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
补充说明:Anthropic
/news列表页已可确认新条目——9 月 22 日 Opus 5.5 排在首位,摘要为「Opus 5.5 在多数工作上达到 Claude Fable 5.1 的水平,运行成本比 Opus 5 低 40%」。此前几期简报中「Anthropic 窗口内无新增」的状态由此结束。Anthropic 官方 YouTube 频道本期仍无新增(最新视频仍为 9 月 1 日的 Claude Fable 5.1),故本板块的视频条目留空。
国内大厂动态¶
DeepSeek / Kimi / 豆包 / 智谱 等
阿里云栖大会全模态深稿:Qwen4 已开练,路线图指向 5–10T¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
商汤 SenseNova U1 Pro 正式发布¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
英特尔:Agent 时代 CPU 价值重估¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
其他窗口内动态¶
- 鲲为科技被机器之心报道:以声学空间智能与颅脑超声切入非侵入式穿颅读脑,被称为「全球唯一非侵入穿颅读脑突破」,公司定位是成为脑科学的「英伟达」。文章同时指出侵入式路线(Neuralink 已接受 27 例受试者、计划量产)的根本矛盾——钻孔插电极决定了它只适用于极少数患者。(机器之心)
- Snorkel AI 完成 3.5 亿美元 E 轮融资,估值 35 亿美元,是 17 个月前 D 轮(13 亿)的近三倍;官方称年化收入运行率 3.75 亿美元,12 个月增长 18 倍。公司卖的是 RL 环境与完整数据集,而非人力标注——因此支付给人类专家的费用计入销货成本而非收入。(TechCrunch)
- 高通发布两款新手机芯片(Snapdragon 8 Elite Extreme Gen 6 与 8 Elite Gen 6),称旗舰款可在本地运行 30B MoE 模型。(TechCrunch)
- Meta 承认 Muse 受 OpenClaw 深度影响:MSL 的 Friedman 在 X 上表示「Muse 是从零构建的,但作为产品明显深受 OpenClaw 启发」,并解释连 workspace 文件名与
SOUL.md内容都几乎相同,是因为「我们认为 Peter(Steinberger,OpenClaw 作者)把这些东西做得完全正确」。他提到自己 1 月用过 OpenClaw 后「为 MSL 团队买了几百台 Mac mini」。(TechCrunch)
AI 研究前沿¶
重要论文、技术突破
HuggingFace 每日论文:9 月 23 日批次尚未生成¶
本期 API 对 date=2026-09-23 返回 400,报错文案为 "date" must be less than or equal to "2026-09-22T00:00:00.000Z"——说明当前最新批次仍是 9 月 22 日批次,当日新批次尚未生成(北京时间早间抓取时的常规状态)。9-22 批次已在昨日简报中详述,本期不重复。这里补充两点:一是该批次的点赞数在窗口内继续增长(RRSI 从 66 涨到 154、WorldCrafter 从 86 涨到 113、GameHorizon 从 62 涨到 111、VLM-to-Robotic-Control 从 92 涨到 101),说明这几篇的热度是持续积累而非发布瞬间的噪音;二是昨日未展开的几篇值得记名:Jev-Mem: System-One-Controlled Agentic Memory for Efficient AI Agents(2609.23986)、CARE: Experience-Guided Atomic Corrective Execution for Vision-Language-Action Policies(2609.24118)、1% of Tokens Can Be Enough: On Gradient Estimation in On-Policy Distillation(2609.24432)、Towards Full Pipeline FP8 Reinforcement Learning for LLMs、Complex KDA: Understanding and Enhancing the Expressivity of Kimi Delta Attention。(来源:Hugging Face Daily Papers)
苏剑林:排序不等式及其推广(9 月 21 日,非窗口内,仅记录)¶
苏剑林博客最新一篇为 9 月 21 日的《排序不等式及其推广》,属数学基础内容(排序不等式 → 冯·诺伊曼迹不等式 → 多矩阵推广),与 AI 动态无关,不纳入条目。其「让炼丹更科学一些」系列第十篇《单调性假设的拆与补》(9 月 14 日)对优化器收敛理论有兴趣的读者值得一读——该系列正在把自适应梯度算法的收敛框架从「常数学习率 + 单调预条件矩阵」两个假设中解放出来,把 RMSProp/Adam 这类滑动平均型算法纳入理论范围。(来源:科学空间)
行业观点与解读¶
KOL 重要推文、深度分析文章
Simon Willison:新的价格战与 Opus 5.5 max 的失效模式¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
Sebastian Raschka:MiMo-V2.6 Pro 架构与训练笔记¶
详见顶部「深度阅读推荐」:⭐ 深度推荐(详见深度阅读区)
其他 KOL 直源状态¶
本期直源扫描结果:Andrej Karpathy RSS 的
<updated>刷新到 9 月 22 日,但最新文章仍是 4 月 30 日的 Sequoia Ascent 总结——feed 刷新不等于有新文,不据此新增条目;Ethan Mollick(One Useful Thing)最新仍为 9 月 18 日,窗口内无新增;Jack Clark(Import AI)最新仍为 9 月 21 日第 473 期,已在昨日简报处理;Latent Space 的 John Platt 一期为本期新增(见上);Simon Willison 与 Sebastian Raschka 各有新文(见上)。搜索类信源(WebSearch、DuckDuckGo Lite、Mojeek、Brave、Ecosia)本期未作尝试——据近期多次实测,该类通道自 9 月 18 日起持续不可用,本期全部内容通过 RSS/API/官方页面直源完成;中文 KOL(宝玉 @dotey、向阳乔木 @vista8)与知乎作者(toyama nao、李沐、季宇)因此本期未能扫描。归藏 AIGC Weekly 直源仍不可抓(quail.ink返回 Redirect was cancelled)。
值得关注的视频¶
YouTube 播客与频道近期值得看的视频。标注 ⭐ 的重点推荐。
本期说明:OpenAI 与 Anthropic 两个官方 YouTube 频道窗口内均无新增(OpenAI 最新为 9 月 21 日那批 GPT-6 Astra 案例视频,已在昨日简报列出;Anthropic 最新仍为 9 月 1 日的 Claude Fable 5.1 系列)。B 站资讯频道与中文播客(AI 日报(灵感港)、AI 前沿日报、TAI 快报、十字路口、AI Next)本期未能完成扫描——B 站搜索接口风控与搜索类通道全线不可用的问题延续。本期唯一可核实的新增视频内容是 Latent Space 的 John Platt 对谈(见深度阅读区),故本板块今日无新增条目。
灵感种子¶
以下是今日简报中值得进一步思考的灵感种子。
48 小时四次重定价,价格战的真正受害者是「默认用最强模型」这个习惯
Grok 4.7(\(2/\)6)→ Opus 5.5(\(4/\)20)→ GPT-6 Sol(\(2/\)10)→ GPT-6 Luna(\(0.10/\)0.50),四次重定价集中在 48 小时内。值得注意的是降价发生在中间档而不是旗舰档:Astra 与 Fable 5.1 都稳在 \(10/\)50。这个结构说明厂商并不打算打掉旗舰的定价权,而是把「够用的智能」做得极便宜,逼你在每一类任务上重新做模型选择。值得深挖的问题是:当中间档的性价比高到这个程度,「模型路由」会变成产品能力还是基础设施? 如果它变成基础设施(像 CDN 一样不需要产品经理操心),那么昨天基元律动那套「路由省 88.9% 成本」的商业叙事就会迅速被平台吃掉;如果它保持为产品能力,那么「知道什么任务该用什么模型」就会沉淀成团队资产。目前还没有人给出答案。
「思考到崩溃」是一个全新的、无人监控的失效模式
Simon Willison 实测 Opus 5.5 在 max 档把 128K 输出 token 全部用在推理一个 SVG 上仍未收敛。推理预算变成可配置项之后,必然存在「想得越多、结果越差」的区间,而没有任何厂商在公布这个区间的位置。 这给两个方向留下空间:一是评测侧——现有的所有榜单都只报最好分数,不报「多少比例的请求会失控」,而这恰恰是生产环境最关心的;二是工程侧——需要一层「推理预算的自适应控制」,判断什么时候该停止加预算。这与昨天清华斯坦福那篇「奖励子系统」研究正好接上:如果价值神经元真的能在每一步给出「继续推理还有没有希望」的信号,那么「什么时候该停」就有了模型内部的可读依据,而不必靠外部启发式。
生图模型的竞争指标换成了「可交付性」,这对多模态 Agent 是更强的约束
商汤把「多轮连续修改不崩、只改局部、多参考图融合、自己检索素材」列为核心能力;腾讯混元用设计师盲测和 0.15 元/张定价。两边合起来定义的是一套生产级标准:能不能进稿,而不是能不能出图。 但这里有一个被反复暴露的缺口——王珞丹说的「故事一长,人物状态很难保持」。单项能力达标之后,真正的门槛是「跨轮次、跨模态的上下文一致性」,而这件事目前既没有公开基准,也没有通用解法。 值得跟踪的是阿里提出的「原生全模态统一模型」和「Agentic Video」会不会定义出这类基准;如果定义出来了,它会是生图/视频模型竞争的下一个分水岭。
数据与环境的供给方正在获得基础设施级估值
Snorkel AI 以 35 亿美元估值完成 E 轮,年化收入运行率 3.75 亿、12 个月增长 18 倍,而它卖的是 RL 环境与数据集而非人力标注。这与小米把「环境与奖励配方」和权重一起开源、以及 Raschka 指出 MiMo 的关键改进是「agentic grader 替换正确性验证器」是同一件事的三次印证:训练侧的稀缺资源已经从上量数据转向「可验证的环境」。一个可以立即追问的问题是:当环境比权重更值钱,开源权重模型发布时会开源环境吗? 小米这次开了(verl 配方 + ARVO + mimoagent 环境),华为 openJiuwen 也在做「Agent 能力资产化」。如果这个惯例立起来,开源模型的门槛会从「有没有万卡」进一步变成「有没有一套能把开放代码库自动转成可验证环境」的流水线。
生成时间:2026-09-23 08:57 | 下次更新:明日 9:00