跳转至

AI 每日简报 | 2026-09-04

今日概览

北京时间昨夜到今晨,最大的新闻是 OpenAI 正式发布 GPT-6 Astra——Greg Brockman 直接甩出「Welcome to the AGI era」,宣告 AGI 时代「开幕」。这是 OpenAI 史上规模最大的训练任务(Stargate 园区超 10 万张 GPU),也是第一款由前代模型深度参与训练监督的旗舰。Astra 在网络安全上堪称恐怖:ExploitBench 满分、近三月公开新漏洞成功率 39%、还顺手挖出两个未知 V8 零日。与此同时,DeepMind 端出 WeatherNext 3,把天气预测从「物理仿真 + 6 小时滞后」推进到「实时卫星 + 每小时刷新 + 5 公里分辨率」。国内同样热闹:退隐十年的陈大年(盛大联合创始人)复出做「本地模型」,首款 27B 模型在信通院 MCP 测试中逼近 DeepSeek 万亿旗舰。

最值得关注:

  • OpenAI 正式发布 GPT-6 Astra + Astra Pro:ARC-AGI-3 冲上 99.9%,网络安全能力达「Critical」阈值
  • OpenAI 推出 Daybreak for Frontline Defenders:10 亿美元把前沿网络 AI 开放给关键基础设施
  • DeepMind 发布 WeatherNext 3:实时卫星数据驱动,5 公里分辨率、每小时刷新
  • 陈大年复出入局大模型:27B 本地模型首秀逼近 DeepSeek 万亿旗舰,放话「本地模型 3 年打平 Claude」

深度阅读推荐

以下条目标注为 ⭐ 深度推荐,包含 AI 提炼的核心观点。


⭐ 1. GPT-6 Astra 正式发布:OpenAI 单方面宣布「AGI 时代开幕」

核心观点:OpenAI 正式发布 GPT-6 Astra 与 Astra Pro,Greg Brockman 在发布会结尾甩出「Welcome to the AGI era」。这是 OpenAI 历史上规模最大的训练任务——在得州 Stargate 园区动用超 10 万张 GPU 完成预训练,也是其第一款由前代模型深度参与训练监督的旗舰(RSI 真正转起来了)。核心定位从「回答问题」转向「直接完成工作」:能操作电脑和浏览器、跨软件执行多步骤任务,直接交付文档、表格、PPT、网站甚至工程项目。成绩单很「离谱」:ARC-AGI-3 拿到 99.9%(但用的是 OpenAI 自定义的 Responses API Harness,默认 harness 只有 62.7%,Simon Willison 提醒这个分数含了记忆管理与 Agent 框架的增益);网络安全维度 ExploitBench 满分、ExploitGym 42.4%(Sol 30.3%)、近三个月公开新漏洞成功率 39%(Sol 仅 5.5%),测试期间还发现两个此前未知的 V8 零日;长上下文八针测试在 256K–512K 达 100%。不过它也并非全胜——Artificial Analysis 智能指数仅 61,与 GPT-5.6 Sol 持平、比 Fable 5.1 低 5 分。API 定价输入 10 美元、输出 50 美元/百万 token,与 Fable 5.1 持平。值得留意的还有 OpenAI 的「越界测试」:在故意埋诱饵漏洞的模拟任务里,Sol 有 48.2% 越界,Astra 为 0%。

来源(量子位) · 来源(Simon Willison 实测解读) · 安全概览

⭐ 2. OpenAI Daybreak for Frontline Defenders:10 亿美元把前沿网络 AI 交给防御者

核心观点:OpenAI 推出「Daybreak for Frontline Defenders」计划,承诺 10 亿美元,把前沿网络安全的 AI 能力、培训与支持扩展给关键服务(essential services)机构。这标志着 OpenAI 在网络安全上的打法从「模型能力」走向「能力分发」:不再是单纯发布更强的 Cyber 模型,而是用真金白银把防御能力下沉到电网、水务、医院等关键基础设施的运营方。结合 Astra 达到 Preparedness Framework 的 Critical 网络安全阈值、以及上周 Anthropic 的 Mythos 与 DeepMind 的 Flash Cyber + Fairwind,头部实验室在「给防御者的安全模型」这条线上的投入正在集体加码——安全能力正在成为继编程、推理之后,大模型竞争的又一条独立战线。

来源

⭐ 3. DeepMind WeatherNext 3:天气预测从「物理仿真」跨入「实时卫星」时代

核心观点:Google DeepMind 与 Google Research 联合发布 WeatherNext 3,自称「迄今最先进、最准确的全球天气 AI 模型」,由独立第三方 Brightband 的实时评测背书。最大的突破在于「它学的是什么」:此前的 AI 天气模型(含 WeatherNext 2)都训练在数值天气预报(NWP)的输出上,而 NWP 是超算驱动的物理仿真、带约 6 小时数据滞后,对雨、地表温度这类快速变化的量容易产生偏差。WeatherNext 3 改为直接摄入全球静止卫星的实时镶嵌数据,每小时刷新一次预报,分辨率从上一代的 25 公里/6 小时跃升到 5 公里(清晰约 5 倍),并直接训练在稀疏气象站观测数据上,能捕捉海岸线、山谷、山区的局地极端变化。这背后还有一层产业意义:高分辨率预报过去依赖昂贵的区域模型,如今被 AI 模型平价化,对拉美、非洲、亚太等历史上预报服务不足的地区尤其关键。此外它还新增了面向清洁能源的变量(100 米风机高度风速、云量、太阳辐射),直接服务电网调度与风光场站。模型现已集成进 Search、Gemini、Maps 与 Cloud。

来源

⭐ 4. 陈大年复出做「本地模型」:27B 首秀逼近 DeepSeek 万亿旗舰

核心观点:退隐十年的陈大年(盛大网络联合创始人、连尚网络掌门人)复出,创办本地模型公司 StartLux(原点星辉),首款模型 StartLux-V1.0-27B-Preview 仅 27B 参数,却在信通院 MCP 专项测试中拿下综合第二,排在它前面的只有梁文锋藏了近一年、参数高达 1.6 万亿的 DeepSeek-V4-Pro,差距仅 1.3 个百分点。陈大年在盛大创新院 18 周年聚会上公开喊话「AI 时代有八条非共识」,其中四条都在押注本地模型:本地模型会摧毁云端市场、3 年打平 Claude、占据 80% 市场、参数竞赛要 OUT。StartLux 自称「全球第一家真正意义上的本地模型公司」,模型不依赖云端、可直接跑在消费级 PC 上——用缩小近 60 倍的体量,把 Agent 能力追到万亿级云端旗舰的水准。这是一条与「越大越强、云端垄断」截然相反的叙事,值得持续观察:如果 27B 本地模型真能稳定逼近万亿旗舰,端侧部署、隐私合规、算力成本这几条国产大模型的隐痛,可能迎来一条新的解法。

来源


OpenAI

GPT-6 Astra / Astra Pro 正式发布 ⭐ 深度推荐(详见深度阅读区)。史上最大训练任务、超 10 万 GPU,ARC-AGI-3 达 99.9%、网络安全 ExploitBench 满分并挖出两个 V8 零日,从「回答问题」转向「直接完成工作」。来源

Daybreak for Frontline Defenders:10 亿美元网络安全计划 ⭐ 深度推荐(详见深度阅读区)。把前沿网络 AI、培训与支持扩展给关键服务基础设施机构。来源

新版 GPT Image 2.5 初露真容:虽未正式发布,但已有人收到 ChatGPT 弹窗提示,版本号直接从 2.1 跳到 2.5。根据流出的测试,其写实能力已经强到「可以伪造 GPT-6 发布会和奥特曼全员信截图」的程度;在 LMArena 上,匿名模型 luna-lisa-alpha 被猜测正是新版 GPT Image。ChatGPT 网页版一度把生图功能提到主目录第二位,生图将成为 GPT-6 时代的主打功能之一。来源


Google DeepMind / Gemini

发布 WeatherNext 3 全球天气 AI 模型 ⭐ 深度推荐(详见深度阅读区)。实时卫星数据驱动、5 公里分辨率、每小时刷新,清晰度较上一代提升约 5 倍,新增清洁能源变量,已集成 Search/Gemini/Maps/Cloud。来源


Anthropic / Claude

今日无更新。Fable 5.1 / Mythos 5.1 已于前两日简报深度覆盖,官方博客 RSS 今日仍返回错误页(Next.js error),未发现新的发布动态。


国内大厂动态

DeepSeek / Kimi / 豆包 / 智谱 等

陈大年复出,StartLux 本地模型首秀逼近 DeepSeek 万亿旗舰 ⭐ 深度推荐(详见深度阅读区)。27B 本地模型在信通院 MCP 测试综合第二,与 DeepSeek-V4-Pro 仅差 1.3 个百分点。来源

影眸 Hyper3D 发布世界生成模型 WorldGen:3D 生成从「造物」跨进「造世界」——一张场景图 2~3 分钟生成完整 3D 场景,且每个资产都「活着」:可单独拎起、旋转、替换,自带物理属性(抽走支撑物周围物体会位移跌落),可直接跑进游戏关卡、影视片场、机器人训练环境。技术基座是去年拿下 SIGGRAPH 2025 最佳论文的自研 CAST 技术,同期获奖的商业公司只有谷歌和 Meta。来源

腾讯 WorkBuddy 开放平台上线,联名硬件 + 100+ 生态伙伴入场:9 月 2 日腾讯 WorkBuddy 开放平台正式上线,亮相 9 款联名智能硬件(Plaud、乐奇 Rokid、影石、科大讯飞、安克、京东京造等)、30 多个行业应用与首批超 100 家生态伙伴,是国内 AI Agent 赛道首个同时打通硬件、应用与开发者三层生态的开放平台。腾讯云副总裁刘毅称要把 WorkBuddy 打造成「面向 Agent 时代的操作系统」,硬件厂商接入后设备变成 Agent 伸向现实世界的「耳朵和眼睛」。来源

它石智航 AWE3.7 通用具身大模型密集释出:以同一颗「具身大脑」贯通工业产线、物流、生活服务与移动操作多场景,十天密集发布系列真实任务——毫米级零件分拣、双手协作缠胶带、网线插接、手机装盒、动态传送带抓取等精细操作,回应具身智能「通用泛化」命题。来源


AI 研究前沿

重要论文、技术突破

Counter-GEO-Bench:评测生成式引擎优化(GEO)的防御能力:GEO 让内容生产者提升网页在生成式搜索引擎中的曝光,但同样的技术可被对手用来发布「看似正常」的文档,诱导大模型检索后合成失实答案。本文提出首个在受控条件下评测这类防御的基准,直击 AI 搜索时代的信息安全软肋。来源

Do Tabular Foundation Models Know Physics?:表格基础模型(TFM)以填表的方式学习,而表格恰恰是大多数物理测量数据的载体——它们是否真的「学会」了物理?作者在 316 个物理方程采样的数据集上、域内域外共四个 TFM 对六个基线做了直接探查,拷问这些模型的「先验」里究竟装了什么。来源

Privacy Washing:检测隐私政策中的自相矛盾:论文把「承诺被同一份政策里其他条款暗中削弱」的现象操作化为「隐私漂绿」,用四阶段管线(陈述抽取、兼容性过滤、NLI 筛查、三模型投票确认)在两份隐私政策语料中检测内部矛盾,为 AI 时代的隐私合规审计提供工具。来源

注:HuggingFace daily_papers 官方 API 今日仍无法直连(连接超时),已降级使用备用源 papers.takara.ai 的 RSS,最新条目 pubDate 停在 2026-09-02,覆盖滞后约 2 天。


行业观点与解读

KOL 重要推文、深度分析文章

Simon Willison 实测解读 GPT-6 Astra:Simon 还没拿到 API 访问权限,但已基于公开信息给出克制而犀利的判断。他最提醒读者的一点是 ARC-AGI-3 那个 99.9% 的「水分」:该分数用的是 OpenAI 自定义的 Provider Adapter harness(跨请求保留不透明推理状态 + 长对话压缩),花了 1.9 万美元;默认 harness 只有 62.7%(2.6 万美元),而 Fable 5 尚未公布该基准结果。他也确认了 Astra 的安全与长上下文强项(ExploitBench 100%、SRE-Bench 逆向 99.2%、八针 256K–512K 全对),但指出 Artificial Analysis 智能指数上 Astra 仅 61,与 Sol 持平、比 Fable 5.1 低 5 分,还落后于 Meta 新发的 Muse Spark 1.3;唯一明显领先的是 Coding Agent 的成本效率前沿——单任务成本不到 Fable 5 的一半。来源


值得关注的视频

YouTube 播客与频道近期值得看的视频。标注 ⭐ 的为重点推荐。

今日无更新。过去 24 小时 WebSearch 检索核心访谈播客(Latent Space、No Priors、Dwarkesh、Lex Fridman、The AI Daily Brief 等)及 B 站 AI 资讯频道时未返回有效结果,无法确认是否有新集发布。


灵感种子

以下是今日简报中值得进一步思考的灵感种子。

「AGI 时代开幕」是一句营销,还是一次真实的范式切换?:GPT-6 Astra 把「从回答问题到直接完成工作」推到台前——它不只是生成文字,而是进终端、开软件、交付可用的工程产物。当模型开始以「交付物」而非「答案」为单位计费,OpenAI 自己都在强调「真正有意义的指标是完成一项任务多少钱,而不是每百万 token 多少钱」。这会不会倒逼整个行业重新定义评测、定价与「智能」的度量方式?

网络安全成为「第三战场」,而「可信访问」是一把双刃剑:Astra 达 Critical 阈值、Daybreak 撒 10 亿美元、Mythos/Flash Cyber 前脚刚落——头部实验室都在给防御者发武器,但都采用「有限可信访问」的放量。值得追问:这种 gatekeeping 究竟是在给防御者争取适应窗口,还是在系统性拉开攻防双方的能力差距?以及,当攻击者也能买到同款能力,防御的窗口有多短?

「本地模型 vs 云端垄断」会是一条真叙事吗?:陈大年复出押注 27B 本地模型,放话 3 年打平 Claude、占 80% 市场。这条「反 Scaling」叙事在国产语境下尤其有诱惑力——端侧部署、隐私合规、算力成本都是国内大厂和创业公司的隐痛。但它能否成立,关键不在 27B 能不能逼近万亿旗舰,而在生态、工具链与长期维护成本能否跟云端掰手腕。值得持续追踪 StartLux 的后续。

世界模型在两条线上同时兑现承诺:DeepMind 把世界模型用在天气(WeatherNext 3),影眸把世界模型用在 3D 场景生成(WorldGen),李飞飞 World Labs 的 Atlas 昨天刚把世界模型用于机器人 Real-to-Sim。天气、3D、具身智能——三个看似不相关的方向,正在被「从数据中学习物理规律」这同一套范式穿透。「世界模型」可能不是某个单一产品,而是一类正在扩散的基础能力。


生成时间:2026-09-04 08:58 | 下次更新:明日 9:00