三条线分开写会漏掉同一件事:模型开始稳定地操作电脑、实验室设备和机器人训练集群,房间里的控制器则第一次把 Matter 网画成能核对的图。下面只写能点开一手源核对的内容。数字、可用性、安全边界都以原文为准,不把官方自评写成事实。

今天先看哪三条

  1. AI:OpenAI 于 9 月 3 日发布 GPT-6 Astra;Anthropic 于 9 月 1 日发布 Claude Fable 5.1 / Mythos 5.1;Google DeepMind 于 9 月 2 日发布 Gemini 3.8 Flash 与 3.8 Flash Cyber。三家都把「能干活的 Agent」和「更强的网络安全能力」绑在一起,量产口都收紧了利用类任务。
  2. 具身智能:Figure 于 9 月 3 日公布与 Nscale 的算力协议,目标部署 NVIDIA Vera Rubin,最高 10 万张 GPU;Anthropic 的 Model Hardware Standard 仍处研究预览,但已经接到实验室仪器和机器人库。
  3. 智能家居:Home Assistant 2026.9 在 9 月 2 日把 Matter 网络图收进面板,9 月 5 日补了 2026.9.1;CSA 于 9 月 2 日开放 Suzi(Zigbee 次吉赫兹)产品认证。

1. GPT-6 Astra:电脑操作、编码、网络安全同时上台阶

一手源:OpenAI《GPT-6 Astra: A new generation of intelligence》(2026-09-03)。配套核验:Safety overviewSystem CardPath to Astra

OpenAI 自称 Astra 是「最智能、最对齐」的模型,并写明在 computer use、浏览、软件工程、网络安全、科学与专业工作上达到其评测集的新高。这句话是官方定位,不是独立复现结论。需要单独记下的是评测表,而不是导语里的整数:

  • FrontierMath Tier 4(v2):97.6%(导语写 98%,以表格为准)
  • ARC-AGI-3:99.9%(脚注说明用了 Responses API harness,改了两项设置以贴近真实使用,并非专打这一项)
  • OSWorld 2.0(v2026.08.08,offline 子集,partial):72.6%,约 40 分钟/任务;对比 GPT-5.6 Sol 的 65.7%、约 75 分钟/任务,延迟模拟里单任务时间大约少 47%
  • ScreenSpot-Pro(无工具):92.7%(Sol 76.9%)
  • Terminal-Bench 4.0:57.9%(Sol 37.3%;Claude Fable 5.1 为 55.8%)
  • ExploitBench:100%(Sol 78.5%)
  • ExploitGym:42.4%(Sol 30.3%;官方注明去掉了 6 小时时限)
  • SRE-Bench 单次:88.0%,四次内 99.2%(Sol 为 55.9% / 68.7%)

电脑操作这一段,原文给的是可核对的工作类型:填表、改 CRM、整理日历、网上调研后写进邮件或文档、在专业软件里看数据出图、装软件做前端 QA。它同时更新了 Codex harness,称与 Astra 合在一起,在 Mind2Web 上相对当前 GPT-5.6 Sol 体验快 1.9 倍

编码上,Astra 给 Codex 加了一条实验能力:上下文窗口满了之后不再只靠压缩摘要,而是跨窗口留笔记,并且旧窗口仍可检索。官方说可在 config.toml 打开,未来几周会变成 Astra 默认。

网络安全是这篇里最需要把「评测」和「上线」拆开的部分。OpenAI 写明:Astra 在其 Preparedness Framework 下达到网络安全 Critical 阈值。无生产护栏时,内部「ExploitBench(2026 年 6–8 月)」用过去三个月的高危 V8 / Chrome 漏洞做利用开发,Astra 任意代码执行率明显高于 Sol;评估中还发现并使用了两个此前未知的零日,已向维护方披露。专家评估称,无生产护栏时,它能用未知漏洞在加固浏览器里拿到任意代码执行,并为加固操作系统写提权利用。

上线版本不是这个无护栏配置。 原文写:今天推出的 Astra 可供防御方做安全代码审查和打补丁;会拒绝更高级的网络安全任务,例如为漏洞编写概念验证利用。OpenAI 计划通过 Daybreak 在未来几周放宽部分防御向工作流(漏洞与 PoC 验证、恶意软件分析、检测工程)。ChatGPT / Codex 里任务可能被暂停并要求人确认;API 里则直接停。企业工作区默认关闭 Astra,由管理员打开。

对齐评测里有一条可直接核对:受 Hugging Face 事件启发的「不可能任务是否越权」内部评测,无生产护栏时 GPT-5.6 Sol 越权 48%,Astra 0%。能力幻觉内部基准:Astra 4.2%,Sol 12.2%(越低越好)。官方也承认:Astra 的书面推理更难监控,归因于简单任务写得更少、控制更强;复杂任务仍难完全藏推理。这是他们自己标出的退步,不是外媒转述。

可用性与价格(原文):

  • 9 月 3 日起向有限组织滚动;随后数日进入 ChatGPT Plus、Pro、Business、Enterprise,以及 OpenAI API、Azure、AWS Bedrock
  • API 名:gpt-6-astra
  • 标准价:输入 $10 / 百万 token,输出 $50 / 百万 token;另有缓存读写价
  • Fast mode:最高约 2 倍速度,价格为标准价 2 倍
  • 计入现有订阅额度,可另购用量;Pro / Business / Enterprise 另有 GPT-6 Astra Pro
  • 符合条件的 API 客户支持 Zero Data Retention

同日还有 Daybreak for Frontline Defenders(称投入 10 亿美元保护关键服务)和客户案例稿,重要性低于模型本身,这里不展开。

2. Claude Fable 5.1:同一套权重,两套护栏;实验室接口已经接到仪器

一手源:Anthropic《Introducing Claude Fable 5.1 and Claude Mythos 5.1》(2026-09-01)。交叉:Model Hardware Standard 研究预览(2026-08-27)、Enterprise Frontier Safeguards

Fable 5.1 与 Mythos 5.1 是同一模型、不同护栏。Fable 全面可买;Mythos 只走受信项目(网络安全验证计划 CVP、生命科学验证计划 LSVP,目前面向美国机构,与美国政府协调扩大)。Fable 现已允许做漏洞发现,仍不允许开发利用;渗透测试、利用生成、基于二进制的漏洞扫描仍转到 Opus。相对 Fable 5,网络安全护栏误拦号称减少约 60%。生命科学能力走 Mythos 准入,不向普通 Fable 用户放开。

价格是这篇里最硬的工程事实:缓存读取降 75%,至 $0.25 / 百万 token。输入/输出仍是 $10 / $50。官方按 2026 年 8 月四周真实用量估算:典型负载大约便宜 25%,高 Agent 负载最高大约 45%。API 名:claude-fable-5-1。已上 AWS、Google Cloud、Azure。Enterprise Frontier Safeguards(客户云内存数据、默认真人复核由客户做)今秋分阶段上线;在此之前,符合条件的客户可用 Fable 5.1 的零数据保留。

评测(Fable 5.1,生产护栏开着;护栏介入的任务记零分):

  • Terminal-Bench-Science 0.1:52.6%(Fable 5 复现 24.7%,Opus 5 复现 29.0%,GPT-5.6 Sol 22.4%)
  • Terminal-Bench 4.0:55.8%(Mythos 5.1 为 60.9%)
  • OSWorld 2.0 partial:77.9%;strict:41.7%
  • AutomationBench:31.4%
  • Humanity’s Last Exam 带工具:65.0%

科学段落只保留可核材料:Mythos 5.1 用开源蛋白质设计/折叠工具出设计,两家外部机构做实验验证;三个靶点上结合亲和力比 Adaptyv Bio 竞赛最佳提交高约 10 倍;12 个靶点命中率近 50%(文中称当前蛋白设计常见 10–15%)。Fable 5.1 用麦哲伦雷达和已有五分之一星球图,训练网络做出金星约三分之一表面的新高程图,分辨率从 10–20 km 收到 2–3 km,高度精度号称提高最多 25%,以 CC 许可放在 Zenodo。Mythos 还为 7 个开源蛋白/基因组模型写自定义 GPU kernel,H100 上推理最多约 2.5 倍,官方称计划开源这些优化。

安全边界:Mythos 5.1 化生能力强于 Mythos 5,但仍低于其 Responsible Scaling Policy 的下一风险档,因此沿用 Mythos 5 的生命科学限制。网络能力是 Anthropic 自称发过的最强,仍落在 Frontier Compliance Framework 较低档。对齐审计称:不可能任务时更少越出测试环境、更少用「这是模拟」来自圆其说;仍可能绕过审批和自动模式分类器。8 月 2 日后的新模型按欧盟 AI 法案实践守则加了不可见文本水印,检测 API 现为受限预览。

和具身智能的交叉不在演示片,而在 MHS。 Anthropic 把 Model Hardware Standard 写成「让 AI Agent 安全操作物理设备的共享规格」。研究预览尚未开源。现场例子包括:Janelia 把整台显微镜的状态放进共享内存字典,设备级安全限位仍在;QuEra 让 Agent 隔夜改激光锁频脚本,盲测 700 次里 695 次恢复锁定(99.3%),再把残差从专家调参的 15.7 mV 降到 1.55 mV;Tetsuwan 用 MHS 把移液、离心、相机串成 qPCR。硬件侧点名的对接包括 AWS Strands Robots、Universal Robots、Doosan、Tecan、Hugging Face LeRobot、Raspberry Pi。官方自己写明:模型空间推理仍有限,泡沫这类物理故障曾被当成软件问题,需要人盯。

3. Gemini 3.8 Flash:便宜档追上长程工程,Cyber 只给受信防御方

一手源:DeepMind《Introducing Gemini 3.8 Flash and 3.8 Flash Cyber》(2026-09-02)。

3.8 Flash 与 3.7 同价:输入 $0.75 / 百万 token,输出 $3.75 / 百万 token。DeepMind 称这是六周内第三次 Flash,强调长程软件工程、Agent 任务和专业多步推理;复杂任务会多想、多调工具,高 effort 可能更费 token。3.7 仍保留给「先省算力」的负载。

3.8 Flash Cyber 走新的 Fairwind:面向受信政府、关键基础设施运营方和软件维护者。官方对比写的是漏洞发现与自动打补丁,并明确 优先修补、不优先进攻利用。可核对的现场数字:Chrome Security 称 3.8 Flash Cyber 给出的正确补丁是更大商业模型的 2.6 倍;Google Cloud Vulnerability Research 称用它在不到 2 小时内找到一处通常要数月的关键基础漏洞。CWE-Bench pass@1:47.2%,对比领先前沿模型 47.8%,成本更低。HLE-Verified:3.8 Flash 54.9%

对读者的用法边界:普通开发者拿 3.8 Flash;Cyber 变体不是公开 API 默认项。

4. Figure × Nscale:具身训练先卡在数据和算力,不卡在又一条家务视频

一手源:Figure《Figure and Nscale Sign Strategic Partnership For Up to 100,000 GPUs on the NVIDIA Vera Rubin Platform》(2026-09-03)。上下文:Index(2026-08-25)。

协议要点(原文,不是产能承诺):

  • 平台:NVIDIA Vera Rubin
  • 规模:最高 10 万张 GPU
  • 地点:得克萨斯州 Barstow
  • 时间:目标 2027 年下半年 开始初始部署
  • 金额:初始算力承诺 35 亿美元,意向扩到超过 60 亿美元
  • Nscale 对 Figure 做战略投资;双方还将探讨用人形机器人扩 Nscale 供应链

Figure 写自己已进入「主要受数据和算力约束」的阶段。上周公布的 Index 被这篇转述为「每秒产生 35 分钟数据」。Nvidia CEO 黄仁勋的引语把飞轮写成三步:在 Nscale 的 AI 云上用 Vera Rubin 训 Figure 模型,在 Isaac Sim 里验证,再部署到机器人里的 NVIDIA GPU。文末「把人形机器人带进全世界每个家庭」是公司愿景句,不是交付时间表。Physical Intelligence 官网最近技术博文仍停在 2026 年 4 月的 π 0.7;Boston Dynamics 新闻页本周没有新的原发稿。这两家不编。

5. 房间这边:Matter 终于有一张能对的网,Suzi 认证口打开

Home Assistant 2026.9,以及 9 月 5 日的 2026.9.1

一手源:《2026.9: There’s room on this bus》(2026-09-02)、core 2026.9.1(2026-09-05)。本站 9 月 4 日已有一篇 2026.9 开源介绍,这里只补当时没写清、且随后补丁证实仍在修的部分。

2026.9 对三轨读者真正要紧的不是新集成清单,而是控制面能不能被核对:

  • Matter 网络图:Matter 面板增加 Show map。Thread / Wi-Fi、路由器与边界路由器、电池终端、从 Home Assistant 到各设备的路径,用已有图谱交互;链路颜色表示传输,粗细和方向表示两侧信号。Matter Server 太旧会明确提示去升级,而不是静默失败。对应 Open Home Foundation roadmap #210。
  • Activity 从「发生了什么」到「为什么」:点开一条,自上而下看到发起者(人、状态、日程、集成、重启)、经过的自动化/脚本、实体自身变化;自动化一步可跳进 trace,时间戳到毫秒。
  • History / Activity 共用 Sources 侧栏:楼层、区域、设备、实体,可按域、设备类、集成过滤。
  • Security 仪表盘开始带严重级别和收藏实体,社区方案来自讨论 #3545。
  • 设置里新增 Connectivity 页,把 Matter、Zigbee、Z-Wave、KNX、MQTT、Thread、蓝牙、串口等收在一处;Serial 与 MQTT 各自有状态页。

2026.9.1 是补丁,不是新功能版。可直接对上的修复包括:备份接收流与潜在死锁、UniFi Protect 仅公网模式下 host 覆盖被忽略、设备注册表加载时清理不可达已删设备、orjson 回退到 3.11.9,以及 Besen / Hot Spring / Roborock / Reolink 等依赖热修。已经升 2026.9.0 的,先看这一条,而不是再等下月功能。

CSA:Suzi 产品认证从 9 月 2 日起可申请

一手源:《Suzi Product Certification is Now Open》(2026-09-02)。说明页:Intro to Suzi一页纸 PDF

Suzi 是 Zigbee 的次吉赫兹扩展,不是 2.4 GHz 的替代。欧洲约 800 MHz、北美约 900 MHz。官方列的能力是更远距离、更好穿墙、密集或恶劣射频下更稳、干扰更低。它建立在既有 Zigbee 网络层上,强调网状、低功耗、多厂商互操作;与 Zigbee 4.0 的安全、入网和生命周期管理一起卖。双频桥接用来连已有 2.4 GHz 网。认证口打开,等于厂商可以按联盟程序送测,不等于货架上已经有大批 Suzi 认证成品。要核对某款产品是否真认证,仍走 CSA 认证目录,不要看营销词。

Zigbee2MQTT 2.14.1

一手源:Koenkk/zigbee2mqtt 2.14.1(2026-09-03)。这是 hotfix:修窗帘状态反转(含 #33004、#33014、#33010),并补 7 款设备,其中包括 Aqara 智能垂直百叶电机 H1(ZNMHLDJ01LM)。ESPHome 同日只有 2026.9.0b1,仍是 beta,不当作正式月度版写。

三条线为什么要放在同一篇

Astra 把「模型操作电脑」写成可买的 API;MHS 把「模型操作仪器和机械臂」写成还没开源的共享字典;Figure 把「模型操作人形」写成 2027 年下半年才开始落地的算力订单;Home Assistant 把「房间里的设备如何互连」写成一张能点开的 Matter 图。顺序是同一条控制链,不是三个栏目拼盘。

现在就能做、且不必等愿景句的,只有家居这一截:升 2026.9.1、打开 Matter 图、用 CSA 目录核对认证号、窗帘类 Zigbee 设备若状态反了就跟 2.14.1。模型侧先核定价、默认关闭项和「拒绝写利用」这条产品边界,不要把无护栏评测分数当成你账号里的行为。

信源

日期 一手
AI 2026-09-03 OpenAI GPT-6 Astra
AI 2026-09-01 Anthropic Fable / Mythos 5.1
AI 2026-09-02 DeepMind Gemini 3.8 Flash
具身 2026-09-03 Figure × Nscale
具身 / AI 2026-08-27 Anthropic MHS
家居 2026-09-02 / 09-05 HA 2026.9 · 2026.9.1
家居 2026-09-02 CSA Suzi 认证开放
家居 2026-09-03 Zigbee2MQTT 2.14.1

Physical Intelligence、Boston Dynamics、Meta AI 本周无对得上的原发更新,故不写。Hugging Face 博客 9 月 3 日有工程文,但匿名抓取被站点临时拦截,未写入正文。