大模型发布监控34 条
2026-09-08回看 2 天 · 新增 34 条(框架 17,媒体 12,官方 5)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(350 天前)
一句话总览
今天最重要的是 OpenAI 在官方公司博客中以已上线口径提及 GPT-6 Astra,称其为"世界上最智能、最对齐的模型",在计算机操作、浏览、软件工程、网络安全、科学和专业工作上达到 SOTA;xAI 文档站同时冒出 grok-4-6 的模型页,说明该型号已可调用。框架侧 DeepSeek V4 / Qwen3.8-Flash-Next / GLM-5 / Kimi-K3 等适配密集推进,但均未见官方权重。
正式发布
- OpenAI · GPT-6 Astra · 2026-09-08(官方提及) —— OpenAI CFO Sarah Friar 署名的公司博客《The Work Now Within Reach》把 GPT-6 Astra 作为已发布事实来写:定位为"a major step forward in AI capability",宣称是全球最智能且最对齐的模型,在 computer use、browsing、软件工程、网络安全、科学与专业工作等领域达到 SOTA。这篇是商业战略文而非模型发布文,未给出参数、上下文、定价等规格,细节待官方模型页补充;媒体所称的 $10/M tokens 定价只见于二手转述,暂不采信。同文披露 ChatGPT 周活超 10 亿、企业客户 250 万。来源
- xAI · grok-4-6 · 日期待官方补充 —— docs.x.ai 的 API 文档索引中新出现 grok-4-6.md 模型页,按该站惯例,文档页与发布同步甚至更早上线,可以认为该模型 ID 已可通过 API 调用。索引不带日期且正文未抓到,规格、定价、与 Grok 4 系列前代的关系均待官方补充。来源
- Google DeepMind · AlphaGenome Atlas · 2026-09-08 —— DeepMind 官方博客发布 AlphaGenome Atlas,定位为"人类基因组中每一种可能的单碱基变化的预测图谱",副标题称覆盖约 90 亿个人类 DNA 变体的分子层面预测。这是 AlphaGenome 科学模型的成果产品化,属于 AI for Science 而非通用大模型,正文细节抓取不完整,具体开放方式待查看原文。来源
早期信号
- DeepSeek V4 系列:vLLM 两条 PR 分别修复 "DeepSeek V4 MegaMoE 要求 expert parallel" 的启动报错、并为 DeepSeek-V4 Flash Vision 添加 LoRA 支持,HF 上尚无官方组织的 V4 权重,疑似 V4 存在 MegaMoE 新架构与带视觉的 Flash 分支,正处于适配期(与媒体所称 V4.1 Flash 限时内测相呼应,但官方未发文)。vLLM #55914
- Qwen3.8-Flash-Next:vLLM PR 为 Qwen/Qwen3.8-Flash-Next-FP8 启用 FlashInfer TRTLLM MoE 后端(TP2/4/8,128×128 FP8 量化块,配置显示 E=512 专家),HF 上未见该型号官方权重,疑似通义在准备一个新的 Flash 系 MoE 模型。vLLM #55867
- Gemma 4:vLLM 把 Gemma 4 的权重加载改为通用 AutoWeightsLoader,测试表中直接跑了 gemma-4-e4b-it / E2B-it / 26B-A4B-it 三个尺寸,但交叉验证 HF 上没有官方组织同版本权重,疑似 Google 已把 Gemma 4 权重分发给框架方做预适配,尺寸线索指向 E2B / E4B 与 26B-A4B MoE。vLLM #55911
- GLM-5:vLLM 两条 BugFix 涉及 GLM-5 加载 msmodelslim 原生量化 checkpoint、丢弃 MTP draft 权重、以及 indexer/state 两类混合 KV cache 分组,疑似 GLM-5 采用带 indexer 的混合注意力架构并自带 MTP 层,HF 上暂无官方权重。vLLM #55813
- Kimi-K3:AMD 工程师向 vLLM 提交 ROCm 侧 Kimi-K3 "large-M merged MoE front" 优化并配套 AITER PR,疑似月之暗面下一代 K3 已在 AMD 平台做推理预适配,HF 上无官方权重。vLLM #55811
- MiniMax-M3:vLLM 两条 PR 为 MiniMax-M3 启用 CUTLASS MSA 小 batch 解码、以及 ROCm 上 MiniMax-M3-MXFP8 的可断 CUDA graph,疑似 M3 已进入框架侧性能调优阶段,官方权重未见。vLLM #55838
媒体转述(二手)
- 据 tech-insider.org 报道,GPT-6 Astra 定价为 $10/M tokens;qz.com 另报道黄仁勋在 OpenAI 发布新模型后宣称"AGI 已到来",均为二手说法。
- 据 36氪 / finance.biggo.com 报道,DeepSeek 突然开启 V4.1 Flash 两天限时内测,新架构原生融合多模态;shattered.io 另称 DeepSeek V4 Pro 0813 版本价格上涨 3.6 倍。
- 据新浪财经报道,讯飞星火 X2.5 发布,总参数 2930 亿,全国产算力训练。
- 据搜狐报道,月之暗面、阿里开始对开源模型的商业使用要求分成,引发"大模型税"讨论。
判断
真正要跟进的是 GPT-6 Astra:官方博客已把它当既成事实写,但规格与定价一个字没给,今天的行动应是盯 OpenAI 模型页和 API 定价页,而不是转发媒体的 $10/M 数字;xAI 的 grok-4-6 同理,先查文档页再决定是否入选型对比。框架侧信号密度很高,DeepSeek V4(MegaMoE + Flash Vision)、Qwen3.8-Flash-Next、GLM-5、Kimi-K3、MiniMax-M3 五家同时在 vLLM 里调优,意味着接下来两到四周国内开源旗舰可能集中放权重,值得提前留好评测算力;Gemma 4 的三个尺寸名已在 PR 测试里明文出现,发布应当很近。Mistral 30 亿欧元 D 轮和 AlphaGenome Atlas 是重要新闻但不影响近期模型选型,Accenture 与 Google Cloud 的合作、OpenAI 新闻业计划属噪音。
原始条目
■ 官方 (5 条)
■ 框架 (17 条)
■ 媒体 (12 条)