大模型发布监控26 条
2026-09-12回看 2 天 · 新增 26 条(框架 12,媒体 9,官方 4,权重 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(354 天前)
一句话总览
过去两天无新模型正式发布。最有分量的一手信息是 OpenAI 连发两篇 GPT‑6 Astra 客户案例(Cognition、Perplexity),确认该模型已在 API 侧承担端到端的自动测试与生产监控类任务;框架侧则密集出现 DeepSeek‑V4.1、GLM‑5.3‑Flash、Qwen4、MiniMax‑M3 的适配 PR,下一波国产开源旗舰已在路上。
正式发布
- OpenAI · GPT‑6 Astra · 2026-09-11 / 09-14(客户案例,非首发) —— 官方两篇客户故事确认 GPT‑6 Astra 已通过 API 商用:Cognition 用它让 Devin 自测代码并回传模拟器录屏与测试报告,Perplexity 用它撰写通信、修改真实系统、监控生产软件,并称"检查频率远低于上一代模型"。官网导航栏已把 GPT‑6 列在 GPT‑5.6/5.5/5.4 之前,定位为当前最新旗舰。两篇文章均未给出参数、上下文、定价等规格,细节待官方补充。来源 · 来源
- NVIDIA · NemotronLabs‑VoiceChat‑11B · 2026-09-12 —— HF 仓库建于 7 月 29 日,9 月 12 日发生实质内容更新,目前 473 likes / 3643 下载,safetensors 格式、英文标签,从命名看是 11B 规模的语音对话模型(权重已上线,官方尚未发文)。属于 Nemotron 系列的垂直分支,非旗舰基座,架构与是否端到端语音待官方补充。来源
- AWS · Bedrock Managed Knowledge Base 接入 TwelveLabs Marengo 3.0 · 2026-09-11 —— Bedrock 托管知识库新增视频、音频、图片的多模态 embedding,底层为 TwelveLabs Marengo 3.0。这是平台能力更新而非新模型首发,对做多模态 RAG 的团队有意义,模型规格与定价条目未给出。来源
早期信号
- DeepSeek‑V4.1 —— transformers 新增 deepseek_v41 文本模型,vllm 已把 V4.1 合入主线并持续修 MegaMoE 路由、V4.1‑Flash 的 SM120/GB10 几何不匹配、Engram 表 DP 分片与异步预取;HF 尚无官方权重,疑似 V4.1(含 Flash 变体、带 Engram n‑gram 记忆层)临近开放。来源
- 智谱 GLM‑5.3‑Flash —— vllm 两个 Bugfix PR 涉及 ROCm 上 indexer 查询的 FP8 量化和 FP8 权重/缩放对加载;HF 无官方权重,疑似在为开源版本预热,也可能仅是闭源 API 侧的内部适配。来源
- Qwen4 —— vllm 给 "Qwen4Exp" MTP 加可选 FP8 提议头,llama.cpp 为 qwen4 启用 CUDA 稀疏注意力;两大框架同步动作,疑似 Qwen4 系列(带 MTP 与稀疏注意力)进入发布前适配。来源
- MiniMax‑M3 —— vllm 三个性能 PR(ROCm MXFP8 MoE、sm100 上的 flashinfer MSA 后端、marker 查找优化);HF 无官方权重,疑似 M3 采用 MSA 稀疏注意力架构并在做多硬件适配。来源
- Gemma 4 MTP 草稿模型 —— vllm 修复 Gemma 4 推测解码时以 google/gemma‑4‑26B‑A4B‑it‑assistant、gemma‑4‑31B‑it‑assistant 为 drafter 的 KV scale 崩溃;交叉验证显示 HF 无同版本权重,疑似官方 assistant 草稿检查点尚未完全公开或命名有别。来源
- Qwen3 Omni + DSpark —— vllm CI 修 Qwen3 Omni 的 DSpark 草稿模型加载测试,疑似 Omni 系列在补推测解码(共享 embedding、小词表草稿)支持。来源
媒体转述(二手)
- 据 快科技 报道,谷歌 Gemini 4 大模型将有"大升级",无官方细节。
- 据 blog.google / 9to5Google / CNET / SammyGuru 报道,Gemini 桌面 App 已登陆 Windows 与 Galaxy Book,属客户端产品更新而非模型更新。
- 据 aroundprague.cz 报道,Anthropic 披露胡塞武装曾利用 Claude 辅助导弹研发的细节,属安全与滥用事件,非模型发布。
- 据 中国经营报 专访,科大讯飞雷琴辉称大模型上车的产业拐点在于"主控智能体"。
判断
真正值得跟进的是两条线:一是 GPT‑6 Astra 已被 Cognition、Perplexity 用于"自测并出证据"和"少盯管的端到端自动化",这直接关系到代理型编码工具的选型,值得拿自家 CI 场景实测;二是 DeepSeek‑V4.1 已合入 vllm 主线、transformers 也在加模型类,通常意味着开源权重只差一个博客,自建推理的团队可以提前评估 Engram 层对显存与部署拓扑的要求。GLM‑5.3‑Flash、Qwen4、MiniMax‑M3 的 PR 密度说明国产厂商正扎堆在 Q3 末冲发布,但眼下只是信号,不必动手。NVIDIA 语音模型、Bedrock 多模态 embedding 属常规迭代;Gemini Windows 客户端和"Gemini 4 大升级"报道是噪音,等官方发文再看。
原始条目
■ 官方 (4 条)
■ 权重 (1 条)
■ 框架 (12 条)
■ 媒体 (9 条)