大模型发布监控51 条
2026-08-27回看 2 天 · 新增 51 条(框架 16,官方 16,媒体 13,权重 6)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(338 天前)
一句话总览
今天最值得知道的是智谱 GLM-5.3-Flash已在官方文档上线可调用:320B 总参 / 18B 激活、GLM-5 系列首个原生多模态、混合稀疏+线性注意力、1M 上下文,llama.cpp 侧已有两个 PR 在补齐支持。其次是 IBM Granite 4.2(3B/8B/30B 稠密推理模型,Apache 2.0)官方技术博客发布,以及 Qwen3.8-Flash-Next(Qwen4 架构预览版)权重已可用的二手确认。
正式发布
- 智谱 Z.ai · GLM-5.3-Flash · 日期待官方补充(文档索引不带日期) —— GLM-5 系列第一个原生多模态模型,官方称智能水平高于 GLM-5.2 且保持 Flash 级成本。320B 总参数、18B 激活,采用稀疏注意力 + 线性注意力的混合架构,相比 GLM-5.3 注意力计算量降 3.01×、KV cache 降 4.44×;文本参数与 GLM-5.3 一致,支持 1M token 上下文,图像通过 image_url 内容块传入;已进入 GLM Coding Plan 并给 3× 配额,模型代号 glm-5.3-flash。官方文档自称"首个开源前沿模型",但本次 HF 扫描尚未捕获官方组织权重;llama.cpp 已有两个 PR(#27754 by danielhanchen、#27773)在补齐支持,PR 里给出的结构是 46 层、34 层 KDA + 11 层 DSA、mHC、DeepSeek 式 MoE,外加视觉塔。来源
- IBM · Granite 4.2(3B / 8B / 30B)· 2026-08-25 —— Granite 家族第一代明确面向推理的稠密 decoder-only 模型,三个尺寸从零预训练约 15T token,五阶段训练把上下文扩到 512K;SFT 后接多阶段 RL 管线,8B 和 30B 额外做了在真实沙箱里带工具的 agentic RL。全系支持 thinking / non-thinking 切换、低成本 thinking 模式和原生工具调用,提供 FP8 / FP4 / GGUF 量化,Apache 2.0 许可。定位是本地部署的推理型小中模型。来源
- Qwen · Qwen3.8-Flash-Next · 2026-08-26 前后 —— 据 Simon Willison 转述,这是 Qwen 又一个开源权重多模态 MoE 模型,官方把它定位为"Qwen4 所用架构的早期预览",激活参数仅 6B(转述称总量 125B),Unsloth 已放出多档 GGUF 量化并可在 DGX Spark 上跑。一手侧证是 transformers PR #48368 直接引用了 HF 仓库 Qwen/Qwen3.8-Flash-Next-FP8 的讨论区并修复其 FP8 embedding 加载(权重已上线,本次未直接抓到官方发文,细节待官方补充)。来源
- Anthropic · Claude Fable 5 / Opus 5 / Sonnet 5 产品线 · 日期未知(文档索引不带日期) —— 文档站 release notes 新增了 Claude Fable 5 的 system prompts 页面,模型页显示现役阵容为 Fable 5(1M 上下文 / 128K 输出 / $10 · $50 每 MTok / adaptive thinking 常开)、Opus 5($5 · $25,2026-07-24 发布,知识截止 2026-05)、Sonnet 5($2 · $10,Sonnet 4.6 的 drop-in 升级,手动 extended thinking 和非默认采样参数会直接返回 400),Opus 4.8 已被标为 Legacy 并引导迁移到 Opus 5。属于文档层面的阵容确认而非当日新发布。来源
- NVIDIA · Cosmos3-Super / Cosmos3-Nano 权重更新 · 2026-08-26 —— 两个仓库 3 月建仓、8-26 有实质更新,tags 含 cosmos3_omni、diffusers、vllm-omni,属于 Cosmos 世界模型 / 物理 AI 系列的第 3 代(权重已上线,官方尚未发文,规格细节待官方补充)。同期 Nemotron-3-Super-120B-A12B-BF16 也有内容刷新。来源
- Google DeepMind · Gemini 3.5 Transcribe · 2026-08-27 —— 官方博客发布的转写(ASR)专用模型,标题为"Intelligent transcription",正文抓取只拿到导航栏,规格与定价待官方补充。属专用模型,非旗舰。来源
- 小模型 / 工具模型合集 · 2026-08-26~27 —— inclusionAI 上传 UI-Venus-2-9B(基于 qwen3_5 的 GUI agent 视觉语言模型,权重已上线,官方尚未发文);腾讯 HunyuanOCR 仓库有实质更新;FrontiersMind Lumma-0.6B-Base(因子化绑定嵌入 + 共享 KV 注意力,KV cache 减半)由 llama.cpp #27791 补齐支持;微软放出 SQuadGen(3D 四边形网格扩散生成)。均为非旗舰。来源
早期信号
- vLLM #54051 出现 XingChen4(星辰 4)MoE 模型的 WIP 适配:复用 DeepSeek-V2/V3 骨干(MLA + MoE + 可选 DSA indexer),把残差换成流形约束超连接 mHC,并可选接 FlagOS/FlagGems 加速;作者明说权重尚未公开,疑似国内某厂即将发布的新一代基座。
- llama.cpp #27804 为 Nemotron 3.5 Lightning 30B-A3B 加 DSpark 投机解码支持,PR 直接链到 nvidia 组织下的 NVFP4-DSpark 仓库,疑似 Nemotron 3.5 已有或即将有权重(本次扫描未捕获到官方发布记录);L40S 上解码加速 1.14~1.48×。
- vLLM #53989 测试用模型写的是 Qwen/Qwen3.8-27B(Qwen3.5 家族文本配置、Qwen3Next 注意力),transformers #48368 内部代号叫 qwen4exp,加上 Flash-Next 自称"Qwen4 架构预览",疑似 Qwen3.8 稠密 27B 已存在、Qwen4 正在路上。
- vLLM #53984 / #53972 在给 DeepSeek V4 做 DSpark 投机解码适配(跳过未注册 expert 权重、broadcast mHC),llama.cpp 侧也已把 DSV4 的 mHC 实现复用给 GLM-5.3-Flash;本次 HF 扫描未见 DeepSeek 官方 V4 权重,权重状态以官方为准。
- vLLM 三个 Kimi-K3 PR(KDA prefill 融合内核、MLA gate 合并进 QKV-A、a4w4 flydsl 内核)和两个 Gemma 4 PR(GPTQ 分片检查、AITER 融合内核)全部是 ROCm/AMD 性能优化,属已发布模型的生态补齐,不是新版本信号。
- llama.cpp #27779 给 FWHT(快速 Walsh-Hadamard 变换)加 F16 输入,作者称是"一个小系列的第一步",后续加 1024/2048 宽度和各后端内核,疑似在为 Hadamard 旋转类量化(如 QuaRot/SpinQuant 路线)铺路。
媒体转述(二手)
- 据 Bloomberg 报道,智谱 Z.ai 推出的匿名"Ox Alpha"隐身模型性能可与 DeepSeek 抗衡;同日新浪财经称智谱在港股盘中"认领"了"牛来"大模型并涨超 8%(Bloomberg / 新浪财经)。
- 据 nokiapoweruser 报道,Gemini 3.8 Flash 疑似泄露,标题问 Google 是否准备以远低成本超越 Fable 5,标题夸大成分大,无一手佐证(nokiapoweruser.com)。
- 据 GIGAZINE 转述,微软、亚马逊、谷歌正与月之暗面洽谈基于 Kimi K3 提供服务,月之暗面提议 30% 分成(GIGAZINE)。
- 据新浪财经报道,阿里云发布全新 Qoder,内置 Qwen3.8-Max 等模型——这是 Qwen3.8-Max 这一型号首次出现在本次抓取中(新浪财经)。
判断
真正值得动手试的只有 GLM-5.3-Flash:18B 激活换 GLM-5.2 以上的能力和原生视觉,Coding Plan 还给 3× 配额,对做 agent coding 和长上下文的团队是直接的成本选项;但注意"开源"目前只是文档口径,权重没落地前先按 API 用。Granite 4.2 值得关注的是 30B 稠密 + 512K + agentic RL + Apache 2.0 这个组合,适合要本地部署又要工具调用的场景,性能数据需自己跑。
Qwen 这边信号很密:Flash-Next 自称 Qwen4 架构预览、框架里冒出 Qwen3.8-27B 和 qwen4exp、媒体又提到 Qwen3.8-Max,基本可以判断 Qwen 在 3.8 → 4 的过渡期,选型上不急于押注单个版本。XingChen4 和 DeepSeek V4 的 DSpark 适配说明 mHC 和投机解码正在成为国产大 MoE 的标配路线,值得跟进但暂无可用物。Gemini 3.5 Transcribe、Cosmos3 更新、各类 OCR/GUI 小模型属常规迭代;Gemini 3.8 Flash"泄露"和 Ox Alpha 在拿到一手证据前当噂音处理。
原始条目
■ 官方 (16 条)
■ 权重 (6 条)
■ 框架 (16 条)
■ 媒体 (13 条)