大模型发布监控27 条
2026-09-06回看 2 天 · 新增 27 条(框架 18,媒体 8,权重 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(348 天前)
一句话总览
今天没有官方一手渠道确认的旗舰模型发布,唯一实锤是蚂蚁 inclusionAI 放出的 LLaDA2.2-mini 扩散语言模型权重;真正热闹的是框架侧对 DeepSeek-V4、GLM-5.3-Flash、Kimi-K3、MiniMax-M3 等一批"听说过名字但官方还没发文"的模型做适配,以及媒体围绕 GPT-6 Astra 上线后遗症的持续报道。
正式发布
- inclusionAI · LLaDA2.2-mini · 2026-09-05 —— 蚂蚁 inclusionAI 团队在 Hugging Face 上传的扩散式语言模型(dLLM,llada2_moe 架构),定位是 mini 尺寸的对话模型,支持自定义代码加载。当前热度和下载量都很低(likes 8,downloads 0),细节待官方补充(权重已上线,官方尚未发文)。来源
早期信号
- vllm 连续出现 3 个 DeepSeek-V4 专属性能/兼容性 PR(融合残差、prefill logits gather、跨流水线阶段输入 ID 转发),HF 上尚无官方权重,疑似 DeepSeek 下一代旗舰模型正在框架侧提前适配。来源
- vllm 出现修复 GLM-5.3-Flash 在 SM120(DGX Spark)稀疏 MLA 索引宽度的 PR,涉及 Glm5NextForConditionalGeneration 新配置项,HF 无对应官方权重,疑似智谱 GLM-5.3 系列在适配中。来源
- vllm 出现让 Qwen3.8-Flash-Next(内部代号 Qwen4Exp)在稀疏注意力路径支持 fp8 KV cache 的 PR,HF 无官方权重,疑似 Qwen 下一代 Flash-Next 系列在做推理优化适配。来源
- llama.cpp 和 vllm 分别出现 Kimi-K3 的循环状态回滚支持、以及 mamba 混合架构对称 DCP 分离式推理支持,HF 无官方权重,疑似月之暗面 Kimi-K3 正在多框架同步适配。来源
- vllm 出现修复 MiniMax-M3 混合 TP GQA 与索引器缓存传输(Mooncake 连接器)的 PR,HF 无官方权重,疑似 MiniMax-M3 也在做分布式推理适配。来源
- vllm 新增 reasoning_eos_policy 参数专门应对 "Qwen3.8" 推理模型在思考态中途误采样 EOS 的问题,侧面印证 Qwen3.8 系列推理模型已在广泛使用中。来源
媒体转述(二手)
- 据 Storyboard18、The News International、Barron's 等多家媒体报道,OpenAI 的 GPT-6 Astra 已上线但订阅用户遭遇延迟,Sam Altman 为"混乱"的发布过程道歉,同时也有报道称其在音乐、游戏等任务上表现出新能力。
- 据 quasa.io 报道,Gemini 3.8 Flash 公布了定价并开放了受限的网络安全(cyber)访问权限。
- 据 Sohu 报道,沙特基于 MiniMax 底座模型打造了本地阿拉伯语大模型,被视为大模型出海的新模式。
- 据新浪财经报道,大模型原厂近期涨价,但第三方托管服务价格反而持续走低。
判断
今天真正值得记一笔的只有 LLaDA2.2-mini 这个小众扩散语言模型,热度低,暂不必跟进。更值得盯的是早期信号里密集出现的 DeepSeek-V4、GLM-5.3、Qwen3.8-Flash-Next、Kimi-K3、MiniMax-M3 这五个"框架已在适配、官方未发文"的型号,说明下一波旗舰发布可能在近期集中到来,建议接下来几天重点盯这几家的官方博客。GPT-6 Astra 相关全是媒体转述且方向混乱(既报道故障又报道能力惊艳),噪音成分较高,等官方 release notes 更新后再评估。
原始条目
■ 权重 (1 条)
■ 框架 (18 条)
■ 媒体 (8 条)