大模型发布监控28 条
2026-09-21回看 2 天 · 新增 28 条(框架 14,媒体 12,权重 1,官方 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(363 天前)
一句话总览
今天没有旗舰级正式发布。实质性的新东西有两件:阿里 Qwen-Image-2.1 权重在 HF 上线(轻量图像生成/编辑模型),以及 Yandex 的 AliceAI-Foundation-80B-A3B 开源基座模型进入 vLLM 原生支持。早期信号里最值得盯的是 vLLM 侧连出三个 DeepSeek V4.1 视觉相关的 PR。
正式发布
- Yandex · AliceAI-Foundation-80B-A3B-Base · 2026-09-21(vLLM 适配 PR 日期,实际发布日待官方补充) —— 一个从零训练的 Apache-2.0 自回归基座模型,总参数 80B、每 token 激活 3B,上下文 262,144。架构是混合线性注意力路线:36 层 Kimi Delta Attention 加 12 层全注意力,带 Attention Residual,512 个路由专家 top-10 路由外加 1 个共享专家,并自带 1 层多 token 预测(MTP)用于投机解码。vLLM 的 PR 直接复用 Qwen3-Next 的全注意力/加载基础设施、Kimi KDA 层和 DeepSeek 式 sigmoid 路由,说明它是在"当前开源 MoE 最佳实践"上拼出来的。PR 已链接到 HF 权重页,官方博客本次未抓到。来源
- 阿里 Qwen · Qwen-Image-2.1 · 2026-09-21 —— 仓库 9 月 14 日建好、今天内容才真正更新,likes 已到 1241,按惯例 lastModified 才是实际发布日。HF 标签显示这是 diffusers 生态的文生图加图像编辑模型,且支持 RGBA 输出。据 doit 报道,定位是"轻量、消费级显卡可跑、对标商业闭源模型"。参数量、定价等细节待官方补充。(权重已上线,官方博文本次未抓到)来源
早期信号
- vLLM 一天内出现 3 个 DeepSeek V4.1 相关 PR(ViT 测试、视觉特征 profiling、"Engram" 的 tokenizer revision),疑似 V4.1 是一个带原生视觉编码器的多模态版本,HF 上尚无官方组织同版本权重。来源
- vLLM Rust 前端为 XiaomiMiMo/MiMo-V2.5 加推理与工具调用解析器,并以其"已发布的对话模板"做回归测试,疑似小米 MiMo V2.5 已在做上线前适配。来源
- vLLM 为 GLM-5.2 打通流水线并行下的 DSpark 投机解码,PR 明确其复用 DeepSeek-V3.2 骨干(DeepseekV32ForCausalLM),疑似智谱下一版走的是 DeepSeek 架构路线。来源
- vLLM ROCm 侧在给 MiniMax-M3 的 indexer 加上下文并行并替换为 Triton 内核,疑似 MiniMax M3 在做 AMD 平台适配,尚无公开权重。来源
- llama.cpp 新增 Gemma 4 DSpark 草稿模型 的 GGUF 转换与运行支持(全注意力与 SWA1024 两种),同时 vLLM 出现 Qwen3.5-4B DFlash 复现 PR,疑似两家都在为小尺寸模型配套投机解码草稿。来源
- OpenAI 官方客户案例(V7)虽非发布,但确认 GPT-6 Astra 已进入客户生产使用,且 GPT-5.6 系列存在 Luna/Terra/Sol 三个变体名,分别用于抽取与推理/工具调用。来源
媒体转述(二手)
- 据新浪财经、澎湃报道,Kimi K3 已上线亚马逊 Bedrock,并与海外云厂商落地了收入分成模式,被解读为中国模型出海的标志性动作。
- 据 marketscreener、citybiz、analyticsindiamag 等多家报道,Anthropic 正考虑在 IPO 前推出新模型;另有博主称"Claude Opus 5.5"泄露信息指向降价 20% 与周二发布,此说仅为传闻。
- 据搜狐报道,阶跃星辰发布 Step 5 Preview,细节待官方补充。
- 据 TechStock² 报道,Google Gemini 3.8 已上线,报道角度偏向 Alphabet 企业 AI 营收,而非模型规格。
判断
真正值得动手试的是 AliceAI 80B-A3B:3B 激活加 262K 上下文加 Apache-2.0,且架构与 Qwen3-Next/Kimi 同源,如果 vLLM 合入顺利,它会是本地部署里性价比很高的一个新选项,但目前只有 Base 版,缺 Instruct 之前别急着上生产。Qwen-Image-2.1 对做图像生成/编辑的团队值得看一眼,对纯 LLM 选型无影响。
早期信号里 DeepSeek V4.1 带视觉的证据最硬,三个 PR 同一天集中出现通常意味着发布临近,做多模态选型的可以先留位置。Anthropic 新模型的一堆报道全是二手转述加匿名"泄露",等官方 release notes 再说。其余 ROCm 优化、KV offload、KleidiAI 之类都是常规工程迭代。
原始条目
■ 官方 (1 条)
■ 权重 (1 条)
■ 框架 (14 条)
■ 媒体 (12 条)