大模型发布监控16 条
2026-09-13回看 2 天 · 新增 16 条(框架 10,媒体 6)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(355 天前)
一句话总览
过去两天无实质的官方发布:没有厂商博客、release notes 或官方 HF 权重上线。最值得注意的是框架侧围绕 DeepSeek-V4.1(含 Flash 变体)的密集适配,配合媒体口径"发布数小时后即出现去审查版本",说明这一代模型已在流通,但一手证据链尚未闭合。
正式发布
无。今天所有一手条目都是框架 PR,且交叉验证均显示 HF 上没有官方组织的同版本权重,不满足"确认已发布"标准。
早期信号
- DeepSeek · V4.1 / V4.1-Flash —— transformers #48768 在加 DeepSeek-V4.1 视觉支持,vllm #56686/#56625 在优化 V4.1-Flash 的 B200 吞吐(TP=8 下每千请求 24.6s→22.9s)与编码器 CUDA Graph,PR 正文提到稀疏注意力候选块内核按 1M token 上限设计;疑似这一代已具备多模态与百万上下文,但 HF 尚无官方权重,或走闭源 API 路线。来源
- 智谱 · GLM-5 系列(含 5.1/5.2/5.3) —— transformers #48761 的正文把 GlmMoeDsaAttention 标注为 "GLM-5 / 5.1 / 5.2 / 5.3" 共用,并与 DeepSeek-V3.2 同属 DSA(稀疏注意力)家族;该 PR 改为缓存压缩后的 MLA latent,GLM-5 每 token KV 缓存从 32768 值降到 576 值(约 57 倍)。疑似 GLM-5.3 已在代码路径中就位,HF 无官方权重。来源
- 智谱 · GLM-5 建模修正 —— transformers #48762/#48764/#48765 三个 PR 在修 GLM-5 的 MLA latent norm eps、indexer_types 校验并移除测试 skip;属于对已在库中的架构做纠错,间接说明该架构已有人在实际跑。来源
- Moonshot · Kimi-K3 + DSpark 草稿模型 —— vllm #56664 为 Kimi-K3 的 DSpark 投机解码草稿模型开启 torch.compile,在 8×MI355X 上做了 1200 秒 A/B;疑似 K3 已在生产推理栈中,但 HF 无官方权重,倾向闭源或限量分发。来源
- 阿里 · Qwen3.8 —— vllm #56644 在稳定 B200 上 Qwen3.8 的 AIME25 精度 CI(0.85 门槛,30 题随机评测抖动到 25/30);说明 Qwen3.8 已进 vLLM 主线的常规精度看护,但 HF 无官方组织同版本权重,权重形态待观察。来源
- Google · Gemma4 / OpenAI · gpt-oss / DeepSeek-V4 —— vllm #56693 把这三个型号纳入 JIT 监控模式的 CI 报错检查,仅是 CI 护栏,不含新规格信息。来源
媒体转述(二手)
- 据 Pasquale Pillitteri 报道,DeepSeek 4.1 Flash 发布数小时后 HuggingFace 上即出现"去审查/abliterated"改版,暗示原始权重已公开,但与上面的交叉验证结论冲突,待官方确认。(Pasquale Pillitteri)
- Simon Willison 记录了在 ChatGPT Work 中用 GPT-6 Astra(Max)跑 27 分钟完成 OSM 跑步路线生成,并批评压缩上下文后无法回溯代码是"反特性"。(Simon Willison 博客)
- 据 Decrypt 报道,GPT-6 Astra 用户抱怨模型"变笨",文中称类似情况此前也发生过。(Decrypt)
- 据 BeInCrypto 报道,Kimi K3 发布 8 周后 Moonshot AI 已在报警处理相关事件,具体事由标题未说明。(BeInCrypto)
判断
真正值得跟进的只有一件事:DeepSeek-V4.1 这一代的形态。框架 PR 已经把"视觉支持 + 1M 上下文 + 稀疏注意力"写进代码,若权重随后放出,会直接影响自部署选型和长上下文成本;建议盯 HF 的 deepseek-ai 组织而不是等博客。GLM-5 的 MLA latent 缓存改动是实打实的推理成本利好(KV 缓存缩约 57 倍),对本地跑 DSA 架构模型的人值得升级 transformers 后复测。其余的 Qwen3.8 CI 稳定、Kimi-K3 编译加速、Nemotron 拼写修正都是常规维护;三条 GPT-6 Astra / Kimi K3 的媒体稿属于舆情噱头,不改变任何技术判断。
原始条目
■ 框架 (10 条)
■ 媒体 (6 条)