大模型发布监控32 条
2026-08-13回看 2 天 · 新增 32 条(媒体 13,框架 13,官方 4,权重 2)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(324 天前)
一句话总览
今天有两个实打实的发布:xAI 正式发布 Grok 4.6(官方公告页与 API 文档均已上线),DeepSeek 的 V4 Pro 0813 以纯 API 形式悄然上线(官方未发公告);此外 MiniMax 视频生成模型 MiniMax-H3 权重在 HF 转为公开。媒体盛传阿里开源 2.4T 参数的 Qwen 3.8,但今日抓取中尚无一手证据。
正式发布
- xAI · Grok 4.6 · 日期未标注(今日抓取确认) —— xAI 官网已挂出 grok-4-6 公告页,且 grok-4.6 / grok-4-6 两种写法的模型 ID 已出现在 docs.x.ai 的 API 文档中,说明模型已可调用。x.ai 正文被 Cloudflare 拦截抓不到,规格细节待官方补充;有媒体称其"实力比肩 GPT-5.6",仅供参考、非官方口径。来源
- DeepSeek · V4 Pro 0813 · 2026-08-13 —— DeepSeek 最新旗舰迭代,目前仅提供 API(可经 OpenRouter 调用),官方没有任何公告页面,本条信息源为 Simon Willison 第三方实测而非官方发文。他注意到该模型在 low/medium/high 三档推理力度下输出风格差异异常明显;开源权重尚未放出,但鉴于 4 月的 V4-Pro 和 7 月的 V4-Flash-0731 权重都已开源,后续放权重的可能性较大。基准成绩仅在官方微信群流传,无可靠出处。来源
- MiniMax · MiniMax-H3 · 2026-08-13 —— MiniMax 官方组织在 HF 上的视频生成模型仓库今日发生实质更新(建仓于 7 月 28 日,符合"先建仓、发布日才公开内容"的惯例),标签覆盖文生视频、图生视频、视频到视频及文生音视频,已积累 3790 likes、160 万次下载(权重已上线,官方尚未发文)。这是视频生成方向的旗舰级权重,不是语言模型。来源
- NVIDIA · Nemotron-3.5-Lightning-30B-A3B(NVFP4)· 2026-08-12 —— 英伟达官方组织在 HF 上线 Nemotron 3.5 Lightning 30B-A3B 的 NVFP4 量化版权重(权重已上线,官方尚未发文),东方财富"英伟达发布大模型"的报道可作旁证。属于 Nemotron 3.5 系列的小激活 MoE 分支,更多规格细节待官方补充。来源
- DeepGrove · Maple 20B-A1B(preview)· 日期未标注 —— llama.cpp 正在合入这款三值(ternary)MoE 的 CPU 支持:24 层、256 专家激活 8 个、SWA-512 与全局注意力 3:1 交错、TQ1_0/TQ2_0 量化、MIT 许可;PR 中已用 HF 上的 deepgrove/maple-preview 权重实测(Apple M4 上预填充 216 t/s、生成 88 t/s)。小众但架构上值得留意的开源模型,官方正式发布信息待补充。来源
早期信号
- vllm/llama.cpp 共 4 个 PR 在为 DeepSeek V4 做适配(含"DSpark"投机解码 checkpoint 检测、Vulkan 后端 LIGHTNING_INDEXER),但 HF 上没有对应版本官方权重——疑似 V4 Pro 0813 的开源权重及配套草稿模型正在路上。来源
- vllm 的 DeepSeek V3.2 注意力 PR 中明确以 GLM-5.2 做端到端验证,并引用了将 GLM-5.2 路由到该实现的另一 PR——疑似智谱下一代模型在框架侧先行适配,HF 尚无同版本权重。来源
- vllm 两个 ROCm 性能 PR 针对 MiniMax-M3 稀疏注意力——疑似 MiniMax 文本线新旗舰在适配中(与今天公开的 H3 视频模型是两条产品线),HF 无官方权重。来源
- vllm 两个 PR 继续优化 Kimi-K3(AMD MLA 的 RMSNorm 融合、序列并行 GEMM-RS)——K3 的框架侧适配在持续推进,HF 上未见对应官方权重。来源
- vllm 已存在 Gemma 4 MTP 投机解码代码路径并在修正确性 bug(suppress_tokens 未生效)——HF 上没有官方 Gemma 4 权重,疑似 Google 侧适配先行于发布。来源
媒体转述(二手)
- 据华尔街见闻报道,阿里开源 2.4T 参数的 Qwen 3.8(另有博客称型号为 Qwen3.8-2.4T-A95B),称国产超大模型架构走向趋同——今日抓取中无 Qwen 官网或 HF 一手证据,待证实。(华尔街见闻)
- 据 The Tech Buzz 报道,Google 发布了名为 Gemini Omni 的新模型——无任何官方渠道佐证。(The Tech Buzz)
- 据 proactiveinvestors 报道,Google 旗舰 Gemini Pro 的发布再度推迟,市场下调其近期上线概率——与上一条"Gemini Omni 发布"的说法互相矛盾,可信度都存疑。(proactiveinvestors.co.uk)
- 据 Geeky Gadgets 报道,OpenAI 推出 GPT-5.7 Astra 并预告 ChatGPT 6 "Doug"——OpenAI 官方渠道今日只有一篇 RingCentral 客户案例,此说无官方佐证。(Geeky Gadgets)
判断
今天值得动手的是两个:Grok 4.6 文档已放出模型 ID,可以直接换 ID 试跑对比 4.x 前代;DeepSeek V4 Pro 0813 在 OpenRouter 可用,三档推理力度输出差异大这一点对做成本/质量分档路由的团队有实际参考价值,但注意目前无官方口径、基准数据不可信,自己测再下结论。MiniMax-H3 是视频生成方向少见的开放权重旗舰,做多模态选型的应该关注。悬念在 Qwen 3.8:2.4T 开源若属实是开源规模新纪录,但今天全部证据都是二手,等官方博客或 HF 权重落地再判断;Gemini 相关报道互相打架,GPT-5.7 之说无佐证,都当噪音处理。
原始条目
■ 官方 (4 条)
■ 权重 (2 条)
■ 框架 (13 条)
■ 媒体 (13 条)