<?xml version="1.0" encoding="UTF-8"?><rss version="2.0" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>大模型发布监控</title><link>https://ai-digest-53p.pages.dev</link><description>每晚自动生成的 AI 新闻与大模型发布监控日报</description><language>zh-CN</language><atom:link href="https://ai-digest-53p.pages.dev/modelwatch/feed.xml" rel="self" type="application/rss+xml"/><item><title>大模型发布监控 2026-08-05</title><link>https://ai-digest-53p.pages.dev/modelwatch/2026-08-05.html</link><guid isPermaLink="true">https://ai-digest-53p.pages.dev/modelwatch/2026-08-05.html</guid><pubDate>Wed, 05 Aug 2026 00:00:00 +0000</pubDate><category>大模型发布监控</category><description>回看 2 天 · 新增 45 条（官方 20，框架 17，媒体 7，权重 1）</description><content:encoded><![CDATA[<div class="warn">⚠️ 以下源疑似停更/换阵地（能正常抓取但最新条目很旧，属于不可见的覆盖缺口，需人工换源）：Qwen Blog（316 天前）</div><h3>一句话总览</h3>
<p>今天最值得知道的是两条：MiniMax-H3 的 HF 仓库正式放出内容（全模态生成，文本/图像/音频/视频进、带音轨短视频出），以及智谱文档站上 GLM-5.2 已经作为 1M 上下文的旗舰在售、GLM-5.1 / GLM-5-Turbo 同列。此外 Upstage 放出 Solar-Open2-250B 开源权重，NVIDIA 把 Alpamayo 全家族改成可商用开源许可。</p>

<h3>正式发布</h3>
<ul>
<li><b>MiniMax · MiniMax-H3 · 2026-08-05（HF 内容更新）</b> —— 仓库 7-28 建好、8-05 才放出实质内容，likes 已 2389。tags 覆盖 text-to-video / image-to-video / video-to-video / text-to-audio-video / image-to-audio-video，是一个"全模态生成系统"而非纯语言模型：接受文本、图像、音频、视频，输出带音轨的短视频（据媒体转述上限约 15 秒）。已有第三方 MLX 移植可在 Apple Silicon 上跑，权重体积约 115GB 量级。参数量/上下文等细节待官方补充。<a href="https://huggingface.co/MiniMaxAI/MiniMax-H3">来源</a></li>
<li><b>智谱 · GLM-5.2 / GLM-5.1 / GLM-5-Turbo · 日期未标注</b> —— 文档站上 GLM-5.2 已标 HOT 并有专门的迁移指南，定位旗舰基座：上下文 1M、最大输出 128K，新增 <i>tool_stream</i> 流式工具调用、<i>thinking</i> 自主判断是否思考（不同于 GLM-4.7 的强制思考）、<i>reasoning_effort</i>（high / max，默认 max）。同族 GLM-5.1 为 200K 上下文的长程任务旗舰，官方口径称"综合对齐 Claude Opus 4.6"、可单任务连续自主工作 8 小时；GLM-5-Turbo 是 200K/128K 的 OpenClaw 场景专用模型，官方自带 ZClawBench。上一代 GLM-4.7/4.6 仍在列。<a href="https://docs.z.ai/guides/llm/glm-5.2">来源</a></li>
<li><b>xAI · grok-4.5 / grok-4.3 · 日期未标注</b> —— 官方 API 文档里同时出现 <i>grok-4.5</i>（含 <i>grok-4-5</i> 别名）、<i>grok-4.3</i> / <i>grok-4.3-latest</i>，以及 <i>grok-4-1-fast</i> 的 reasoning / non-reasoning 两档和一个 <i>grok-4-code-eapi-lap4-unified-</i> 编码型号。闭源模型出现在文档站基本等于已可调用。规格与定价文档条目未给出，细节待官方补充。<a href="https://docs.x.ai">来源</a></li>
<li><b>Upstage · Solar-Open2-250B · 2026-08-05（框架侧适配）</b> —— 权重已上线 HF 并附技术报告，本次抓取未见官方博客。250B 级开源模型，注意力用自有的 KDA（gated delta net 变体，<i>2*sigmoid(b)</i> beta、全秩 f_proj/g_proj），因为 Kimi K3 重写了共享 KDA 层，vLLM 里只能给它单独一份实现。带官方 reasoning 与 tool-call 解析器（流式/非流式），适配文档提到 B200 上的 TP8 形态。<a href="https://github.com/vllm-project/vllm/pull/51129">来源</a></li>
<li><b>NVIDIA · Alpamayo 2 Super · 2026-08-04</b> —— 自动驾驶/Robotaxi 用的开源推理基座，基于 Cosmos 3 Super Reasoner 并做了 RL 后训练，强调可检查的决策链而非纯感知预测。关键变化是许可：以 OpenMDW-1.1（Linux Foundation 宽松许可）上 HF，覆盖微调、衍生模型与商业再分发，并回溯适用于整个 Alpamayo 家族（1 / 1.5 之前只面向 R&D）。家族内 2 Super 主打最强推理与生成教师数据/蒸馏，1.5 与 1 走性价比。<a href="https://blogs.nvidia.com/blog/alpamayo-2-super-open-model-now-available/">来源</a></li>
<li><b>AWS · Bedrock Web Search（GA）· 2026-08-05</b> —— 不是模型，但影响选型：Bedrock 上线亚马逊自建的服务端联网检索工具，一个参数即可给 OpenAI 模型（GPT-5.4、GPT-5.5，以及 GPT-5.6 的 Sol / Terra / Luna 三档）做事实接地，全程在 AWS 内完成、零数据出网，兼容 OpenAI Responses API。此前需自接第三方搜索供应商。首发 us-east-1 / us-east-2 / us-west-2。<a href="https://aws.amazon.com/about-aws/whats-new/2026/08/amazon-bedrock-web/">来源</a></li>
<li><b>lmms-lab · LLaVA-OneVision-1.5 · 2026-08-05（框架侧适配）</b> —— 已发布，transformers 侧在补齐原生支持（config/modeling/权重转换脚本/集成测试齐全），对齐的 checkpoint 是 <i>lmms-lab/LLaVA-OneVision-1.5-4B-Instruct</i>。视觉塔用 RiceRotaryEmbedding。同日 vLLM 也在接 <i>internlm/Intern-S2-Mobius</i>。两者都是开源多模态，不是旗舰级发布。<a href="https://github.com/huggingface/transformers/pull/47795">来源</a></li>
<li><b>InclusionAI · Ling 3.0 Flash · 2026-08-05（框架侧适配）</b> —— llama.cpp 正在加 BailingMoE3 架构支持，PR 明确说是为了跑"新的 Ling 3.0 flash 模型"并带 MTP（多 token 预测）。MoE 架构，规格与权重发布形态本次抓取未确认，细节待官方补充。<a href="https://github.com/ggml-org/llama.cpp/pull/26608">来源</a></li>
</ul>

<h3>早期信号</h3>
<ul>
<li>llama.cpp 重新启用了 <b>MiniMax M3</b> 的架构测试（测试此前被禁、已被修好），但 HF 上没有官方组织的同版本权重——疑似 M3 尚未公开发布，或是只走 API 的闭源型号；注意它与今天放权重的 H3（视频/全模态）不是一回事。<a href="https://github.com/ggml-org/llama.cpp/pull/26633">来源</a></li>
<li><b>Kimi K3</b> 在 vLLM 侧同时有 4 个动作：/v1/responses 的 special token 空格开关、ROCm MLA small-head 汇编 decode 路径（TP8）、megamoe 路径去掉一次 add（GSM8K 96.2%→96.4%）、MLA DCP world size 修复；抓取未在 HF 官方组织匹配到同版本权重，措辞上仍按"疑似/在做适配"处理，但框架侧已按 <i>moonshotai/Kimi-K3</i> 跑端到端评测。<a href="https://github.com/vllm-project/vllm/pull/51152">来源</a></li>
<li><b>DeepSeek V4</b> 疑似存在 Flash 变体：vLLM 的 ROCm 修复里出现 <i>deepseek-ai/DeepSeek-V4-Flash-0731</i> 与 <i>DSparkDeepseekV4ForCausalLM</i>，DSpark 是全词表草稿模型的投机解码方案；HF 上没有官方组织的同版本权重。<a href="https://github.com/vllm-project/vllm/pull/51145">来源</a></li>
<li><b>Gemma 4</b> 疑似已在流通：transformers 里在为 gemma4 跳过 QuantizedCache 测试、llama.cpp 出现 <i>Gemma4Assistant</i> 共享张量路径，媒体侧也已有人本地跑 gemma-4-12b；但抓取未匹配到 HF 官方组织权重，仍按疑似记。<a href="https://github.com/huggingface/transformers/pull/47790">来源</a></li>
<li>llama.cpp 冒出一批投机解码/共享张量的新代号 —— <b>Eagle3、DFlash、DSpark、MTP</b> 通过 <i>ctx_other</i> 与目标模型共享 tok_embd/output，疑似指向多家在推"草稿模型跨 GPU"的部署形态；另有为 Gated DeltaNet 类循环模型做的前向望远镜式状态回滚引擎，以及 NVIDIA-Nemotron-Parse-2.0 的投机解码支持。<a href="https://github.com/ggml-org/llama.cpp/pull/26636">来源</a></li>
<li><b>Mistral</b> 两条：<i>Voxtral-Mini-4B-Realtime-2602</i> 的 vLLM 全图 CUDA Graph 优化（H200 上 decode 吞吐 181.7→191.1 tok/s，batch 4 提速 1.24x），以及 Mistral3 嵌套 config 的词嵌入绑定修复——后者 HF 上没有官方组织的同版本权重，疑似在做适配。<a href="https://github.com/vllm-project/vllm/pull/51167">来源</a></li>
</ul>

<h3>媒体转述（二手）</h3>
<ul>
<li>据 TradingKey 报道，马斯克称 <b>Grok 4.6 将于下周发布</b>，会用上 SpaceX 数据和独占的 NVIDIA 算力——注意 xAI 文档站目前只见到 4.5 / 4.3。</li>
<li>据 Simon Willison 博客，其 LLM CLI 发布 0.32：默认模型换成 <b>GPT-5.6 Luna</b>，新增可见推理轨迹、服务端工具（OpenAI 的 CodeInterpreter/WebSearch，llm-anthropic 侧的 WebSearch/WebFetch/CodeExecution/AnthropicMCP）与内容寻址的 SQLite 日志。</li>
<li>据 Fortune 报道，白宫与 OpenAI、Anthropic、微软等评审了一套 AI 模型评估框架，但拒绝公开，被业内称为"令人费解"。</li>
<li>据华尔街见闻 / CSDN 等中文媒体，DeepSeek 与 Qwen 掀起的降价潮反而在推高 GPU 需求，同时一级市场对"SOTA 叙事"的估值权重在下降。</li>
</ul>

<h3>判断</h3>
<p>真正值得动手的是 GLM-5.2 和 MiniMax-H3。GLM-5.2 的 1M 上下文 + 128K 输出 + reasoning_effort 分档，是这半年国产旗舰里第一个把"整项目塞进去"讲成主打场景的，做代码 agent 选型的话值得拿真实仓库压一轮；官方自己拿 Claude Opus 4.6 当 GLM-5.1 的对标线，说明定价/性能比这条路他们要继续打。MiniMax-H3 是权重真放出来的全模态视频生成，但 115GB 权重、单机 45 分钟出一段片子，短期只有离线批量场景能用。</p>
<p>Bedrock Web Search 是今天对成本影响最直接的一条：省掉第三方搜索供应商的接入、账单和合规审查，还顺带确认了 GPT-5.6 Sol/Terra/Luna 三档命名。Solar-Open2-250B 值得关注开源 250B + KDA 这条架构线，但注意它为了绕开 Kimi K3 重写过的共享层要走单独实现，短期部署会有坑。</p>
<p>其余基本是噪音或常规迭代：Qwen 的两个 vLLM PR 是 parser 自动识别和去 warning，transformers 那条 qwen2_moe 只是更新过期的期望输出字符串；Alpamayo 2 Super 是重要但垂直（AV 领域）的动作，真正的新闻是许可证回溯改成可商用。Grok 4.6 目前只有马斯克口头预告，别写进选型表。</p><h3>原始条目</h3><p class="meta"><span class="g官方">■ 官方</span> （20 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-05 04:37</td><td>AWS What&#x27;s New</td><td><a href="https://aws.amazon.com/about-aws/whats-new/2026/08/amazon-bedrock-web/">Amazon Bedrock launches Web Search for OpenAI GPT models</a></td></tr><tr><td>08-05 03:00</td><td>OpenAI News</td><td><a href="https://openai.com/index/third-party-cyber-evaluations-involving-openai-models">Third-party cyber evaluations involving OpenAI models</a></td></tr><tr><td>08-04 23:00</td><td>NVIDIA Blog</td><td><a href="https://blogs.nvidia.com/blog/alpamayo-2-super-open-model-now-available/">NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use</a></td></tr><tr><td>08-04 08:00</td><td>OpenAI News</td><td><a href="https://openai.com/index/learn-teach-chatgpt-work-codex">New ways to learn and teach with ChatGPT Work and Codex</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.5</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-5</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-code-eapi-lap4-unified-</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.3-latest</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.3</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-1-fast-non-reasoning</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-1-fast-reasoning</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-1-fast</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-3-mini-latest</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-3-mini</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-5-turbo">GLM-5-Turbo</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-5.1">GLM-5.1</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-5.2">GLM-5.2</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/overview/migrate-to-glm-new">Migrate to GLM-5.2</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/vlm/glm-4.5v">GLM-4.5V</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/vlm/glm-4.6v">GLM-4.6V</a></td></tr></table><p class="meta"><span class="g权重">■ 权重</span> （1 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-05 21:19</td><td>HF 重大更新</td><td><a href="https://huggingface.co/MiniMaxAI/MiniMax-H3">MiniMaxAI/MiniMax-H3 内容更新（仓库 8 天前就建好了）</a></td></tr></table><p class="meta"><span class="g框架">■ 框架</span> （17 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-05 22:39</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51169">qwen —— 框架侧 2 个 PR（vllm 2）</a></td></tr><tr><td>08-05 22:27</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51168">nemotron —— 框架侧 2 个 PR（llama.cpp 1, vllm 1）</a></td></tr><tr><td>08-05 21:44</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51167">vllm #51167: [Model] Voxtral Realtime: add support for `CUDAGraphMode.FULL_DECODE_ONLY`</a></td></tr><tr><td>08-05 21:26</td><td>框架 PR</td><td><a href="https://github.com/ggml-org/llama.cpp/pull/26636">llama.cpp #26636: llama : add backends of the other model to the context</a></td></tr><tr><td>08-05 20:15</td><td>框架 PR</td><td><a href="https://github.com/ggml-org/llama.cpp/pull/26633">llama.cpp #26633: tests: re-enable MiniMax M3 in `test-llama-archs`</a></td></tr><tr><td>08-05 19:34</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51152">kimi3 —— 框架侧 2 个 PR（vllm 2）</a></td></tr><tr><td>08-05 19:04</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51149">vllm #51149: Interns2mobius support</a></td></tr><tr><td>08-05 18:20</td><td>框架 PR</td><td><a href="https://github.com/huggingface/transformers/pull/47795">transformers #47795: Add llava onevision 1.5</a></td></tr><tr><td>08-05 17:57</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51146">vllm #51146: K3: remove the add operation for megamoe path</a></td></tr><tr><td>08-05 17:37</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51145">vllm #51145: [Bugfix][ROCm] Fix DeepSeek V4 DSpark probabilistic startup</a></td></tr><tr><td>08-05 16:48</td><td>框架 PR</td><td><a href="https://github.com/huggingface/transformers/pull/47790">transformers #47790: skip QuantizedCache tests for gemma4 and cancel deterministic for XPU</a></td></tr><tr><td>08-05 15:35</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51129">vllm #51129: [Model] Support Solar Open2 (SolarOpen2ForCausalLM)</a></td></tr><tr><td>08-05 15:16</td><td>框架 PR</td><td><a href="https://github.com/ggml-org/llama.cpp/pull/26617">llama.cpp #26617: llama: add forward-telescoping rollback engine for recurrent models (prep for #22746)</a></td></tr><tr><td>08-05 10:42</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51105">vllm #51105: Fix Mistral3 nested word embedding tying</a></td></tr><tr><td>08-05 10:30</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51103">vllm #51103: [CI Failure]: Kimi-Linear-48B-A3B Disaggregated DP EP  #51072</a></td></tr><tr><td>08-05 08:22</td><td>框架 PR</td><td><a href="https://github.com/ggml-org/llama.cpp/pull/26608">llama.cpp #26608: BailingMoE3 Support</a></td></tr><tr><td>08-05 06:48</td><td>框架 PR</td><td><a href="https://github.com/huggingface/transformers/pull/47784">transformers #47784: [serge] Fix 2 integration tests for model `qwen2_moe` failing with `other` (other (2))</a></td></tr></table><p class="meta"><span class="g媒体">■ 媒体</span> （7 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-05 14:44</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMiUkFVX3lxTE4wOTN5RGN6WXVPWFBuOXBZX3BnN1RNSTkyLVJqaVltSUtEWEs4TUlIRXZNS0NDRUVCSTFERGZuMVpCMjZPUDRJeDBqSmtuMDFraFE?oc=5">开源模型越便宜，GPU需求越大 - 华尔街见闻</a></td></tr><tr><td>08-05 12:13</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMiswFBVV95cUxPeW1FOVJuVDZxRTdva1Zwb0p3eE5SN3BLX3RaeHUtY1BaQUNob3Q2MTBEYkxaNlNkTmF2dVdzNV9JM0M0elZMbWlMRjNkTFRSbDI1RktPQ3ZfN2NCWTNfdy1JTDNnWnIwZFdyeU91M19Sb21aOXRNc25JWkRuTmxaT3RZYnRBN01XNFBkYWNRNEFpSURqd0JiSnhVN1gwWi1vLUdvRTFMMmtiVGxHajBEWGJROA?oc=5">Musk: Grok 4.6 to Launch Next Week With SpaceX Data, Exclusive Nvidia Computing Power - TradingKey</a></td></tr><tr><td>08-05 09:34</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMia0FVX3lxTE9JNWhOWDhRN205UjRTZWFoM2U4ZF83SFNlaklXTXkzYW44cS1Kd2o0Z1dhd3hrNU1MQm0wc1hacjYtUGVBSW53OWd4dU9leWEwajJsTmRLMFhYbHdYejd0bFVsYVJreGxnWlAw?oc=5">DeepSeek、Qwen掀起大模型价格战，连锁反应下AI“奥本海默时刻”来临？ - blog.csdn.net</a></td></tr><tr><td>08-05 07:58</td><td>Simon Willison</td><td><a href="https://simonwillison.net/2026/Aug/4/new-release-of-llm/#atom-everything">New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging</a></td></tr><tr><td>08-05 06:53</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMi-AFBVV95cUxPWlcyMlRoSEdoMWV5QjZBeXRGenZEeHVSeV9NMzFRajlpX2xITkNiLS14TjJIcVhtYWExY2VaNzltV3F5TmgyRnFjdFBuTmozWWdsVm5mX3BIUG51eWNxQnBMenJCOUtYeUE3RlRhQV9DLVo4RU53U0lGNTdjTGw5NWVNeG11SDRQT2oxeWFMTmJIZ2I3RzBOSzRsWEctMFRKWFY5R21aS1YzcktXSjRubzVqM2NlTHVRcjBRYWV6WmlTbHBwblVfa0RIQUlLX0o3WE9Sa0NqV08yRGRDX2ZKdU1aV1JSeDNCRGVKd0NrV25TMDhNNGRPNQ?oc=5">‘Baffling’: White House won’t publicly release AI model evaluation framework it reviewed today with OpenAI, Anthropic, Microsoft and others - fortune.com</a></td></tr><tr><td>08-05 03:10</td><td>Simon Willison</td><td><a href="https://simonwillison.net/2026/Aug/4/minimax-h3-mlx/#atom-everything">PipeNetwork/minimax-h3-mlx</a></td></tr><tr><td>08-04 08:02</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMiVkFVX3lxTE9ocUJoaHRQWWZpaXpBUmlGcFNldlp6aFlwVnI1SWRvZk9XQmNITVBoNnU3RDRpTWlNaWJTQkx2akZUWllQSUx4WU9VSGwtd2ZaZHlpTG9B?oc=5">大模型公司估值，正在降权「SOTA叙事」｜估值叙事 - 投资界</a></td></tr></table><div class="foot">摘要引擎：claude。<br><b>证据分级</b>：官方 = 厂商博客/文档 release notes（官方口径）；权重 = Hugging Face 新 repo（最硬的一手，常领先博文）；框架 = transformers/vllm/llama.cpp 的加架构 PR（未发布的早期信号，领先数天到数周）；媒体 = 二手转述，措辞可能失真。<br><b>已知覆盖缺口</b>：x.ai 整站 Cloudflare 403（Grok 只能靠媒体转述）；anthropic.com 无 RSS，改用 docs.claude.com release notes；Grok 靠 docs.x.ai/llms.txt 覆盖（Cloudflare 只拦 x.ai 网页、不拦文档站）；Qwen 官网是 catch-all SPA，只能取到首页 banner 的文章 slug、抓不到正文；seed.bytedance.com 无可用 feed，靠 HF 权重通道兜。<br>本页内容由 <code>modelwatch/modelwatch.py</code> 自动生成。</div>]]></content:encoded></item><item><title>大模型发布监控 2026-08-04</title><link>https://ai-digest-53p.pages.dev/modelwatch/2026-08-04.html</link><guid isPermaLink="true">https://ai-digest-53p.pages.dev/modelwatch/2026-08-04.html</guid><pubDate>Tue, 04 Aug 2026 00:00:00 +0000</pubDate><category>大模型发布监控</category><description>回看 2 天 · 新增 37 条（官方 26，框架 6，媒体 3，权重 2）</description><content:encoded><![CDATA[<div class="warn">⚠️ 以下源疑似停更/换阵地（能正常抓取但最新条目很旧，属于不可见的覆盖缺口，需人工换源）：Qwen Blog（315 天前）</div><h3>一句话总览</h3>
<p>今天的硬料主要来自各厂文档站与 Hugging Face：Moonshot 官方定价页已明确写出「Kimi K3 旗舰模型已正式发布」（1M 上下文、始终推理），Anthropic 文档索引新增 <b>Claude Fable 5 / Mythos 5</b> 模型页，xAI 的 <b>grok-4.20</b> 系列与智谱 <b>GLM-5</b> 系列也已在文档中可调用；HF 侧 MiniMax-H3 视频/音视频生成权重刚刚公开。唯一的官方博客发文是 Mistral 的 3B 安全分类器 Shieldstral。</p>

<h3>正式发布</h3>
<ul>
<li><b>Moonshot · Kimi K3 · 日期未标注</b> —— 官方定价页顶栏直接挂着「🎉 Kimi K3 旗舰模型已正式发布」。定位是面向长程编程与端到端知识工作的旗舰模型，1M token 上下文，官方称综合智能达到领先水平。它<b>始终进行推理</b>，可用请求顶层 <i>reasoning_effort</i> 配置强度（low / high / max，默认 max）；相比 K2 系列新增了工具调用约束（<i>tool_choice</i>）和动态加载工具两项 API 能力，并支持自动上下文缓存、JSON Schema 结构化输出、Partial Mode。具体价格数字页面未抓到，细节待官方补充。<a href="https://platform.kimi.com/docs/pricing/chat-k3">来源</a></li>

<li><b>Anthropic · Claude Fable 5 与 Claude Mythos 5 · 日期未标注</b> —— 官方文档索引新增了「Introducing Claude Fable 5 and Claude Mythos 5」页面，按惯例模型页与发布同时上线，即这两个型号已可用；同期还新增了「What's new in Claude Opus 5」和「What's new in Claude Sonnet 5」两页，说明 Opus 5 / Sonnet 5 也有一轮更新。索引条目不带描述，参数、定价、模态等全部细节待官方补充。<a href="https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5">来源</a></li>

<li><b>智谱 · GLM-5 系列（GLM-5.2 / 5.1 / 5 / 5-Turbo） · 日期未标注</b> —— 文档站新增了 GLM-5 的模型页，且语言模型导航已完整列出 GLM-5.2（标记 HOT）、GLM-5.1、GLM-5、GLM-5-Turbo，Get Started 里还多了一篇「Migrate to GLM-5.2」迁移指南——这套组合基本等于 GLM-5 世代已成为主线在售。视觉侧同步有 GLM-5V-Turbo / GLM-4.6V / GLM-OCR，上一代 GLM-4.7（200K 上下文、128K 最大输出，含 FlashX 与完全免费的 Flash 档）已退居次席。GLM-5 各档的参数量与定价页面未给出，细节待官方补充。<a href="https://docs.z.ai/guides/llm/glm-5">来源</a></li>

<li><b>xAI · grok-4.20 系列 · 日期未标注</b> —— API 文档中出现了 <i>grok-4.20</i>、<i>grok-4.20-0309-reasoning</i>、<i>grok-4.20-0309-non-reasoning</i>，以及两个 <b>multi-agent</b> 型号 <i>grok-4.20-multi-agent</i> / <i>grok-4.20-multi-agent-0309</i>，说明这一代已可调用。推理 / 非推理拆成独立型号，加上把「多智能体」做成一个可直接点名的模型 ID，是相对 grok-4 时代（<i>grok-4</i>、<i>grok-4-fast</i>、<i>grok-4-0709</i>）比较明显的产品形态变化。闭源 API 模型，无权重，规格与定价待官方补充。<a href="https://docs.x.ai">来源</a></li>

<li><b>MiniMax · MiniMax-H3 · 2026-08-04</b> —— HF 仓库 7 天前建好、今天才放出实质内容（权重已上线，官方尚未发文）。从 tags 看是一个 diffusers 系的生成模型，覆盖 text-to-video、image-to-video、image-text-to-video、video-to-video，以及 <b>text-to-audio-video / image-to-audio-video</b>——即音画一体生成，这是比纯视频模型更进一步的能力面。已有 1828 likes 而 downloads 仍是 0，说明刚公开、社区还没跑起来。参数量与上下文未标注。<a href="https://huggingface.co/MiniMaxAI/MiniMax-H3">来源</a></li>

<li><b>NVIDIA · Alpamayo-R1-10B · 2026-08-04</b> —— 建仓在 2025-11-22，今天才有实质内容更新（权重已上线，官方尚未发文），已累积 425 likes / 26181 downloads。10B 规模，tags 标为 robotics 且带自定义架构 <i>alpamayo_r1</i>，safetensors + transformers 可直接加载，endpoints 兼容。属于具身/自动驾驶方向的推理模型而非通用聊天模型，训练数据与评测细节待官方补充。<a href="https://huggingface.co/nvidia/Alpamayo-R1-10B">来源</a></li>

<li><b>Moonshot · Kimi K2.7 Code（含 HighSpeed） · 日期未标注</b> —— 与 K3 同期挂在定价页上的代码专用模型：256K 上下文，<b>仅支持思考模式</b>，强调长上下文里更可靠地遵循指令、更高的编程任务成功率，支持文本/图片/视频输入。HighSpeed 版是同一模型的高速档，输出约 180 tokens/s，短上下文可达 260 tokens/s。同一定价目录下还并列着 K2.6（通用、256K、多模态、思考/非思考双模）与 K2.5（256K、多模态），构成 K3 之下的分层。<a href="https://platform.kimi.com/docs/pricing/chat-k27-code">来源</a></li>

<li><b>Mistral AI · Shieldstral · 2026-08-04</b> —— 今天唯一的官方博客发文：一个 <b>3B 开源权重的多模态安全分类器</b>，官方称性能超过体量达其 7 倍的模型。属于护栏/内容审核类工具模型，不是基座或推理模型，但 3B 的体量意味着可以贴着业务侧本地部署做输入输出过滤。具体评测集与许可细节待官方补充。<a href="https://mistral.ai/news/shieldstral/">来源</a></li>
</ul>

<h3>早期信号</h3>
<ul>
<li>llama.cpp PR #26578 在给 <b>DeepSeek-V4</b> 的三个 hyper-connection 融合算子（DSV4_HC_COMB/PRE/POST）补 Vulkan 后端，正文提到 CUDA 自 DeepSeek-V4 首次合并起就有、Metal 在 #26459 已补齐，还点名了 <i>DeepSeek-V4-Flash</i> 上「未融合的 20 轮 Sinkhorn comb 链占解码算子时间约 32%、每 token 约 1.6 万次 dispatch」——架构细节已相当具体，但 HF 上查不到官方组织的同版本权重，疑似权重尚未公开或走闭源。<a href="https://github.com/ggml-org/llama.cpp/pull/26578">来源</a></li>
<li>vllm PR #51012 把 <b>Qwen3.5</b> 迁到「硬件无关的模型定义」以便各家厂商接入融合算子，说明 vLLM 侧已在为该系列做适配；HF 无官方组织的同版本权重，疑似还未正式发布。<a href="https://github.com/vllm-project/vllm/pull/51012">来源</a></li>
<li>vllm PR #51015 在稳定 <b>GLM-5.2</b> 的 TP1/PCP4 GSM8K 评测（开 expandable CUDA allocator 解 FlashInfer CUTLASS MoE 的 OOM），可见 CI 已常态跑该模型；但 HF 上没有官方组织的同版本权重，疑似 GLM-5.2 暂以闭源 API 形态提供、开源权重未放出。<a href="https://github.com/vllm-project/vllm/pull/51015">来源</a></li>
<li>vllm PR #51037 为 <b>Qwen3-ASR</b> 实时会话做「稳定窗口感知的 KV 复用」，正文披露其 AuT 编码器是双向的、活动窗口内表示会随新音频变化，因此不能直接复用 KV；HF 无官方组织的同版本权重，疑似该 ASR 模型尚未正式放出。<a href="https://github.com/vllm-project/vllm/pull/51037">来源</a></li>
<li>同一个 vllm CI PR 里提到某次早期构建「在近期的 Kimi/K3 改动之前」就有同样的报错签名，侧面印证 K3 相关改动已进入 vLLM 主干。<a href="https://github.com/vllm-project/vllm/pull/51015">来源</a></li>
<li>xAI 文档抓取里冒出 <i>gpt-4o-realtime-preview</i> 这个明显属于 OpenAI 的型号 ID，疑似是文档站的兼容层/迁移页所致，或本次抓取归类串台，不宜当作 xAI 自家型号看待。<a href="https://docs.x.ai">来源</a></li>
</ul>

<h3>媒体转述（二手）</h3>
<ul>
<li>据 21 世纪经济报道，<b>Qwen3.8-Max 发布</b>，阿里巴巴当日港股上涨 7%——注意这是媒体口径，一手渠道今天只见到 vLLM 侧的 Qwen3.5 适配。<a href="https://news.google.com/rss/articles/CBMijAFBVV95cUxPRVJnMUQ2cm5HSHl5QVNUMUEyWVBTQ3d0WnlCdDBpZldub1VzRXhFajhqem9Fa1VRZVBZVjMzRk1nTHdqLXdPRU1uZmpqT3FJT3hNRnpxdms1NFV3MFlCMkdZMFNpZ1dTaDJ1UUI2QXFETDF2YnNUVTJpQWl1V3ZkTEtLZjhxNXpXRXNBTg?oc=5">21jingji.com</a></li>
<li>据 36Kr，一个月内出现 9 款旗舰模型，行业进入所谓「月抛」节奏。<a href="https://news.google.com/rss/articles/CBMiUEFVX3lxTE9PV2NTQU5JSU90TWNIRHV3OXNVUExBcnB1NUlPODZ0dGIyWG9NSW9NajM3Y2VISVFhc3ZWQWlkaXZoR0lkMW9TTU1fMUF5ZDA0?oc=5">36Kr</a></li>
<li>据 nokiapoweruser 报道，Google 可能在 8 月 12 日推出 Gemini 3.5 Pro——纯传闻，官方渠道今天无任何对应证据。<a href="https://news.google.com/rss/articles/CBMie0FVX3lxTE5rNkJCQjNFdEk5U0p2SEdGMW1WZFZyYVZPaFZpRjQtNmFqcGdsV1ktQ0dHaW9IZHpqTWhtX2hVb3RlX1ZnQ2l5U1ZLMkREY3FqTUc3ZEdXekl3S2xvYkVqazNiWlFWUHJzQm5EUnlJSzR0VHA5eExIT2tfVQ?oc=5">nokiapoweruser.com</a></li>
</ul>

<h3>判断</h3>
<p>真正值得动手的有三件。<b>Kimi K3</b> 是今天影响选型最直接的一条：1M 上下文加上可分档的 reasoning_effort（默认就是 max，不显式调就是最贵的档），再加 tool_choice 约束和动态加载工具，意味着长上下文 Agent 的成本曲线和可控性都要重新测一遍，别按 K2 系列的经验估预算。<b>MiniMax-H3</b> 的 image/text-to-audio-video 是能力面上的跨越而不是刷分，下载量还是 0，现在试就是第一批。<b>Shieldstral</b> 3B 的价值在于把审核这类高频低价值调用从旗舰模型上卸下来，是笔省钱账。</p>
<p>其余多是噪音或工程性维护：vLLM 的 SSE keep-alive、KV offload 的 out-of-tree 加载、CI 显存调参都属日常，不影响选型；xAI 文档里的 grok-4 / grok-4-0709 是存量型号而非新发；<i>gpt-4o-realtime-preview</i> 出现在 xAI 通道八成是抓取串台，别当情报。另外提醒两处口径差：媒体说 Qwen3.8-Max 已发，一手渠道今天只有 Qwen3.5 的框架适配，两者对不上，采信前等官方发文；Gemini 3.5 Pro 的 8/12 日期是单一小站传闻，不要写进任何计划表。</p><h3>原始条目</h3><p class="meta"><span class="g官方">■ 官方</span> （26 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-04 20:00</td><td>Mistral AI</td><td><a href="https://mistral.ai/news/shieldstral/">Introducing Shieldstral.</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-latest</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-fast</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4-0709</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.20</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.20-multi-agent</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.20-0309-non-reasoning</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.20-0309-reasoning</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：grok-4.20-multi-agent-0309</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai">文档中出现模型 ID：glm-4.6.md</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai">文档中出现模型 ID：glm-4.5v.md</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai">文档中出现模型 ID：glm-4.5.md</a></td></tr><tr><td>—</td><td>Kimi 开放平台文档</td><td><a href="https://platform.kimi.com/docs/pricing/chat-k25">多模态模型 Kimi K2.5 定价</a></td></tr><tr><td>—</td><td>Kimi 开放平台文档</td><td><a href="https://platform.kimi.com/docs/pricing/chat-k26">Kimi K2.6 模型定价</a></td></tr><tr><td>—</td><td>Kimi 开放平台文档</td><td><a href="https://platform.kimi.com/docs/pricing/chat-k27-code">编程模型 Kimi K2.7 Code 定价</a></td></tr><tr><td>—</td><td>Kimi 开放平台文档</td><td><a href="https://platform.kimi.com/docs/pricing/chat-k3">旗舰模型 Kimi K3 定价</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-4-32b-0414-128k">GLM-4-32B-0414-128K</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-4.5">GLM-4.5</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-4.6">GLM-4.6</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-4.7">GLM-4.7</a></td></tr><tr><td>—</td><td>智谱 Z.ai 文档</td><td><a href="https://docs.z.ai/guides/llm/glm-5">GLM-5</a></td></tr><tr><td>—</td><td>Claude 文档索引</td><td><a href="https://platform.claude.com/docs/en/about-claude/models/introducing-claude-fable-5-and-claude-mythos-5">Introducing Claude Fable 5 and Claude Mythos 5</a></td></tr><tr><td>—</td><td>Claude 文档索引</td><td><a href="https://platform.claude.com/docs/en/about-claude/models/whats-new-opus-5">What&#x27;s new in Claude Opus 5</a></td></tr><tr><td>—</td><td>Claude 文档索引</td><td><a href="https://platform.claude.com/docs/en/about-claude/models/whats-new-sonnet-5">What&#x27;s new in Claude Sonnet 5</a></td></tr><tr><td>—</td><td>xAI 文档</td><td><a href="https://docs.x.ai">文档中出现模型 ID：gpt-4o-realtime-preview</a></td></tr></table><p class="meta"><span class="g权重">■ 权重</span> （2 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-04 22:18</td><td>HF 重大更新</td><td><a href="https://huggingface.co/nvidia/Alpamayo-R1-10B">nvidia/Alpamayo-R1-10B 内容更新（仓库 255 天前就建好了）</a></td></tr><tr><td>08-04 21:14</td><td>HF 重大更新</td><td><a href="https://huggingface.co/MiniMaxAI/MiniMax-H3">MiniMaxAI/MiniMax-H3 内容更新（仓库 7 天前就建好了）</a></td></tr></table><p class="meta"><span class="g框架">■ 框架</span> （6 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-04 22:40</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51037">vllm #51037: [Feature][Model] Support stable-window-aware KV reuse for Qwen3-ASR realtime</a></td></tr><tr><td>08-04 22:15</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51034">vllm #51034: feat: add SSE keep-alive comments for idle streaming responses</a></td></tr><tr><td>08-04 22:01</td><td>框架 PR</td><td><a href="https://github.com/ggml-org/llama.cpp/pull/26578">llama.cpp #26578: vulkan: add DeepSeek-V4 hyper-connection fused ops (DSV4_HC_COMB/PRE/POST)</a></td></tr><tr><td>08-04 18:41</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51015">vllm #51015: [CI] Stabilize GLM-5.2 PCP evaluation</a></td></tr><tr><td>08-04 17:53</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51012">vllm #51012: [Models] Move Qwen3.5 to hardware agnostic model definitions</a></td></tr><tr><td>08-04 17:27</td><td>框架 PR</td><td><a href="https://github.com/vllm-project/vllm/pull/51007">vllm #51007: [KV Offload] Support out-of-tree secondary tier managers via `module_path`</a></td></tr></table><p class="meta"><span class="g媒体">■ 媒体</span> （3 条）</p><table><tr><th>时间</th><th>通道</th><th>条目</th></tr><tr><td>08-04 19:14</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMiUEFVX3lxTE9PV2NTQU5JSU90TWNIRHV3OXNVUExBcnB1NUlPODZ0dGIyWG9NSW9NajM3Y2VISVFhc3ZWQWlkaXZoR0lkMW9TTU1fMUF5ZDA0?oc=5">一个月9款旗舰，大模型进入“月抛”时代？ - 36Kr</a></td></tr><tr><td>08-04 11:19</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMijAFBVV95cUxPRVJnMUQ2cm5HSHl5QVNUMUEyWVBTQ3d0WnlCdDBpZldub1VzRXhFajhqem9Fa1VRZVBZVjMzRk1nTHdqLXdPRU1uZmpqT3FJT3hNRnpxdms1NFV3MFlCMkdZMFNpZ1dTaDJ1UUI2QXFETDF2YnNUVTJpQWl1V3ZkTEtLZjhxNXpXRXNBTg?oc=5">Qwen3.8-Max发布：阿里巴巴当日港股大涨7％ - 21jingji.com</a></td></tr><tr><td>08-04 00:04</td><td>媒体转述</td><td><a href="https://news.google.com/rss/articles/CBMie0FVX3lxTE5rNkJCQjNFdEk5U0p2SEdGMW1WZFZyYVZPaFZpRjQtNmFqcGdsV1ktQ0dHaW9IZHpqTWhtX2hVb3RlX1ZnQ2l5U1ZLMkREY3FqTUc3ZEdXekl3S2xvYkVqazNiWlFWUHJzQm5EUnlJSzR0VHA5eExIT2tfVQ?oc=5">Google Might Finally Drop Gemini 3.5 Pro on August 12: Here’s What We Know - nokiapoweruser.com</a></td></tr></table><div class="foot">摘要引擎：claude。<br><b>证据分级</b>：官方 = 厂商博客/文档 release notes（官方口径）；权重 = Hugging Face 新 repo（最硬的一手，常领先博文）；框架 = transformers/vllm/llama.cpp 的加架构 PR（未发布的早期信号，领先数天到数周）；媒体 = 二手转述，措辞可能失真。<br><b>已知覆盖缺口</b>：x.ai 整站 Cloudflare 403（Grok 只能靠媒体转述）；anthropic.com 无 RSS，改用 docs.claude.com release notes；Grok 靠 docs.x.ai/llms.txt 覆盖（Cloudflare 只拦 x.ai 网页、不拦文档站）；Qwen 官网是 catch-all SPA，只能取到首页 banner 的文章 slug、抓不到正文；seed.bytedance.com 无可用 feed，靠 HF 权重通道兜。<br>本页内容由 <code>modelwatch/modelwatch.py</code> 自动生成。</div>]]></content:encoded></item></channel></rss>