大模型发布监控53 条
2026-09-02回看 2 天 · 新增 53 条(框架 16,媒体 14,官方 14,权重 9)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(344 天前)
一句话总览
今天最大的实质动作是 Anthropic 正式发布 Claude Fable 5.1 / Mythos 5.1(AWS/GCP/Azure 同步上线),其余大部分是围绕 GLM-5.2/5.3、Kimi-K3、Qwen3.8-Flash-Next 等已发布模型的框架生态补齐;Gemini 3.8 Flash、Grok 4.7、OpenAI Astra 均只是二手爆料,尚未正式落地。
正式发布
- Anthropic · Claude Fable 5.1 / Claude Mythos 5.1 · 2026-09-01 —— Claude Fable 5 的继任旗舰,主打长时程 agentic 编程、科学研究与知识工作,1M 上下文窗口、最大 128K 输出、自适应思维默认开启(五档 reasoning effort:low/medium/high/xhigh/max)。定价维持 $10/$50 每 MTok 不变,但 prompt cache 读取价降至 $0.25/MTok(约为其他模型的 1/4)。新增按消息切换 effort、轮次级系统消息(beta)、工具调用间可读进度更新、文本水印与 C2PA 内容溯源;forced tool use(`tool_choice: any/tool`)不再支持,思维块只能被同代或更新模型读取。Mythos 5.1 为同一底层模型,面向 Project Glasswing 邀请制客户,保留完整 cyber/bio 能力。已在 Claude API、AWS Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundry 同步上线。来源
- Z.ai · GLM-5.2(含 FP8/NVFP4 量化版)· HF 更新于 2026-09-01 —— 权重已上线一段时间,今日 HF 仓库再有实质更新(likes 5000+,下载超 145 万次),NVIDIA 官方还提供了 GLM-5.2-NVFP4 量化版本。同期 vLLM PR(GLM-5.3 相关)显示该系列在 ROCm 上因架构字符串共享曾被错误切换到 MRV1 导致精度暴跌(GSM8K 91.6%→14.9%),已修复保持 MRV2 默认路径——属于已发布模型的生态/推理引擎适配补齐,不是新模型信号。来源
- Moonshot AI · Kimi-K3 · HF 权重持续更新(建仓 6-13,实际发布约 7-27) —— 多模态(image-text-to-text)大模型,权重下载量已超 278 万次,likes 超 1.1 万,热度维持高位。今日 vLLM 出现两个 ROCm 性能优化 PR(MoE 上投影分片、MLA 解码延迟优化),属已发布模型的推理侧持续优化。细节待官方补充。来源
早期信号
- vLLM/llama.cpp 出现多个 Qwen3.8-Flash-Next 专属 PR(MTP 模块、索引器优化、FP8 缓存支持),HF 上未见对应官方权重,疑似即将发布的新一代 Qwen 稀疏/MoE 模型。
- vLLM 出现 DeepSeek-V4 专属 PR(标注 Preview/DO NOT MERGE),用于训练/rollout 对齐的批不变性内核,HF 无对应权重,疑似 DeepSeek 下一代模型正在内部适配中。
- InclusionAI 上传 Ling-3.0-flash/tiny-singprobe 两个新 HF 仓库,为幻觉检测/护栏探针模型,配合 vLLM 的 SingProbe token 级探针 PR,指向 Ling 3.0 系列护栏能力扩展(非旗舰模型)。
- vLLM 出现 Ernie4.5-VL ViT cudagraph 测试修复 PR,HF 无同版本官方权重,暂看不出是否指向新版本,更像既有模型的 CI 维护。
媒体转述(二手)
- 据 qz.com、Yahoo Finance、tech-insider.org 等多家媒体报道,Google 可能最早于本周三发布 Gemini 3.8 Flash,主打编程能力提升,但均为"预计/据报道",官方未确认。
- 据 The Standard (HK)、BeInCrypto 报道,马斯克宣称 Grok 4.7 将在 10 天内发布并"击败所有模型",纯营销性表态,无技术细节。
- 据 WIRED、The Hindu、BeInCrypto 报道,OpenAI 即将发布首个达到 Preparedness Framework "Critical"级网络安全能力门槛的模型(代号 Astra),OpenAI 官方博客已发文确认 Astra 存在及门槛达标,但尚未给出发布日期和具体规格。
判断
Claude Fable 5.1 是今天唯一真正值得跟进的发布——同价位下 cache 读取成本降到 1/4,对长上下文/多轮 agentic 场景(尤其是重度依赖 prompt caching 的场景)有直接成本影响,值得评估迁移;但注意 forced tool use 被砍、思维块跨版本不兼容这两个 breaking change,迁移前要过一遍官方 migration guide。GLM-5.2/Kimi-K3 系列的 PR 都是老模型的推理引擎打磨,无需特别关注。Gemini 3.8 Flash、Grok 4.7、OpenAI Astra 三条线索都值得留意但今天没有实锤,建议明后两天继续盯官方渠道,不必现在就下结论。
原始条目
■ 官方 (14 条)
■ 权重 (9 条)
■ 框架 (16 条)
■ 媒体 (14 条)