大模型发布监控36 条
2026-08-25回看 2 天 · 新增 36 条(框架 12,官方 10,权重 9,媒体 5)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(336 天前)
一句话总览
今天最重要的两件事都指向"新一代":Anthropic 的 Claude Fable 5 / Mythos 5 文档页已完整上线(1M 上下文、$10/$50 定价、双轨安全策略),同时 OpenAI 公布了自研推理芯片 Jalapeño 的首批实测数据,能效与时延双双领先现有系统。
正式发布
- Anthropic · Claude Fable 5 / Claude Mythos 5 · 日期未标注 —— Anthropic 文档站已上线 Fable 5(claude-fable-5)完整规格页:1M 上下文、128K 最大输出、$10/$50 每百万 token、自适应思考常开、知识截止 2026 年 1 月,定位"最强公开可用模型"。同底座的 Mythos 5 为邀请制专用版(Project Glasswing,面向防御性网络安全与生物研究),区别在于 Fable 5 内置可主动拒答的安全分类器而 Mythos 5 没有。对比表还显示当前主线已是 Opus 5($5/$25)/ Sonnet 5($2/$10),Opus 4.8 及更早版本全部转入 legacy。文档索引不带日期,发布时间以官方公告为准。来源
- OpenAI · Jalapeño 推理芯片首批实测 · 2026-08-25 —— OpenAI 首款自研推理芯片公布实测:相对对比系统,峰值吞吐下每瓦性能高 1.5–1.9 倍,端到端时延低 1.7–3.6 倍,高交互负载性能高 2.1–4.1 倍;且在 GPT-OSS 120B、DeepSeek R1 670B、Kimi K2.5 1T 三个内外部模型上都成立。官方强调用 AI 设计芯片、并为 AI 编程而设计芯片的全栈路线。这不是模型发布,但直接关系推理成本曲线。来源
- NVIDIA · Nemotron-3 全家族权重更新 · 2026-08-24 —— Nano 30B-A3B(含 Omni 全模态推理版)、Super 120B-A12B、Ultra 550B-A55B 共 7 个仓库在同一天集中更新内容(FP8/BF16/NVFP4 多精度,latent-moe 架构标签)。这些仓库建仓已久且下载量巨大(最高超 120 万),本次更像一轮协调的版本刷新而非首发,具体改动细节待官方补充。(权重已上线,官方尚未发文说明本次更新)来源
- OpenAI · GPT-5.6 上线 Kiro · 2026-08-24 —— 官方宣布 GPT-5.6 进入 Kiro(AWS 的开发工具),主打更好的性价比,覆盖规划、编码、评审、测试环节。属渠道铺开而非新模型。来源
- 腾讯 · WeMM-Embedding 2B/4B/9B · 2026-08-25 —— 三个尺寸的多模态 embedding 模型(文本/图像/视频统一向量,支持 MRL 弹性维度),标签显示基座为 qwen3_5。工具类模型,放在末位供检索/RAG 选型参考。(权重已上线,官方尚未发文)来源
早期信号
- vLLM 单日出现 4 个 Kimi-K3 相关 PR(ROCm fused KDA、内部前缀 checkpoint + 投机解码、DCP 前缀缓存、流水线并行),其中 PP 支持已用 moonshotai/Kimi-K3 在 262K 上下文跑通 GSM8K——适配已近收尾,但交叉验证 HF 上尚无官方公开权重,疑似发布/开权重在即。来源
- vLLM 接入 FlashInfer fused GDN decode 的 PR 中,FlashInfer 侧明确"新增对 Qwen3.6-35B-A3B 几何结构的支持"——疑似 Qwen3.6 系列新尺寸在路上。来源
- vLLM 3 个 DeepSeek-V4 PR(MXFP4→块 FP8 专家反量化提速 Hopper prefill、XPU LoRA 支持),HF 无官方同版权重,疑似 V4 适配持续推进。来源
- vLLM 一个 Qwen3-VL 修复 PR 里同时修了名为 Cosmos3-Edge 的文本架构——疑似 NVIDIA Cosmos 3 边缘版模型在做适配。来源
- transformers 的 per-layer MTP 配置 PR 顺带修复了一个名为 Inkling 的模型的注意力掩码选择——该名字此前未公开,疑似某家未发布新架构的占位名。来源
- vLLM 修复 MiniMax-M3 的 ROCm fused MXFP8 块量化——HF 无官方同版权重,疑似 M3 适配中或为闭源 API 模型。来源
媒体转述(二手)
- 据 Google Cloud Press Corner 系列通稿,Google 推出 Gemini Enterprise 法律版与金融服务版行业方案,NetDocuments、Legora、GFT 等作为首批合作伙伴参与。来源
- 据新浪科技的大模型周榜,国产 glm-5.3-max 首秀进入综合榜前 15,kimi-k3-max 冲进前十(榜单口径,非官方发布信息)。来源
- 据 53AI 报道,一个 2 万 Star 的 Mac 本地大模型服务器项目实现了在本机跑 Codex 所用的开源模型。来源
判断
真正需要动手跟进的是 Fable 5:它比 Opus 5 贵一倍($10/$50 对 $5/$25),且内置会主动拒答的安全分类器,接入方要新增拒答处理和降级回退逻辑——是否值这个差价得实测,成本敏感的场景 Opus 5 大概率仍是默认选择。Jalapeño 短期买不到,但 1.5–1.9 倍每瓦性能意味着 OpenAI API 后续有实打实的降价空间,是成本预期信号而非行动项。自托管选型可以顺手看一眼 Nemotron-3 这轮全家族刷新,30B-A3B 尺寸对单卡友好。早期信号里 Kimi-K3、DeepSeek-V4、Qwen3.6 三条线同时升温,下一波开源旗舰不远;Gemini 行业版通稿和 GPT-5.6 进 Kiro 属于渠道动作,可忽略。
原始条目
■ 官方 (10 条)
■ 权重 (9 条)
■ 框架 (12 条)
■ 媒体 (5 条)