大模型发布监控21 条
2026-08-22回看 2 天 · 新增 21 条(框架 14,媒体 6,官方 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(333 天前)
一句话总览
今天没有任何厂商发布新模型:唯一的官方一手动静是 AWS Bedrock 给 OpenAI GPT-5.6 Sol 降价。真正的信息量全在框架侧——Kimi K3、DeepSeek V4、Spark3、Inkling 四条尚未发布的型号同时在 vLLM 里推进适配。
正式发布
- AWS(Amazon Bedrock)· OpenAI GPT-5.6 Sol 降价 · 2026-08-22 —— 不是新模型,是已上线模型的定价下调:Bedrock 宣布对 OpenAI GPT-5.6 Sol 降低价格。抓到的页面只有公告标题,具体新单价与生效区域细节待官方补充。对已经在 Bedrock 上跑 GPT-5.6 Sol 的用量来说,这是今天唯一会直接改动账单的官方变更。来源
除此之外,过去两天没有官方博客、release notes 或 Hugging Face 官方组织权重可以支撑任何"新模型已发布"的结论。
早期信号
- Kimi K3(疑似未发布) —— vLLM 一天内 4 个 PR 集中在 Kimi K3(交错权重流加载、MoE 输出协议重构、ROCm 上跨 cache group 复用 attention metadata、think 标记缺失导致 tool call 为空),但 HF 上没有官方组织的同版本权重,属于真正的未发布信号(也可能是闭源 API 模型)。来源
- Kimi K3 的结构细节疑似从 KV 连接器 PR 里漏出 —— vLLM #53324 为"mamba 混合模型(例如 kimi k3)"支持 MooncakeStore + 解码上下文并行,复现例子写的是 Kimi-K3 在 DCP 8 + DSpark 下 attention block 跨度 12288 token、mamba block 跨度 1536,指向一个注意力/mamba 混合架构。来源
- DeepSeek V4(疑似未发布) —— vLLM 出现两个 DeepSeek V4 相关 PR(LoRA 支持、Rust 前端相邻用户消息渲染修复),HF 上没有官方组织的同版本权重;已经做到 LoRA 与前端渲染这种"下游可用性"层面,说明适配不算早期。来源
- Spark3(疑似新架构) —— vLLM #53373 新增 Spark3ForCausalLM 原生支持:滑动窗口 + 全注意力混合、head-wise 注意力输出门控、TP/PP、以及专门的 XML 风格 tool-call 解析器,还顺手改了 supported_models 文档。一个此前没在 vLLM 出现过的型号名带着完整配置类进来,疑似某家在为新基座做发布前适配。来源
- "Inkling"(疑似内部/未公开型号) —— vLLM #53317 放开 Inkling 全局 FA4 相对注意力路径在 SM90 上的 num_splits=1 限制,正文直接引用"生产 TP8-local 形状"和 H200 微基准,说明这套专用相对注意力算子已在真实部署里跑,但公开渠道查不到对应模型。来源
- Qwen3.5 / 3.6 / 3.8 与 Gemma4 在解析器代码里被当成既有型号引用 —— vLLM #53302 修 qwen3 reasoning parser 时提到"Qwen3.5/3.6/3.8 广泛使用的社区模板"会提前闭合 think 块,并说这与 Gemma4 已覆盖的 hook 是同一处、极性相反;HF 上没有官方组织的同版本权重,措辞上只能算这些型号在生态中已流通的间接痕迹。来源
媒体转述(二手)
- 据 Geeky Gadgets 报道,Anthropic 疑似推迟了 Claude Fable 5.1,官方无任何口径可对照。来源
- 据麻省理工科技评论转述,一个来源不明的"牛来大模型"在外网走红,称部分测试成绩超过 Fable 与 GPT-5.6——无官方主体、无权重、无技术报告。来源
- 据新浪财经(转极客公园)报道,阿里以"模型团战"方式集中发布多个模型并宣称多项 SOTA,具体型号与指标本次抓取未取到正文。来源
- 据 gbhackers 报道,有攻击者用 DeepSeek 配合 Hermes agent 发起自动化网络攻击;属安全事件转述,与模型发布无关。来源
判断
唯一需要今天就动手的是 Bedrock 那条降价:如果 GPT-5.6 Sol 在你的成本表里占份额,等新单价页出来重算一次即可,不涉及选型改动。
真正值得预研的是 Kimi K3——它已经不是"有个名字"的阶段,vLLM 里同时在处理交错权重流、mamba 混合状态的 KV 传输、DCP 分片和 tool-call 解析,这四类工作凑齐通常离可跑不远;混合注意力 + mamba 意味着 KV 显存模型和现有 dense/MLA 部署经验不通用,提前看一眼布局比发布当天临时救火便宜。DeepSeek V4 做到 LoRA 层面同理,但暴露的架构信息太少,只能盯着。
Spark3 和 Inkling 目前只值得记名字:一个是新配置类落地、一个是生产形状的性能调优,都不足以判断规模或用途。剩下的(DeepSeek-R1-Distill tokenizer 回归修复、ESMFold2 的 AutoModel 注册、NIXL/FSDP2/权重热重载这类基础设施 PR)是常规工程噪音。媒体三条——Fable 5.1 延迟、"牛来大模型"、阿里团战——在拿到官方发文或权重之前都不该进入任何决策。
原始条目
■ 官方 (1 条)
■ 框架 (14 条)
■ 媒体 (6 条)