大模型发布监控19 条
2026-08-24回看 2 天 · 新增 19 条(框架 11,媒体 7,官方 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(335 天前)
一句话总览
今天没有全新旗舰落地,最实的一条是 OpenAI GPT-5.6 Terra/Luna 上线 AWS GovCloud(Bedrock);更值得盯的是水面下的动静——vLLM 一天之内为 Kimi K3 合入 8 个适配/优化 PR,K3 开源发布可能已经很近。
正式发布
- OpenAI(via AWS Bedrock)· GPT-5.6 Terra / Luna · 2026-08-24 —— GPT-5.6 家族的两个档位(Terra 均衡档、Luna 低价快速档)在 Amazon Bedrock 的 AWS GovCloud(US-West/US-East)正式可用,属于区域可用性扩展而非新模型首发。官方口径:Terra 以 GPT-5.5 一半的成本提供同级性能,Luna 是最低价位档;Bedrock 上支持 100 万 token 上下文,并支持显式缓存断点的 prompt caching(重复上下文按 9 折——即 90% 折扣计费)。对需要美国政府合规环境跑 agent 工作流的团队是实质利好,对其他人主要是定价参照。来源
早期信号
- Kimi K3(月之暗面) —— vLLM 单日出现 8 个 K3 专属 PR(KeyError 修复、CUDA graph、KDA mixer 拆分、MegaMoE 尾部融合、SM100 低延迟 decode 等),HF 上尚无官方权重,疑似开源发布前的密集适配冲刺;PR 标题暴露了 KDA + latent MegaMoE 的新架构组合。来源
- Kimi Linear(月之暗面) —— transformers 出现 "Kimi linear" 官方建模 draft PR,疑似 K3 所用线性注意力组件在 HF 生态的前置铺路。来源
- GLM-5.2(智谱) —— vLLM 性能 PR 直接以 zai-org/GLM-5.2-FP8 在 8×H20 上跑稀疏注意力(FLASHMLA_SPARSE)基准,但 HF 官方组织下尚未见同版本公开权重,疑似发布在即或内测权重先行。来源
- DeepSeek-V4 —— vLLM 合入 ROCm 路径的 DeepSeek-V4 SWA 解码融合内核优化,HF 上没有官方同版本权重,疑似 V4 正在做发布前的多硬件适配(PR 细节显示 V4 引入了 SWA + indexer 的新解码管线)。来源
- Qwen3.6(阿里) —— 一个与模型无关的 vLLM 权重校验 PR 的问题描述里顺带出现了客户部署 "Qwen3.6-35B-A3B-w8a8" 的字样,疑似 Qwen3.6 系列已在部分客户处流通但尚未公开。来源
- Dots3 NOTE(疑似小红书 dots 系列) —— vLLM 出现 Dots3NoteForCausalLM 的 torch.compile/MTP 优化 PR,含视觉编码器与 MTP 投机模块,指向一个尚未广泛公开的多模态新型号。来源
媒体转述(二手)
- 据 Geeky Gadgets 报道,Gemini 4 可能配备 1000 万 token 上下文窗口(无官方口径佐证)。
- 据 Geeky Gadgets 报道,DeepSeek V4 Flash Vision 在 Apex Bench 测试中表现突出。
- 据 nokiapoweruser 报道,Google Gemini 3.5 Pro 疑似即将发布;另据 Pluang 报道,Gemini Pro 发布再度推迟——两条消息互相矛盾,均无官方确认。
- 据搜狐网转述,日媒发布全球大模型实力调查报告,Kimi K3 排名第六。
判断
今天真正值得跟进的是 Kimi K3:一天 8 个 vLLM PR 加 transformers 侧的 Kimi Linear 铺路,这种密度通常出现在开源发布前一到两周,架构上 KDA 线性注意力 + MegaMoE 的组合也值得提前研究部署要求。GLM-5.2 和 DeepSeek-V4 的适配 PR 说明国产三家下一代基座都在管线里,但时间点还看不出来。GPT-5.6 GovCloud 上线对绝大多数团队只是区域扩展新闻,唯一有普适价值的信息是"Terra = GPT-5.5 半价同级性能"这个定价锚点。Gemini 系列的传闻互相打架,纯属噪音,等官方。
原始条目
■ 官方 (1 条)
■ 框架 (11 条)
■ 媒体 (7 条)