大模型发布监控38 条
2026-08-28回看 2 天 · 新增 38 条(框架 15,官方 12,媒体 10,权重 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(339 天前)
一句话总览
今天有两个实质发布:腾讯开源新一代 MoE 基座 Hy4-preview(770B 总参/49B 激活,权重已上 Hugging Face),Google 官宣 Gemini Omni 1.1 Flash;此外 NVIDIA Cosmos 3 世界模型家族与 Meta、Qwen 两款模型集中上架 SageMaker JumpStart。
正式发布
- 腾讯 · Hy4-preview · 2026-08-27 —— 腾讯混元新一代开源 MoE 语言模型:总参 770B、每 token 激活 49B、78 层,除首层 dense 外每层 256 路由专家(top-8)+1 共享专家,另带 10B 参数(激活 0.7B)的原生 MTP 层做投机解码。架构上采用借鉴 DeepSeek/GLM 的 Gated DSA 稀疏注意力(IndexCache 跨层复用稀疏索引)和 iHC 恒等超连接。HF 权重(含 FP8 量化版)已上线,vLLM 官方适配 PR 同步就位;官方博客暂未抓到,媒体称今日开源上线。来源
- Google DeepMind · Gemini Omni 1.1 Flash · 2026-08-28 —— 官方博客正式发文,主打"让开发者获得更多控制力"(more control)。抓取到的页面正文残缺,具体规格、定价与上下文等细节待官方补充。结合 Omni 命名推测为多模态 Flash 线的迭代版本。来源
- NVIDIA · Cosmos 3 家族(Edge/Nano/Super)· 2026-08-28 上架 SageMaker —— 面向 physical AI(机器人/自动驾驶/视觉智能体)的开源前沿全模态世界模型三件套:Edge 为 4B 端侧模型(含 2B Nemotron 推理器,Jetson Thor 上 15Hz 实时出 32 个动作);Nano 16B 主打物理推理与世界生成,支持文本/图像/视频/音频/动作轨迹混合输入;Super 64B 用统一 Mixture-of-Transformers 架构做最高保真的仿真与合成数据生成,支持 720p。此为 AWS 官方上架公告,模型本体发布时间以 NVIDIA 官方为准。来源
- Meta · Muse-Glimmer-30B / 阿里 · Qwen 3.8-27B · 2026-08-28 上架 SageMaker —— 两款模型登陆 JumpStart。Muse-Glimmer-30B 来自 Meta Superintelligence Lab:30B dense + 约 1.8B ViT-G/14 视觉编码器,131K+ 上下文,可选推理强度,Apache 2.0,定位本地自治 Agent。Qwen 3.8-27B 为 27B dense 原生视觉语言模型:262K 上下文(YaRN 可扩至约 1M),SWE-bench Pro 61.7,量化后约 17GB 可跑。同样属渠道上架公告,非首发。来源
- inclusionAI · Ling 3.0 Flash D-Spark · 日期未知 —— Ling 3.0 Flash 的官方投机解码 draft 权重(Ling-3.0-flash-dspark)已在 HF 上线,vLLM 正在补齐 D-Spark serving 支持(复用 Qwen3 D-Spark 骨干,训练 query block 为 8)。属已发布模型的生态补齐。来源
- Anthropic · Claude 平台更新 · 2026-08-27 —— 非模型发布:Console 新增个人密钥与服务账号密钥(随账号权限走、账号移除即失效,可限定 workspace),各语言 SDK 的 files/skills API 结束 beta 头。对做用量审计和密钥治理的团队是实用更新。来源
早期信号
- vLLM 三个 PR 密集打磨 Qwen3.5(MTP 投机解码、GDN FP8 kernel 调优、视频剪枝),HF 尚无官方权重,疑似 Qwen 下一代已进入发布前适配冲刺。
- llama.cpp 出现 qwen4exp 的正确性修复与 graph split 优化 PR,无官方权重,疑似 Qwen 4 代实验架构在提前铺路。
- vLLM 两个 PR 涉及 DeepSeek-V4(reasoning_effort 归一化文档、ROCm 上 FHMoE+DP8),无官方权重,疑似 V4 在做适配,且 reasoning_effort 参数暗示推理档位设计。
- vLLM 两个 kernel 级 PR 针对 Kimi-K3(低 M 融合 latent MoE、序列并行 AG-GEMM),无官方权重,疑似月之暗面下一代模型在优化推理路径。
- llama.cpp 新增 Spark2_5 架构端到端支持(滑窗+全注意力混合、head 级 sigmoid 注意力门控),参考权重却挂在个人账号 XHToken/xh-beta 而非官方组织,疑似某厂商(命名指向讯飞星火)未公开的新模型。
- vLLM 并行化 PR 的测试计划中出现 GLM-4.7-Flash 作为测试模型,此前未见官方发布记录,疑似智谱已有该型号在流转。
媒体转述(二手)
- 据智源社区报道,Anthropic 的 Opus 5.1 被曝将于本周发布。(智源社区)
- 据 Business Insider 报道,Google 员工已在内部测试下一代 Gemini Flash 模型。(Business Insider)
- 据华尔街见闻报道,Claude 推出面向机器人交互的"MHS 协议",被称为机器人版 MCP。(华尔街见闻)
- Simon Willison 转述安全研究员 Johann Rehberger 的发现:Claude Code Opus 5 的 auto mode 可被 zip+base64 侧载攻击以约 80% 成功率绕过,甚至出现分类器拦截清理命令、放行恶意进程的反向失效,结论是无人值守 agent 必须跑在沙箱里。(simonwillison.net)
判断
真正值得动手的是 Hy4-preview:770B/49B 的激活比、Gated DSA 稀疏注意力加原生 MTP,是 DeepSeek 路线的重量级开源竞品,权重和 vLLM 支持当天齐活,有 8 卡资源就能直接测。Gemini Omni 1.1 Flash 要等规格和定价落地再判断,但 Flash 线迭代通常直接影响低成本多模态选型。最值得盯的其实是早期信号区——Qwen3.5、DeepSeek-V4、Kimi-K3 三家同时在 vLLM 里做发布前冲刺,加上 Opus 5.1 的传闻,未来一两周大概率是密集发布窗口。Cosmos 3 是 physical AI 垂类,做机器人的才需要跟;两条 SageMaker 上架和 Anthropic 平台更新属常规渠道动作。
原始条目
■ 官方 (12 条)
■ 权重 (1 条)
■ 框架 (15 条)
■ 媒体 (10 条)