大模型发布监控15 条
2026-08-09回看 2 天 · 新增 15 条(框架 11,媒体 3,权重 1)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(320 天前)
一句话总览
今天最重要的是 LG AI Research 的 K-EXAONE-2.0-750B-A37B(从型号名看是总参 750B、激活 37B 的超大开源 MoE)进入 vLLM 适配且权重与技术报告链接已出现;此外 MiniMax 的视频生成模型 MiniMax-H3 权重在 HF 上实质更新,官方尚未发文。
正式发布
- LG AI Research · K-EXAONE-2.0-750B-A37B-DSpark · 2026-08-09 —— vLLM 收到官方作者提交的模型支持 PR,PR 中已给出 Hugging Face 官方组织的权重链接和 arXiv 技术报告(2608.04505)。从型号名看是总参约 750B、激活约 37B 的 MoE 大模型,是 EXAONE 系列迄今最大的一代,规模上直接对标 DeepSeek/Kimi 级别的开源旗舰。(权重链接已出现在官方 PR 中,官方博客发文情况待确认,细节待官方补充。)来源
- MiniMax · MiniMax-H3 · 2026-08-09 —— HF 仓库 7 月 28 日建好、今日内容实质更新,标签显示这是一个覆盖文生视频、图生视频、视频转视频乃至"文/图生带音频视频"的多模态视频生成模型(diffusers 格式)。已有 3196 likes、3.5 万下载,热度不低。(权重已上线,官方尚未发文,参数规模等细节待官方补充。)来源
早期信号
- vLLM 出现 DeepSeek-V4 稀疏 indexer 的 ROCm 内核 PR(paged-MQA logits 的 Triton 移植与 torch 回退向量化),HF 上没有官方组织的同版本权重——疑似 DeepSeek-V4 正在推理框架侧提前适配,且架构含稀疏注意力 indexer。来源
- vLLM 两个 Gemma 4 相关 PR(暴露 per-layer 参数、tool_choice 兼容处理),HF 上尚无官方组织同版本权重——疑似 Google 下一代 Gemma 在做适配。来源
- vLLM 已存在 MiniMax-M3 的模型代码(本次是非 CUDA 平台 RMSNorm 崩溃修复),但 HF 上没有官方权重——疑似 MiniMax 的文本旗舰 M3 已在框架侧就位、权重未公开(或走闭源 API)。来源
- llama.cpp 新增 LocateAnything-3B(指代表达定位/grounding)和 Mage-VL 视觉塔两个多模态 projector——疑似两个新的视觉模型正在进入本地推理生态。来源
媒体转述(二手)
- 据 Simon Willison(转述 Anthropic 官方文章):Claude Code 将于 8 月 14 日起对 Pro/Max/Team 计划默认开启 auto mode,官方引用第三方评测称三款 Claude 5 模型在 720 次间接提示注入攻击中零失守,他本人对此持"愿意相信但想看独立验证"的态度。(Simon Willison 博客)
- 据 Inshorts 报道,Altman 称 OpenAI 下一代模型"强大到现在还不能发布",将在隔离环境中测试(代号 Astra)——典型造势话术,无任何可验证细节。(Inshorts)
- 据 The American Bazaar 报道,阿里巴巴计划对 Qwen 模型的大客户推行收入分成模式。(The American Bazaar)
判断
真正值得跟进的是 K-EXAONE-2.0-750B:LG 把开源 MoE 做到 750B 这个量级,如果权重和技术报告属实,它会直接进入开源旗舰第一梯队,值得等官方发文后第一时间看评测和许可条款。DeepSeek-V4 的框架侧动作也在持续加密(稀疏 indexer 内核已经在修 ROCm 兼容),发布应该不远,做推理选型的可以提前留意其稀疏注意力架构对硬件的要求。MiniMax-H3 对做视频生成的团队值得一试,但对 LLM 选型无影响。Altman 的"太强不能发"属于噪音,听听就好;Claude Code auto mode 转默认则是工程团队需要实际关注的行为变更,8 月 14 日前最好确认自己团队的权限策略。
原始条目
■ 权重 (1 条)
■ 框架 (11 条)
■ 媒体 (3 条)