大模型发布监控42 条
2026-10-03回看 2 天 · 新增 42 条(框架 16,媒体 12,官方 11,权重 3)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(375 天前)
一句话总览
今天最值得知道的是 OpenAI GPT-6 系列的落地:GPT-6 Astra Ultrafast 已经在 API 上线,官方也发布了 GPT-6 选型与使用指南。Anthropic 文档站同时确认 Claude Sonnet 5.5 已于 9 月 28 日发布,规格为 1M 上下文、每百万 token 输入 $2、输出 $10。Gemini 4 Argon 的讨论很多,但本次只抓到媒体转述,没有抓到 Google 官方渠道的条目。
正式发布
- OpenAI · GPT-6 Astra Ultrafast / GPT-6 系列 · 2026-10-01~10-02 —— 据 NVIDIA 官方博客,GPT-6 Astra Ultrafast 跑在 Blackwell GPU 上,已在 OpenAI API 开放,ChatGPT Work 和 Codex 的符合条件用户也能用。它的 token 生成速度最高是 Astra Standard 模式的 8 倍,主要面向编码 agent 的“改代码—跑测试—调试”循环和多次工具调用的场景。OpenAI 同时发布了《GPT-6 family 模型指南》,称 GPT-6 是“迄今最先进的模型套件”,提供多个可选模型,并建议按任务选择模型、推理强度(reasoning effort)和速度档位。指南还提到缓存输入最多可便宜 95%(视模型而定),并推荐用 compaction、steering、async tools、delegation 处理长任务。具体价格和各型号规格见官方 Ultrafast guide,这里细节待官方补充。来源 · 指南
- Anthropic · Claude Sonnet 5.5 · 2026-09-28 —— 这是 Anthropic 当前最新的 Sonnet,模型 ID 为 claude-sonnet-5-5。规格:1M 上下文,最大输出 128K(Batch API beta 下可到 300K),输入 $2 / 输出 $10(每百万 token),文本和图像输入,知识截止 2026 年 6 月,默认开启 adaptive thinking,默认 effort 为 high。它和 Fable 5.1($10/$50)、Opus 5.5($4/$20)组成当前的模型阵容。从 Sonnet 5 迁移有 5 处破坏性变更,例如强制工具调用改为报错、旧版 computer use 工具不再接受、工具调用之间的文本改为放在 thinking 块里返回;而且 effort 档位重新校准过,官方建议重新扫一遍档位,不要沿用旧设置。来源
- Ai2 · AstaBrief 8B · 2026-10-02 —— 一个专门做科研文献报告的小模型:输入研究问题和检索到的文献片段,一次生成带引用的完整报告。权重和训练数据都已开源。在 Asta 平台上,它作为 Fast 模式和 Claude 驱动的 Thinking 模式并列,平均每份报告 51.1 秒,Thinking 模式为 178.5 秒,约快 3.5 倍。适合需要本地部署、处理敏感或未发表研究的机构。来源
- NVIDIA · PixelUMM / PixelDiT2-ImageNet · 2026-10-02 —— 两个仓库同一天上传到 HF。PixelUMM 的标签同时包含图像生成、图像理解、视频生成和视频问答,看起来是一个统一的多模态模型;PixelDiT2-ImageNet 从名字看是在 ImageNet 上训练的 DiT 类生成模型。参数量和用途细节待官方补充。(权重已上线,官方尚未发文)来源
- RheoEcho · ETET 1.0 Preview(1.8B-A1B MoE)· 2026-10-03 —— 一个小团队模型,基于 MiniCPM5 / Llama 结构,把后 8 层改造成 MoE(每层 3 个专家,每次激活 1 个)。“Preview”指只用了部分训练数据。HF 权重已经有了,llama.cpp 正在合入对它的支持。属于小众实验模型。来源
- IBM · Granite 时序集成预测 · 2026-10-02 —— ibm-granite 组织新上传了一个时序预测集成仓库,没有标注任务类型,属于工具类模型。(权重已上线,官方尚未发文)来源
早期信号
- vLLM 一天内出现 3 个 DeepSeek-V4.1 相关 PR:新增 V4.1-Flash 支持、ROCm 上的 FP4 dispatch(a4w4)、SM120 上解码 V4.1 自有 KV 格式的稀疏 MLA。HF 上还没有官方权重,疑似 DeepSeek-V4.1(含 Flash 版)正在做发布前的推理适配。
- vLLM 出现带 “Qwen4Exp” 标签的 PR,其中一个是给 “Qwen3.8-Flash-Next” 调 sm_120 上的 GEMM 性能,另一个涉及 PLE 表 offload。HF 上没有对应的官方权重,疑似 Qwen 的下一代实验架构在做适配。
- vLLM 修复 GLM-5.x(glm5next)的 NVFP4 加载问题时,用到第三方量化包 tiyuvta/GLM-5.3-Flash-NVFP4;另一个 PR 在优化 GLM-5.2 的低延迟 GEMM。HF 上没有智谱官方的同版本权重,疑似 GLM-5.3-Flash 已经在小范围流转。
- vLLM 在给 Kimi-K3 补 ROCm(MI355X)上的 DSpark 自适应投机解码验证,PR 里写明 K3 按 TP8 部署。HF 上没有官方权重,疑似 Kimi-K3 已经在做多硬件部署适配,也可能暂不开放权重。
- vLLM 新增 nvidia/nemotron-3.5-asr-streaming-0.6b 的整段音频转写支持。HF 上没有官方权重,疑似 NVIDIA 将推出 Nemotron 3.5 系列的流式 ASR 小模型。
媒体转述(二手)
- 据 CNET、CNBC 报道,Google 已发布 Gemini 4(Argon),但华尔街认为它没有拿出突破性的个人 agent,Alphabet 股价随之下跌;另据 Law360 报道,Alphabet 已因 Gemini 发布滞后遭投资者起诉。
- 据 MIXED 报道,Google 将向受信任的网络安全防御方提供不带网络安全护栏的 Gemini 4 Argon;新浪财经称这款新模型暂不面向普通用户。
- 据 Neowin 报道,Argon 发布几天后,Google 调整了 AI 订阅方案,大幅限制免费用量。
- 据 i-hls.com 报道,OpenAI 因安全顾虑取消了一款新模型的发布。标题偏耸动,目前没有官方口径印证。
判断
真正值得动手试的有两个。一是 GPT-6 Astra Ultrafast:标称最高 8 倍速,对编码 agent 这类多轮工具调用的场景,能直接缩短端到端时间,值得拿自己的 agent 流程实测一下延迟和价格。二是 Claude Sonnet 5.5:1M 上下文、$2/$10 的价格会影响选型和成本测算,但 5 处破坏性变更和重新校准的 effort 档位意味着不能直接替换旧模型 ID,要先回归测试。Gemini 4 Argon 目前只有媒体二手信息,而且看起来不对普通用户开放,等 Google 官方文档出来再评估。DeepSeek-V4.1 一天内冒出 3 个适配 PR,是最强的“快要发布”信号,值得盯住。其余条目,包括 AstaBrief、NVIDIA 像素生成模型、ETET 和 Granite 时序模型,都是小众或垂直方向,可以略过。
原始条目
■ 官方 (11 条)
■ 权重 (3 条)
■ 框架 (16 条)
■ 媒体 (12 条)