大模型发布监控65 条
2026-09-24回看 2 天 · 新增 65 条(官方 23,框架 19,媒体 14,权重 9)
⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(366 天前)
一句话总览
本期最重要的是 OpenAI 正式推出 GPT-6 Sol 与 GPT-6 Luna,API 价格对 GPT-5.6 同档直接砍半;同一天 Claude Opus 5.5 上线微软 Foundry 与 AWS GovCloud,每 token 降价并大幅下调缓存读取价。中低价位档正式进入价格战,Gemini 4 则只有媒体放风、尚无官方发布。
正式发布
- OpenAI · GPT-6 Sol / GPT-6 Luna · 2026-09-22 —— GPT-6 家族在本月初 Astra 之后新增两个更便宜的档位,训练方法与 Astra 相近。Sol 定位日常复杂任务与软件开发,官方称在内部事实性评测上错误约为 GPT-5.6 Sol 的一半;Luna 面向摘要、抽取、分类、路由等高吞吐任务,可调 reasoning effort。API 定价 Sol 2/10 美元、Luna 0.10/0.50 美元(每百万输入/输出 token),比 GPT-5.6 促销价再降 50%;AWS 公告两者上下文均支持至 100 万 token,已在 Amazon Bedrock 与 Microsoft Foundry 正式可用。配套还发布了 GPT-6 改进版 prompt caching:30 分钟窗口内共享前缀自动命中,新增缓存看板与 cache-miss 诊断字段,且切换 reasoning effort 不再破坏缓存。来源
- Anthropic · Claude Opus 5.5 · 2026-09-22 —— Opus 5 的迭代版,主打长程 agentic 编程与知识工作,强调"更少 token 做更多事"以及类似队友的过程沟通(做了什么、发现了什么、哪里需要用户输入)。微软 Foundry 与 AWS GovCloud (US) 两条官方渠道同日上线;每 token 价格低于 Opus 5,缓存读取价格降幅更大。本批条目未抓到 Anthropic 自家博客,具体基准数字以官方后续为准。来源
- Google DeepMind · Gemini 3.8 Flash TTS / Flash-Lite TTS · 2026-09-23 —— 两款文本转语音模型,DeepMind 官方博客已发文,正文抓取不完整,细节待官方补充。属于语音工具类模型,非旗舰基座。来源
早期信号
- vLLM 两个 PR(#58540 加 Hopper FP8 FlashInfer MoE 后端、#58458 忽略 thinking 采样覆盖)明确针对 DeepSeek-V4,另一 PR 的基准已直接使用 deepseek-ai/DeepSeek-V4-Flash-DSpark 这个模型名;交叉验证 HF 官方组织下暂无同版本权重,疑似 DeepSeek V4 系列处于发布前适配或部分变体先行阶段。
- vLLM #58489 出现全新架构名 Qwen4Exp(带 PLE 嵌入 CPU 卸载与 engram_config),HF 无对应官方权重,疑似 Qwen 4 实验性架构正在推理框架侧预埋。
- vLLM #58526 针对 MiniMax-M3 视觉塔做 mRoPE 加速,HF 无官方同版本权重,疑似 MiniMax M3 多模态版本在做适配。
- vLLM #58454 修复 GLM-5.3-Flash 投机解码下的 kpool 损坏,并提及 GLM5Next 视觉合并层;HF 无官方权重,疑似智谱 5.3 系列以 API 或未公开形式在跑。
- transformers #49077 修复 Qwen2Tokenizer 忽略自定义 pretokenize_regex 的问题,起因是 Qwen3.6 / Qwen3.8 的分词正则新增了 \p{M} 组合标记;vLLM 侧同日基准也在跑 Qwen3.8-2.4T-A95B,属这两代模型的生态补齐。
- inclusionAI(蚂蚁)在两小时内批量更新了 Ling-mini-2.0、Ling-flash-2.0、Ling-1T、Ring-1T、Ring-2.5-1T、Ling-2.6-1T、Ling-2.6-flash、Ling-3.0-flash 共 8 个旧仓库,并新建了名为 AI-Transparency 的文档类仓库(tags 为 documentation/transparency),疑似是统一补透明度说明的文档批量更新,而非新权重发布。
媒体转述(二手)
- 据 The Verge、Times of India 等多家报道,Google DeepMind 新负责人 Koray Kavukcuoglu 表示 Gemini 4 "几乎就绪",可能远早于年底发布;目前无任何官方博客或文档佐证。
- 据 Simon Willison 博客,前一天 xAI 发布了 Grok 4.7(API 2/6 美元)、小米发布 MiMo v2.6 Flash/Pro,并称 Anthropic 已预告 Sonnet 5.5 与 Haiku 5.5 即将推出;同文给出 Opus 5.5 定价为 4/20 美元、缓存读取降价 60%。
- 据智源社区报道,Claude Opus 5.5 "减价 40%";对照 Simon Willison 整理的价目表,每 token 降幅为 20%,40% 一说标题存在夸大。
- 据 The AI Economy(Ken Yeung)报道,Adobe 创意工具接入 Gemini,Acrobat 接入 Claude。
判断
真正影响选型和成本的是 GPT-6 Luna 与 Sol:Luna 0.10/0.50 美元把分类、抽取、路由这类高吞吐任务的成本压到了此前 Haiku 4.5 的十分之一,值得马上拿现有批量任务做一轮 A/B;Sol 2/10 美元对标 Opus 5.5 的 4/20 美元,编程与 agent 场景的默认模型需要重新评估。Opus 5.5 的价值主要在长会话 agent 场景,缓存读取大幅降价加上更省 token,实际账单降幅可能高于名义 20%,但要看 Anthropic 官方基准补齐。Gemini 3.8 TTS 是垂类工具,DeepSeek-V4 与 Qwen4Exp 的框架 PR 值得持续盯,Gemini 4 目前全是媒体放风,不构成任何决策依据;Ling 系列的批量更新大概率是文档动作,无需跟进。
原始条目
■ 官方 (23 条)
■ 权重 (9 条)
■ 框架 (19 条)
■ 媒体 (14 条)