AI 情报站

大模型发布监控31 条

2026-09-05

回看 2 天 · 新增 31 条(框架 17,媒体 12,官方 2)

⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(347 天前)

一句话总览

今天最实锤的进展是 GPT-6 Astra 已被微软 Azure 官方博客确认在 Microsoft Foundry 正式可用(GA),其余全是框架侧对一批尚未发权重的下一代模型(Qwen3.8-Flash-Next、Kimi K3、GLM-5.3-Flash、MiniMax-M3、DeepSeek-V4)的适配 PR,尚不构成正式发布。

正式发布

早期信号

媒体转述(二手)

判断

今天真正值得跟进的只有 GPT-6 Astra 的 Foundry GA——如果业务上会用到 Azure OpenAI/Foundry,值得关注其定价和接入方式一旦官方补充规格。框架侧那一串 Qwen3.8-Flash-Next / Kimi K3 / GLM-5.3-Flash / MiniMax-M3 / DeepSeek-V4 适配 PR 只是"厂商在憋大招"的强信号,尚不可用,值得记一笔但不必现在行动。GPT-6 Astra 基准分数被悄悄改动、以及大量同质化的"OpenAI 发布"媒体稿本质是同一件事的多次转述和炒作噪音,可忽略。

原始条目

■ 官方 (2 条)

■ 框架 (17 条)

时间通道条目
09-05 22:15框架 PRvllm #55477: Support PP
09-05 22:01框架 PRdeepseek —— 框架侧 2 个 PR(transformers 1, vllm 1)
09-05 20:43框架 PRvllm #55464: [Feature] Add TP MoE sequence parallel compile pass
09-05 14:58框架 PRvllm #55437: [Bugfix][Whisper] Apply timestamp decoding rules
09-05 13:48框架 PRvllm #55430: [Kernel][Qwen3.8-Flash-Next] Tile-union QSA sparse attention for prefill on SM121
09-05 12:16框架 PRkimi3 —— 框架侧 2 个 PR(vllm 2)
09-05 10:48框架 PRglm5.3 —— 框架侧 2 个 PR(vllm 2)
09-05 07:02框架 PRtransformers #48538: [serge] Fix 1 integration test for model `qwen3_vl_moe` failing with `OOM` (other (1))
09-05 04:18框架 PRvllm #55398: [5/N] HiSparse: support direct GPU landing for P/D transfers
09-05 02:39框架 PRvllm #55389: [Model] Extend device-side mm normalization to GLM4V/GLM5Next
09-05 02:03框架 PRvllm #55380: [Turing] Restore flashinfer support for SM75
09-05 01:46框架 PRvllm #55374: [KV Connector] Support piecewise prefix loading with NIXL connectors
09-05 01:23框架 PRvllm #55372: [Kernel][MiniMax-M3] Query-tiled sparse verify-decode attention (RFC)
09-05 01:00框架 PRvllm #55369: [Bugfix][Spec Decode] Resolve n_predict from text_config for Qwen3.5 multimodal MTP
09-05 00:07框架 PRtransformers #48529: Support for MoE in the GGUF integration
09-04 23:29框架 PRvllm #55356: [Kimi Perf] Group fp8 mla cahche insertion, 4~6x kernel level performance improvement for small batch
09-04 23:28框架 PRvllm #55355: [Model] Add DeepSeek-V4 CPU backend

■ 媒体 (12 条)

摘要引擎:claude。
证据分级:官方 = 厂商博客/文档 release notes(官方口径);权重 = Hugging Face 新 repo(最硬的一手,常领先博文);框架 = transformers/vllm/llama.cpp 的加架构 PR(未发布的早期信号,领先数天到数周);媒体 = 二手转述,措辞可能失真。
已知覆盖缺口:x.ai 整站 Cloudflare 403(Grok 只能靠媒体转述);anthropic.com 无 RSS,改用 docs.claude.com release notes;Grok 靠 docs.x.ai/llms.txt 覆盖(Cloudflare 只拦 x.ai 网页、不拦文档站);Qwen 官网是 catch-all SPA,只能取到首页 banner 的文章 slug、抓不到正文;seed.bytedance.com 无可用 feed,靠 HF 权重通道兜。
本页内容由 modelwatch/modelwatch.py 自动生成。
AI News 与模型发布两个栏目由本机 cron 每晚自动抓取、LLM 摘要并发布;HBR 精读与股票分析为手工撰写、不定期更新,股票分析不构成投资建议。页面构建于 2026-10-03 23:55 CST。
源脚本:ainews-digest/ainews_digest.py、modelwatch/modelwatch.py;发布器:digest-site/publish.py。