AI 情报站

大模型发布监控11 条

2026-08-23

回看 2 天 · 新增 11 条(框架 7,媒体 4)

⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(334 天前)

一句话总览

过去两天没有任何厂商发布新模型——官方博客、release notes、HF 权重三条一手通道全空,无实质发布;真正的看点是框架侧的两条未发布信号:vLLM 的 fp8 MoE 调优配置里直接写出了「Gemma 4 26B A4B」的专家规格,以及连续两个 PR 在修 DeepSeek-V4 的流式工具调用解析。

正式发布

今日无确认发布条目:本批抓取中没有官方发文,也没有任何厂商官方组织下的新权重上线。

早期信号

媒体转述(二手)

判断

这两天不需要动选型:没有一条能落地试用的新模型。唯一值得现在就跟的是 Gemma 4——vLLM 已经在为它写 GB10 的 fp8 MoE 调优配置,说明规格冻结、离开闸不远,做本地部署预算的可以按 26B 总参 / A4B 激活这个量级先算显存。DeepSeek V4 则要做好「只有 API、没有权重」的心理准备,配合它这次计费调整,成本模型可能要重估。

唯一今天就能吃到的实惠是 llama.cpp #27590:Q5_K/Q6_K 点积走 AVX-512 双块 + VNNI,实测吞吐 1.2 倍,纯 CPU 跑量化模型的直接受益,不改权重格式。其余 vLLM 的权重热重载和 KvHints 是基础设施长线投资,短期无感。Qwen3-0.6B 加进 batch invariance 测试列表那条是纯噪音——那是文档 PR,跟发布无关,交叉验证的「无同版本权重」标记在这条上属误报,不必当信号。

原始条目

■ 框架 (7 条)

■ 媒体 (4 条)

摘要引擎:claude。
证据分级:官方 = 厂商博客/文档 release notes(官方口径);权重 = Hugging Face 新 repo(最硬的一手,常领先博文);框架 = transformers/vllm/llama.cpp 的加架构 PR(未发布的早期信号,领先数天到数周);媒体 = 二手转述,措辞可能失真。
已知覆盖缺口:x.ai 整站 Cloudflare 403(Grok 只能靠媒体转述);anthropic.com 无 RSS,改用 docs.claude.com release notes;Grok 靠 docs.x.ai/llms.txt 覆盖(Cloudflare 只拦 x.ai 网页、不拦文档站);Qwen 官网是 catch-all SPA,只能取到首页 banner 的文章 slug、抓不到正文;seed.bytedance.com 无可用 feed,靠 HF 权重通道兜。
本页内容由 modelwatch/modelwatch.py 自动生成。
AI News 与模型发布两个栏目由本机 cron 每晚自动抓取、LLM 摘要并发布;HBR 精读与股票分析为手工撰写、不定期更新,股票分析不构成投资建议。页面构建于 2026-10-03 23:55 CST。
源脚本:ainews-digest/ainews_digest.py、modelwatch/modelwatch.py;发布器:digest-site/publish.py。