过去两天没有任何厂商发布新模型——官方博客、release notes、HF 权重三条一手通道全空,无实质发布;真正的看点是框架侧的两条未发布信号:vLLM 的 fp8 MoE 调优配置里直接写出了「Gemma 4 26B A4B」的专家规格,以及连续两个 PR 在修 DeepSeek-V4 的流式工具调用解析。
今日无确认发布条目:本批抓取中没有官方发文,也没有任何厂商官方组织下的新权重上线。
这两天不需要动选型:没有一条能落地试用的新模型。唯一值得现在就跟的是 Gemma 4——vLLM 已经在为它写 GB10 的 fp8 MoE 调优配置,说明规格冻结、离开闸不远,做本地部署预算的可以按 26B 总参 / A4B 激活这个量级先算显存。DeepSeek V4 则要做好「只有 API、没有权重」的心理准备,配合它这次计费调整,成本模型可能要重估。
唯一今天就能吃到的实惠是 llama.cpp #27590:Q5_K/Q6_K 点积走 AVX-512 双块 + VNNI,实测吞吐 1.2 倍,纯 CPU 跑量化模型的直接受益,不改权重格式。其余 vLLM 的权重热重载和 KvHints 是基础设施长线投资,短期无感。Qwen3-0.6B 加进 batch invariance 测试列表那条是纯噪音——那是文档 PR,跟发布无关,交叉验证的「无同版本权重」标记在这条上属误报,不必当信号。
| 时间 | 通道 | 条目 |
|---|---|---|
| 08-23 20:38 | 框架 PR | gemma4 —— 框架侧 3 个 PR(transformers 1, vllm 2) |
| 08-23 19:57 | 框架 PR | deepseek4 —— 框架侧 2 个 PR(vllm 2) |
| 08-23 15:49 | 框架 PR | llama.cpp #27590: ggml-cpu: add AVX-512 and VNNI paths for Q5_K/Q6_K dot products |
| 08-23 13:58 | 框架 PR | vllm #53438: [Reload] Add manifest-driven streaming modelwise weight reload |
| 08-23 10:23 | 框架 PR | vllm #53423: [Feature] Add first-class KV hints request envelope for programmatic KV management |
| 08-23 10:21 | 框架 PR | vllm #53422: [Feature] Add PCP O-Proj tensor parallelism |
| 08-23 05:40 | 框架 PR | vllm #53403: [Docs] Add Qwen3-0.6B to batch invariance tested models |
| 时间 | 通道 | 条目 |
|---|---|---|
| 08-23 18:26 | 媒体转述 | DeepSeek计费再调整,大模型开启价值定价,谁能受益? - 新浪财经 |
| 08-22 19:24 | 媒体转述 | 神秘「牛来」大模型刷屏,限时免费 - me.news |
| 08-22 19:03 | 媒体转述 | 神秘「牛来」大模型刷屏 限时免费开放体验 - 36 Kr |
| 08-22 14:35 | 媒体转述 | Mama Llama Bakery’s famous cinnamon rolls set for cafe debut - FOX5 Vegas |
modelwatch/modelwatch.py 自动生成。ainews-digest/ainews_digest.py、modelwatch/modelwatch.py;发布器:digest-site/publish.py。