今天有两个实质发布:NVIDIA 开源了 30B MoE 模型 Nemotron 3.5 Lightning(面向常驻 Agent 场景,权重已上线),OpenAI 推出网络安全专用模型 GPT-5.6-Cyber 并扩展 Daybreak 准入计划;同时 DeepSeek V4、Kimi K3、Qwen3.5 三家在推理框架侧的适配动作非常密集,属于值得盯的临发布信号。
今天最值得动手试的是 Nemotron 3.5 Lightning:30B MoE、开源权重、首日全家桶格式支持,正好卡在单卡工作站能跑的甜点位,做本地常驻 Agent 或路由分流里的"干活小模型"很合适,配套的 NeMo Switchyard 路由库也值得看一眼。GPT-5.6-Cyber 战略意义大于实用意义——准入审批制注定大多数团队摸不到,但它标志着头部厂商开始为高危双用途能力单独开产品线。真正要盯的是信号面:DeepSeek V4 和 Qwen3.5 的框架适配已经细到数值语义和性能调优层面,按惯例这是发布前几周的典型形态,近期值得每天看一眼。AWS 上架、TCS 体验中心之类属于渠道噪音,可忽略。
| 时间 | 通道 | 条目 |
|---|---|---|
| 08-11 17:46 | HF 重大更新 | nvidia/NVIDIA-NemotronLabs-VoiceChat-11B 内容更新(仓库 12 天前就建好了) |
| 08-11 17:06 | HF 重大更新 | MiniMaxAI/MiniMax-H3 内容更新(仓库 14 天前就建好了) |
| 08-11 15:36 | HF 重大更新 | zai-org/GLM-5 内容更新(仓库 181 天前就建好了) |
| 08-10 10:44 | HF 新权重 | inclusionAI/Ling-3.0-tiny ×3 |
| 时间 | 通道 | 条目 |
|---|---|---|
| 08-11 22:37 | 框架 PR | vllm #51831: [Model] Support R3 capture with DeepGEMM MegaMoE |
| 08-11 21:05 | 框架 PR | deepseek4 —— 框架侧 4 个 PR(vllm 4) |
| 08-11 20:18 | 框架 PR | vllm #51815: [MoE][Humming] Enable group-32 W4A16 MoE via compressed-tensors checkpoints |
| 08-11 20:01 | 框架 PR | vllm #51812: [Bugfix] Align Qwen GDN gates with speculative tokens |
| 08-11 19:12 | 框架 PR | kimi3 —— 框架侧 3 个 PR(vllm 3) |
| 08-11 18:01 | 框架 PR | vllm #51797: [Model] Match Qwen3.5 GDN BF16 semantics |
| 08-11 16:50 | 框架 PR | gemma4 —— 框架侧 3 个 PR(llama.cpp 1, transformers 1, vllm 1) |
| 08-11 16:14 | 框架 PR | transformers #47894: fix(whisper): prevent NaN propagation in fbank feature extraction |
| 08-11 05:17 | 框架 PR | transformers #47887: fix(qwen3_5,qwen3_next): sample GatedDeltaNet A in float32 to avoid -… |
| 08-11 03:15 | 框架 PR | vllm #51724: [Do Not Merge] Enable W4A16 DSA |
| 08-11 00:54 | 框架 PR | vllm #51707: [Humming] Fuse Kimi SiTU activation + per-token FP8 quant on w2 path |
modelwatch/modelwatch.py 自动生成。ainews-digest/ainews_digest.py、modelwatch/modelwatch.py;发布器:digest-site/publish.py。