AI 情报站

大模型发布监控41 条

2026-09-11

回看 2 天 · 新增 41 条(媒体 12,框架 11,官方 11,权重 7)

⚠️ 以下源疑似停更/换阵地(能正常抓取但最新条目很旧,属于不可见的覆盖缺口,需人工换源):Qwen Blog(353 天前)

一句话总览

今天最硬的一条是 DeepSeek-V4.1-Flash 权重登陆 Hugging Face(FP8、图文多模态),vLLM 侧已有大批 V4.1 适配 PR 跟进,媒体则集中在"HBM 用量大减、芯片股下跌"的叙事上。OpenAI 同日在 API 侧上线了全双工语音模型 GPT-Live-1 和托管型 Agents API,官方博文里已把 GPT-6 Astra 当作现成旗舰引用。

正式发布

早期信号

媒体转述(二手)

判断

值得马上跟进的只有 DeepSeek-V4.1-Flash:FP8 开源权重、原生多模态、vLLM 主线已并入支持,如果媒体说的"低 HBM 占用"属实,会直接影响自托管的显存与成本预算,建议等官方技术报告出来后第一时间在本地 GPU 上试跑。OpenAI 这波是产品与 API 形态的变化而非新基座:GPT-Live-1 对做语音 agent 的团队有选型意义,Agents API 则和 Anthropic Managed Agents 形成对标,两家托管 agent 运行时的定价与权限模型值得放在一起比较。早期信号里 Qwen4Exp 与 Qwen3.6 两个名字同一天出现在 vLLM,是 Qwen 下一轮发布最强的预告,建议持续盯。NVIDIA 的一堆 Nemotron 3.5 权重刷新、GLM-OCR、IBM 时序模型都是常规迭代,不改选型。

原始条目

■ 官方 (11 条)

■ 权重 (7 条)

■ 框架 (11 条)

■ 媒体 (12 条)

摘要引擎:claude。
证据分级:官方 = 厂商博客/文档 release notes(官方口径);权重 = Hugging Face 新 repo(最硬的一手,常领先博文);框架 = transformers/vllm/llama.cpp 的加架构 PR(未发布的早期信号,领先数天到数周);媒体 = 二手转述,措辞可能失真。
已知覆盖缺口:x.ai 整站 Cloudflare 403(Grok 只能靠媒体转述);anthropic.com 无 RSS,改用 docs.claude.com release notes;Grok 靠 docs.x.ai/llms.txt 覆盖(Cloudflare 只拦 x.ai 网页、不拦文档站);Qwen 官网是 catch-all SPA,只能取到首页 banner 的文章 slug、抓不到正文;seed.bytedance.com 无可用 feed,靠 HF 权重通道兜。
本页内容由 modelwatch/modelwatch.py 自动生成。
AI News 与模型发布两个栏目由本机 cron 每晚自动抓取、LLM 摘要并发布;HBR 精读与股票分析为手工撰写、不定期更新,股票分析不构成投资建议。页面构建于 2026-10-03 23:55 CST。
源脚本:ainews-digest/ainews_digest.py、modelwatch/modelwatch.py;发布器:digest-site/publish.py。