引言

今日 AI 动态集中在模型发布与开放、产品能力上线、推理成本变化及智能体工程实践,开源模型和本地化部署继续成为讨论重点。

模型与能力

1. DeepSeek V4 Pro 上线 SiliconFlow,支持 1M 上下文

DeepSeek-V4-Pro-0813 上线 SiliconFlow,提供 1M 上下文窗口和三档推理强度,侧重编码、工具调用与智能体工作流,并保持 MIT 开源协议。X:SiliconFlowAI (@SiliconFlowAI) ↗

2. GLM-5.3 发布:编程能力提升,并展现网络安全能力

智谱发布 GLM-5.3,通过后训练 Scaling 提升能力。其编程能力较前代提升 50%,在 Terminal Bench 3.0 等公开基准中位居开源模型第一;在白盒代码审查和 CyberGym 等安全任务中也有表现。模型权重计划两周后开源,并已上线 ZCode、AutoClaw 等工具。微信公众号 ↗

3. dots3-note Preview 开源:280B 参数,面向长程智能体与多模态推理

小红书技术开源 dots3-note Preview。该模型总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。微信公众号 ↗

4. GLM-5.3 发布:Coding 更接近 Fable 5,揪出潜伏 40 年的 bug

GLM-5.3 发布,Coding 更接近 Fable 5,并拿下最强开源安全模型。量子位 ↗

5. Qwen3.8-27B 开源,家用显卡可运行

所有人均可免费下载、部署及商用。量子位 ↗

6. Meta 开源 Muse Glimmer:面向端侧执行优化的 30B 本地智能体模型

Meta AI Research 推出 Muse Glimmer。这是一款采用 Apache 2.0 许可证的 300 亿参数开放权重模型,面向本地工作流。它无需依赖云端 API,即可在消费级 GPU 上支持自主智能体和复杂任务执行。该模型采用多阶段训练以提升效率,并支持多模态输入,用于编码和自动化任务。InfoQ AI ↗

产品与应用

7. Gemini 3.7 Flash 向 Pro 和 Ultra 用户上线

Gemini 3.7 Flash 已向 Gemini 聊天中的 Pro 和 Ultra 用户开放,提升多步骤任务的推理与准确性,例如整合数十个文件和邮件生成主文档。Gemini Spark 也已运行于 3.7 Flash,并改进了对 Google Workspace 应用的工具调用。X:GeminiApp (@GeminiApp) ↗

8. 百度文库网盘「库库AI」AI办公MAU超2500万,新推办公独立端

该条目暂无摘要。量子位 ↗

开发与基础设施

9. Claude Code v2.1.233 发布,支持 GitLab MR

Claude Code v2.1.233 为 --worktree 标志和 agents 视图增加 GitLab 合并请求 URL 支持,并新增可选的 forward_user_identity 网关设置。GitHub ↗

10. OpenRouter 指南:通过 API 向多模态模型发送图像

OpenRouter 发布指南,说明如何通过 Chat Completions API 向多模态模型发送图像。请求使用 messages 数组,content 可包含 text 和 image_url,支持公开 URL 或 base64 数据 URL,以及 PNG、JPEG、WebP 和 GIF。openrouter.ai:Blog ↗

11. 算力需求两年增长10倍,机器人正加速进入真实物理世界

成本可减少一半,部署效率提升80%,机器人研发无需重复造轮子。量子位 ↗

12. 太初元碁助力国家级“AI+教育”大赛 “AI+加速卡模型适配赛道”开启招募

该条目暂无摘要。量子位 ↗

公司与资本

13. SpaceX 正式收购 Cursor

Cursor 完成自 4 月启动的收购流程。合并后将获得大型 GPU 集群,用于构建更强、成本更低的模型,并以更低价格向客户提供更强模型。Grok 4.6 是双方合作的早期成果。cursor.com:Blog ↗

14. OpenAI 与 Anthropic 降价,中国 AI 厂商竞争加剧

模型 API 降价使成本弹性更加明显,曾因账单压力转向中国厂商的用户可能重新比较模型能力与价格。arstechnica.com ↗

15. 印尼首个大学 AI 技术中心启动

印尼通信与数字事务部、Indosat、NVIDIA 与加查马达大学在日惹共同启动 UGM Indosat NVIDIA AI 技术中心,这是印尼首个大学 AI 技术中心。blogs.nvidia.com:Blog ↗

16. Google 调整 DeepMind,多个团队划归总部

布林亲自督战。量子位 ↗

17. 德塔智能与舞肌科技达成战略合作,联合规范全身协同灵巧操作数据采集

该条目暂无摘要。量子位 ↗

政策与安全

18. Claude 文本水印机制

未来 Claude 生成的文本将包含水印,用于判断其由 Claude 撰写的可能性。该变更旨在遵守欧盟《AI 法案》,基于 Google DeepMind 的 SynthID-Text 技术,不影响输出质量、创造力和可读性,也不增加 token 或成本。Anthropic ↗

论文与研究

19. 蚂蚁百灵与ASystem验证单机Agentic RL后训练闭环

团队以Ling-3.0-tiny和AReno在DGX Spark上进行单机Agentic RL后训练验证。井字棋实验使用GSPO训练400步后,rollout/rewards_mean由约-0.5升至0.4,response_len降至约850 tokens,工具调用和动作选择趋于稳定。微信公众号 ↗

观点与教程

20. 2026年夏季开源模型生态观察:中国前沿模型规模领先

2026年1至8月,Hugging Face公开模型仓库由243万增至296万,但85.6%的模型下载不足200次,1.5%的仓库占99.2%的下载量。中国实验室月度最大开源模型规模为754B至2.78万亿参数;AMD与NVIDIA各新增超过200个模型仓库。Hugging Face:Blog ↗

21. OpenRouter 数据:84%的 token 来自非前沿模型

OpenRouter 数据显示,84%的模型 token 并非来自 SOTA 模型。用户最常用的六款模型性能约为前沿模型的 77%,成本显著更低;企业正转向更小、微调或开源模型以优化性价比。tomtunguz.com ↗

22. 如何提升Claude Code会话的token使用效率

Claude Code成本受模型、输入输出token和提示缓存影响,输出token价格约为输入的5倍。任务间使用/clear可减少无关上下文;会话中切换模型或effort级别会破坏提示缓存并增加成本。claude.com:Blog ↗

23. Databricks 解析数据仓库中的 AI_Functions 用例

Databricks 探讨 AI_Functions 在数据仓库中的主要应用场景,帮助组织处理非结构化数据,并将 AI 能力直接集成到 SQL 工作流中。databricks.com:Blog ↗

24. 300个正确Token胜过10万个噪声Token:上下文工程架构

Baruch Sadogursky与Patrick Debois探讨编码代理因上下文窗口膨胀和提示词堆塞而失效的原因,并介绍延迟加载技能、版本化上下文工件、外部记忆库和LLM-as-a-judge评测等实用改进方法,帮助软件架构师和工程负责人将原始Markdown文件转化为可靠的代理工作流。InfoQ AI ↗

人物与动态

25. 余家辉离职 Meta 创业,任职仅一年

余家辉在 Meta 仅任职一年。量子位 ↗

今日脉络

  • 模型发布与开放持续推进
    DeepSeek-V4-Pro-0813 上线 SiliconFlow,支持 1M 上下文、三档推理强度,并保持 MIT 开源协议。智谱发布 GLM-5.3,编程能力较前代提升 50%,模型权重计划两周后开源;小红书技术开源 dots3-note Preview,支持 512K 上下文和文本、视觉、语音多模态理解。

  • 产品与开发工具加快落地
    Gemini 3.7 Flash 已向 Gemini 聊天中的 Pro 和 Ultra 用户开放,强化多步骤任务推理及 Google Workspace 工具调用。Claude Code v2.1.233 增加 GitLab 合并请求 URL 支持和用户归因设置,OpenRouter则发布多模态图像请求指南。

  • 成本与开源生态成为竞争变量
    OpenAI 与 Anthropic 的模型 API 降价,使用户重新比较模型能力与价格。OpenRouter 数据显示,84% 的模型 token 来自非前沿模型;Hugging Face 观察显示,模型仓库数量增长明显,但下载量高度集中。

  • 智能体工程与安全实践推进
    蚂蚁百灵与 ASystem 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环,井字棋实验中工具调用和动作选择趋于稳定。Anthropic 介绍 Claude 文本水印机制,未来生成文本将包含用于判断来源可能性的水印,且不增加额外 token 或成本。

总结

从模型参数规模和上下文能力,到 API 价格、本地运行与智能体后训练,AI 竞争正同时向能力、成本和工程可用性展开。开发者需要结合任务复杂度、部署条件与预算选择合适模型,并关注开放权重和工具生态的变化。