引言

今日AI领域动态频出,Google DeepMind、Meta、阿里等密集发布新模型,Anthropic与Cursor更新产品能力,同时资本与政策层面也有重大进展。

模型与能力

1. Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型

Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型。deepmind.google:Blog ↗
补充来源:blog.google:Blog ↗

2. Meta 发布 Muse Spark 1.3,智能体与科学推理能力提升

Meta 发布 Muse Spark 1.3,为五个月内第四个版本,xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。X:alexandr_wang (@alexandr_wang) ↗
补充来源:research.meta.ai:Blog ↗

3. Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿

通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现可在 QwenCloud 试用。X:Alibaba_Qwen (@Alibaba_Qwen) ↗
补充来源:微信公众号 ↗

4. 美团 LongCat-2.0 上线 Cline 免费试用

该条目暂无摘要。X:Meituan_LongCat (@Meituan_LongCat) ↗

5. Multiverse Computing 推出 Quasar 438B

Multiverse Computing 推出 4380 亿参数推理模型 Quasar 438B,官方称在 Artificial Analysis 评测中为最强欧洲模型,已开放 API。X:MultiverseCompu (@MultiverseCompu) ↗

6. fal 推出 MiniMax H3 Max Turbo 预览版,速度翻倍成本减半

fal 发布 MiniMax H3 Max Turbo 预览版,速度翻倍、成本减半,已开放试用;fal 称质量约为原版 97%,促销价为期两周。X:fal (@fal) ↗

7. 网友推测 gpt-6-astra 已部署至 OpenAI API

有用户实测发现,OpenAI API 对模型标识 gpt-6-astra 返回 404 错误,而不存在的模型名返回 400 错误,据此推测新模型已部署、即将发布。X:synthwavedd (@synthwavedd) ↗

8. 马斯克宣布 Grok 4.7 将于十天后推出

马斯克宣布 Grok 4.7 模型将于 10 天后推出。他此前曾透露该模型参数达 2.1 万亿,整体优于前代且有望超越竞品,但速度可能略慢。X:elonmusk (@elonmusk) ↗

9. Claude最强Fable 5.1发布:8项榜单居首,最高降价45%,反蒸馏机制上线

无论此前让Claude处理什么任务,Fable 5.1都能做更多,并将最难的部分完成得更出色。量子位 ↗

10. 阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一

该条目暂无摘要。量子位 ↗

产品与应用

11. UU远程新版本上线:完整 TUI 渲染与多终端会话管理

9月2日上线新版本,优化终端功能,补齐 TUI 渲染交互与会话管理;更新包括 Mac 免密登录、移动端独立输入框及多终端会话跨端同步接管(uuyc-cli lterm)。微信公众号 ↗

12. Claude Cowork 和 Claude Code 支持后台操作电脑

Claude Cowork 和 Claude Code 新增后台使用电脑能力。用户交办任务后,Claude 可像人一样点击、输入并打开应用,用户可同时处理其他事务。X:claudeai (@claudeai) ↗

13. Anthropic 上线 Claude Content Checker 文件来源检测工具

Anthropic 上线 Claude Content Checker,可检查文件是否带有 Claude 签发的 C2PA Content Credential,判断 Claude 是否参与文件生成或处理;文本水印无法通过该网页工具检查,Anthropic 另有 Detection API。claude.com ↗

14. SkyProduction天工工作台:从剧本到成片的一站式短剧创作平台

SkyProduction(天工工作台)全新版本于8月31日正式上线。量子位 ↗

15. WorkBuddy开放平台上线,开放Agent基座能力

WorkBuddy开放平台正式上线,面向智能硬件、行业应用与开发者开放底层Agent能力,首批引入超百家生态伙伴。微信公众号 ↗

16. 百融硅基企业级Agent批量上岗,AI客服日处理1.5万通电话

企业级Agent落地应用,AI客服每日处理1.5万通电话,按结果结算。量子位 ↗

17. Swiggy 使用 350+ 特征和多任务 MLP 预测客户生命周期价值

Swiggy 开发了一款内部预测生命周期价值模型,该模型使用 350 多个预购特征和多任务 MLP,应用于 Food 和 Instamart 业务。将订单量作为辅助任务使模型参数减少了 63%,同时提升了预测性能。该 pLTV 信号与 Google Target ROAS 竞价结合使用,以优化客户获取。InfoQ AI ↗

18. 海信JUOS正式发布:行业首个家庭智能伴侣级AIOS

海信正式发布行业首个家庭智能伴侣级AIOS——海信JUOS。量子位 ↗

19. 香港首个真实开放场景服务机器人落地兰桂坊

在香港兰桂坊,一位特殊的“酒保”正式上岗。量子位 ↗

开发与基础设施

20. Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行

Cursor 发布 Self-Hosted Machines,将云智能体工具执行迁移至企业自有网络内机器;智能体循环、推理与规划仍留在 Cursor 云端,通过 worker 出站 HTTPS 连接对接,Cursor 不主动连入企业网络。cursor.com:Blog ↗

21. Perplexity 开源本地推理引擎 Lily

Perplexity 开源为 Perplexity Computer 混合计算打造的本地推理引擎 Lily,专为 Apple silicon 上运行 Qwen3.6-35B-A3B 特化,已在 GitHub 公开。perplexity.ai:Blog ↗

22. Cloudflare 新增可选 OAuth 作用域,允许开发者标记用户可拒绝的权限

Cloudflare 新增了可选 OAuth 作用域,允许客户端所有者标记用户在授权时可取消哪些权限。该公司将 MCP 服务器作为推动此功能的动机案例,因为代理会请求其可能执行的所有操作的并集。部分授权在其他地方存在,但开发者对哪些作用域可被删除的控制尚属首创。InfoQ AI ↗

公司与资本

23. Nvidia 接近以 129 亿美元收购 Hugging Face

Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议;该价格约为 Hugging Face 2023 年 45 亿美元估值的 2.9 倍,并拟含 10 亿美元员工留任方案。X:rohanpaul_ai (@rohanpaul_ai) ↗

政策与安全

24. OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼,被指协助教唆

OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。The Verge ↗

25. 美司法部就 OpenAI 版权诉讼提交意见书,支持模型训练属合理使用

美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般属合理使用,称其具有非凡转换性,并警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书不具约束力,数据获取与输出复制问题仍由法院逐案判断。X:rohanpaul_ai (@rohanpaul_ai) ↗
补充来源:the-decoder.com ↗

26. OpenAI 回应 Astra「不可监控」争议

Astra 采用 recurrent depth 推理,在改善成本与性能的同时引发模型内部推理更难监控的担忧;OpenAI 首席科学家 Jakub Pachocki 澄清前沿模型实际计算深度仍在 GPT-4 两倍范围内,并警告勿因误读报道而竞相牺牲思维链可监控性。X:merettm (@merettm) ↗

论文与研究

27. Proximal 发布 FrontierSWE v2 基准

Proximal 团队发布 FrontierSWE v2 基准,包含 34 项超长时程任务,每项预算 20 小时。frontierswe.com:Blog ↗

28. 蚂蚁集团OmniTable获VLDB工业最佳论文,提升大模型数据处理效率

蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。量子位 ↗

观点与教程

29. GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本

GitHub 工程师分享 Copilot 降本的四项改动:选择性压缩工具输出;移除 view 工具行号前缀(线下推理成本降约 5%,线上日均推理成本降约 3%);压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%);后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。GitHub Blog:Blog ↗

30. Google 总结 AI Agents Challenge 最强提交背后的 4 个工程模式

Google 复盘 AI Agents Challenge,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。developers.googleblog.com:Blog ↗

31. 什么是 Harness 工程:Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

Google 员工介绍 harness 工程,即用确定性组件包裹 LLM,包含编排层、执行沙箱、状态持久化和验证工具,使 Agent 无需逐行人工审查即可安全生成代码。dev.to ↗

32. Google AI 团队分享为 LLM-as-a-Judge 评测编写可靠评分标准的方法

Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,并给出四条经验:问题保持原子化且互不重叠、仅评估客观事实、只评 prompt 明确要求的内容、用专家标注的 golden set 校准评判模型。dev.to ↗

33. Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现

Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。claude.com:Blog ↗
补充来源:claude.com:Blog ↗

34. 今年最难的机器人Demo:“机器人含量”为0

遥操技术可能面临危险。量子位 ↗

35. 演讲:超越提示词:面向生产级 AI 的上下文工程

Ricardo Ferreira 探讨了如何超越简单的提示词工程来构建生产级 AI 应用。他分享了使用 Redis 集成长短期记忆、通过摘要管理 LLM token 限制、利用重排和语义缓存缓解上下文衰减,以及在严格延迟约束下控制指数级 API 成本的实用架构策略。InfoQ AI ↗

36. 大规模简化AI集成

随着企业规模扩大,支持运营的技术可能迅速从资产变为负担。断连的系统、特定工具和人工变通会产生数据孤岛,导致难以及早发现问题、协调响应和自信决策。对于全球制造企业 Jabil 而言……。MIT科技评论AI ↗

人物与动态

37. 前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局

9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能。量子位 ↗

今日脉络

  • 头部厂商密集发布新模型
    Google DeepMind发布Gemini 3.8 Flash与Cyber,Meta发布Muse Spark 1.3,阿里发布Qwen3.8-Max-0902登顶Code Arena,Claude发布Fable 5.1。

  • AI产品与开发工具持续演进
    Anthropic为Claude Cowork和Claude Code新增后台操作电脑能力并上线文件来源检测工具,Cursor推出Self-Hosted Machines支持云智能体在企业自有机器执行。

  • 资本并购与版权政策引关注
    Nvidia接近以129亿美元收购Hugging Face,美国司法部就OpenAI版权诉讼提交意见书支持训练属合理使用,OpenAI回应Astra模型内部推理不可监控争议。

总结

整体来看,AI大模型竞争进入高频迭代期,底层能力与上层应用同步推进。同时,版权争议与资本并购预示着行业生态与规则正在加速重构。