引言
今日AI领域动态频出,Google DeepMind、Meta、阿里等密集发布新模型,Anthropic与Cursor更新产品能力,同时资本与政策层面也有重大进展。
模型与能力
1. Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber 两款新模型。deepmind.google:Blog ↗
补充来源:blog.google:Blog ↗
2. Meta 发布 Muse Spark 1.3,智能体与科学推理能力提升
Meta 发布 Muse Spark 1.3,为五个月内第四个版本,xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。X:alexandr_wang (@alexandr_wang) ↗
补充来源:research.meta.ai:Blog ↗
3. Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿
通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现可在 QwenCloud 试用。X:Alibaba_Qwen (@Alibaba_Qwen) ↗
补充来源:微信公众号 ↗
4. 美团 LongCat-2.0 上线 Cline 免费试用
5. Multiverse Computing 推出 Quasar 438B
Multiverse Computing 推出 4380 亿参数推理模型 Quasar 438B,官方称在 Artificial Analysis 评测中为最强欧洲模型,已开放 API。X:MultiverseCompu (@MultiverseCompu) ↗
6. fal 推出 MiniMax H3 Max Turbo 预览版,速度翻倍成本减半
fal 发布 MiniMax H3 Max Turbo 预览版,速度翻倍、成本减半,已开放试用;fal 称质量约为原版 97%,促销价为期两周。X:fal (@fal) ↗
7. 网友推测 gpt-6-astra 已部署至 OpenAI API
有用户实测发现,OpenAI API 对模型标识 gpt-6-astra 返回 404 错误,而不存在的模型名返回 400 错误,据此推测新模型已部署、即将发布。X:synthwavedd (@synthwavedd) ↗
8. 马斯克宣布 Grok 4.7 将于十天后推出
马斯克宣布 Grok 4.7 模型将于 10 天后推出。他此前曾透露该模型参数达 2.1 万亿,整体优于前代且有望超越竞品,但速度可能略慢。X:elonmusk (@elonmusk) ↗
9. Claude最强Fable 5.1发布:8项榜单居首,最高降价45%,反蒸馏机制上线
无论此前让Claude处理什么任务,Fable 5.1都能做更多,并将最难的部分完成得更出色。量子位 ↗
10. 阿里更新旗舰模型Qwen3.8-Max,前端编程能力跃居全球第一
该条目暂无摘要。量子位 ↗
产品与应用
11. UU远程新版本上线:完整 TUI 渲染与多终端会话管理
9月2日上线新版本,优化终端功能,补齐 TUI 渲染交互与会话管理;更新包括 Mac 免密登录、移动端独立输入框及多终端会话跨端同步接管(uuyc-cli lterm)。微信公众号 ↗
12. Claude Cowork 和 Claude Code 支持后台操作电脑
Claude Cowork 和 Claude Code 新增后台使用电脑能力。用户交办任务后,Claude 可像人一样点击、输入并打开应用,用户可同时处理其他事务。X:claudeai (@claudeai) ↗
13. Anthropic 上线 Claude Content Checker 文件来源检测工具
Anthropic 上线 Claude Content Checker,可检查文件是否带有 Claude 签发的 C2PA Content Credential,判断 Claude 是否参与文件生成或处理;文本水印无法通过该网页工具检查,Anthropic 另有 Detection API。claude.com ↗
14. SkyProduction天工工作台:从剧本到成片的一站式短剧创作平台
SkyProduction(天工工作台)全新版本于8月31日正式上线。量子位 ↗
15. WorkBuddy开放平台上线,开放Agent基座能力
WorkBuddy开放平台正式上线,面向智能硬件、行业应用与开发者开放底层Agent能力,首批引入超百家生态伙伴。微信公众号 ↗
16. 百融硅基企业级Agent批量上岗,AI客服日处理1.5万通电话
企业级Agent落地应用,AI客服每日处理1.5万通电话,按结果结算。量子位 ↗
17. Swiggy 使用 350+ 特征和多任务 MLP 预测客户生命周期价值
Swiggy 开发了一款内部预测生命周期价值模型,该模型使用 350 多个预购特征和多任务 MLP,应用于 Food 和 Instamart 业务。将订单量作为辅助任务使模型参数减少了 63%,同时提升了预测性能。该 pLTV 信号与 Google Target ROAS 竞价结合使用,以优化客户获取。InfoQ AI ↗
18. 海信JUOS正式发布:行业首个家庭智能伴侣级AIOS
海信正式发布行业首个家庭智能伴侣级AIOS——海信JUOS。量子位 ↗
19. 香港首个真实开放场景服务机器人落地兰桂坊
在香港兰桂坊,一位特殊的“酒保”正式上岗。量子位 ↗
开发与基础设施
20. Cursor 推出 Self-Hosted Machines,云智能体可在企业自有机器上执行
Cursor 发布 Self-Hosted Machines,将云智能体工具执行迁移至企业自有网络内机器;智能体循环、推理与规划仍留在 Cursor 云端,通过 worker 出站 HTTPS 连接对接,Cursor 不主动连入企业网络。cursor.com:Blog ↗
21. Perplexity 开源本地推理引擎 Lily
Perplexity 开源为 Perplexity Computer 混合计算打造的本地推理引擎 Lily,专为 Apple silicon 上运行 Qwen3.6-35B-A3B 特化,已在 GitHub 公开。perplexity.ai:Blog ↗
22. Cloudflare 新增可选 OAuth 作用域,允许开发者标记用户可拒绝的权限
Cloudflare 新增了可选 OAuth 作用域,允许客户端所有者标记用户在授权时可取消哪些权限。该公司将 MCP 服务器作为推动此功能的动机案例,因为代理会请求其可能执行的所有操作的并集。部分授权在其他地方存在,但开发者对哪些作用域可被删除的控制尚属首创。InfoQ AI ↗
公司与资本
23. Nvidia 接近以 129 亿美元收购 Hugging Face
Bloomberg 报道 Nvidia 正接近以约 129 亿美元收购 Hugging Face,交易总额可能达约 140 亿美元,双方尚未达成最终协议;该价格约为 Hugging Face 2023 年 45 亿美元估值的 2.9 倍,并拟含 10 亿美元员工留任方案。X:rohanpaul_ai (@rohanpaul_ai) ↗
政策与安全
24. OpenAI 因 Tumbler Ridge 枪击案面临 30 起新诉讼,被指协助教唆
OpenAI 及 CEO Sam Altman 面临 30 起新诉讼,指控其为加拿大 Tumbler Ridge 校园枪击案嫌疑人提供实质性协助与鼓励,诉讼由事发时在校的学生、教师和校长于加州联邦法院提起。The Verge ↗
25. 美司法部就 OpenAI 版权诉讼提交意见书,支持模型训练属合理使用
美国司法部在 OpenAI 与纽约时报的版权诉讼中提交意见书,主张用受版权文本训练 LLM 一般属合理使用,称其具有非凡转换性,并警告全面许可要求会削弱美国 AI 开发者竞争力。该意见书不具约束力,数据获取与输出复制问题仍由法院逐案判断。X:rohanpaul_ai (@rohanpaul_ai) ↗
补充来源:the-decoder.com ↗
26. OpenAI 回应 Astra「不可监控」争议
Astra 采用 recurrent depth 推理,在改善成本与性能的同时引发模型内部推理更难监控的担忧;OpenAI 首席科学家 Jakub Pachocki 澄清前沿模型实际计算深度仍在 GPT-4 两倍范围内,并警告勿因误读报道而竞相牺牲思维链可监控性。X:merettm (@merettm) ↗
论文与研究
27. Proximal 发布 FrontierSWE v2 基准
Proximal 团队发布 FrontierSWE v2 基准,包含 34 项超长时程任务,每项预算 20 小时。frontierswe.com:Blog ↗
28. 蚂蚁集团OmniTable获VLDB工业最佳论文,提升大模型数据处理效率
蚂蚁集团推出统一宽表系统OmniTable,论文获评VLDB 2026工业赛道最佳论文。量子位 ↗
观点与教程
29. GitHub Copilot 如何在不牺牲任务质量的前提下降低 AI 编码成本
GitHub 工程师分享 Copilot 降本的四项改动:选择性压缩工具输出;移除 view 工具行号前缀(线下推理成本降约 5%,线上日均推理成本降约 3%);压缩 task-tool 提示词(每轮省约 1300 token,每活跃小时归一化成本降 2.9%);后台任务完成后直接交付结果(AI Credits 用量降约 2.3%)。GitHub Blog:Blog ↗
30. Google 总结 AI Agents Challenge 最强提交背后的 4 个工程模式
Google 复盘 AI Agents Challenge,从各赛道头部提交中提炼出四个工程模式:双向 MCP、事件驱动并发、同标准回退和分层路由。developers.googleblog.com:Blog ↗
31. 什么是 Harness 工程:Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环
Google 员工介绍 harness 工程,即用确定性组件包裹 LLM,包含编排层、执行沙箱、状态持久化和验证工具,使 Agent 无需逐行人工审查即可安全生成代码。dev.to ↗
32. Google AI 团队分享为 LLM-as-a-Judge 评测编写可靠评分标准的方法
Google AI 团队发布教程,讲解如何为 LLM-as-a-Judge 评测编写可靠的布尔式评分标准,并给出四条经验:问题保持原子化且互不重叠、仅评估客观事实、只评 prompt 明确要求的内容、用专家标注的 golden set 校准评判模型。dev.to ↗
33. Anthropic 发布电商 Agent 架构与生产实践指南,并开源 commerce-agents 参考实现
Anthropic 发布电商 Agent 构建指南,基于与零售、旅游、电信等团队的落地经验,核心架构是单个 Claude 在标准 Agent 循环中配合技能与工具,而非按领域拆分子智能体,并开源了 anthropics/commerce-agents 参考实现,含购物与商家 Agent。claude.com:Blog ↗
补充来源:claude.com:Blog ↗
34. 今年最难的机器人Demo:“机器人含量”为0
遥操技术可能面临危险。量子位 ↗
35. 演讲:超越提示词:面向生产级 AI 的上下文工程
Ricardo Ferreira 探讨了如何超越简单的提示词工程来构建生产级 AI 应用。他分享了使用 Redis 集成长短期记忆、通过摘要管理 LLM token 限制、利用重排和语义缓存缓解上下文衰减,以及在严格延迟约束下控制指数级 API 成本的实用架构策略。InfoQ AI ↗
36. 大规模简化AI集成
随着企业规模扩大,支持运营的技术可能迅速从资产变为负担。断连的系统、特定工具和人工变通会产生数据孤岛,导致难以及早发现问题、协调响应和自信决策。对于全球制造企业 Jabil 而言……。MIT科技评论AI ↗
人物与动态
37. 前字节强化学习专家孙鹏博士加盟星尘智能,完善Physical AI全栈技术布局
9月2日,前字节跳动强化学习专家、前腾讯Robotics X智能体中心负责人孙鹏博士正式加入星尘智能。量子位 ↗
今日脉络
-
头部厂商密集发布新模型
Google DeepMind发布Gemini 3.8 Flash与Cyber,Meta发布Muse Spark 1.3,阿里发布Qwen3.8-Max-0902登顶Code Arena,Claude发布Fable 5.1。 -
AI产品与开发工具持续演进
Anthropic为Claude Cowork和Claude Code新增后台操作电脑能力并上线文件来源检测工具,Cursor推出Self-Hosted Machines支持云智能体在企业自有机器执行。 -
资本并购与版权政策引关注
Nvidia接近以129亿美元收购Hugging Face,美国司法部就OpenAI版权诉讼提交意见书支持训练属合理使用,OpenAI回应Astra模型内部推理不可监控争议。
总结
整体来看,AI大模型竞争进入高频迭代期,底层能力与上层应用同步推进。同时,版权争议与资本并购预示着行业生态与规则正在加速重构。
评论 (0)
发表评论
请先登录后发表评论