引言

今日动态聚焦于开源模型与本地部署、智能体工作流进入桌面和企业协作环境,以及开发者基础设施围绕数据驻留、合规与代码迁移持续扩展。

模型与能力

1. NVIDIA 推出 Nemotron 3.5 Lightning,面向本地常驻智能体

NVIDIA 发布可定制的开源 30B MoE 模型 Nemotron 3.5 Lightning,面向常驻智能体任务。相比同类开源模型,token 生成速度最高提升 4 倍,任务完成时间缩短 30%,支持微调并可运行于 RTX PC、DGX Spark 和 Jetson 等设备。blogs.nvidia.com:Blog ↗
补充来源:developer.nvidia.com:Blog ↗lmsys.org:Blog ↗

2. OpenAI 的 Astra 模型解决 10 道数学难题,数学家既兴奋又担忧

OpenAI 表示,其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涉及球体堆积、纠错码和非 sofic 群存在性等领域,并发布超过 250 页的论文及 Lean 验证结果。The Verge ↗

3. 消息称 NVIDIA 开发万亿参数开源 AI 模型 Nemotron 4

消息称,NVIDIA 正研发新一代开源 AI 模型 Nemotron 4,最大模型预计至少拥有 1 万亿参数,目标与顶级开源模型竞争。最终训练尚未完成,发布日期未定。ithome.com ↗

4. 蚂蚁百灵开源 Ling-3.0-tiny

Ling-3.0-tiny 是原生混合推理模型,总参数量 7.9B,推理时激活 1.3B 参数,并提供 BF16、FP8 和 INT4 版本。微信公众号 ↗

5. Bilibili IndexTeam 发布开源 IndexTTS-2.5 语音克隆模型

Bilibili 正式发布 IndexTTS-2.5 零样本语音克隆模型权重,支持中文、英文、日文、西班牙文和阿拉伯文五种语言的跨语种迁移。模型重构架构以提升推理效率,并增强发音与情感控制,支持 0.5 至 2 倍语速调节;代码与权重已在相关平台发布。GitHub ↗

6. LTX 发布开源世界模型 LTX-2.5

LTX 发布开源世界模型 LTX-2.5,可根据图文和视频生成高保真音视频,实现原生多镜头场景与角色一致。模型引入扩散保真渲染以提升细节,开放权重,最低 16GB 显存即可本地运行。ltx.io ↗

7. 商汤发布 SenseNova 6.8 Flash Lite Preview 预览版

商汤上线多模态模型 SenseNova 6.8 Flash Lite Preview,用户可通过 SenseNova Token Plan 抢先体验,每 5 小时享有 1500 次限时免费额度。官方表示,SenseNova 6.8 Flash Lite 正式版和 6.8 Flash 模型预计本月发布。微信公众号 ↗

8. Claude 以未公开新模型刷新黎曼猜想纪录

该模型将相关下界大幅推高。量子位 ↗

9. 蚂蚁数亿元押注机器人触觉,全球首个“物理交互脑”发布

资本正从具身本体转向触觉领域。量子位 ↗

产品与应用

10. Runway 上线 Seedance 2.5,支持 50 个角色参考

Seedance 2.5 已在 Runway 上线,支持 50 个独特角色参考,以及最长 30 秒、与音乐同步的视频片段。X:runwayml (@runwayml) ↗

11. 微信小微内测朋友圈AI帮写与AI点评

微信小微内测朋友圈AI帮写和AI点评:可基于图片及已有文字生成3条文案,也可长按文字生成评价或快捷评论。文章认为,这可能推动AI内容进入社交互动并影响创作者生产。微信公众号 ↗

12. ChatGPT 桌面端支持导入智能体工作数据

ChatGPT 桌面应用支持将其他智能体的项目、聊天记录、技能和插件导入 ChatGPT Work 与 Codex,并可查看导入历史和设置自动更新。X:OpenAI Developers (@OpenAIDevs) ↗
补充来源:learn.chatgpt.com ↗

13. OpenAI 推出 ChatGPT 桌面应用 Linux 预览版

ChatGPT 桌面应用推出 Linux 预览版,支持 ChatGPT、ChatGPT Work 和 Codex,可用于指定 Debian、Fedora 等发行版的 x64 与 ARM64 架构。X:OpenAI (@OpenAI) ↗

14. SpaceXAI 发布 Grok Bot,Elon Musk 预告本周推出 Grok 4.6

SpaceXAI 推出 Grok Bot 早期测试版。该 Agent 拥有独立云端计算机,可登录已有工具及无公开 API 的平台完成多步骤任务;目前向 SuperGrok Heavy 等订阅用户开放桌面和 iOS 版。x.ai ↗

15. 消息称 OpenAI 拟向美国大学生提供一年免费 ChatGPT Plus

消息称,该福利将覆盖 220 多所参与高校的在读学生,需通过 SheerID 验证后激活;目前尚未获得官方确认。X:testingcatalog (@testingcatalog) ↗

16. OpenAI 推出 ChatGPT 工作区 Agent 功能

OpenAI 推出 ChatGPT 工作区 Agent,支持创建可共享的 Agent 处理跨工具、多步骤工作流。该功能处于研究预览阶段,面向 ChatGPT Business、Enterprise、Edu 和 Teachers 订阅方案开放。OpenAI ↗

17. WorkBuddy上线多端同步功能

WorkBuddy打通PC、APP和小程序;用户登录同一账号后,可通过手机远程控制电脑Agent,支持锁屏操作和双端协同。微信公众号 ↗

开发与基础设施

18. ZCode 上线 Goal、Subagents、Remote Control 与闲时任务

ZCode 针对 GLM 优化,上线 Goal、Subagents、Remote Control 和闲时任务四项功能。Z.ai Code Bench 测试显示,GLM-5.2 搭配 ZCode 的任务整体通过率较 Claude Code 高 2.39%。微信公众号 ↗
补充来源:微信公众号 ↗

19. Databricks 开源 Metals v2,服务大规模 Java 和 Scala 代码库

Databricks 开源 Metals v2,这款 Java 和 Scala 语言服务器面向数百万行代码库及智能体驱动开发,旨在提升大规模代码库中的编辑与导航性能。目前 Databricks 大部分代码由智能体编写,Metals v2 用于支持仍需工程师手动介入的环节。databricks.com:Blog ↗

20. NVIDIA 提出 800 VDC 供电架构以扩展 AI 算力

NVIDIA 主张以 800 VDC 直流配电替代传统交流多次转换,以降低损耗并支持 AI 算力扩展。NVIDIA 与 Google、Microsoft 通过 OCP 联合制定该架构,已发布白皮书和 LVDC 固态变压器规范 v0.3。blogs.nvidia.com:Blog ↗

21. 用 ComfyUI API 构建 MiniMax-H3 多模态音视频生成流水线

教程介绍以 ComfyUI 作为无头推理后端,通过 Python 构建 MiniMax-H3 视频生成工作流,支持多种条件生成、权重自动选择、模型下载、音视频解码与进度监控。marktechpost.com ↗

22. Electric 加入 Databricks,为 AI 智能体沙箱引入 WASM Postgres

Databricks 宣布 Electric 团队加入,将 WASM Postgres 引入 AI 智能体沙箱。该技术支持智能体在隔离环境中运行本地数据库,并实现实时数据同步和离线操作。databricks.com:Blog ↗

23. Gemini 助力 DMS 加速 PostgreSQL 迁移

Google Cloud 在 Database Migration Service(DMS)中推出 Gemini 驱动的 AI 代码转换功能,可将 Oracle 或 SQL Server 的存储过程、触发器和自定义函数转换为 PostgreSQL PL/pgSQL 代码。cloud.google.com:Blog ↗

24. Mistral AI 推出区域推理端点并支持第三方开放模型

Mistral AI 推出区域推理端点,客户可选择在欧洲或美国运行以满足数据驻留需求。Mistral 平台还将支持第三方开放模型,首批引入智谱 GLM-5.2。mistral.ai ↗

25. 微软在 GitHub Copilot 推出 MAI-Code-1.1-Flash

微软正将代码模型 MAI-Code-1.1-Flash 引入 GitHub Copilot。该模型新增原生视觉支持,优化 CLI 和 .NET 任务,并减少所需 token、提升传输速度。microsoft.ai ↗

26. 腾讯混元发布 WorldClaw Agentic 框架

WorldClaw 可将文本提示词转化为可自由探索、由可编辑 3D 资产构成的大规模 3D 开放世界场景。tencent-hunyuan.github.io ↗

27. Anthropic将Compliance API扩展至Claude Cowork和Claude Code

Anthropic向Enterprise客户开放Compliance API Beta测试,合规团队可获取Claude Cowork和Claude Code的会话内容及元数据,用于审计取证,无需单独集成。claude.com:Blog ↗

28. NVIDIA开源NeMo Switchyard模型路由库

NeMo Switchyard支持按任务分发Agent请求,提供LLM分类器、阶段路由和升级路由等算法,目前处于pre-alpha阶段。developer.nvidia.com:Blog ↗

29. Unsloth 发布开源桌面应用 Unsloth Desktop

Unsloth 发布开源桌面应用 Unsloth Desktop,支持在 Mac、Windows 和 Linux 本地运行和训练 LLM 等 AI 模型,兼容 NVIDIA、AMD、Intel 和 Apple Silicon 芯片。unsloth.ai ↗

30. 新能源大厂如何支撑全球最大 AI 算力单体

算力竞争的重心正向电力倾斜。量子位 ↗

31. IBM与Red Hat扩展Lightwell,强化AI时代开源信任与治理

IBM与Red Hat扩展Lightwell,并引入商业服务,帮助组织为AI辅助软件开发建立可信、可验证的软件供应链。InfoQ AI ↗

公司与资本

32. Gemini 月活用户超 10 亿,成为 Google 增长最快产品

Sundar Pichai 表示,Gemini 月活用户已超过 10 亿,是 Google 增长最快的产品,也是其第 14 个达到 10 亿用户里程碑的产品。X:sundarpichai (@sundarpichai) ↗

33. AI SaaS龙头获得估值溢价

SaaS整体估值承压,但各细分领域的AI龙头估值更高:CrowdStrike前瞻收入倍数为34.4x,Cloudflare为32.6x,Shopify为11.3x。tomtunguz.com ↗

34. 消息称 Anthropic 最快于今年 9 月上市,并淡化 AI 模型竞争挑战

消息称 Anthropic 正接触潜在投资者,为可能成为史上规模最大的 IPO 做准备,计划于今年 9 月或 10 月初正式上市。公司估值最高达 9650 亿美元,年化收入已超过 470 亿美元,并淡化来自中国 AI 企业的竞争影响。Anthropic 还计划拓展 AI 在医疗和生物学领域的应用,但尚未公布具体 IPO 定价方案。ithome.com ↗

35. Manus 将恢复独立运营,部分用户数据将被删除

Manus 宣布将恢复独立运营。作为与 Meta 分拆的一部分,部分用户在特定日期后产生的数据将于 8 月 23 日至 24 日(新加坡时间)删除;受影响用户需提前备份,并可于 8 月 25 日起恢复数据。manus.im:Blog ↗

36. Riot Platforms与Anthropic达成91亿美元数据中心租赁协议

据报道,Riot Platforms与Anthropic达成约91亿美元的20年数据中心租赁协议,覆盖191兆瓦算力,并含两次五年续约选项,总潜在价值约161亿美元。Bloomberg ↗

37. 英伟达循环融资达到新高度,黄仁勋是否过度出牌?

该条目已按原始标题回退,未经原始证据明确支持的细节不予展开。garymarcus.substack.com ↗

38. GPU金融化?黄仁勋联合华尔街融资5000亿美元

GPU被形容为理财产品。量子位 ↗

39. 字节跳动成立“AI数据与安全”一级部门

据报道,字节跳动近期成立“AI数据与安全”一级部门,整合多个团队,为公司大模型提供跨模态数据服务。微信公众号 ↗

40. 通义千问前负责人林俊旸创立语用科技,进军具身智能

通义千问前负责人林俊旸宣布创立语用科技,研发连接数字与物理世界的下一代 Agent,并获红杉中国、高榕创投等机构投资支持。pragmatik.com ↗

政策与安全

41. 研究人员发现可读取 ChatGPT 等模型加密推理过程的 API 漏洞

Alexander Panfilov 团队称 OpenAI、Anthropic、Google 等主要 AI 提供商的 API 存在漏洞,可读取推理模型的加密思考过程。对约 7000 条公开会话的扫描发现 62 个 API 密钥、33 个邮箱和 33 个密码;通过越狱,Anthropic 的 Haiku 4.5 可逐字转写 Opus 4.8 的原始推理。解码 10000 条推理轨迹的 API 成本约为 720 美元。the-decoder.com ↗

42. 研究论文称主流大模型存在可跨模型越狱提取隐藏推理的漏洞

研究人员发表论文称,利用专有大语言模型 API 的漏洞,可将强模型的加密推理块注入弱模型进行越狱,提取明文隐藏推理;研究人员表示已向相关公司进行负责任披露。stolen-thoughts.com ↗

43. AI智能体安全实战测评:中国方案DoGNAVY位列前三

全球AI安全实战化测评中,中国方案DoGNAVY位列前三。量子位 ↗

44. Claude骂声中启动「隐形水印」:新模型全量嵌入,标记所有文字

该条目已按原始标题回退,未经原始证据明确支持的细节不予展开。量子位 ↗

论文与研究

45. Llama.cpp 在 macOS 虚拟机中实现 11 至 16 倍 LLM 推理加速

研究团队构建了 macOS 虚拟机 Metal 能力查询的进程级兼容层,使 llama.cpp 可使用更新的 Metal 内核。在 M1 Ultra 上,TinyLlama 1.1B 的提示处理和 token 生成速度分别提升 11.08 倍和 16.36 倍,接近裸机性能的 98%。GitHub:Blog ↗

46. AMIE 首次展示实时临床视频问诊能力

医疗 AI 系统 AMIE 基于 Gemini 和 Project Astra,可解读视听线索、引导虚拟体格检查并进行实时诊断推理。随机研究中,临床评估者认可其病史采集和诊断准确性等能力,患者演员更偏好视频体验。blog.google:Blog ↗
补充来源:blog.google:Blog ↗

47. 统一 Radix 缓存:用单一树结构管理混合模型前缀缓存

LMSYS 团队提出 Unified Radix Cache,以单一 token 键控的 radix 拓扑统一管理混合模型中 FULL、SWA 和 MAMBA 组件的缓存,同时保留各组件独立的执行路径、滑动窗口和检查点复用语义。lmsys.org:Blog ↗

观点与教程

48. 编写智能体应选择哪种编程语言?

作者让 GPT-5.6 Sol 实现 zstd 解码器,比较动态与静态语言的 token 效率。结果因推理力度而异,且指出既有评测存在测试路径错误,琐碎任务的结果难以推广。danluu.com ↗

49. 将 GitHub Copilot 接入 MitM 代理后的观察

作者使用 mitmproxy 拦截 VS Code 中 GitHub Copilot 的网络流量,分析其运行时行为与内部架构,并分享代理配置方法。lighthousenewsletter.com ↗

50. Can you trust what AI tells you?

该条目暂无摘要。youtube.com ↗

51. 演讲:如何实现全球最低成本的 Token 生产

Meryem Arik 分享如何为高吞吐、非实时任务设计低成本 LLM 推理架构,并通过硬件、推理运行时、投机解码和智能队列重排等关键取舍,将成本降低一个数量级。InfoQ AI ↗

人物与动态

52. Ryan Greenblatt谈递归自我改进与超级智能风险

Ryan Greenblatt与Dwarkesh Patel讨论递归自我改进:当AI达到顶级专家水平后,AI研发可能加速。Ryan的中位预期是2031年实现AI研发自动化,双方也讨论了对齐与奖励黑客风险。dwarkesh.com ↗

53. 宇树会破发吗?王兴兴回应

以200问回应相关问题。量子位 ↗

54. 布林紧急接管 Gemini 团队,Gemini 3.5 Pro 被取消

谷歌内部的算力分配问题严重。量子位 ↗

55. 机器人赛道新岗位:月入6000元的“骨科大夫”,专治缺胳膊断腿

该条目暂无摘要。量子位 ↗

今日脉络

  • 开源模型继续下沉至本地与多模态创作
    NVIDIA 发布面向常驻智能体的 Nemotron 3.5 Lightning,支持微调并可在 RTX PC、DGX Spark 和 Jetson 等设备运行。Ling-3.0-tiny、IndexTTS-2.5 与 LTX-2.5 也分别覆盖混合推理、跨语种语音克隆和音视频生成。

  • 智能体工作流向桌面、远程控制与团队共享延伸
    OpenAI 推出 ChatGPT 工作区 Agent 研究预览,并在桌面应用中支持导入其他智能体的项目、聊天记录、技能和插件;Linux 预览版同步覆盖 ChatGPT Work 与 Codex。WorkBuddy 和 ZCode则补充了多端协同、远程控制、子智能体及闲时任务能力。

  • 企业基础设施强化部署选择、代码迁移与审计
    Mistral 提供欧洲或美国区域推理端点,并计划支持第三方开放模型;Google Cloud 在 DMS 中加入 Gemini 驱动的数据库代码转换。Anthropic 将 Compliance API 扩展至 Claude Cowork 和 Claude Code 的 Enterprise Beta,用于获取会话内容和元数据开展审计取证。

  • 隐藏推理保护暴露跨模型提取风险
    两项研究均称,主流模型 API 可能被用于提取加密或隐藏的推理内容,其中一项还报告在公开会话扫描中发现 API 密钥、邮箱和密码。相关研究者表示已向受影响公司进行负责任披露。

总结

从今天的更新看,模型层面的开放与性能优化仍在推进,但实际竞争更集中于可部署性、工作流连接、企业控制与安全边界。对团队而言,评估新能力时需要同时核对运行环境、权限范围、数据驻留和审计要求。