引言
今日AI动态聚焦大模型能力演进与安全应用。OpenAI的GPT-6 Astra在基准测试、用量优化及训练规模上引发多方关注,同时其自动化研究和对齐困境也引发讨论。此外,Google与Figma展示了AI在安全领域的落地,具身智能与AI对人类心理的影响亦成为新焦点。
模型与能力
1. Fortune 报道 OpenAI 多次修改 GPT-6 Astra 基准测试数据
据 Fortune 报道,OpenAI 自 9 月 3 日发布 GPT-6 Astra 公告以来多次修改评测基准数据,如幻觉率曾从 4.2% 降至 2% 后又改回。ithome.com ↗
2. OpenAI Codex 完成 Astra 用量改进,质量保持不变
Codex 负责人 Tibo 宣布,针对使用 ChatGPT 账号登录的用户完成用量效率改进,在长尾场景下使用 Astra 最多可减少 3 到 4 倍订阅用量消耗,且质量不变。Tibo 还称,GPT-6 Astra 在 low 推理强度下的表现优于 GPT-5.6 Sol 在 high 下的表现。X:thsottiaux (@thsottiaux) ↗
3. 具身ICL迎来创业玩家,上下文成为Scaling新赛道
让机器人学会利用更长的多模态Context。量子位 ↗
产品与应用
4. Figma 如何利用 AI 代理提升安全能力
Figma 工程团队分享了构建 AI 代理的经验,该代理可协助安全团队调查警报、搜索过往事件、检查系统并准备代码修复。代理能从过往调查中学习,减少重复工作,使工程师解决复杂警报的速度提升约 70%。InfoQ AI ↗
5. B站首届AI创造公开赛收官,超八成参赛者为一人团队
该条目暂无摘要。量子位 ↗
开发与基础设施
6. 黄仁勋透露 GPT-6 Astra 训练使用超 10 万个 GB200 NVL72
黄仁勋发帖称,GPT-6 Astra 由超过 10 万个 NVIDIA Grace Blackwell NVLink72 训练,并向 OpenAI 团队表示祝贺。X:OpenAI (@OpenAI) ↗
7. Google开源Mantis:旨在减少误报的智能体漏洞扫描框架
Google开源了AI智能体框架Mantis,用于自动化软件漏洞生命周期,包括识别、验证、复现和修复漏洞。Google表示,开发Mantis是为了解决传统AI代码扫描中误报和幻觉漏洞率高的问题。InfoQ AI ↗
政策与安全
8. OpenAI 阐述对齐与监测困境:CoT 监控能力正随模型提升而减弱
OpenAI 发布长文《An Alien Mind》,阐述目标对齐与价值对齐的区分。文章指出链式思维监控效果正随模型能力提升而减弱,GPT-6 Astra 在对齐上显著优于 GPT-5.6 Sol,并呼吁自愿放缓扩展、建立第三方安全门槛及加强国际协调。OpenAI ↗
补充来源:OpenAI ↗
论文与研究
9. 研究团队提出“AI相关精神病”概念
伦敦国王学院等机构研究团队提出“AI相关精神病”,指重度使用聊天机器人期间精神病性症状的出现或加重,能否列为独立临床诊断仍存争议。arXiv ↗
观点与教程
10. OpenAI 发布内部研究加速报告:达成自动化研究实习生目标,推进 2028 年自动化 AI 研究员
OpenAI 披露自动化研究进展,宣布已达成今年 9 月拥有自动化研究实习生的目标,并计划在 2028 年 3 月前造出自动化 AI 研究员。OpenAI:Blog ↗
补充来源:OpenAI:Blog ↗
今日脉络
-
GPT-6 Astra 的能力与争议
Fortune 报道 OpenAI 多次修改 GPT-6 Astra 评测基准数据。同时,Codex 负责人宣布完成 Astra 用量效率改进,且其在低推理强度下表现优于 GPT-5.6 Sol。黄仁勋透露该模型由超 10 万个 GB200 NVL72 训练。 -
AI 在安全与自动化研究中的进展
Figma 工程团队分享了构建 AI 代理协助安全团队调查警报的经验,提升解决速度约 70%。Google 开源了旨在减少误报的智能体漏洞扫描框架 Mantis。OpenAI 则披露已达成自动化研究实习生目标,并计划 2028 年造出自动化 AI 研究员。 -
对齐困境与具身智能新探索
OpenAI 发文阐述目标与价值对齐区分,指出链式思维监控效果随模型提升而减弱。具身 ICL 迎来创业玩家,上下文成为 Scaling 新赛道。此外,研究团队提出“AI相关精神病”概念,探讨重度使用聊天机器人对心理的影响。
总结
随着 GPT-6 Astra 等模型在算力与能力上的突破,AI 发展正面临更复杂的对齐与安全挑战。从安全代理的落地到自动化研究的推进,技术演进与人类社会的互动日益加深,需要持续关注其潜在影响与规范发展。
评论 (0)
发表评论
请先登录后发表评论