OpenAI发布GPT-6,总裁布罗克曼称其可算AGI
GPT-6 Astra在ARC-AGI-3取得99.9%,OpenAI总裁称其可算AGI;安全评估同时披露网络攻击能力和模型监控风险。
免费微软自然语音 · 推荐使用 Microsoft Edge
OpenAI于9月3日发布GPT-6 Astra。公司总裁格雷格·布罗克曼在发布时说,他个人认为OpenAI已经达到通用人工智能(AGI),但也表示应由用户判断新模型是否符合这一称呼。OpenAI的产品公告没有把AGI列为经过认证的技术等级。
OpenAI公布的测试显示,Astra在ARC-AGI-3取得99.9%,在电脑操作测试OSWorld 2.0取得72.6%,上一代GPT-5.6 Sol为65.7%。新模型先向少数机构开放,随后提供给ChatGPT Plus、Pro、Business和Enterprise用户,并将进入OpenAI API、微软Azure和AWS Bedrock。
| OpenAI公布的测试 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% |
| OSWorld 2.0 | 72.6% | 65.7% |
| AutomationBench | 41.4% | 18.1% |
| Terminal-Bench 4.0 | 57.9% | 37.3% |
AGI没有统一的行业定义,也没有一家独立机构负责认证。ARC-AGI衡量模型处理陌生问题的能力,OSWorld测试电脑操作;这些成绩能够比较特定任务表现,不能单独证明模型已经具备与人类相当的通用能力。OpenAI在产品页面采用的表述是“最智能、最对齐的模型”。
随产品一同公布的安全评估把Astra列为OpenAI首个达到“关键级”网络安全能力的模型。公司称,它在获得适当工具和权限后,可以发现未知漏洞并设计利用方法,因此加强了系统隔离、运行轨迹监测和发布前评估。
评估还记录了新的监控问题。Astra更能控制自身思维链,在人为要求模型规避监测的对抗测试中,有时可以避开内部监控。OpenAI没有在测试中发现模型利用隐写方式把推理藏进普通文本,安全团队已把行为、工具调用和运行结果纳入审计,不再只检查模型留下的思维链。
读到这里,说明你关注真正重要的事
锐报每周深度分析直送邮箱——财经、地缘、科技,穿透表象。零广告,零废话。