GPT-6 Astra:破纪录之后,AGI 真的来了吗?
ARC-AGI-3 榜单上 GPT-6 Astra 拿出两个差别巨大的成绩:供应商中立的标准框架下 62.7%(花费约 2.6 万美元),换成 OpenAI 自家的 Provider Adapter 框架就冲到 99.9%(约 1.9 万美元)——后者会在请求间保留模型的不透明推理状态并做上下文压缩。模型评测与安全研究者顾言和你拆解:两套分数各自在回答什么问题、Astra 为什么会边玩陌生游戏边'发明临时语言'(96% 的完成关卡里动作数低于受测人类中位数,平均少 51.7%)、外界盛传的循环架构'神经语'担忧到底有几分证据、以及为什么 OpenAI 第一个达到'关键级'网络安全能力的模型会先交给 Daybreak 安全机构而不是普通用户。 来源: - https://arcprize.org/blog/astra - https://www.lesswrong.com/posts/PLisnSFir8y5AHkmP/how-concerned-should-we-be-about-astra-s-recurrent - https://www.cnbc.com/2026/09/03/open-ai-astra-gpt-6-cyber.html - https://simonwillison.net/2026/Sep/3/gpt6-astra/ - https://news.ycombinator.com/item?id=49554643
