今日焦点
GPT-6 Astra 在 ARC-AGI-3 上拿到 98.6%,而该基准今年上线时前沿模型只有 0.5%。FirstMark 合伙人 Matt Turck 直言这太疯狂,OpenAI 工程负责人则问:我们是不是需要一个新的 AGI 基准。
关键内容
ARC-AGI 设计初衷是抵抗缩放范式,o1 在 2024 年也只有 18%
- Astra 带原生 harness 考试,官方口径 99.9% 与第三方 98.6% 已对不齐
- Epoch AI 排第一 vs Artificial Analysis 仅 61 分,评测体系互相打架
- Chollet 承认进展比预期快约一倍,并提前自己的 AGI 预测
一句话总结
当模型强到把旧尺子打满,别急着庆祝,先去找下一把尺子——你的下一个产品要靠新尺子活。
