François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现
GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems…
精选理由
ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。
AI 摘要
François Chollet 发文称 GPT-6 Astra 在交互式推理任务上带来阶跃式能力提升,使用标准 harness 在 ARC-AGI-3 上得 66%,配合持续对话 harness 和自定义 compaction 接近 100%,每局成本约 $360。
正文 · AI 翻译
GPT-6 Astra 代表了模型在交互式推理问题上能力的阶跃式变化。使用我们的标准测试框架,它在 ARC-AGI-3 上得分 66%;而使用连续对话框架和自定义压缩后,得分接近 100%,每局成本约为 360 美元。
事实上,在几乎所有关卡中,连续框架版本在行动效率上都显著优于我们的人类基线。当我们检查推理链以理解模型的运作方式时,发现它在每个游戏和关卡中都在进行高效、实时的符号化世界建模。它甚至发展到开发出自己的简写 DSL 来表示游戏内情境--本质上是一种针对特定游戏的代数记法。
总体而言,Astra 展现出了我们此前仅在复杂框架中才见过的符号化建模行为--因此,框架的能力正越来越多地转移到模型本身之中。
我们认为 Astra 是模型智能领域的一项重大突破。
阅读我们关于 Astra 及其结果意义的文章:https://arcprize.org/blog/astra
原文
Original Title
GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems…
Source
François Chollet (@fchollet)
Site
x.com
Published
2026-09-04 03:42