返回 AI 情报
技巧精选 812026-09-04 03:42François Chollet (@fchollet)

François Chollet 评 GPT-6 Astra 在 ARC-AGI-3 上的表现

GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems…

精选理由

ARC Prize 作者基于自家标准 harness 的实测数据评估 GPT-6 Astra,读者可对比 66% 与近 100% 两种设置看模型与 harness 能力的边界变化。

AI 摘要

François Chollet 发文称 GPT-6 Astra 在交互式推理任务上带来阶跃式能力提升,使用标准 harness 在 ARC-AGI-3 上得 66%,配合持续对话 harness 和自定义 compaction 接近 100%,每局成本约 $360。

正文 · AI 翻译

GPT-6 Astra 代表了模型在交互式推理问题上能力的阶跃式变化。使用我们的标准测试框架,它在 ARC-AGI-3 上得分 66%;而使用连续对话框架和自定义压缩后,得分接近 100%,每局成本约为 360 美元。

事实上,在几乎所有关卡中,连续框架版本在行动效率上都显著优于我们的人类基线。当我们检查推理链以理解模型的运作方式时,发现它在每个游戏和关卡中都在进行高效、实时的符号化世界建模。它甚至发展到开发出自己的简写 DSL 来表示游戏内情境--本质上是一种针对特定游戏的代数记法。

总体而言,Astra 展现出了我们此前仅在复杂框架中才见过的符号化建模行为--因此,框架的能力正越来越多地转移到模型本身之中。

我们认为 Astra 是模型智能领域的一项重大突破。

阅读我们关于 Astra 及其结果意义的文章:https://arcprize.org/blog/astra

原文

Original Title

GPT-6 Astra represents a step-function change in model capability for interactive reasoning problems…

Source

François Chollet (@fchollet)

Site

x.com

Published

2026-09-04 03:42

阅读原文· x.com

继续阅读