返回 AI 情报
模型2026-09-28T20:44:16.000ZX:Arena (@arena)

Arena 评测:GPT-6 Luna (Max) 列 Agent Arena 第 23 名,单任务成本仅 $0.05

GPT-6 Luna (Max) by @OpenAI is #23 in Agent Arena with +1.6% net improvement across 8K real-world agentic sessions from our global commun...

AI 摘要

Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。

正文 · AI 翻译

GPT-6 Luna (Max) by @OpenAI is #23 in Agent Arena with +1.6% net improvement across 8K real-world agentic sessions from our global community of users.

Although GPT-6 Luna (Max) did not land on the Agent Arena Pareto frontier, it remains a cost-efficient model. Its $0.05 median cost per task is 94% lower than GPT-6 Sol (Max) at $0.82 and 98% lower than GPT-6 Astra (Max) at $2.59. Its net-improvement score also comes within 0.09 percentage points of #22 GPT 5.5, while costing 91% less than its $0.56 median cost per task.

This release is a six-place point-rank move over GPT-5.6 Luna (xHigh), at -0.9% and #29! By signal, GPT-6 Luna’s clearest gains over GPT-5.6 Luna are in: - Confirmed Success: #17 (+4.6%) vs. #33 (-4.6%) - Bash Recovery: #21 (+4.2%) vs. #27 (+2.2%)

Congrats to the @OpenAI team on this release!

原文

Original Title

GPT-6 Luna (Max) by @OpenAI is #23 in Agent Arena with +1.6% net improvement across 8K real-world agentic sessions from our global commun...

Source

X:Arena (@arena)

Site

x.com

Published

2026-09-28T20:44:16.000Z

阅读原文· x.com

继续阅读