返回 AI 情报
技巧精选 622026-09-22 08:00Kenny RogersOpenRouter:Announcements(RSS)

OpenRouter 实测 Jev 1.13 与 Claude Opus 5 在 Banking77 分类任务上的准确率、延迟与成本

Is Jev as Accurate as Frontier Models at Classification?

精选理由

原文用同一测试流程给出两家模型的准确率、延迟与成本数据,并演示了基于置信度的级联路由方法,便于读者按自身流量权衡选型。

AI 摘要

OpenRouter 用 Banking77 测试集的 3,080 条客服语料对比 Jev 1.13 与 Claude Opus 5 的意图分类表现。Jev 准确率 81.0% 比 Opus 的 84.4% 低 3.3 个百分点,但中位延迟 175 ms 约为 Opus(2,266 ms)的 1/13,每千次请求成本 $0.11 对 $2.42(启用提示词缓存)。

正文 · AI 翻译

Jev 是 TypeSafe 的 System One 决策模型。给它一个应用状态对象和一个带类型的问题,它就会返回一个带类型的答案、一个置信度分数,以及每个可能选项的概率(即 Decisions API 的响应类型,而非聊天端点)。根据 TypeSafe 的宣传,在此类分类任务上,你可以用像 Jev 这样的小型判断模型替换前沿聊天模型,从而在成本和延迟两方面都获得显著降低。那么你牺牲了多少准确率?

我们将 3,080 条 Banking77 客户支持话语分别输入 Jev 1.13 和 Claude Opus 5——截至 2026 年 9 月 22 日,后者是 OpenRouter 用户在其 排行榜页面的 Task spend 板块中用于分类任务花费最多的模型。每条话语被归入 77 种银行意图之一,两个模型都获得了相同的每种意图的一行描述。

下图将 Jev 和 Opus 并排展示,呈现它们在准确率、中位延迟和每千次请求成本上的对比。

Jev 在准确率上落后 Opus 3.3 个百分点,但其中位速度快 13 倍,成本仅为 Opus 的 1/22。

Jev 与 Claude Opus 5 一览

下面更仔细地看看结果。Macro-F1 对每种意图给予同等权重。

Jev 1.13Claude Opus 5

准确率81.0%(79.6 至 82.3)84.4%(83.1 至 85.6)

宏平均 F180.5%83.6%

无效响应0 / 3,0800 / 3,080

延迟 p50175 ms2,266 ms

延迟 p95270 ms3,004 ms

延迟 p99353 ms3,835 ms

计费成本,完整运行$0.34$7.44

每 1,000 次请求的成本$0.11$2.42

平均输入 token 数2,6053,750(3,725 已缓存)

平均输出 token 数82617

括号中的数字是 95% bootstrap 置信区间,我们使用 3,080 个样本计算得出。两个模型都没有返回格式错误的响应。每一个错误都是标签错误,而不是解析失败。

我们如何运行

Banking77 是来自 PolyAI 的一个话语级客户支持意图数据集,采用 CC BY 4.0 许可。这些话语很短,中位数为九个词,每一条都标注为 77 个意图之一。当我们在 Banking77 上运行 Jev 和 Opus 时,我们使用了完整的测试划分,其中包含 3,080 个样本,每个意图 40 个。有些意图彼此足够接近,以至于模型不能只抓住几个关键词就停止阅读。想想 card_arrival 与 card_delivery_estimate。

我们仅根据标签名称,为每个意图写了一条单行判定标准,完全没有查看测试数据,并且把完全相同的一份标准清单同时给了 Jev 和 Opus。为了给 Jev 打分,我们把每句话作为一道 Decisions API Choice 问题发送,并将这 77 条标准作为选项。对于 Opus,我们构建了一个提示词,其中系统消息列出所有标准,然后是一条仅包含该话语的用户消息。我们以 temperature 为零、关闭推理,并使用带 77 个标签枚举的严格 JSON schema 响应格式来运行 Opus。我们为系统消息开启了 提示词缓存,因为它在每次请求中都完全相同。两个模型都从同一台机器运行,我们一次发送 8 个并发请求,并将延迟测量为客户端通过 OpenRouter 观察到的往返时间。

Jev 的准确率如何?

来说数字。在 Banking77 上,Jev 为 81.0%,Opus 为 84.4%。配对 bootstrap 给出的 95% CI 为 2.3 到 4.4 个百分点,因此 Opus 领先约三个百分点不太可能是噪声。

从好的方面看,这两者的一致性非常高。它们在 89.3% 的话语上意见一致。在它们出现分歧的地方,Opus 单独答对 175 个,Jev 答对 72 个。

从不利的方面看,两者仍明显低于在所有 10,003 个 Banking77 训练样本上微调过的编码器所报告的略高于 90% 的水平。这就是依赖单行标准而不是进行完整微调的代价。

按类别划分,Opus 在 77 个意图中有 35 个领先 Jev,Jev 在 15 个上领先,27 个打平。Opus 领先幅度最大的是 receiving_money,达到 80.0%,而 Jev 为 52.5%。与此同时,Jev 在 compromised_card 上表现出色,达到 95.0%,而 Opus 为 70.0%。Opus 倾向于将盗刷的银行卡信息误判为无法识别的支付。

Jev 有多快、有多便宜?

简而言之,Jev 的往返延迟中位数为 175 ms,p95 为 270 ms。而 Opus 在未开启推理模式的情况下,往返延迟中位数为 2,266 ms,p95 为 3,004 ms。这意味着 Jev 最慢的一次调用(约 1.6s)比 Opus 最快的一次调用(约 1.9s)还要快。

Jev 的总费用为 $0.34,即每千次请求 $0.11。Opus 则为 $7.44,即每千次请求 $2.42。Opus 的这个数字是在 3,700-token 系统提示词已缓存的情况下得出的,因此所有请求都按缓存读取费率计费,而非标价费率。如果不使用缓存,Opus 的标价费率约为每千次请求 $19。所以,如果你在使用前沿模型搭配标签分类体系,记得缓存那个系统提示词。

基于 Jev 置信度的路由

Jev 会给出一个置信度分数,但它并非经过校准的概率。在这里,它在中间区间高估了自身的准确率。尽管如此,它的排序表现仍然不错。在置信度 ≥0.99 的 58% 话语中,准确率为 96.3%。而在低于 0.5 的 3.5% 话语中,准确率为 29.6%。

这种排序正是你实现级联所需要的。接受高于给定阈值的 Jev,其余交给 Opus。以下是每个阈值下的准确率和每千次成本,范围从仅用 Jev 一直到仅用 Opus。

阈值由 Jev 处理准确率每 1,000 次成本

仅用 Jev100%81.0%$0.11

0.9957.8%84.3%$1.13

0.9568.1%84.2%$0.88

0.9075.9%84.0%$0.69

0.8082.7%83.6%$0.53

0.7087.3%83.2%$0.42

仅 Opus0%84.4%$2.42

在阈值 0.90 时,76% 的流量会绕过 Opus。作为交换,你的准确率相对于仅使用 Opus 最多下降 0.4 个百分点,而成本降低为原来的 1/3.5。有 175 条话语 Opus 答对了而 Jev 漏掉了。这些案例的置信度中位数为 0.67,其中 85% 低于 0.90。所以 Jev 通常能意识到自己只是在猜。

注意事项

所以让我们狭义地谈谈我们实际做的测试:一个数据集、一个领域、一种提示词设计,以及某个下午的一个十五分钟窗口。

如果这里存在 Opus 的记忆化优势,它的得分可能会因此被略微抬高,因为 Banking77 发布于 2020 年。但仅凭这一次运行无法判断。

另一点是,两个模型都在某一个类别上栽了跟头,因为判定标准仅根据标签名称编写,没有参考示例消息。在这个案例中,其中一个标签是 get_physical_card,它涵盖的是关于 PIN 是否单独发送的查询。仅凭名称几乎不可能猜到这一点。两个模型在该类别上都是 40 题得 0 分,将大多数消息路由到了 change_pin。仅排除这一个类别,Jev 达到了 82.1%,Opus 达到了 85.5%。但一个上线团队会使用留出的训练数据来迭代判定标准,而不是测试集,两个模型都会变得更好。

我们展示的级联表格使用的正是用于准确率测量的那 3,080 个样本,所以这是一个上限。请根据你自己的流量来选择阈值。

最后,这些测试是在 Opus 处于“推理关闭”模式且开启结构化输出的情况下运行的。Opus 未在“推理开启”模式下测试,也未使用其他 schema 或 few-shot 示例进行测试。

这意味着什么

如果 3 个百分点的准确率优势值得每千次请求多花 $2.42,那就选 Opus。如果你面对的是高流量、低延迟的场景,或者需要一个备用方案,Jev 单独运行与 Opus 的差距在 3.3 个百分点以内。更好的做法是,基于 Jev 的置信度分数运行级联,能将与 Opus 的差距缩小到 0.4 个百分点以内,而成本不到 30%。

Decisions API 参考文档介绍了基本的请求结构。Jev cookbook通过一个可运行的 TypeScript Choice 问题带你上手。Jev 验证级联 cookbook用代码展示了升级模式:由廉价模型起草,Jev 检查草稿,前沿模型只处理未通过检查的部分。Banking77 测试集是 PolyAI 仓库中一个 3,080 行的 CSV 文件。

常见问题

在意图分类上,Jev 与 Claude Opus 5 相比准确率如何?

在 2026 年 9 月 22 日运行的 Banking77 测试集上(包含 77 个意图的 3,080 条语句),Claude Opus 5 达到了 84.4% 的准确率和 83.6% 的 macro-F1,而 Jev 1.13 达到了 81.0% 的准确率和 80.5% 的 macro-F1。

配对差距在准确率上为 3.3 个百分点,95% bootstrap 区间为 2.3 至 4.4 个百分点。两个模型在 89.3% 的语句上结果一致。

在分类任务上,Jev 比前沿模型快多少?

在客户端观测到的往返延迟中位数和 p95 上,Jev 实现了中位数 175 ms 和 p95 270 ms,而禁用推理的 Claude Opus 5 实现了中位数 2,266 ms 和 p95 3,004 ms,中位数约高出 13 倍。这些数字是在 8 个并发请求下从同一客户端测得的。它们包含网络时间以及提供商系统在实际推理前的任何排队时间。

在 OpenRouter 上用 Jev 做文本分类要花多少钱?

在 typesafe/jev-1.13 上,全部 3,080 次 Banking77 请求总计计费 $0.34,即每千次请求 $0.11,约合每次请求 $0.0001。对包含 77 个标签的系统提示词使用提示词缓存后,同样的请求在 anthropic/claude-opus-5 上总计计费 $7.44,即每千次 $2.42。若不使用缓存,Opus 按标价计费约为每千次 $19。

我可以用 Jev 的置信度分数来决定何时回退到更大的模型吗?

可以,在我们的数据中它确实能作为排序信号发挥作用。我们测得,在置信度至少为 0.99 的那 58% 话语上,Jev 的准确率为 96.3%;而在置信度低于 0.5 的那 3.5% 话语上,准确率为 29.6%。将所有置信度低于 0.9 的请求路由到 Claude Opus 5 后,准确率恢复到 84.0%,与单用 Opus 相差在 0.4 个百分点以内,成本为每千次请求 $0.69。

由于该分数并未按概率进行校准,请根据你自己的数据选择适用的阈值。

原文

Original Title

Is Jev as Accurate as Frontier Models at Classification?

Source

OpenRouter:Announcements(RSS)

Site

openrouter.ai

Author

Kenny Rogers

Published

2026-09-22 08:00

阅读原文· openrouter.ai

继续阅读