返回 AI 情报
技巧精选 732026-08-01 05:15Simon Willison 博客

smevals:用于评测模型、提示词与评测框架的小型评测套件

smevals - a small eval suite for evaluating models, prompts, and harnesses

精选理由

一个轻量级评估框架,让编码代理帮你搭 eval,再直接跑模型对比。对想针对业务场景自建基准的团队,比通用榜单更实用。

AI 摘要

smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。

正文 · AI 翻译

这是一则列表来源,站内未收录完整正文。

> 站内仅提供摘要,全文见原文。

原文

Original Title

smevals - a small eval suite for evaluating models, prompts, and harnesses

Source

Simon Willison 博客

Site

simonwillison.net

Published

2026-08-01 05:15

阅读原文· simonwillison.net

继续阅读