精选理由
一个轻量级评估框架,让编码代理帮你搭 eval,再直接跑模型对比。对想针对业务场景自建基准的团队,比通用榜单更实用。
AI 摘要
smevals 是 Simon Willison 与 Prime Radiant 实验室合作开发的新工具,用于跨不同模型配置运行小型评测套件并对结果打分。它支持通过 `uvx smevals run` 对 gpt-5.5、claude-opus-4.6 等模型运行评测,并将运行与打分分离,最终可生成静态 HTML 报告。这是 Willison 在评测方法上的第三次迭代。
正文 · AI 翻译
这是一则列表来源,站内未收录完整正文。
> 站内仅提供摘要,全文见原文。
原文
Original Title
smevals - a small eval suite for evaluating models, prompts, and harnesses
Source
Simon Willison 博客
Site
simonwillison.net
Published
2026-08-01 05:15