技能说明
适合客服、RAG 和工具调用 Agent 的持续质量检查,覆盖 Promptfoo 等评测框架、LLM-as-judge、阈值断言、模型对比和 GitHub Actions。运行模型评测可能产生 API 费用;API 密钥应放在安全变量中,阈值和裁判结果也需要人工抽检。
关于此技能
把 AI Agent 和大模型输出当作可测试对象,加入自动评测、回归对比和 CI 质量门。
核心能力
多框架评测
提供 Promptfoo、Cobalt 和 Braintrust 等评测思路,覆盖准确性、延迟、工具调用和 RAG 质量。
阈值与回归检查
用评分标准、基线和阈值判断输出质量,发现提示词或模型变更导致的回归。
CI 自动化
将评测接入 GitHub Actions,在拉取请求或提示词变更时运行并以结果决定是否通过。
适用场景
上线前测试 AI Agent
为客服、RAG 或工具调用 Agent 建立可重复的测试集和质量门。
比较模型和提示词
在更换模型或修改系统提示前,用同一组案例比较质量、延迟和成本。
持续发现质量回退
把评测加入 CI,尽早发现输出质量下降,而不是上线后再人工抽查。
使用步骤
- 01
第一步:准备测试集
整理正常、边界、对抗和跑题案例,写清期望行为、评分标准与最低通过线。
- 02
第二步:本地跑通评测
选择 Promptfoo 或自定义框架,先在本地比较结果并固定基线;需要模型裁判时配置对应 API 密钥。
- 03
第三步:接入 CI
在 GitHub Actions 中按相关文件变更触发评测,保存结果并让低于阈值的构建失败。
常见问题
运行评测需要 API 密钥吗?+
基础流程取决于被测模型;使用 LLM-as-judge 时通常需要 OpenAI 或 Anthropic API 密钥。密钥应放在 CI 的安全变量中,不要写进配置文件。
LLM 评分是不是完全客观?+
不是。SKILL.md 把 LLM-as-judge 作为实用方案,但仍建议结合明确断言、固定测试集、人工抽检和长期趋势记录。
它会自动替我部署或修改线上 Agent 吗?+
不会。技能主要生成评测配置、脚本和 CI 建议;是否运行、修改工作流和部署仍由项目维护者审批。
安装前检查
把兼容性、来源和安装入口先看清楚,再放进自己的工作流。
Claude Code · Codex · Cursor
已提供来源链接
命令可直接复制
2026/09/02
安装提醒:即使有清晰的来源和安装方式,也建议先阅读 SKILL.md,确认它会访问哪些文件和服务。
npx terminal-skills install ai-eval-ci