返回技能库
开发 / AI精选

AI 评测 CI 质量门

把 AI Agent 和大模型输出接入自动评测与 CI 质量门,及时发现提示词、模型和 RAG 质量回退。

查看安装方式

技能说明

适合客服、RAG 和工具调用 Agent 的持续质量检查,覆盖 Promptfoo 等评测框架、LLM-as-judge、阈值断言、模型对比和 GitHub Actions。运行模型评测可能产生 API 费用;API 密钥应放在安全变量中,阈值和裁判结果也需要人工抽检。

关于此技能

把 AI Agent 和大模型输出当作可测试对象,加入自动评测、回归对比和 CI 质量门。

核心能力

多框架评测

提供 Promptfoo、Cobalt 和 Braintrust 等评测思路,覆盖准确性、延迟、工具调用和 RAG 质量。

阈值与回归检查

用评分标准、基线和阈值判断输出质量,发现提示词或模型变更导致的回归。

CI 自动化

将评测接入 GitHub Actions,在拉取请求或提示词变更时运行并以结果决定是否通过。

适用场景

上线前测试 AI Agent

为客服、RAG 或工具调用 Agent 建立可重复的测试集和质量门。

比较模型和提示词

在更换模型或修改系统提示前,用同一组案例比较质量、延迟和成本。

持续发现质量回退

把评测加入 CI,尽早发现输出质量下降,而不是上线后再人工抽查。

使用步骤

  1. 01

    第一步:准备测试集

    整理正常、边界、对抗和跑题案例,写清期望行为、评分标准与最低通过线。

  2. 02

    第二步:本地跑通评测

    选择 Promptfoo 或自定义框架,先在本地比较结果并固定基线;需要模型裁判时配置对应 API 密钥。

  3. 03

    第三步:接入 CI

    在 GitHub Actions 中按相关文件变更触发评测,保存结果并让低于阈值的构建失败。

常见问题

运行评测需要 API 密钥吗?+

基础流程取决于被测模型;使用 LLM-as-judge 时通常需要 OpenAI 或 Anthropic API 密钥。密钥应放在 CI 的安全变量中,不要写进配置文件。

LLM 评分是不是完全客观?+

不是。SKILL.md 把 LLM-as-judge 作为实用方案,但仍建议结合明确断言、固定测试集、人工抽检和长期趋势记录。

它会自动替我部署或修改线上 Agent 吗?+

不会。技能主要生成评测配置、脚本和 CI 建议;是否运行、修改工作流和部署仍由项目维护者审批。

安装前检查

把兼容性、来源和安装入口先看清楚,再放进自己的工作流。

信息卡
兼容平台

Claude Code · Codex · Cursor

来源状态

已提供来源链接

安装方式

命令可直接复制

最近整理

2026/09/02

安装提醒:即使有清晰的来源和安装方式,也建议先阅读 SKILL.md,确认它会访问哪些文件和服务。

安装命令
npx terminal-skills install ai-eval-ci

适用平台与标签

Claude CodeCodexCursorGitHub CopilotGemini CLI兼容 Agent Skills#AI 评测#CI#LLM#回归测试#Promptfoo