返回技能库
开发 / Agent 技能精选

技能创建与评测

把重复工作整理成可触发、可测试、可迭代的 Agent Skill,并用基线对照衡量效果。

查看安装方式

技能说明

来自 Anthropic skills 的技能开发流程,覆盖意图澄清、SKILL.md 编写、测试提示、技能版与基线版对照、评测反馈和触发描述优化。默认评测流程围绕 Claude 设计,迁移到 Codex 或 Cursor 时需适配执行方式。

关于此技能

来自 Anthropic skills 的技能创建与评测流程,帮助把一个想法整理成可触发、可测试、可迭代的 SKILL.md。

核心能力

从意图到 SKILL.md

先明确能力范围、触发场景、输出格式和依赖,再编写清晰的技能说明与渐进式参考资料。

带基线的效果评测

用真实测试提示同时跑有技能和无技能的结果,比较质量、耗时和 Token,避免只凭感觉判断。

反馈驱动迭代

通过评测页面收集定性反馈和量化结果,再改进正文、测试集和触发描述。

适用场景

从零创建技能

把一套重复工作流程整理成可安装、可复用、能自动触发的 SKILL.md。

改进现有技能

检查技能是否过长、触发不准或输出不稳定,并用测试结果指导下一版。

比较技能版本

用有技能与基线对照的方式衡量效果差异,为是否发布或继续迭代提供依据。

使用步骤

  1. 01

    捕捉目标与边界

    写清技能要做什么、什么时候触发、输入输出是什么,并确认是否需要可验证的测试案例。

  2. 02

    编写初版并准备测试

    按名称、描述、正文和引用资源组织技能,建立 evals/evals.json 测试提示。

  3. 03

    并行跑技能版与基线版

    使用相同任务分别运行有技能和无技能的版本,记录输出、耗时、Token 和测试断言。

  4. 04

    看反馈再迭代

    汇总结果并打开评测查看器,修复失败项后扩大测试集,直到效果达到发布标准。

常见问题

一定要用 Claude Code 吗?+

SKILL.md 格式可被兼容 Agent 使用,但内置评测脚本和示例默认围绕 Claude 流程设计,换到 Codex 或 Cursor 时需要适配运行方式。

它会自动发布技能吗?+

不会。它负责创建、测试和改进,发布、安装和权限管理仍需人工或项目流程完成。

主观创作类技能也要做基准吗?+

不一定;客观可验证的文件转换或固定流程更适合量化测试,主观写作和视觉输出应结合人工评价。

安装前检查

把兼容性、来源和安装入口先看清楚,再放进自己的工作流。

信息卡
兼容平台

Claude Code · Codex · Cursor

来源状态

已提供来源链接

安装方式

命令可直接复制

最近整理

2026/09/08

安装提醒:这项技能可能涉及网络、脚本、文件或凭据权限,安装前请先阅读 SKILL.md,并确认它需要哪些权限。

安装命令
npx skills add https://github.com/anthropics/skills --skill skill-creator

适用平台与标签

Claude CodeCodexCursor兼容 Agent Skills#技能开发#评测#Benchmark#提示触发#Agent Skills#Claude Code
技能创建与评测 | AI 技能详情 - 小黑丸