skill-creator
Anthropic 官方的「制造 skill 的 skill」:引导 Claude Code 完成从访谈需求、起草 SKILL.md 到并行对照评测、定量 benchmark、浏览器人工评审、迭代改进再到触发描述优化与打包 .skill 的完整闭环,让 skill 开发变成可测量可迭代的工程。
仓库:anthropics/skills
热度证据:同上,SKILL.md 规范的模板来源;官方 anthropics/skills 仓库 168,637 star,Claude Code 内置核心技能之一,全网被教程引用最多;五库分析第5章:唯一带闭环评测(with-skill vs ba
五维评分
热度5/5
质量5/5
创新5/5
易用4/5
文档5/5
优秀点拆解
- 闭环评测体系:每个测试用例同时跑 with-skill 与 baseline(新 skill 用无 skill,改进用旧版快照),aggregate_benchmark.py 输出 pass_rate/时间/token 的 mean±stddev 与 delta,让 skill 的净增量可量化
- 人类留在环路中:eval-viewer/generate_review.py 生成自带浏览器的评审页(Outputs 定性 + Benchmark 定量双 tab,反馈自动存 feedback.json),并强调评审页要先于自己评估生成
- 「解释为什么」的指令写作哲学:明确反对全大写 MUST/ALWAYS,用 theory of mind 讲清因果,使指令能泛化到未见输入
- 把触发(triggering)当一等公民:指出 Claude 欠触发倾向并建议写 pushy 的 description;run_eval.py 用流式事件提前探测是否触发,20 条含近失负例的评测集自动调优描述
- 工程健壮性:随机 uuid 临时命令文件防冲突、超时 kill、进程清理、1024 字符超限二次改写、grader 断言字段锁定并在 schemas.md 文档化
可复用的设计模式
- 对照实验模式:验证任何 agent 工具/模板价值都跑「有 vs 无」两组并对比 delta,改进场景用 cp -r 快照做基线
- 渐进披露分层:常驻元数据(<100词)→ 正文(<500行)→ 按需加载的 references/scripts,超限下推一层并给出指针
- 跑批期间并行补断言 + 易失数据(timing)到手即时落盘,不空等长任务
- 防过拟合的自动化改进循环:train/test 分层切分、历史致盲、按 test 分选优、上限迭代次数
适用场景
从零创建一个新 skill 并验证它确实有用系统性改进现有 skill,用对照评测确认新版本真的更好优化 skill 的 description 提升触发准确率(should-trigger / should-not-trigger 评测)教学/研究场景:作为「如何把 prompt 工程做成工程」的参考范本
边界与注意:完整闭环依赖子代理 + claude CLI,资源消耗大;主观型输出(文风/艺术)不适合上断言;一次性小 skill 用这套流程过重;无子代理环境(Claude.ai)会降级为串行并跳过定量评测,严谨性打折;需要用户深度参与评审,非全自动
完整拆解分析文档
本页为摘要版,完整精读分析(核心机制、逐条优秀点拆解、写作过程)见本地 Markdown 文档:
analysis/anthropics-skill-creator.md