Skill Market 如何判断什么值得收录。How Skill Market evaluates
我们更看重小而清晰的推荐,而不是噪声很大的索引。每个精选技能都应该说明适用场景、安装路径和可见风险。上次评测 · last reviewed: 2026-06-10
4 个维度,权重公开Four dimensions, weights public
评分公式Scoring formula每个候选 skill 在四个维度上各得 0-10 分,按下方权重加权后得到总分。总分前 3 名进入「编辑精选」榜单,其余进入「社区索引」可被搜到,但不出现在默认列表。
在真实任务集上盲测:把 skill 名字遮起来,跑同一组场景任务,看输出是否真能解决问题。我们看的是「针对场景的命中率」,不是通用聊天能力。
源码是否公开、作者是否可验证、网络/文件/依赖访问范围是否最小、是否有审计备注。任何高风险 skill 在这一维 < 5 分都不能进入精选。
最近 90 天的提交活跃度、issue 响应时间、release 节奏、文档更新频率。3 个月以上无维护、3 个开 issue 未回的直接出榜。
安装命令、前置依赖、平台支持是否明确写在卡上;首次安装到第一次成功使用的耗时是否在 5 分钟内。靠「试试看就知道了」的不收。
什么时候重排,什么时候紧急复查When we re-rank, when we hot-fix
评测节奏Review cadence每季度末把每个品类的 #1 和次选拉出来重新盲测一次。如果 #1 在新一轮里输给次选,名次直接互换,并在 changelog 里记原因。
出现 CVE、密钥泄漏、信任边界回归这类问题,7 天内必须复查。复查结果可能是降级、加红色警告,或者直接下榜。
GitHub 爬虫每周跑一次,新候选默认进入「社区索引」,标 Curator review pending。没有经过人工审核之前,永远不会被标 featured,也不出现在分类首屏。
以 code-review 为例:为什么是这 3 个Code-review category: why these three
案例走查Walkthrough我们挑 code-review 来走查,因为它的 Top 3 各自代表「同一个任务下的不同心智模型」,公式权重在这里看得最清楚。
场景适配 9.4 / 安全 8.8 / 维护 8.5 / 安装 9.0 → 8.97 分。强在面向 diff 的具体性,能抓信任边界类问题(SQL 注入、鉴权、条件副作用),不是把整个仓库重新总结一遍。
场景适配 8.6 / 安全 9.1 / 维护 8.0 / 安装 8.8 → 8.55 分。比 #1 轻——只输出建议,不改 diff、不写评论。适合资深工程师在自己 merge 前做二次审视,不抢 #1 的「给别人代码把关」位置。
场景适配 8.0 / 安全 8.5 / 维护 7.8 / 安装 9.2 → 8.32 分。补的是「分支可合」和「评审者能冷启动接手」之间的窄缝——不审查逻辑,专门做发布前检查和评审者交接说明。
小而透明,不假装是「我们」Small, transparent, not pretending to be "we"
编辑团队Who reviewsSkill Market 目前由一名主编 + 评测顾问网络运营。这意味着每个季度能精选的 skill 数量有上限(当前共 28 个 featured,平均每个品类 2-3 个)——这也是我们把 Hero 文案从「Top 10 per category」改成「Top picks per category」的原因:不撒谎,宁可写少。所有评测决策都会进 changelog,对结论有异议的可以直接在 GitHub 仓库开 issue。
最近 4 次评测决策的来龙去脉The last four re-rank decisions
重排日志Re-rank changelog之前每个精选 skill 的「编辑结论」只有一句话,无法支撑决策。把 14 个有完整背景的 featured(gstack-review、qa-loop 等)的 verdict 扩到 80-120 字,统一格式:定位 / 强项 / 弱项 / 小提醒。
原承诺「Top 10 per category」实际只有平均 2.8 个 featured 凑得齐。降级到「Top picks per category」与现实对齐;同时 /skills 默认只显示 28 个 curated,加 chip 切换查看全部 1229 indexed。
新一轮盲测里,原 #3 和 #4 在评估循环(eval discipline)这一维丢分明显,不再具备「精选」资格,进入「社区索引」状态保留可搜性,但不出现在分类首屏。
原本两个 skill 在「证据交付 vs 实现修复」两种心智模型上重合度低,硬绑在同一名次反而误导用户。拆出后 qa-loop 走「带证据链给干系人」路径,gstack-qa 走「同会话内修完」路径。
为什么我们的排名值得信Why our rankings are trustworthy
评测原则Curation principles优先按真实场景挑选最合适的那个,而不是按人气堆榜单——多不等于好。
安装命令、前置依赖、平台支持都列在卡上,不靠"试试就知道了"。
风险等级、源码链接、审计备注都贴在安装按钮旁,不藏在另一个页面。
中文/英文页面分别标注翻译完成度,缺失就直说,不掩盖。
高风险 skill 可以收录,但必须有明确的红色警告和使用限制。