跳到主要内容
评测方法· Methodology

Skill Market 如何判断什么值得收录。How Skill Market evaluates

我们更看重小而清晰的推荐,而不是噪声很大的索引。每个精选技能都应该说明适用场景、安装路径和可见风险。上次评测 · last reviewed: 2026-06-10

4 个维度,权重公开Four dimensions, weights public

评分公式Scoring formula

每个候选 skill 在四个维度上各得 0-10 分,按下方权重加权后得到总分。总分前 3 名进入「编辑精选」榜单,其余进入「社区索引」可被搜到,但不出现在默认列表。

场景适配度 · Scenario fit35%

在真实任务集上盲测:把 skill 名字遮起来,跑同一组场景任务,看输出是否真能解决问题。我们看的是「针对场景的命中率」,不是通用聊天能力。

安全 & 信任 · Security & trust25%

源码是否公开、作者是否可验证、网络/文件/依赖访问范围是否最小、是否有审计备注。任何高风险 skill 在这一维 < 5 分都不能进入精选。

维护信号 · Maintenance signal20%

最近 90 天的提交活跃度、issue 响应时间、release 节奏、文档更新频率。3 个月以上无维护、3 个开 issue 未回的直接出榜。

安装清晰度 · Install clarity20%

安装命令、前置依赖、平台支持是否明确写在卡上;首次安装到第一次成功使用的耗时是否在 5 分钟内。靠「试试看就知道了」的不收。

什么时候重排,什么时候紧急复查When we re-rank, when we hot-fix

评测节奏Review cadence
01
季度重排 · Quarterly re-rank

每季度末把每个品类的 #1 和次选拉出来重新盲测一次。如果 #1 在新一轮里输给次选,名次直接互换,并在 changelog 里记原因。

02
安全紧急复查 · Security hot-fix

出现 CVE、密钥泄漏、信任边界回归这类问题,7 天内必须复查。复查结果可能是降级、加红色警告,或者直接下榜。

03
社区自动发现 · Community auto-discovery

GitHub 爬虫每周跑一次,新候选默认进入「社区索引」,标 Curator review pending。没有经过人工审核之前,永远不会被标 featured,也不出现在分类首屏。

以 code-review 为例:为什么是这 3 个Code-review category: why these three

案例走查Walkthrough

我们挑 code-review 来走查,因为它的 Top 3 各自代表「同一个任务下的不同心智模型」,公式权重在这里看得最清楚。

小而透明,不假装是「我们」Small, transparent, not pretending to be "we"

编辑团队Who reviews

Skill Market 目前由一名主编 + 评测顾问网络运营。这意味着每个季度能精选的 skill 数量有上限(当前共 28 个 featured,平均每个品类 2-3 个)——这也是我们把 Hero 文案从「Top 10 per category」改成「Top picks per category」的原因:不撒谎,宁可写少。所有评测决策都会进 changelog,对结论有异议的可以直接在 GitHub 仓库开 issue。

最近 4 次评测决策的来龙去脉The last four re-rank decisions

重排日志Re-rank changelog
2026-05-19
Editor's Verdict 14 个 featured 扩写到 ~100 字

之前每个精选 skill 的「编辑结论」只有一句话,无法支撑决策。把 14 个有完整背景的 featured(gstack-review、qa-loop 等)的 verdict 扩到 80-120 字,统一格式:定位 / 强项 / 弱项 / 小提醒。

2026-05-18
Hero 文案 Top 10 → Top picks

原承诺「Top 10 per category」实际只有平均 2.8 个 featured 凑得齐。降级到「Top picks per category」与现实对齐;同时 /skills 默认只显示 28 个 curated,加 chip 切换查看全部 1229 indexed。

2026-04
agent-building featured 从 4 个砍到 2 个

新一轮盲测里,原 #3 和 #4 在评估循环(eval discipline)这一维丢分明显,不再具备「精选」资格,进入「社区索引」状态保留可搜性,但不出现在分类首屏。

2026-03
testing 拆成 qa-loop / gstack-qa

原本两个 skill 在「证据交付 vs 实现修复」两种心智模型上重合度低,硬绑在同一名次反而误导用户。拆出后 qa-loop 走「带证据链给干系人」路径,gstack-qa 走「同会话内修完」路径。

为什么我们的排名值得信Why our rankings are trustworthy

评测原则Curation principles
01
场景匹配度比单纯热度更重要。

优先按真实场景挑选最合适的那个,而不是按人气堆榜单——多不等于好。

02
安装清晰度也是质量的一部分。

安装命令、前置依赖、平台支持都列在卡上,不靠"试试就知道了"。

03
安全说明必须靠近安装决策。

风险等级、源码链接、审计备注都贴在安装按钮旁,不藏在另一个页面。

04
中英文页面都要说明内容完整度。

中文/英文页面分别标注翻译完成度,缺失就直说,不掩盖。

05
高风险技能可以收录,但必须把风险说清楚。

高风险 skill 可以收录,但必须有明确的红色警告和使用限制。

Skill Market
按品类找最好用的 AI 技能·Find the best AI skills for the job
v0.4 · 收录 1306 个 skill · 上次评测 2026-06-10