Skill Eval Harness

Revoir · 62
Indexé par la communauté

Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters

Verified installs0
Stars63
Version1.0.0
Qualité74/100 · Solide
Confiance62/100 · Sandbox uniquement
Audit79/100 · Revue nécessaire

Profil de l’actif

Agents de code et de développement

Code review, repo analysis, testing, CI, GitHub, DevOps, and developer workflow skills.

Voir la catégorie

Scénario

GitHub automation

I need my agent to triage GitHub issues, review pull requests, and summarize repository changes.

Adéquation Agent

Claude Code + OpenAI Agents + CLI

Compatible avec Codex, Claude Code, Cursor, CLI ou des Agents personnalisés.

Installer

Prêt

npx skills add adewale/skill-eval-harness

Maintenance

À jour

21 jours depuis le dernier push

Risque

Revue nécessaire

Dependency or permission surface needs review

Qualité GitHub

63

74/100 Qualité · 70/100 Confiance

Tags de couverture

CodingGitHub automationOutil généralagent-skillskill

Notes de revue

Dependency or permission surface needs review · Permission surface may require sandboxing

Carte d’adoption Agent

Confiance, audit et préparation à l’installation en un coup d’œil

Ces scores combinent les métadonnées publiques du dépôt, les signaux de revue OpenAgentSkill, la fraîcheur de maintenance et la préparation à l’installation. Ils servent à présélectionner et ne remplacent pas la revue humaine.

Qualité

Solide
74

Solid option that is likely worth shortlisting for production workflows.

Confiance

Sandbox uniquement
62

Candidate utile avec des signaux de confiance incomplets ou mixtes. Gardez-la dans un espace isolé jusqu’à ce que la boucle de résultats confirme son adéquation.

Audit

Revue nécessaire
79

Revue lisible par machine de la préparation à l’installation, des métadonnées de sécurité, de la maintenance et du risque d’adoption.

Trust Score OpenAgentSkill v5

Revue humaine avant installation

Exécutez uniquement dans un sandbox et comparez les alternatives proches avant usage réel.

PythonCodexClaude CodeCursorOpenAgentSkill CLI

Stars

63 stars GitHub

Activité du dépôt

63 stars et 5 forks

Maintenance

21 jours depuis le dernier push

Licence

MIT

Installer

npx skills add adewale/skill-eval-harness

Sécurité d’installation

dynamic command execution, standard package or runtime install path

Surface de permissions

secrets or environment access, shell or command execution

Résultats Agent

Pas encore de données de résultats Agent

Documentation

Contexte README/SKILL.md solide

Résumé des risques

Revoir avant production

  • Quality score needs review
  • Permission surface needs review: secrets or environment access, shell or command execution
  • GitHub adoption: 63 GitHub stars
  • Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata

Préparation à l’installation

Chemin d’installation disponible

  • Le chemin d’installation est disponible
  • La preuve du dépôt est disponible
  • La licence est déclarée
  • Pas encore de preuve de résultat Agent-Proven

Métadonnées lisibles par Agent

Données de décision lisibles par machine pour ce skill.

Utilisez ce bloc ou le JSON intégré pour décider si un Agent doit installer ce skill, choisir une alternative ou demander d’abord une revue humaine.

Ouvrir JSON

Tâches adaptées

  • Workflows d’Agents de recherche
  • Équipes Claude Code
  • builders willing to evaluate younger projects
  • Sources de recherche

Agents adaptés

PythonCodexClaude CodeCursorOpenAgentSkill CLIOpenAI AgentsCLI

Décision d’installation

Commande
npx skills add adewale/skill-eval-harness
Politique
Bloquer
Revue humaine
Oui

Confiance et risque

Confiance
62/100
Audit
79/100
Niveau de risque
Revue nécessaire

Boucle de résultat

Endpoint
/api/agent/outcome
ID d’événement
resolve
Résultats
5

Commande d’installation

npx skills add adewale/skill-eval-harness

Ne pas utiliser quand

  • Équipes qui nécessitent un SLA soutenu par le fournisseur
  • Environnements fortement conformes sans revue interne de sécurité
  • No major risk signals from current metadata
  • Indices de permissions à haut risque : Shell or command execution, Secrets or environment access
  • Dependency or permission surface needs review

Sécurité Agent v2

39/100 · Éviter l’installation automatique

Blocked for auto-installBloquer

This skill should not be selected by an agent without explicit human security review.

Do not auto-install. Inspect the source, dependencies, and permission surface first.

Résoudre via API

Élevé

Exécution shell ou de commande

Les métadonnées de la skill font référence à des workflows de terminal, CLI, shell, sous-processus ou exécution de commande.

Moyen

Accès réseau

La skill récupère probablement des pages distantes, API, dépôts ou services externes.

Moyen

Accès au système de fichiers

La skill peut lire ou écrire des fichiers de projet, documents, artefacts générés ou l’état local de l’espace de travail.

Élevé

Secrets or environment access

Skill metadata references credentials, tokens, environment variables, or secret-bearing workflows.

  • Indices de permissions à haut risque : Shell or command execution, Secrets or environment access
  • Dependency or permission surface needs review

Cibles d’installation

Installer ce skill dans votre workflow Agent

Utilisez le point de terminaison public pour récupérer la commande, la checklist, les prompts et les liens canoniques.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install adewale-skill-eval-harness

Plan de résolution Agent

Laissez un Agent vérifier la pertinence avant l’installation.

L’API Resolve renvoie la skill sélectionnée, des alternatives, la politique de sécurité, les notes d’audit, la cible d’installation et un prompt prêt à l’emploi.

Ouvrir le plan texte

L’Agent doit vérifier

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Copier le prompt

Task: Use Skill Eval Harness in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Skill%20Eval%20Harness%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install
Install command: npx skills add adewale/skill-eval-harness
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Relais Agent

Donnez à l’Agent le chemin d’installation, pas un autre annuaire.

Utilisez le point de terminaison public pour récupérer la commande, la checklist, les prompts et les liens canoniques.

Ouvrir l’API d’installation

Prompt Agent

Use Skill Eval Harness for this task. Review https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install, then install with: npx skills add adewale/skill-eval-harness

Métadonnées Registry

Profil lisible par Agent pour la sélection automatique de skills.

L’API Registry fournit les signaux de décision, confiance, audit, cas d’usage et installation sans analyser l’interface.

Ouvrir Manifest

Adéquation Agent

73/100

Agents de recherche

Plateformes

Python, Claude Code, OpenAI Agents

Rapport d’audit

Revue nécessaire · 79/100

Revue lisible par machine de la préparation à l’installation, des métadonnées de sécurité, de la maintenance et du risque d’adoption.

Voir le rapport d’auditVoir le rapport d’évaluation

Panneau de décision Agent

Companion skill for Research agents

Shortlist this skill and compare it with close alternatives before production adoption.

73
Préparation
Préselection
Étape

Rôle dans la pile

Skill complémentaire

Pertinence principale

Agents de recherche

Libellé de confiance

Liste solide

Chemin d’installation

Commande prête

À utiliser lorsque

  • Workflows d’Agents de recherche
  • Équipes Claude Code
  • builders willing to evaluate younger projects

Preuves

  • recent repository activity
  • install command or GitHub repo available
  • profil qualité 74/100
  • 1 événements OpenAgentSkill

revoir d’abord

  • No major risk signals from current metadata

Chemin d’implémentation

  1. 1Installez-le dans un Agent en sandbox et exécutez une tâche de Agents de recherche de bout en bout.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Profil de confiance

Sandbox uniquement

Candidate utile avec des signaux de confiance incomplets ou mixtes. Gardez-la dans un espace isolé jusqu’à ce que la boucle de résultats confirme son adéquation.

62
Trust Score OpenAgentSkill

Adoption GitHub

Vérifier

63 stars GitHub

Activité stars/forks

Vérifier

63 stars et 5 forks; l’activité des issues n’est pas disponible dans les métadonnées actuelles

Maintenance récente

Validé

21 jours depuis le dernier push

Clarté de licence

Validé

MIT

Signaux positifs

  • Revue IA approuvée
  • Le chemin d’installation est disponible
  • La preuve du dépôt est disponible
  • Dépôt maintenu récemment
  • La commande d’installation ne présente aucun motif de haut risque évident
  • La boucle de résultats est prête mais nécessite la première exécution réelle de l’Agent

Réviser avant installation

  • Quality score needs review
  • Permission surface needs review: secrets or environment access, shell or command execution
  • GitHub adoption: 63 GitHub stars
  • Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata
  • Dependency/runtime risk: command execution surface, credential or environment access
  • Permission surface: secrets or environment access, shell or command execution
  • Pas encore de rapports de résultats Agent réels
  • Une revue humaine est requise avant une installation sans surveillance

Action recommandée

Exécutez uniquement dans un sandbox et comparez les alternatives proches avant usage réel.

Profil qualité

Solide candidat pour les workflows Agent

Solid option that is likely worth shortlisting for production workflows.

74
Stars GitHub
63
Actualité
il y a 21 jours
Prêt à installer
Oui
Licence
MIT

Adéquation au workflow

Utilisez cette skill dans ces scénarios

Adéquation au workflow

Ajouter à un workflow complet

Liste d’alternatives

Comparer avant installation

Similar skills that may fit this task.

Tout comparer

Vue d’ensemble

# Skill Eval Harness

[![CI](https://github.com/adewale/skill-eval-harness/actions/workflows/ci.yml/badge.svg)](https://github.com/adewale/skill-eval-harness/actions/workflows/ci.yml) [![License: MIT](https://img.shields.io/badge/License-MIT-blue.svg)](LICENSE)

Skill Eval Harness is a Python CLI that measures the **causal lift** of an Agent Skill: it runs the same case, model, and repetition with and without the skill, validates that exact experimental identity, then reports what changed, what passed, and whether the eval leaked its own answer. It reads `evals/shared-benchmark.json`, emits answer-key-safe task rows, grades files under `eval-runs/` locally and deterministically — no model call in the grade path — and writes benchmark reports you can diff across variants.

General eval frameworks (openai/evals, vitest-evals, viteval) score one output against a rubric. This one measures the *difference the skill makes*, and spends its surface area on keeping that difference honest: paired with/without comparison, `tune`/`holdout`/`holdback` split discipline, leakage lint, materialized ablations with provenance gates, and per-model lift. None of those frameworks have them, and they are what make a reported number trustworthy rather than merely green.

## Questions this helps answer

| Question | Command/report to use | |---|---| | Does this skill improve outputs compared with no skill at all? | `prepare` paired `with_skill` / `without_skill` rows, then `benchmark` paired lift and significance. | | Which prompts improved, regressed, saturated, or showed no lift? | `benchmark` `case_flags`, `render-viewer`, and `error-analysis`. | | Is the skill worth its extra tokens or dollars? | `profile-skill`, `token-overhead`, `cost-summary`, and lift-per-dollar summaries. | | Did my latest skill edit introduce a regression? | Re-run the same manifest, inspect `ablation_regressions`, `trend`, and `render-viewer --previous-workspace`. | | Which instruction, checklist, reference, scr

Compatibilité plateforme

pythonFULL

Détails techniques

Version
1.0.0
Licence
MIT
Dernière mise à jour
18 août 2026
Publié
29 juil. 2026

Frameworks et outils

Python

Instantané de décision

Skill complémentaire

73
Prêt
Préselection
Étape

recent repository activity

Audit

Revue d’installation

Revue d’installation et d’adoption

79
Revue nécessaire
Sécurité
75/100
Maintenance
100/100
Installer
92/100
Ouvrir l’audit completVoir le rapport d’évaluation

Preuves validées par Agent

Preuves validées par Agent

Rapports après resolve, revue, installation et une exécution limitée.

0
Validé
Needs first agent runAuto-installation: revoir d’abordDernier: Inconnu
Taux de réussite
Échec récent
Résultats
0
Qualité de sortie
Échecs
0
Non pertinent
0
Installations
0
Bloqué par le risque
0
Configuration requise
0
Production
0

Aucune donnée de résultat Agent pour l’instant. La première exécution peut signaler succès, besoin de configuration, blocage de risque, échec ou non-pertinence via /api/agent/outcome.

Installer

Ajouter au workflow Agent

Gratuit et open source. Examinez le rapport avant l’installation dans des Agents de production.

Boucle de croissance

Kit de partage

X

Brouillon guidé par scénario pour Skill Eval Harness, prêt pour une publication manuelle sur X.

Note du curateur
Skill Eval Harness: Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters

63 stars

https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x
Ouvrir le brouillon X
Réponse facultative avec commande d’installation
Listing + install path for Skill Eval Harness:
https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x

Install: npx skills add adewale/skill-eval-harness

Source de la fiche

Indexé par la communauté

Revendiable

Cette fiche a été indexée à partir de sources publiques et n’est pas marquée officielle tant qu’une revendication de mainteneur n’est pas approuvée.

Créateur
adewale
Indexé par
Index communautaire OpenAgentSkill

L’attribution renvoie au dépôt public ou au profil du créateur. Les créateurs peuvent revendiquer la fiche pour mettre à jour les signaux de propriété.

Revendiquer ce skill

Revendication du propriétaire

Revendiquer cette fiche de skill

Cette fiche Indexé par la communauté est attribuée à adewale, mais n’est pas encore marquée officielle. Revendiquez-la pour ajouter un signal de propriétaire vérifié et rendre les futures mises à jour de lancement, d’installation et d’audit plus fiables.

Kit de backlinks créateur

Ajoutez les badges de preuve à votre README

Affichez la fiche canonique, les signaux actuels de confiance et d’audit, ainsi que de vraies preuves Agent-Proven là où les développeurs évaluent le dépôt.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=listed&label=Listed)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=trust&label=Trust)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=audit&label=Audit)](https://www.openagentskill.com/skills/adewale-skill-eval-harness/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)

Auteur

A

adewale

@adewale

Adéquation plateforme

Signaux de santé

Stars GitHub
63
Score de qualité
45/100
Dernier push GitHub
1 août 2026
Indications de framework
1
Vues OpenAgentSkill
1
Copies d’installation
0
Clics sortants
0

Signal de communauté

Indiquez si ce skill semble utile à votre workflow Agent. Les retours agrégés améliorent le classement au fil du temps.

Confiance et sécurité

Sandbox uniquement

62
  • Adoption GitHub63 stars GitHubVérifier
  • Activité stars/forks63 stars et 5 forks; l’activité des issues n’est pas disponible dans les métadonnées actuellesVérifier
  • Maintenance récente21 jours depuis le dernier pushValidé
  • Clarté de licenceMITValidé
  • Complétude README/SKILL.mdLes métadonnées incluent suffisamment de contexte d’usage et de workflowValidé
  • Risque dépendances/runtimecommand execution surface, credential or environment accessVérifier