Skill Eval Harness

Tinjau · 62
Diindeks komunitas

Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters

Verified installs0
Star63
Versi1.0.0
Kualitas74/100 · Kuat
Kepercayaan62/100 · Hanya sandbox
Audit79/100 · Perlu ditinjau

Profil aset

Agent pemrograman dan pengembangan

Code review, repo analysis, testing, CI, GitHub, DevOps, and developer workflow skills.

Lihat kategori

Skenario

GitHub automation

I need my agent to triage GitHub issues, review pull requests, and summarize repository changes.

Kecocokan Agent

Claude Code + OpenAI Agents + CLI

Cocok untuk Codex, Claude Code, Cursor, CLI, atau Agent khusus.

Pasang

Siap

npx skills add adewale/skill-eval-harness

Pemeliharaan

Terkini

22 hari sejak push

Risiko

Perlu ditinjau

Dependency or permission surface needs review

Kualitas GitHub

63

74/100 Kualitas · 70/100 Kepercayaan

Tag cakupan

CodingGitHub automationAlat umumagent-skillskill

Catatan ulasan

Dependency or permission surface needs review · Permission surface may require sandboxing

Kartu adopsi Agent

Kepercayaan, audit, dan kesiapan pemasangan dalam sekali lihat

Skor ini menggabungkan metadata repositori publik, sinyal ulasan OpenAgentSkill, kebaruan pemeliharaan, dan kesiapan pemasangan. Ini adalah sinyal shortlist, bukan pengganti peninjauan manusia.

Kualitas

Kuat
74

Solid option that is likely worth shortlisting for production workflows.

Kepercayaan

Hanya sandbox
62

Kandidat berguna dengan sinyal kepercayaan yang kurang atau bercampur. Gunakan di ruang kerja terisolasi hingga loop hasil membuktikan kecocokan tugas.

Audit

Perlu ditinjau
79

Tinjauan yang dapat dibaca mesin tentang kesiapan pemasangan, metadata keamanan, pemeliharaan, dan risiko adopsi.

Trust Score OpenAgentSkill v5

Tinjauan manusia sebelum pemasangan

Jalankan hanya dalam sandbox dan bandingkan alternatif terdekat sebelum digunakan untuk kerja nyata.

PythonCodexClaude CodeCursorOpenAgentSkill CLI

Star

63 star GitHub

Aktivitas repositori

63 star dan 5 fork

Pemeliharaan

22 hari sejak push

Lisensi

MIT

Pasang

npx skills add adewale/skill-eval-harness

Keamanan pemasangan

dynamic command execution, standard package or runtime install path

Cakupan izin

secrets or environment access, shell or command execution

Hasil Agent

Belum ada data hasil Agent

Dokumentasi

Konteks README/SKILL.md kuat

Ringkasan risiko

Tinjau sebelum produksi

  • Quality score needs review
  • Permission surface needs review: secrets or environment access, shell or command execution
  • GitHub adoption: 63 GitHub stars
  • Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata

Kesiapan pemasangan

Jalur pemasangan tersedia

  • Jalur pemasangan tersedia
  • Bukti repositori tersedia
  • Lisensi dinyatakan
  • Belum ada bukti hasil Agent-Proven

Metadata yang dapat dibaca Agent

Data keputusan yang dapat dibaca mesin untuk skill ini.

Gunakan blok ini atau JSON tersemat untuk memutuskan apakah Agent perlu memasang skill ini, memilih alternatif, atau meminta tinjauan manusia terlebih dahulu.

Buka JSON

Tugas yang sesuai

  • Alur kerja Agent riset
  • Tim Claude Code
  • builders willing to evaluate younger projects
  • Sumber pencarian

Agent yang sesuai

PythonCodexClaude CodeCursorOpenAgentSkill CLIOpenAI AgentsCLI

Keputusan pemasangan

Perintah
npx skills add adewale/skill-eval-harness
Kebijakan
Blokir
Tinjauan manusia
Ya

Kepercayaan dan risiko

Kepercayaan
62/100
Audit
79/100
Tingkat risiko
Perlu ditinjau

Lingkar hasil

Endpoint
/api/agent/outcome
ID event
resolve
Hasil
5

Perintah pemasangan

npx skills add adewale/skill-eval-harness

Jangan gunakan ketika

  • Tim yang membutuhkan SLA dengan dukungan vendor
  • Lingkungan berkompliansi tinggi tanpa tinjauan keamanan internal
  • No major risk signals from current metadata
  • Petunjuk izin berisiko tinggi: Shell or command execution, Secrets or environment access
  • Dependency or permission surface needs review

Keamanan Agent v2

39/100 · Hindari pemasangan otomatis

Blocked for auto-installBlokir

This skill should not be selected by an agent without explicit human security review.

Do not auto-install. Inspect the source, dependencies, and permission surface first.

Selesaikan via API

Tinggi

Eksekusi shell atau perintah

Metadata skill merujuk terminal, CLI, shell, subprocess, atau alur kerja eksekusi perintah.

Sedang

Akses jaringan

Skill kemungkinan mengambil halaman jarak jauh, API, repositori, atau layanan eksternal.

Sedang

Akses sistem file

Skill dapat membaca atau menulis file proyek, dokumen, artefak yang dihasilkan, atau status workspace lokal.

Tinggi

Secrets or environment access

Skill metadata references credentials, tokens, environment variables, or secret-bearing workflows.

  • Petunjuk izin berisiko tinggi: Shell or command execution, Secrets or environment access
  • Dependency or permission surface needs review

Target pemasangan

Pasang skill ini di alur Agent Anda

Gunakan endpoint publik untuk mengambil perintah, checklist keamanan, prompt target, dan tautan kanonis.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install adewale-skill-eval-harness

Rencana resolusi Agent

Biarkan Agent memverifikasi kecocokan sebelum memasang.

API Resolve mengembalikan skill utama, alternatif, kebijakan keamanan, catatan audit, target pemasangan, dan prompt siap pakai.

Buka rencana teks

Agent harus memeriksa

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Salin prompt

Task: Use Skill Eval Harness in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Skill%20Eval%20Harness%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install
Install command: npx skills add adewale/skill-eval-harness
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Serah-terima Agent

Berikan jalur pemasangan kepada Agent, bukan direktori lain.

Gunakan endpoint publik untuk mengambil perintah, checklist keamanan, prompt target, dan tautan kanonis.

Buka API pemasangan

Prompt Agent

Use Skill Eval Harness for this task. Review https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install, then install with: npx skills add adewale/skill-eval-harness

Metadata Registry

Profil yang dapat dibaca Agent untuk pemilihan skill otomatis.

API Registry menyediakan sinyal keputusan, kepercayaan, audit, use case, dan pemasangan tanpa mengikis UI.

Buka Manifest

Kecocokan Agent

73/100

Agent riset

Platform

Python, Claude Code, OpenAI Agents

Laporan audit

Perlu ditinjau · 79/100

Tinjauan yang dapat dibaca mesin tentang kesiapan pemasangan, metadata keamanan, pemeliharaan, dan risiko adopsi.

Lihat laporan auditLihat laporan evaluasi

Panel keputusan Agent

Companion skill for Research agents

Shortlist this skill and compare it with close alternatives before production adoption.

73
Kesiapan
Shortlist
Tahap

Peran di stack

Skill pendamping

Kecocokan utama

Agent riset

Label kepercayaan

Shortlist kuat

Jalur pemasangan

Perintah siap

Gunakan saat

  • Alur kerja Agent riset
  • Tim Claude Code
  • builders willing to evaluate younger projects

Bukti

  • recent repository activity
  • install command or GitHub repo available
  • profil kualitas 74/100
  • 1 event interaksi OpenAgentSkill

tinjau dulu

  • No major risk signals from current metadata

Jalur implementasi

  1. 1Pasang di Agent sandbox dan jalankan satu tugas Agent riset dari awal hingga akhir.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Profil kepercayaan

Hanya sandbox

Kandidat berguna dengan sinyal kepercayaan yang kurang atau bercampur. Gunakan di ruang kerja terisolasi hingga loop hasil membuktikan kecocokan tugas.

62
Trust Score OpenAgentSkill

Adopsi GitHub

Periksa

63 star GitHub

Aktivitas star/fork

Periksa

63 star dan 5 fork; aktivitas issue tidak tersedia dalam metadata saat ini

Pemeliharaan terbaru

Lulus

22 hari sejak push

Kejelasan lisensi

Lulus

MIT

Sinyal positif

  • Tinjauan AI disetujui
  • Jalur pemasangan tersedia
  • Bukti repositori tersedia
  • Repositori yang baru dipelihara
  • Perintah pemasangan tidak memiliki pola berisiko tinggi yang jelas
  • Loop hasil siap tetapi membutuhkan eksekusi Agent nyata pertama

Tinjau sebelum memasang

  • Quality score needs review
  • Permission surface needs review: secrets or environment access, shell or command execution
  • GitHub adoption: 63 GitHub stars
  • Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata
  • Dependency/runtime risk: command execution surface, credential or environment access
  • Permission surface: secrets or environment access, shell or command execution
  • Belum ada laporan hasil Agent nyata
  • Tinjauan manusia diperlukan sebelum pemasangan tanpa pengawasan

Tindakan yang disarankan

Jalankan hanya dalam sandbox dan bandingkan alternatif terdekat sebelum digunakan untuk kerja nyata.

Profil kualitas

Kuat kandidat untuk alur kerja Agent

Solid option that is likely worth shortlisting for production workflows.

74
Star GitHub
63
Keterkinian
22 hari lalu
Siap dipasang
Ya
Lisensi
MIT

Kecocokan alur kerja

Gunakan skill ini pada skenario berikut

Kecocokan alur kerja

Tambahkan ke alur kerja lengkap

Daftar alternatif

Bandingkan sebelum memasang

Similar skills that may fit this task.

Bandingkan semua

Ringkasan

# Skill Eval Harness

[![CI](https://github.com/adewale/skill-eval-harness/actions/workflows/ci.yml/badge.svg)](https://github.com/adewale/skill-eval-harness/actions/workflows/ci.yml) [![License: MIT](https://img.shields.io/badge/License-MIT-blue.svg)](LICENSE)

Skill Eval Harness is a Python CLI that measures the **causal lift** of an Agent Skill: it runs the same case, model, and repetition with and without the skill, validates that exact experimental identity, then reports what changed, what passed, and whether the eval leaked its own answer. It reads `evals/shared-benchmark.json`, emits answer-key-safe task rows, grades files under `eval-runs/` locally and deterministically — no model call in the grade path — and writes benchmark reports you can diff across variants.

General eval frameworks (openai/evals, vitest-evals, viteval) score one output against a rubric. This one measures the *difference the skill makes*, and spends its surface area on keeping that difference honest: paired with/without comparison, `tune`/`holdout`/`holdback` split discipline, leakage lint, materialized ablations with provenance gates, and per-model lift. None of those frameworks have them, and they are what make a reported number trustworthy rather than merely green.

## Questions this helps answer

| Question | Command/report to use | |---|---| | Does this skill improve outputs compared with no skill at all? | `prepare` paired `with_skill` / `without_skill` rows, then `benchmark` paired lift and significance. | | Which prompts improved, regressed, saturated, or showed no lift? | `benchmark` `case_flags`, `render-viewer`, and `error-analysis`. | | Is the skill worth its extra tokens or dollars? | `profile-skill`, `token-overhead`, `cost-summary`, and lift-per-dollar summaries. | | Did my latest skill edit introduce a regression? | Re-run the same manifest, inspect `ablation_regressions`, `trend`, and `render-viewer --previous-workspace`. | | Which instruction, checklist, reference, scr

Kompatibilitas platform

pythonFULL

Detail teknis

Versi
1.0.0
Lisensi
MIT
Pembaruan terakhir
18 Agu 2026
Diterbitkan
29 Jul 2026

Framework dan alat

Python

Ringkasan keputusan

Skill pendamping

73
Siap
Shortlist
Tahap

recent repository activity

Audit

Tinjauan pemasangan

Tinjauan pemasangan dan adopsi

79
Perlu ditinjau
Keamanan
75/100
Pemeliharaan
100/100
Pasang
92/100
Buka audit lengkapLihat laporan evaluasi

Bukti tervalidasi Agent

Bukti tervalidasi Agent

Laporan hasil setelah resolve, tinjau, pasang, dan satu eksekusi terbatas.

0
Terbukti
Needs first agent runPasang otomatis: tinjau duluTerakhir: Tidak diketahui
Tingkat sukses
Kegagalan terbaru
Hasil
0
Kualitas output
Gagal
0
Tidak relevan
0
Pemasangan
0
Diblokir risiko
0
Perlu penyiapan
0
Produksi
0

Belum ada data hasil Agent. Eksekusi pertama dapat melaporkan keberhasilan, kebutuhan setup, blok risiko, kegagalan, atau tidak relevan melalui /api/agent/outcome.

Pasang

Tambahkan ke alur Agent

Gratis dan sumber terbuka. Tinjau laporan sebelum memasang pada Agent produksi.

Siklus pertumbuhan

Kit berbagi

X

Draf berbasis skenario untuk Skill Eval Harness, siap untuk posting manual di X.

Catatan kurator
Skill Eval Harness: Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters

63 stars

https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x
Buka draf X
Balasan opsional dengan perintah pemasangan
Listing + install path for Skill Eval Harness:
https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x

Install: npx skills add adewale/skill-eval-harness
Buka draf balasan

Sumber listing

Diindeks komunitas

Dapat diklaim

Listing ini diindeks dari sumber publik dan belum ditandai resmi hingga klaim pemelihara disetujui.

Kreator
adewale
Diindeks oleh
Indeks komunitas OpenAgentSkill

Atribusi menautkan ke repositori publik atau profil kreator. Kreator dapat mengklaim listing untuk memperbarui sinyal kepemilikan.

Klaim skill ini

Klaim pemilik

Klaim listing skill ini

Listing Diindeks komunitas ini dikaitkan dengan adewale, tetapi belum ditandai resmi. Klaim untuk menambahkan sinyal pemilik terverifikasi dan membuat pembaruan peluncuran, pemasangan, serta audit berikutnya lebih tepercaya.

Kit backlink kreator

Tambahkan badge bukti ke README Anda

Tampilkan listing kanonis, sinyal kepercayaan dan audit saat ini, serta bukti Agent-Proven nyata di tempat pengembang mengevaluasi repositori.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=listed&label=Listed)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=trust&label=Trust)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=audit&label=Audit)](https://www.openagentskill.com/skills/adewale-skill-eval-harness/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/adewale-skill-eval-harness?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/adewale-skill-eval-harness)

Penulis

A

adewale

@adewale

Kecocokan platform

Sinyal kesehatan

Star GitHub
63
Skor kualitas
45/100
Push GitHub terakhir
1 Agu 2026
Petunjuk framework
1
Tampilan OpenAgentSkill
1
Salinan pemasangan
0
Klik keluar
0

Sinyal komunitas

Bagikan apakah skill ini bermanfaat untuk alur kerja Agent Anda. Masukan gabungan meningkatkan peringkat dari waktu ke waktu.

Kepercayaan & keamanan

Hanya sandbox

62
  • Adopsi GitHub63 star GitHubPeriksa
  • Aktivitas star/fork63 star dan 5 fork; aktivitas issue tidak tersedia dalam metadata saat iniPeriksa
  • Pemeliharaan terbaru22 hari sejak pushLulus
  • Kejelasan lisensiMITLulus
  • Kelengkapan README/SKILL.mdMetadata memuat konteks penggunaan dan alur kerja yang cukupLulus
  • Risiko dependensi/runtimecommand execution surface, credential or environment accessPeriksa