Skill Eval Harness
Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters
Profil aset
Agent pemrograman dan pengembangan
Code review, repo analysis, testing, CI, GitHub, DevOps, and developer workflow skills.
Skenario
GitHub automation
I need my agent to triage GitHub issues, review pull requests, and summarize repository changes.
Kecocokan Agent
Claude Code + OpenAI Agents + CLI
Cocok untuk Codex, Claude Code, Cursor, CLI, atau Agent khusus.
Pasang
Siap
npx skills add adewale/skill-eval-harness
Pemeliharaan
Terkini
22 hari sejak push
Risiko
Perlu ditinjau
Dependency or permission surface needs review
Kualitas GitHub
63
74/100 Kualitas · 70/100 Kepercayaan
Tag cakupan
Catatan ulasan
Dependency or permission surface needs review · Permission surface may require sandboxing
Kartu adopsi Agent
Kepercayaan, audit, dan kesiapan pemasangan dalam sekali lihat
Skor ini menggabungkan metadata repositori publik, sinyal ulasan OpenAgentSkill, kebaruan pemeliharaan, dan kesiapan pemasangan. Ini adalah sinyal shortlist, bukan pengganti peninjauan manusia.
Kualitas
KuatSolid option that is likely worth shortlisting for production workflows.
Kepercayaan
Hanya sandboxKandidat berguna dengan sinyal kepercayaan yang kurang atau bercampur. Gunakan di ruang kerja terisolasi hingga loop hasil membuktikan kecocokan tugas.
Audit
Perlu ditinjauTinjauan yang dapat dibaca mesin tentang kesiapan pemasangan, metadata keamanan, pemeliharaan, dan risiko adopsi.
Trust Score OpenAgentSkill v5
Tinjauan manusia sebelum pemasangan
Jalankan hanya dalam sandbox dan bandingkan alternatif terdekat sebelum digunakan untuk kerja nyata.
Star
63 star GitHub
Aktivitas repositori
63 star dan 5 fork
Pemeliharaan
22 hari sejak push
Lisensi
MIT
Pasang
npx skills add adewale/skill-eval-harness
Keamanan pemasangan
dynamic command execution, standard package or runtime install path
Cakupan izin
secrets or environment access, shell or command execution
Hasil Agent
Belum ada data hasil Agent
Dokumentasi
Konteks README/SKILL.md kuat
Ringkasan risiko
Tinjau sebelum produksi
- Quality score needs review
- Permission surface needs review: secrets or environment access, shell or command execution
- GitHub adoption: 63 GitHub stars
- Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata
Kesiapan pemasangan
Jalur pemasangan tersedia
- Jalur pemasangan tersedia
- Bukti repositori tersedia
- Lisensi dinyatakan
- Belum ada bukti hasil Agent-Proven
Metadata yang dapat dibaca Agent
Data keputusan yang dapat dibaca mesin untuk skill ini.
Gunakan blok ini atau JSON tersemat untuk memutuskan apakah Agent perlu memasang skill ini, memilih alternatif, atau meminta tinjauan manusia terlebih dahulu.
Tugas yang sesuai
- Alur kerja Agent riset
- Tim Claude Code
- builders willing to evaluate younger projects
- Sumber pencarian
Agent yang sesuai
Keputusan pemasangan
- Perintah
- npx skills add adewale/skill-eval-harness
- Kebijakan
- Blokir
- Tinjauan manusia
- Ya
Kepercayaan dan risiko
- Kepercayaan
- 62/100
- Audit
- 79/100
- Tingkat risiko
- Perlu ditinjau
Lingkar hasil
- Endpoint
- /api/agent/outcome
- ID event
- resolve
- Hasil
- 5
Perintah pemasangan
npx skills add adewale/skill-eval-harnessJangan gunakan ketika
- Tim yang membutuhkan SLA dengan dukungan vendor
- Lingkungan berkompliansi tinggi tanpa tinjauan keamanan internal
- No major risk signals from current metadata
- Petunjuk izin berisiko tinggi: Shell or command execution, Secrets or environment access
- Dependency or permission surface needs review
Keamanan Agent v2
39/100 · Hindari pemasangan otomatis
This skill should not be selected by an agent without explicit human security review.
Do not auto-install. Inspect the source, dependencies, and permission surface first.
Tinggi
Eksekusi shell atau perintah
Metadata skill merujuk terminal, CLI, shell, subprocess, atau alur kerja eksekusi perintah.
Sedang
Akses jaringan
Skill kemungkinan mengambil halaman jarak jauh, API, repositori, atau layanan eksternal.
Sedang
Akses sistem file
Skill dapat membaca atau menulis file proyek, dokumen, artefak yang dihasilkan, atau status workspace lokal.
Tinggi
Secrets or environment access
Skill metadata references credentials, tokens, environment variables, or secret-bearing workflows.
- Petunjuk izin berisiko tinggi: Shell or command execution, Secrets or environment access
- Dependency or permission surface needs review
Target pemasangan
Pasang skill ini di alur Agent Anda
Gunakan endpoint publik untuk mengambil perintah, checklist keamanan, prompt target, dan tautan kanonis.
OpenAgentSkill CLI
Resolve policy, run the source installer safely, and report a verified install receipt.
$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install adewale-skill-eval-harnessRencana resolusi Agent
Biarkan Agent memverifikasi kecocokan sebelum memasang.
API Resolve mengembalikan skill utama, alternatif, kebijakan keamanan, catatan audit, target pemasangan, dan prompt siap pakai.
Buka JSON
/api/agent/resolve?task=Use%20Skill%20Eval%20Harness%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Teks Resolve
/api/agent/resolve?task=Use%20Skill%20Eval%20Harness%20for%20an%20agent%20workflow&agent=codex&max_risk=medium&format=text
Serah-terima pemasangan
/api/skills/adewale-skill-eval-harness/install
Agent harus memeriksa
- Task fit and alternatives from Resolve API.
- Audit score, trust score, and safety policy warnings.
- Install target compatibility for Codex, Claude Code, Cursor, or CLI.
Salin prompt
Task: Use Skill Eval Harness in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Skill%20Eval%20Harness%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install
Install command: npx skills add adewale/skill-eval-harness
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.Serah-terima Agent
Berikan jalur pemasangan kepada Agent, bukan direktori lain.
Gunakan endpoint publik untuk mengambil perintah, checklist keamanan, prompt target, dan tautan kanonis.
Serah-terima pemasangan
/api/skills/adewale-skill-eval-harness/install
Format teks LLM
/api/skills/adewale-skill-eval-harness/install?format=text
Cari alternatif
/api/skills/search?q=Skill%20Eval%20Harness&limit=3
Prompt Agent
Use Skill Eval Harness for this task. Review https://www.openagentskill.com/api/skills/adewale-skill-eval-harness/install, then install with: npx skills add adewale/skill-eval-harnessMetadata Registry
Profil yang dapat dibaca Agent untuk pemilihan skill otomatis.
API Registry menyediakan sinyal keputusan, kepercayaan, audit, use case, dan pemasangan tanpa mengikis UI.
Manifest
/api/registry/manifest/adewale-skill-eval-harness
Teks LLM
/api/registry/manifest/adewale-skill-eval-harness?format=text
Alias pemasangan
/api/registry/install/adewale-skill-eval-harness
Rekomendasikan
/api/registry/recommend?task=Use%20Skill%20Eval%20Harness%20in%20an%20agent%20workflow&limit=3
Kecocokan Agent
Agent riset
Tag use case
Platform
Python, Claude Code, OpenAI Agents
Laporan audit
Perlu ditinjau · 79/100
Tinjauan yang dapat dibaca mesin tentang kesiapan pemasangan, metadata keamanan, pemeliharaan, dan risiko adopsi.
Panel keputusan Agent
Companion skill for Research agents
Shortlist this skill and compare it with close alternatives before production adoption.
Peran di stack
Skill pendamping
Kecocokan utama
Agent riset
Label kepercayaan
Shortlist kuat
Jalur pemasangan
Perintah siap
Gunakan saat
- Alur kerja Agent riset
- Tim Claude Code
- builders willing to evaluate younger projects
Bukti
- recent repository activity
- install command or GitHub repo available
- profil kualitas 74/100
- 1 event interaksi OpenAgentSkill
tinjau dulu
- No major risk signals from current metadata
Jalur implementasi
- 1Pasang di Agent sandbox dan jalankan satu tugas Agent riset dari awal hingga akhir.
- 2Compare output quality, latency, and failure behavior against at least one alternative.
- 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.
Profil kepercayaan
Hanya sandbox
Kandidat berguna dengan sinyal kepercayaan yang kurang atau bercampur. Gunakan di ruang kerja terisolasi hingga loop hasil membuktikan kecocokan tugas.
Adopsi GitHub
Periksa63 star GitHub
Aktivitas star/fork
Periksa63 star dan 5 fork; aktivitas issue tidak tersedia dalam metadata saat ini
Pemeliharaan terbaru
Lulus22 hari sejak push
Kejelasan lisensi
LulusMIT
Sinyal positif
- Tinjauan AI disetujui
- Jalur pemasangan tersedia
- Bukti repositori tersedia
- Repositori yang baru dipelihara
- Perintah pemasangan tidak memiliki pola berisiko tinggi yang jelas
- Loop hasil siap tetapi membutuhkan eksekusi Agent nyata pertama
Tinjau sebelum memasang
- Quality score needs review
- Permission surface needs review: secrets or environment access, shell or command execution
- GitHub adoption: 63 GitHub stars
- Stars/forks activity: 63 stars, 5 forks; issue activity unavailable in current metadata
- Dependency/runtime risk: command execution surface, credential or environment access
- Permission surface: secrets or environment access, shell or command execution
- Belum ada laporan hasil Agent nyata
- Tinjauan manusia diperlukan sebelum pemasangan tanpa pengawasan
Tindakan yang disarankan
Jalankan hanya dalam sandbox dan bandingkan alternatif terdekat sebelum digunakan untuk kerja nyata.
Profil kualitas
Kuat kandidat untuk alur kerja Agent
Solid option that is likely worth shortlisting for production workflows.
Kecocokan alur kerja
Gunakan skill ini pada skenario berikut
Investigate faster
Research agents
I need my agent to research a topic, compare sources, and produce a concise report.
Manage repositories
GitHub automation
I need my agent to triage GitHub issues, review pull requests, and summarize repository changes.
Automate repeated work
Workflow automation
I need my agent to automate a repeated workflow across tools and files.
Kecocokan alur kerja
Tambahkan ke alur kerja lengkap
Find, compare, and synthesize
Research report agent
A workflow for agents that gather sources, compare claims, summarize long material, and draft useful research briefs.
Turn skills into distribution
Content growth agent
A workflow for turning newly indexed skills into SEO briefs, social drafts, comparison pages, and reusable publishing workflows.
Inspect, patch, and verify code
Coding review agent
A workflow for software agents that inspect repositories, review pull requests, generate tests, and turn findings into shippable patches.
Daftar alternatif
Bandingkan sebelum memasang
Similar skills that may fit this task.
Khazix Skills
A collection of practical, installable AI agent skills for disk cleanup, AI news retrieval, and project management, following the Agent Skills standard.
Awesome Claude Skills
A curated list of resources and tools for enhancing Claude AI workflows.
Claude Scientific Skills
A comprehensive collection of ready-to-use scientific and research skills for AI agents.
Ringkasan
# Skill Eval Harness
[](https://github.com/adewale/skill-eval-harness/actions/workflows/ci.yml) [](LICENSE)
Skill Eval Harness is a Python CLI that measures the **causal lift** of an Agent Skill: it runs the same case, model, and repetition with and without the skill, validates that exact experimental identity, then reports what changed, what passed, and whether the eval leaked its own answer. It reads `evals/shared-benchmark.json`, emits answer-key-safe task rows, grades files under `eval-runs/` locally and deterministically — no model call in the grade path — and writes benchmark reports you can diff across variants.
General eval frameworks (openai/evals, vitest-evals, viteval) score one output against a rubric. This one measures the *difference the skill makes*, and spends its surface area on keeping that difference honest: paired with/without comparison, `tune`/`holdout`/`holdback` split discipline, leakage lint, materialized ablations with provenance gates, and per-model lift. None of those frameworks have them, and they are what make a reported number trustworthy rather than merely green.
## Questions this helps answer
| Question | Command/report to use | |---|---| | Does this skill improve outputs compared with no skill at all? | `prepare` paired `with_skill` / `without_skill` rows, then `benchmark` paired lift and significance. | | Which prompts improved, regressed, saturated, or showed no lift? | `benchmark` `case_flags`, `render-viewer`, and `error-analysis`. | | Is the skill worth its extra tokens or dollars? | `profile-skill`, `token-overhead`, `cost-summary`, and lift-per-dollar summaries. | | Did my latest skill edit introduce a regression? | Re-run the same manifest, inspect `ablation_regressions`, `trend`, and `render-viewer --previous-workspace`. | | Which instruction, checklist, reference, scr
Kompatibilitas platform
Detail teknis
- Versi
- 1.0.0
- Lisensi
- MIT
- Pembaruan terakhir
- 18 Agu 2026
- Diterbitkan
- 29 Jul 2026
Framework dan alat
Ringkasan keputusan
Skill pendamping
recent repository activity
Audit
Tinjauan pemasangan
Tinjauan pemasangan dan adopsi
- Keamanan
- 75/100
- Pemeliharaan
- 100/100
- Pasang
- 92/100
Bukti tervalidasi Agent
Bukti tervalidasi Agent
Laporan hasil setelah resolve, tinjau, pasang, dan satu eksekusi terbatas.
- Tingkat sukses
- —
- Kegagalan terbaru
- —
- Hasil
- 0
- Kualitas output
- —
- Gagal
- 0
- Tidak relevan
- 0
- Pemasangan
- 0
- Diblokir risiko
- 0
- Perlu penyiapan
- 0
- Produksi
- 0
Belum ada data hasil Agent. Eksekusi pertama dapat melaporkan keberhasilan, kebutuhan setup, blok risiko, kegagalan, atau tidak relevan melalui /api/agent/outcome.
Pasang
Tambahkan ke alur Agent
Gratis dan sumber terbuka. Tinjau laporan sebelum memasang pada Agent produksi.
Siklus pertumbuhan
Kit berbagi
Draf berbasis skenario untuk Skill Eval Harness, siap untuk posting manual di X.
Skill Eval Harness: Agent Skill evaluation harness for paired variants, trace artifacts, and runner adapters 63 stars https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x
Balasan opsional dengan perintah pemasangan
Listing + install path for Skill Eval Harness: https://www.openagentskill.com/skills/adewale-skill-eval-harness?ref=x Install: npx skills add adewale/skill-eval-harness
Sumber listing
Diindeks komunitas
Listing ini diindeks dari sumber publik dan belum ditandai resmi hingga klaim pemelihara disetujui.
- Kreator
- adewale
- Diindeks oleh
- Indeks komunitas OpenAgentSkill
Atribusi menautkan ke repositori publik atau profil kreator. Kreator dapat mengklaim listing untuk memperbarui sinyal kepemilikan.
Klaim skill iniKlaim pemilik
Klaim listing skill ini
Listing Diindeks komunitas ini dikaitkan dengan adewale, tetapi belum ditandai resmi. Klaim untuk menambahkan sinyal pemilik terverifikasi dan membuat pembaruan peluncuran, pemasangan, serta audit berikutnya lebih tepercaya.
Kit backlink kreator
Tambahkan badge bukti ke README Anda
Tampilkan listing kanonis, sinyal kepercayaan dan audit saat ini, serta bukti Agent-Proven nyata di tempat pengembang mengevaluasi repositori.
[](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[](https://www.openagentskill.com/skills/adewale-skill-eval-harness)
[](https://www.openagentskill.com/skills/adewale-skill-eval-harness/audit)
[](https://www.openagentskill.com/skills/adewale-skill-eval-harness)Penulis
adewale
@adewale
Kecocokan platform
Sinyal kesehatan
- Star GitHub
- 63
- Skor kualitas
- 45/100
- Push GitHub terakhir
- 1 Agu 2026
- Petunjuk framework
- 1
- Tampilan OpenAgentSkill
- 1
- Salinan pemasangan
- 0
- Klik keluar
- 0
Sinyal komunitas
Bagikan apakah skill ini bermanfaat untuk alur kerja Agent Anda. Masukan gabungan meningkatkan peringkat dari waktu ke waktu.
Kepercayaan & keamanan
Hanya sandbox
- Adopsi GitHub63 star GitHubPeriksa
- Aktivitas star/fork63 star dan 5 fork; aktivitas issue tidak tersedia dalam metadata saat iniPeriksa
- Pemeliharaan terbaru22 hari sejak pushLulus
- Kejelasan lisensiMITLulus
- Kelengkapan README/SKILL.mdMetadata memuat konteks penggunaan dan alur kerja yang cukupLulus
- Risiko dependensi/runtimecommand execution surface, credential or environment accessPeriksa
Skill terkait
Khazix Skills
A collection of practical, installable AI agent skills for disk cleanup, AI news retrieval, and project management, following the Agent Skills standard.
19.6K StarAwesome Claude Skills
A curated list of resources and tools for enhancing Claude AI workflows.
65.9K StarClaude Scientific Skills
A comprehensive collection of ready-to-use scientific and research skills for AI agents.
31.2K Star