Rapport d’audit du skill
evaluating-code-models Rapport d’audit.
Evaluates code generation models across HumanEval, MBPP, MultiPL-E, and 15+ benchmarks with pass@k metrics. Use when benchmarking code models, comparing coding abilities, testing multi-language support, or measuring code generation quality. Industry standard from BigCode Project used by HuggingFace leaderboards.
Trust Score OpenAgentSkill
Trust Score OpenAgentSkill
The Trust Score helps an agent decide whether a skill is safe enough to shortlist before installation.
Adoption GitHub
Info76
825 stars GitHub
Activité stars/forks
Info71
825 stars et 176 forks; l’activité des issues n’est pas disponible dans les métadonnées actuelles
Maintenance récente
Validé88
1 mois depuis le dernier push
Clarté de licence
Validé86
MIT
Complétude README/SKILL.md
Validé94
Les métadonnées incluent suffisamment de contexte d’usage et de workflow
Risque dépendances/runtime
Avertissement44
command execution surface, credential or environment access
Disponibilité de l’installation
Validé92
npx skills add sangrokjung/claude-forge --skill evaluating-code-models
Sécurité de la commande d’installation
Validé92
Chemin d’installation standard de package ou runtime
Surface de permissions
Échoué36
secrets or environment access, shell or command execution
Preuve du dépôt
Validé86
https://github.com/sangrokjung/claude-forge/tree/main/skills/evaluating-code-models
État de revue
Validé88
Données de revue IA disponibles
Résultats prouvés par Agent
Info54
Pas encore de données de résultats Agent
Vérifications
Revue d’installation et d’adoption
Chemin d’installation
92
npx skills add sangrokjung/claude-forge --skill evaluating-code-models
Dépôt
88
https://github.com/sangrokjung/claude-forge/tree/main/skills/evaluating-code-models
Licence
86
MIT
Maintenance
88
1 mois depuis le dernier push
Revue IA
88
Approved with no listed issues
Complétude README/SKILL.md
94
Usable description available
Risque de dépendances
44
command execution surface, credential or environment access
Sécurité de la commande d’installation
92
Chemin d’installation standard de package ou runtime
Surface de permissions
36
secrets or environment access, shell or command execution
Activité stars/forks
71
825 stars et 176 forks; l’activité des issues n’est pas disponible dans les métadonnées actuelles
Adoption
88
825 stars GitHub
Avertissements
- Dependency or permission surface needs review
- Permission surface may require sandboxing
- Quality score needs review
- Permission surface needs review: secrets or environment access, shell or command execution
- Dependency/runtime risk: command execution surface, credential or environment access
- Permission surface: secrets or environment access, shell or command execution
Méthode
This report combines public metadata, AI review output, repository freshness, install readiness, OpenAgentSkill events, quality scoring, trust checks, and the agent safety gate. It is not a full source-code security review.
Comparer les options proches
Skills associés à auditer ensuite
Code Review
Review a branch or diff against repository standards and the originating spec in two independent analysis passes.
169K Stars · Rapport d’audit
Appsmith
Platform to build admin panels, internal tools, and dashboards. Integrates with 25+ databases and any API.
41K Stars · Rapport d’audit
Implement
Implement work from an approved spec or ticket set, run focused and full tests, invoke code review, and commit the result to the current branch.
176K Stars · Rapport d’audit