Awesome LLM Eval

Prüfen · 70
Von der Community indexiert

Awesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.

Verified installs0
Stars642
Version1.0.0
Qualität67/100 · Vielversprechend
Vertrauen70/100 · Nur Sandbox
Audit75/100 · Prüfung nötig

Asset-Profil

Recherche und Wissensarbeit

Deep research, source comparison, literature review, RAG, knowledge search, and reports.

Bereich ansehen

Szenario

RAG and knowledge

I need my agent to build a RAG workflow over documents and retrieve reliable context.

Agent-Fit

Claude Code + OpenAI Agents + CLI

Geeignet für Codex, Claude Code, Cursor, CLI oder benutzerdefinierte Agents.

Installieren

Bereit

npx skills add onejune2018/Awesome-LLM-Eval

Wartung

Stabil

9 Monate seit dem letzten Push

Risiko

Prüfung nötig

Financial research output is not financial advice; require human review before any live investment decision

GitHub-Qualität

642

67/100 Qualität · 78/100 Vertrauen

Abdeckungs-Tags

RechercheRAG and knowledgerag-knowledgeragretrieval

Review-Notizen

Financial research output is not financial advice; require human review before any live investment decision · Financial research output is not financial advice; require human review before any live investment decision.

Agent-Adoptionskarte

Vertrauen, Audit und Installationsbereitschaft auf einen Blick

Diese Werte kombinieren öffentliche Repository-Metadaten, OpenAgentSkill-Reviewsignale, Wartungsaktualität und Installationsbereitschaft. Sie helfen bei der Vorauswahl, ersetzen aber keine menschliche Prüfung.

Qualität

Vielversprechend
67

Useful candidate, but compare it with alternatives before adopting.

Vertrauen

Nur Sandbox
70

Nützlicher Kandidat mit fehlenden oder gemischten Vertrauenssignalen. Bis der Ergebniszyklus die Passung belegt, in einem isolierten Arbeitsbereich verwenden.

Audit

Prüfung nötig
75

Maschinenlesbare Prüfung von Installationsbereitschaft, Sicherheitsmetadaten, Wartung und Akzeptanzrisiko.

OpenAgentSkill Trust Score v5

Menschliche Prüfung vor Installation

Nur in einer Sandbox ausführen und nahe Alternativen vergleichen, bevor sie produktiv eingesetzt wird.

RAGCodexClaude CodeCursorOpenAgentSkill CLI

Stars

642 GitHub-Stars

Repository-Aktivität

642 Stars und 76 Forks

Wartung

9 Monate seit dem letzten Push

Lizenz

MIT

Installieren

npx skills add onejune2018/Awesome-LLM-Eval

Installationssicherheit

dynamic command execution, standard package or runtime install path

Berechtigungsfläche

Dateisystem- oder Dokumentzugriff

Agent-Ergebnisse

Noch keine Agent-Ergebnisdaten

Dokumentation

Starker README/SKILL.md-Kontext

Risikoübersicht

Vor Produktion prüfen

  • Financial research output is not financial advice; require human review before any live investment decision.
  • Quality score needs review

Installationsbereitschaft

Installationspfad verfügbar

  • Installationspfad ist verfügbar
  • Repository-Belege sind verfügbar
  • Lizenz ist angegeben
  • Noch keine Agent-Proven-Ergebnisbelege

Agent-lesbare Metadaten

Maschinenlesbare Entscheidungsdaten für diesen Skill.

Nutze diesen Block oder das eingebettete JSON, um zu entscheiden, ob ein Agent diesen Skill installieren, eine Alternative wählen oder zuerst menschliche Prüfung anfordern soll.

JSON öffnen

Geeignete Aufgaben

  • RAG and knowledge-Workflows
  • Claude-Code-Teams
  • Teams, die GitHub-Adoptionssignale schätzen
  • Chunk documents

Geeignete Agents

RAGCodexClaude CodeCursorOpenAgentSkill CLIOpenAI AgentsCLI

Installationsentscheidung

Befehl
npx skills add onejune2018/Awesome-LLM-Eval
Richtlinie
Prüfen
Menschliche Prüfung
Ja

Vertrauen und Risiko

Vertrauen
70/100
Audit
75/100
Risikoebene
Prüfung nötig

Ergebnis-Loop

Endpoint
/api/agent/outcome
Event-ID
resolve
Ergebnisse
5

Installationsbefehl

npx skills add onejune2018/Awesome-LLM-Eval

Nicht verwenden, wenn

  • Teams, die ein vom Anbieter unterstütztes SLA benötigen
  • Hochregulierte Umgebungen ohne interne Sicherheitsprüfung
  • No major risk signals from current metadata
  • Financial research output is not financial advice; require human review before any live investment decision
  • Financial research output is not financial advice; require human review before any live investment decision.

Agent-Sicherheit v2

59/100 · Vor Installation prüfen

Mit Berechtigungshinweisen geprüftPrüfen

Nutzbarer Kandidat, aber der Agent sollte Berechtigungs- und Auditnotizen vor der Installation anzeigen.

Vor der Installation in einem echten Arbeitsbereich ist menschliche Freigabe erforderlich.

Per API auflösen

Mittel

Netzwerkzugriff

Die Skill ruft wahrscheinlich Remote-Seiten, APIs, Repositories oder externe Dienste ab.

Mittel

Dateisystemzugriff

Die Skill kann Projektdateien, Dokumente, generierte Artefakte oder den lokalen Arbeitsbereich lesen oder schreiben.

  • Financial research output is not financial advice; require human review before any live investment decision

Installationsziele

Diesen Skill im Agent-Workflow installieren

Über den öffentlichen Endpunkt erhältst du Befehl, Sicherheitscheckliste, Ziel-Prompts und kanonische Links.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install onejune2018-awesome-llm-eval

Agent-Auflösungsplan

Lass einen Agent die Eignung vor der Installation prüfen.

Die Resolve API liefert die beste Skill, Alternativen, Sicherheitsrichtlinien, Auditnotizen, Installationsziel und einen direkt nutzbaren Prompt.

Textplan öffnen

Agent sollte prüfen

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Prompt kopieren

Task: Use Awesome LLM Eval in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Awesome%20LLM%20Eval%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/onejune2018-awesome-llm-eval/install
Install command: npx skills add onejune2018/Awesome-LLM-Eval
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Agent-Übergabe

Gib dem Agent den Installationspfad, nicht noch ein Verzeichnis.

Über den öffentlichen Endpunkt erhältst du Befehl, Sicherheitscheckliste, Ziel-Prompts und kanonische Links.

Installations-API öffnen

Agent-Prompt

Use Awesome LLM Eval for this task. Review https://www.openagentskill.com/api/skills/onejune2018-awesome-llm-eval/install, then install with: npx skills add onejune2018/Awesome-LLM-Eval

Registry-Metadaten

Agent-lesbares Profil für die automatische Skill-Auswahl.

Die Registry API stellt Entscheidungs-, Vertrauens-, Audit-, Use-Case- und Installationssignale ohne UI-Scraping bereit.

Manifest öffnen

Agent-Fit

72/100

RAG and knowledge

Plattformen

RAG, Claude Code, OpenAI Agents

Audit-Bericht

Prüfung nötig · 75/100

Maschinenlesbare Prüfung von Installationsbereitschaft, Sicherheitsmetadaten, Wartung und Akzeptanzrisiko.

Audit-Bericht ansehenEval-Bericht ansehen

Agent-Entscheidungspanel

Companion skill for RAG and knowledge

Shortlist this skill and compare it with close alternatives before production adoption.

72
Bereitschaft
Shortlist
Phase

Rolle im Stack

Ergänzende Skill

Primäre Eignung

RAG and knowledge

Vertrauenslabel

Starke Shortlist

Installationspfad

Befehl bereit

Verwenden wenn

  • RAG and knowledge-Workflows
  • Claude-Code-Teams
  • Teams, die GitHub-Adoptionssignale schätzen

Evidenz

  • 642 GitHub-Stars
  • install command or GitHub repo available
  • Qualitätsprofil 67/100
  • 8 OpenAgentSkill-Interaktionen

zuerst prüfen

  • No major risk signals from current metadata

Implementierungspfad

  1. 1Installieren Sie es in einem Sandbox-Agent und führen Sie eine RAG and knowledge-Aufgabe vollständig aus.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Vertrauensprofil

Nur Sandbox

Nützlicher Kandidat mit fehlenden oder gemischten Vertrauenssignalen. Bis der Ergebniszyklus die Passung belegt, in einem isolierten Arbeitsbereich verwenden.

70
OpenAgentSkill Trust Score

GitHub-Akzeptanz

Info

642 GitHub-Stars

Star-/Fork-Aktivität

Info

642 Stars und 76 Forks; Issue-Aktivität ist in den aktuellen Metadaten nicht verfügbar

Aktuelle Wartung

Info

9 Monate seit dem letzten Push

Lizenzklarheit

Bestanden

MIT

Positive Signale

  • KI-Prüfung genehmigt
  • Installationspfad ist verfügbar
  • Repository-Belege sind verfügbar
  • Aussagekräftiges GitHub-Adoptionssignal
  • Der Installationsbefehl weist kein offensichtliches Hochrisikomuster auf
  • Ergebniszyklus ist bereit, benötigt aber den ersten echten Agent-Lauf

Vor Installation prüfen

  • Financial research output is not financial advice; require human review before any live investment decision.
  • Quality score needs review
  • Noch keine echten Agent-Ergebnisberichte
  • Vor unbeaufsichtigter Installation ist menschliche Prüfung erforderlich

Empfohlene Aktion

Nur in einer Sandbox ausführen und nahe Alternativen vergleichen, bevor sie produktiv eingesetzt wird.

Qualitätsprofil

Vielversprechend Kandidat für Agent-Workflows

Useful candidate, but compare it with alternatives before adopting.

67
GitHub-Stars
642
Aktualität
vor 9 Monaten
Installationsbereit
Ja
Lizenz
MIT

Workflow-Eignung

Diese Skill in diesen Szenarien nutzen

Workflow-Eignung

Zum vollständigen Workflow hinzufügen

Alternativen-Shortlist

Vor Installation vergleichen

Similar skills that may fit this task.

Alle vergleichen

Übersicht

Awesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, docs and models, mainly for Evaluation on LLMs. 一个由工具、基准/数据、演示、排行榜和大模型等组成的精选列表,主要面向基础大模型评测,旨在探求生成式AI的技术边界.

Imported by the skill-only GitHub discovery pipeline because it matches agent skill, automation, domain workflow, RAG, document-processing, data, finance, security, or developer-tool signals. Protocol-server projects are excluded from automated imports.

Plattformkompatibilität

ragFULL

Technische Details

Version
1.0.0
Lizenz
MIT
Letzte Aktualisierung
18. Aug. 2026
Veröffentlicht
15. Juni 2026

Frameworks & Tools

RAG

Entscheidungsübersicht

Ergänzende Skill

72
Bereit
Shortlist
Phase

642 GitHub-Stars

Audit

Installationsprüfung

Installations- und Adoptionsprüfung

75
Prüfung nötig
Sicherheit
85/100
Wartung
62/100
Installieren
92/100
Vollständiges Audit öffnenEval-Bericht ansehen

Von Agent belegte Evidenz

Von Agent belegte Evidenz

Ergebnisberichte nach Resolve, Prüfung, Installation und einem begrenzten Lauf.

0
Belegt
Needs first agent runAuto-Installation: zuerst prüfenLetzter: Unbekannt
Erfolgsrate
Letzter Fehler
Ergebnisse
0
Ausgabequalität
Fehlgeschlagen
0
Nicht relevant
0
Installationen
0
Durch Risiko blockiert
0
Einrichtung erforderlich
0
Produktion
0

Noch keine Agent-Ergebnisdaten. Der erste Lauf kann Erfolg, Einrichtungsbedarf, Risikoblockaden, Fehler oder Irrelevanz über /api/agent/outcome melden.

Installieren

Zum Agent-Workflow hinzufügen

Kostenlos und Open Source. Bericht vor der Installation in Produktions-Agents prüfen.

Wachstums-Loop

Share-Kit

X

Szenariobasierter Entwurf für Awesome LLM Eval, bereit für einen manuellen X-Post.

Kuratorenhinweis
Awesome LLM Eval: Awesome-LLM-Eval: a curated list of tools, datasets/benchmark, demos, leaderboard, papers, do...

642 stars

https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval?ref=x
X-Entwurf öffnen
Optionale Antwort mit Installationsbefehl
Listing + install path for Awesome LLM Eval:
https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval?ref=x

Install: npx skills add onejune2018/Awesome-LLM-Eval
Antwortentwurf öffnen

Quelle des Eintrags

Community-indexiert

Beanspruchbar

Dieser Eintrag wurde aus öffentlichen Quellen indexiert und ist erst nach Genehmigung eines Maintainer-Anspruchs offiziell.

Ersteller
onejune2018
Indexiert von
OpenAgentSkill Community-Index

Die Zuordnung verlinkt auf das öffentliche Repository oder Creator-Profil. Creator können den Eintrag beanspruchen, um Eigentümersignale zu aktualisieren.

Diesen Skill beanspruchen

Eigentümeranspruch

Diesen Skill-Eintrag beanspruchen

Dieser Community-indexiert-Eintrag wird onejune2018 zugeschrieben, ist aber noch nicht offiziell markiert. Beanspruche ihn, um ein verifiziertes Eigentümersignal hinzuzufügen und künftige Launch-, Installations- und Audit-Updates vertrauenswürdiger zu machen.

Creator-Backlink-Kit

Evidenz-Badges in deine README einfügen

Zeige den kanonischen Eintrag, aktuelle Vertrauens- und Audit-Signale sowie echte Agent-Proven-Evidenz dort, wo Entwickler das Repository bewerten.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/onejune2018-awesome-llm-eval?metric=listed&label=Listed)](https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/onejune2018-awesome-llm-eval?metric=trust&label=Trust)](https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/onejune2018-awesome-llm-eval?metric=audit&label=Audit)](https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/onejune2018-awesome-llm-eval?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/onejune2018-awesome-llm-eval)

Autor

O

onejune2018

@onejune2018

Gesundheitssignale

GitHub-Stars
642
Qualitätswert
42/100
Letzter GitHub-Push
24. Nov. 2025
Framework-Hinweise
1
OpenAgentSkill-Aufrufe
8
Installationskopien
0
Externe Klicks
0

Community-Signal

Teile mit, ob dieser Skill für deinen Agent-Workflow nützlich ist. Zusammengefasstes Feedback verbessert das Ranking im Laufe der Zeit.

Vertrauen & Sicherheit

Nur Sandbox

70
  • GitHub-Akzeptanz642 GitHub-StarsInfo
  • Star-/Fork-Aktivität642 Stars und 76 Forks; Issue-Aktivität ist in den aktuellen Metadaten nicht verfügbarInfo
  • Aktuelle Wartung9 Monate seit dem letzten PushInfo
  • LizenzklarheitMITBestanden
  • README/SKILL.md-VollständigkeitMetadaten enthalten ausreichend Nutzungs- und Workflow-KontextBestanden
  • Abhängigkeits-/LaufzeitrisikoKeine wesentlichen Abhängigkeitsrisikohinweise in öffentlichen MetadatenBestanden