AI Agent Skill Repository

AI Agent Skills Directory

Browse reusable skills for Codex, Claude Code, Cursor, finance, research, web scraping, PPT, football analytics, data, marketing, design, and more.

Live registry search

Results for “llm-eval

Exact name and slug matches are checked against the live registry before ranked alternatives.

Clear search

Decision filters

Choose by scenario, quality, and trust signals.

Showing 1-16 of 139 ranked candidates matching "llm-eval"

Best blend of relevance, quality, freshness, and verified outcomes

1

Chinese Llm Benchmark

VERIFIEDEXCELLENT · 98TRUST · 85SAFE · REVIEWEDCODING

非线智能 NoneLinear - ReLE评测:中文AI大模型能力评测(持续更新):目前已囊括374个大模型,覆盖chatgpt、gpt-5.4、谷歌gemini-3.1-pro、Claude-4.6、文心ERNIE-X1.1、ERNIE-5.0、qwen3.6-max、qwen3.6-plus、百川、讯飞星火、商汤senseChat…

$ npx skills add jeinlee1991/chinese-llm-benchmark
6.2K stars65 quality85 trustReviewedClaude Code + OpenAI Agents3mo since pushSafe to try

Scenario GitHub automation

Claude Code + OpenAI Agents · 4 targets

llm
by jeinlee1991DetailsQuick view
2

LLM Engineers Handbook

VERIFIEDEXCELLENT · 93TRUST · 88SAFE · REVIEWEDCODING

The LLM's practical guide: From the fundamentals to deploying advanced LLM and RAG apps to AWS using LLMOps best practices

$ npx skills add PacktPublishing/LLM-Engineers-Handbook
5.2K stars61 quality88 trustReviewed4mo since pushSafe to try

Scenario Coding agents

CLI + Codex · 4 targets

pythonllmops
by PacktPublishingDetailsQuick view
3

Awesome Llm Apps

VERIFIEDEXCELLENT · 100TRUST · 88SAFE · REVIEWEDCODING

100+ AI Agent & RAG apps you can actually run — clone, customize, ship.

$ npx skills add Shubhamsaboo/awesome-llm-apps
114.5K stars75 quality88 trustReviewed2mo since pushSafe to try

Scenario GitHub automation

CLI + Codex · 4 targets

pythonrag
by ShubhamsabooDetailsQuick view
4

Anything Llm

VERIFIEDEXCELLENT · 100TRUST · 89SAFE · REVIEWEDRESEARCH

Stop renting your intelligence. Own it with AnythingLLM. Everything you need for a powerful local-first agent experience

$ npx skills add Mintplex-Labs/anything-llm
63.3K stars74 quality89 trustReviewed1mo since pushSafe to try

Scenario RAG and knowledge

CLI + Codex · 4 targets

javascriptvector-search
by Mintplex-LabsDetailsQuick view
5

Llm App

VERIFIEDEXCELLENT · 100TRUST · 89SAFE · REVIEWEDDATA

Ready-to-run cloud templates for RAG, AI pipelines, and enterprise search with live data. 🐳Docker-friendly.⚡Always in sync with Sharepoint, Google Drive, S3, Kafka, Pos…

$ npx skills add pathwaycom/llm-app
59.3K stars74 quality89 trustReviewed2mo since pushSafe to try

Scenario Database and SQL

CLI + Codex · 4 targets

jupyter-notebookrag
by pathwaycomDetailsQuick view
6

Happy Llm

VERIFIEDEXCELLENT · 97TRUST · 83SAFE · REVIEWEDDATA

📚 从零开始构建大模型

$ npx skills add datawhalechina/happy-llm
32.2K stars68 quality83 trustReviewed with permission notes4mo since pushNeeds review

Scenario Data analysis

CLI + Codex · 4 targets

jupyter-notebookrag
by datawhalechinaDetailsQuick view
7

Llm Wiki Agent

VERIFIEDEXCELLENT · 100TRUST · 79SAFE · EXPERIMENTALRESEARCH

A personal knowledge base that builds and maintains itself. Drop in sources — Claude (or Codex/Gemini) reads them, extracts knowledge, and maintains a persistent interli…

$ npx skills add SamurAIGPT/llm-wiki-agent
3.0K stars63 quality79 trustExperimentalClaude Code + OpenAI Agents2mo since pushNeeds review

Scenario RAG and knowledge

Claude Code + OpenAI Agents · 4 targets

pythonknowledge-graph
by SamurAIGPTDetailsQuick view
8

Evalscope

VERIFIEDEXCELLENT · 94TRUST · 88SAFE · REVIEWEDCODING

A streamlined and customizable framework for efficient large model (LLM, VLM, AIGC) evaluation and performance benchmarking.

$ npx skills add modelscope/evalscope
3.0K stars63 quality88 trustReviewed2mo since pushSafe to try

Scenario GitHub automation

CLI + Codex · 4 targets

pythonrag
by modelscopeDetailsQuick view
9

Langfuse

VERIFIEDEXCELLENT · 100TRUST · 87SAFE · REVIEWEDCODING

🪢 Open source AI engineering platform: LLM evals, observability, metrics, prompt management, playground, datasets. Integrates with OpenTelemetry, LangChain, OpenAI SDK,…

$ npx skills add langfuse/langfuse
29.4K stars71 quality87 trustReviewedOpenAI Agents + LangChain2mo since pushSafe to try

Scenario Coding agents

OpenAI Agents + LangChain · 4 targets

typescriptllmops
by langfuseDetailsQuick view
10

Opik

VERIFIEDEXCELLENT · 100TRUST · 90SAFE · REVIEWEDCODING

Debug, evaluate, and monitor your LLM applications, RAG systems, and agentic workflows with comprehensive tracing, automated evaluations, and production-ready dashboards.

$ npx skills add comet-ml/opik
19.8K stars70 quality90 trustReviewedLangChain2mo since pushSafe to try

Scenario Coding agents

LangChain + CLI · 4 targets

pythonllmops
by comet-mlDetailsQuick view
11

Llm Paper Daily

VERIFIEDEXCELLENT · 85TRUST · 82SAFE · REVIEWEDRESEARCH

Daily updated LLM papers. 每日更新 LLM 相关的论文,欢迎订阅 👏 喜欢的话动动你的小手 🌟 一个

$ npx skills add xianshang33/llm-paper-daily
1.3K stars60 quality82 trustReviewed with permission notesOpenAI Agents2mo since pushNeeds review

Scenario RAG and knowledge

OpenAI Agents + CLI · 4 targets

pythonrag
by xianshang33DetailsQuick view
12

Agenta

VERIFIEDEXCELLENT · 97TRUST · 86SAFE · REVIEWEDCODING

The open-source LLMOps platform: prompt playground, prompt management, LLM evaluation, and LLM observability all in one place.

$ npx skills add Agenta-AI/agenta
4.5K stars67 quality86 trustReviewed13d since pushSafe to try

Scenario Coding agents

CLI + Codex · 4 targets

typescriptllmops
by Agenta-AIDetailsQuick view
13

Giskard Oss

VERIFIEDEXCELLENT · 97TRUST · 87SAFE · REVIEWEDCODING

🐢 Open-Source Evaluation & Testing library for LLM Agents

$ npx skills add Giskard-AI/giskard-oss
5.7K stars65 quality87 trustReviewed1mo since pushSafe to try

Scenario Coding agents

CLI + Codex · 4 targets

pythonllmops
by Giskard-AIDetailsQuick view
14

Trulens

VERIFIEDEXCELLENT · 95TRUST · 86SAFE · REVIEWEDCODING

Evaluation and Tracking for LLM Experiments and AI Agents

$ npx skills add truera/trulens
3.4K stars63 quality86 trustReviewed2mo since pushSafe to try

Scenario Coding agents

CLI + Codex · 4 targets

pythonllmops
by trueraDetailsQuick view
15

Openllmetry

VERIFIEDEXCELLENT · 98TRUST · 89SAFE · REVIEWEDCODING

Open-source observability for your GenAI or LLM application, based on OpenTelemetry

$ npx skills add traceloop/openllmetry
7.2K stars66 quality89 trustReviewed2mo since pushSafe to try

Scenario GitHub automation

CLI + Codex · 4 targets

pythonllmops
by traceloopDetailsQuick view
16

Awesome Llm Agents

VERIFIEDEXCELLENT · 86TRUST · 82SAFE · REVIEWEDCODING

A curated list of awesome LLM agents frameworks.

$ npx skills add kaushikb11/awesome-llm-agents
1.5K stars61 quality82 trustReviewed with permission notesLangChain2mo since pushNeeds review

Scenario GitHub automation

LangChain + CLI · 4 targets

pythonllm
by kaushikb11DetailsQuick view

Page 1

Showing the strongest 16 results to keep the registry fast for humans and agents. Refine by use case, platform, stars, or search query for a narrower shortlist.

Try the agent resolve API