VLMEvalKit
Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
供給アセットの概要
コーディングと開発 Agent
コードレビュー、リポジトリ分析、テスト、CI、GitHub、DevOps、開発ワークフロー向けのスキルです。
シナリオ
コーディング Agent
リポジトリを理解し、コードを編集し、プルリクエストをレビューできるコーディング Agent が必要です。
Agent 適合
Claude Code + OpenAI Agents + CLI
Codex、Claude Code、Cursor、CLI、またはカスタム Agent に対応します。
インストール
準備完了
npx skills add open-compass/VLMEvalKit
メンテナンス
アクティブ
最終プッシュから 2 か月
リスク
要レビュー
Financial research output is not financial advice; require human review before any live investment decision
GitHub 品質
4.2K
100/100 品質 · 90/100 信頼
対象タグ
レビュー注記
Financial research output is not financial advice; require human review before any live investment decision · Financial research output is not financial advice; require human review before any live investment decision.
Agent 導入スコアカード
信頼、監査、インストール準備状況を一目で確認
公開リポジトリのメタデータ、OpenAgentSkill のレビューシグナル、保守の鮮度、インストール準備状況を組み合わせたスコアです。候補選定の目安であり、人によるレビューの代替ではありません。
品質
優秀採用度と保守性のシグナルが強い高信頼候補です。
信頼
Do not auto-installTrust Score v5 found insufficient evidence for agent installation. Treat this as discovery material, not an executable recommendation.
監査
要レビューインストール準備、安全メタデータ、保守、採用リスクの機械可読なレビュー。
OpenAgentSkill Trust Score v5
インストール前に人のレビュー
Choose a stronger alternative or inspect the source manually before any install attempt.
スター
GitHub スター 4.2K
リポジトリ活動
スター 4.2K、フォーク 723
メンテナンス
最終プッシュから 2 か月
ライセンス
Apache-2.0
インストール
npx skills add open-compass/VLMEvalKit
インストール安全性
標準パッケージまたはランタイムのインストールパス
権限範囲
ファイルシステムまたはドキュメントアクセス
Agent の成果
Early agent signal: 0% success from 1 agent outcomes
ドキュメント
README/SKILL.md の文脈が十分です
リスク概要
本番前にレビュー
- Financial research output is not financial advice; require human review before any live investment decision.
- Recent failure rate is elevated: 100%
- 1 failed agent outcome(s) reported
- Agent Proven outcomes: Early agent signal: 0% success from 1 agent outcomes
インストール準備状況
インストールパスを利用可能
- インストールパスを利用できます
- リポジトリの根拠を利用できます
- ライセンスが明示されています
- Early agent signal (24/100 Agent Proven)
Agent 可読メタデータ
このスキルの機械可読な判断データ。
このブロックまたは埋め込み JSON を使い、Agent がこのスキルをインストールすべきか、代替を選ぶべきか、先に人のレビューを求めるべきかを判断できます。
適したタスク
- コーディング Agent ワークフロー
- Claude Code チーム
- GitHub 採用シグナルを重視するチーム
- Inspect source files
適した Agent
インストール判断
- コマンド
- npx skills add open-compass/VLMEvalKit
- ポリシー
- レビュー
- 人によるレビュー
- はい
信頼とリスク
- 信頼
- 58/100
- 監査
- 93/100
- リスクレベル
- 要レビュー
成果ループ
- エンドポイント
- /api/agent/outcome
- イベント ID
- resolve
- 成果
- 5
使わない場合
- ベンダー提供の SLA が必要なチーム
- 内部セキュリティレビューのない高コンプライアンス環境
- 現在のメタデータに重大なリスクシグナルはありません
- Financial research output is not financial advice; require human review before any live investment decision
- Financial research output is not financial advice; require human review before any live investment decision.
Agent セーフティ v2
77/100 · インストール前にレビュー
利用可能な候補ですが、Agent はインストール前に権限と監査メモを提示する必要があります。
実際のワークスペースへインストールする前に人の承認が必要です。
中
ネットワークアクセス
Skill はリモートページ、API、リポジトリ、外部サービスにアクセスする可能性があります。
中
ファイルシステムアクセス
Skill はプロジェクトファイル、ドキュメント、生成物、ローカルワークスペース状態を読み書きする可能性があります。
- Financial research output is not financial advice; require human review before any live investment decision
インストール先
Agent ワークフローにこのスキルをインストール
公開インストールエンドポイントからコマンド、安全チェックリスト、対象プロンプト、正規リンクを取得します。
OpenAgentSkill CLI
Resolve policy, run the source installer safely, and report a verified install receipt.
$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install open-compass-vlmevalkitAgent 解決プラン
インストール前に Agent に適合性を検証させます。
Resolve API は第一候補、代替、安全ポリシー、監査メモ、インストール先、Agent がそのまま使えるプロンプトを返します。
JSON を開く
/api/agent/resolve?task=Use%20VLMEvalKit%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Resolve テキスト
/api/agent/resolve?task=Use%20VLMEvalKit%20for%20an%20agent%20workflow&agent=codex&max_risk=medium&format=text
インストール引き継ぎ
/api/skills/open-compass-vlmevalkit/install
Agent が確認すべきこと
- Resolve API でタスク適合と代替を確認。
- 監査・信頼スコアと安全ポリシーの警告を確認。
- Codex、Claude Code、Cursor、CLI のインストール先互換性を確認。
プロンプトをコピー
Task: Use VLMEvalKit in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20VLMEvalKit%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/open-compass-vlmevalkit/install
Install command: npx skills add open-compass/VLMEvalKit
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.Agent 引き継ぎ
別のディレクトリではなく、インストール経路を Agent に渡します。
公開インストールエンドポイントからコマンド、安全チェックリスト、対象プロンプト、正規リンクを取得します。
インストール引き継ぎ
/api/skills/open-compass-vlmevalkit/install
LLM テキスト形式
/api/skills/open-compass-vlmevalkit/install?format=text
代替を探す
/api/skills/search?q=VLMEvalKit&limit=3
Agent プロンプト
Use VLMEvalKit for this task. Review https://www.openagentskill.com/api/skills/open-compass-vlmevalkit/install, then install with: npx skills add open-compass/VLMEvalKitRegistry メタデータ
自動スキル選択用の Agent 可読プロファイル。
Registry API 経由で判断、信頼、監査、ユースケース、インストールのシグナルを提供し、UI をスクレイピングせずに Agent が順位付けできます。
Manifest
/api/registry/manifest/open-compass-vlmevalkit
LLM テキスト
/api/registry/manifest/open-compass-vlmevalkit?format=text
インストール別名
/api/registry/install/open-compass-vlmevalkit
推奨
/api/registry/recommend?task=Use%20VLMEvalKit%20in%20an%20agent%20workflow&limit=3
Agent 適合
コーディング Agent
プラットフォーム
Python, Computer Vision, Claude Code, OpenAI Agents
Agent 判断パネル
コーディング Agent 向けの第一候補
有力候補として扱い、自分の Agent スタックで README とインストール経路を検証してください。
スタック内の役割
第一候補
主な適合
コーディング Agent
信頼ラベル
本番対応
インストールパス
コマンド準備済み
使う場面
- コーディング Agent ワークフロー
- Claude Code チーム
- GitHub 採用シグナルを重視するチーム
根拠
- GitHub スター 4,229
- 最近のリポジトリ活動
- インストールコマンドまたは GitHub リポジトリが利用可能
- 品質プロファイル 100/100
- OpenAgentSkill エンゲージメント 132 件
先にレビュー
- 現在のメタデータに重大なリスクシグナルはありません
実装パス
- 1サンドボックスの Agent にインストールし、コーディング Agent タスクを一度最初から最後まで実行します。
- 2Compare output quality, latency, and failure behavior against at least one alternative.
- 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.
信頼プロファイル
Do not auto-install
Trust Score v5 found insufficient evidence for agent installation. Treat this as discovery material, not an executable recommendation.
GitHub 採用度
合格GitHub スター 4.2K
スター/フォーク活動
合格スター 4.2K、フォーク 723; 現在のメタデータでは Issue 活動を利用できません
最近のメンテナンス
合格最終プッシュから 2 か月
ライセンスの明確さ
合格Apache-2.0
良いシグナル
- 手動確認済みの掲載
- AI レビュー承認済み
- インストールパスを利用できます
- リポジトリの根拠を利用できます
- 最近保守されたリポジトリ
- 意味のある GitHub 採用シグナル
- インストールコマンドに明確な高リスクパターンはありません
- OpenAgentSkill の利用活動を検出しました
- 1 件のレポートに基づく成果信頼度 25%
インストール前にレビュー
- Financial research output is not financial advice; require human review before any live investment decision.
- Recent failure rate is elevated: 100%
- 1 failed agent outcome(s) reported
- Agent Proven outcomes: Early agent signal: 0% success from 1 agent outcomes
- 無人インストールの前に人によるレビューが必要です
推奨アクション
Choose a stronger alternative or inspect the source manually before any install attempt.
品質プロファイル
優秀 Agent ワークフロー向けの候補
採用度と保守性のシグナルが強い高信頼候補です。
ワークフロー適合
このスキルを使うシナリオ
Build and ship code
Coding agents
I need a coding agent that can understand a repository, edit code, and review pull requests.
Search private knowledge
RAG and knowledge
I need my agent to build a RAG workflow over documents and retrieve reliable context.
Automate repeated work
Workflow automation
I need my agent to automate a repeated workflow across tools and files.
ワークフロー適合
完全なワークフローに追加
Turn skills into distribution
Content growth agent
A workflow for turning newly indexed skills into SEO briefs, social drafts, comparison pages, and reusable publishing workflows.
Inspect, patch, and verify code
Coding review agent
A workflow for software agents that inspect repositories, review pull requests, generate tests, and turn findings into shippable patches.
Ingest, retrieve, and cite
RAG knowledge base
A workflow for document-heavy agents that ingest files, create searchable knowledge, retrieve relevant context, and answer with grounded sources.
代替候補
インストール前に比較
このタスクに適する可能性のある類似スキル。
Remove AI Watermarks
AI watermark remover. CLI and Python library to strip visible and invisible AI watermarks (Gemini / Nano Banana sparkle, SynthID) and provenance metadata (C2PA, EXIF, IPTC) from images.
Aily Blockly
AI IDE for hardware development, support Arduino, MicroPython, ESP32, STM32, RP2040, Nrf5x...
AliceVision
3D Computer Vision Framework
MaaNTE
MaaNTE. Nevertheless to Everless automatic assistant 异环小助手
概要
Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
Imported by the skill-only GitHub discovery pipeline because it matches agent skill, automation, domain workflow, RAG, document-processing, data, finance, security, or developer-tool signals. Protocol-server projects are excluded from automated imports.
プラットフォーム互換性
技術詳細
- バージョン
- 1.0.0
- ライセンス
- Apache-2.0
- 最終更新
- 2026年8月18日
- 公開日
- 2026年6月16日
フレームワークとツール
判断の要約
第一候補
GitHub スター 4,229
Agent 実証エビデンス
Agent 実証エビデンス
Resolve、レビュー、インストール、限定実行後の成果レポート。
- 成功率
- 0%
- 直近の失敗
- 100%
- 成果
- 1
- 出力品質
- —
- 失敗
- 1
- 非該当
- 0
- インストール数
- 1
- リスクによりブロック
- 0
- 設定が必要
- 0
- 本番
- 0
Early agent signal: 1 outcome, 0% success, Agent Proven Score 24/100.
成長ループ
共有キット
VLMEvalKit 用のシナリオベース草案です。X へ手動投稿できます。
A practical pick for a repeatable workflow: VLMEvalKit: Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks 4.2K stars https://www.openagentskill.com/skills/open-compass-vlmevalkit?ref=x
任意:インストールコマンド付きの返信
Listing + install path for VLMEvalKit: https://www.openagentskill.com/skills/open-compass-vlmevalkit?ref=x Install: npx skills add open-compass/VLMEvalKit
掲載元
コミュニティにより登録
この掲載は公開ソースから登録されており、メンテナー申請が承認されるまで公式として表示されません。
- 作成者
- open-compass
- インデックス作成者
- OpenAgentSkill コミュニティインデックス
帰属は公開リポジトリまたは作成者プロフィールにリンクされています。作成者は掲載を申請して所有権シグナルを更新できます。
このスキルを申請所有者の申請
このスキル掲載を申請
この コミュニティにより登録 掲載は open-compass に帰属していますが、まだ公式として表示されていません。申請すると、確認済み所有者シグナルが追加され、今後の公開、インストール、監査更新の信頼性が高まります。
クリエイター被リンクキット
README にエビデンスバッジを追加
開発者がリポジトリを評価する場所で、正規掲載、現在の信頼・監査シグナル、実際の Agent-Proven エビデンスを表示します。
[](https://www.openagentskill.com/skills/open-compass-vlmevalkit)
[](https://www.openagentskill.com/skills/open-compass-vlmevalkit)
[](https://www.openagentskill.com/skills/open-compass-vlmevalkit/audit)
[](https://www.openagentskill.com/skills/open-compass-vlmevalkit)作者
open-compass✓
@open-compass
プラットフォーム適合
健全性シグナル
- GitHub スター
- 4.2K
- 品質スコア
- 69/100
- 最終 GitHub プッシュ
- 2026年6月17日
- フレームワークのヒント
- 2
- OpenAgentSkill 閲覧数
- 25
- インストールコピー数
- 1
- 外部クリック
- 0
コミュニティシグナル
このスキルが Agent ワークフローに役立つかを共有してください。集約されたフィードバックがランキングを改善します。
信頼と安全性
Do not auto-install
- GitHub 採用度GitHub スター 4.2K合格
- スター/フォーク活動スター 4.2K、フォーク 723; 現在のメタデータでは Issue 活動を利用できません合格
- 最近のメンテナンス最終プッシュから 2 か月合格
- ライセンスの明確さApache-2.0合格
- README/SKILL.md の完全性メタデータには十分な利用・ワークフロー文脈があります合格
- 依存関係/ランタイムのリスク公開メタデータに重大な依存関係リスクのヒントはありません合格
関連スキル
Remove AI Watermarks
AI watermark remover. CLI and Python library to strip visible and invisible AI watermarks (Gemini / Nano Banana sparkle, SynthID) and provenance metadata (C2PA, EXIF, IPTC) from images.
4.3K スターAily Blockly
AI IDE for hardware development, support Arduino, MicroPython, ESP32, STM32, RP2040, Nrf5x...
3.8K スターAliceVision
3D Computer Vision Framework
3.5K スターMaaNTE
MaaNTE. Nevertheless to Everless automatic assistant 异环小助手
2.6K スター