Open-source evaluation toolkit of large multi-modality models (LMMs), support 220+ LMMs, 80+ benchmarks
$ npx skills add open-compass/VLMEvalKitScenario Research agents · I need my agent to research a topic, compare sources, and produce a concise report.
Claude Code + OpenAI Agents · 4 targets