Agent Vision Toolkit

Stark · 79
Von der Community indexiert

给纯文本 LLM agent 装上眼睛:图片问答、OCR、截图分析、视觉定位等一套视觉工具箱 + skill,并可无缝接入 Codex、Claude Code、OpenCode、Pi | Give text-only LLM agents vision: image Q&A, OCR, screenshot understanding, visual grounding, image-to-SVG - a vision toolkit & skill, with drop-in integration for Codex, Claude Code, OpenCode, Pi

Verified installs0
Stars321
Version1.0.0
Qualität100/100 · Ausgezeichnet
Vertrauen79/100 · Vor Installation prüfen
Audit92/100 · Sicher zu testen

Asset-Profil

Coding- und Entwickler-Agents

Code review, repo analysis, testing, CI, GitHub, DevOps, and developer workflow skills.

Bereich ansehen

Szenario

Coding-Agents

I need a coding agent that can understand a repository, edit code, and review pull requests.

Agent-Fit

Claude Code + OpenAI Agents + CLI

Geeignet für Codex, Claude Code, Cursor, CLI oder benutzerdefinierte Agents.

Installieren

Bereit

npx skills add Anionex/agent-vision-toolkit

Wartung

Aktuell

16 Tage seit dem letzten Push

Risiko

Sicher zu testen

Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata

GitHub-Qualität

321

100/100 Qualität · 84/100 Vertrauen

Abdeckungs-Tags

CodingCoding-AgentsAllgemeines Toolagent-skillskill

Review-Notizen

Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata

Agent-Adoptionskarte

Vertrauen, Audit und Installationsbereitschaft auf einen Blick

Diese Werte kombinieren öffentliche Repository-Metadaten, OpenAgentSkill-Reviewsignale, Wartungsaktualität und Installationsbereitschaft. Sie helfen bei der Vorauswahl, ersetzen aber keine menschliche Prüfung.

Qualität

Ausgezeichnet
100

High-confidence pick with strong adoption and healthy maintenance signals.

Vertrauen

Vor Installation prüfen
79

Gutes Shortlist-Signal, aber der Agent sollte Auditnotizen, Installationsrichtlinien und Ergebnisbelege vor der Ausführung prüfen.

Audit

Sicher zu testen
92

Maschinenlesbare Prüfung von Installationsbereitschaft, Sicherheitsmetadaten, Wartung und Akzeptanzrisiko.

OpenAgentSkill Trust Score v5

Menschliche Prüfung vor Installation

Nach menschlicher oder Sandbox-Prüfung als primären Kandidaten verwenden.

PythonCodexClaude CodeCursorOpenAgentSkill CLI

Stars

321 GitHub-Stars

Repository-Aktivität

321 Stars und 14 Forks

Wartung

16 Tage seit dem letzten Push

Lizenz

MIT

Installieren

npx skills add Anionex/agent-vision-toolkit

Installationssicherheit

Standard-Paket- oder Laufzeit-Installationspfad

Berechtigungsfläche

shell or command execution, filesystem or document access

Agent-Ergebnisse

Noch keine Agent-Ergebnisdaten

Dokumentation

Starker README/SKILL.md-Kontext

Risikoübersicht

Niedriges Metadatenrisiko

  • Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata

Installationsbereitschaft

Installationspfad verfügbar

  • Installationspfad ist verfügbar
  • Repository-Belege sind verfügbar
  • Lizenz ist angegeben
  • Noch keine Agent-Proven-Ergebnisbelege

Agent-lesbare Metadaten

Maschinenlesbare Entscheidungsdaten für diesen Skill.

Nutze diesen Block oder das eingebettete JSON, um zu entscheiden, ob ein Agent diesen Skill installieren, eine Alternative wählen oder zuerst menschliche Prüfung anfordern soll.

JSON öffnen

Geeignete Aufgaben

  • Local desktop-Workflows
  • Claude-Code-Teams
  • builders willing to evaluate younger projects
  • Navigate local resources

Geeignete Agents

PythonCodexClaude CodeCursorOpenAgentSkill CLIOpenAI AgentsCLI

Installationsentscheidung

Befehl
npx skills add Anionex/agent-vision-toolkit
Richtlinie
Prüfen
Menschliche Prüfung
Ja

Vertrauen und Risiko

Vertrauen
79/100
Audit
92/100
Risikoebene
Sicher zu testen

Ergebnis-Loop

Endpoint
/api/agent/outcome
Event-ID
resolve
Ergebnisse
5

Installationsbefehl

npx skills add Anionex/agent-vision-toolkit

Nicht verwenden, wenn

  • Teams, die ein vom Anbieter unterstütztes SLA benötigen
  • Hochregulierte Umgebungen ohne interne Sicherheitsprüfung
  • No major risk signals from current metadata
  • Hinweise auf Hochrisiko-Berechtigungen: Shell- oder Befehlsausführung
  • Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata

Agent-Sicherheit v2

64/100 · Vor Installation prüfen

Mit Berechtigungshinweisen geprüftPrüfen

Nutzbarer Kandidat, aber der Agent sollte Berechtigungs- und Auditnotizen vor der Installation anzeigen.

Vor der Installation in einem echten Arbeitsbereich ist menschliche Freigabe erforderlich.

Per API auflösen

Hoch

Shell- oder Befehlsausführung

Die Skill-Metadaten verweisen auf Terminal-, CLI-, Shell-, Subprozess- oder Befehlsausführungs-Workflows.

Mittel

Netzwerkzugriff

Die Skill ruft wahrscheinlich Remote-Seiten, APIs, Repositories oder externe Dienste ab.

Mittel

Dateisystemzugriff

Die Skill kann Projektdateien, Dokumente, generierte Artefakte oder den lokalen Arbeitsbereich lesen oder schreiben.

  • Hinweise auf Hochrisiko-Berechtigungen: Shell- oder Befehlsausführung
  • Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata

Installationsziele

Diesen Skill im Agent-Workflow installieren

Über den öffentlichen Endpunkt erhältst du Befehl, Sicherheitscheckliste, Ziel-Prompts und kanonische Links.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install anionex-agent-vision-toolkit

Agent-Auflösungsplan

Lass einen Agent die Eignung vor der Installation prüfen.

Die Resolve API liefert die beste Skill, Alternativen, Sicherheitsrichtlinien, Auditnotizen, Installationsziel und einen direkt nutzbaren Prompt.

Textplan öffnen

Agent sollte prüfen

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Prompt kopieren

Task: Use Agent Vision Toolkit in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Agent%20Vision%20Toolkit%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/anionex-agent-vision-toolkit/install
Install command: npx skills add Anionex/agent-vision-toolkit
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Agent-Übergabe

Gib dem Agent den Installationspfad, nicht noch ein Verzeichnis.

Über den öffentlichen Endpunkt erhältst du Befehl, Sicherheitscheckliste, Ziel-Prompts und kanonische Links.

Installations-API öffnen

Agent-Prompt

Use Agent Vision Toolkit for this task. Review https://www.openagentskill.com/api/skills/anionex-agent-vision-toolkit/install, then install with: npx skills add Anionex/agent-vision-toolkit

Registry-Metadaten

Agent-lesbares Profil für die automatische Skill-Auswahl.

Die Registry API stellt Entscheidungs-, Vertrauens-, Audit-, Use-Case- und Installationssignale ohne UI-Scraping bereit.

Manifest öffnen

Agent-Fit

100/100

Local desktop

Plattformen

Python, Claude Code, OpenAI Agents

Audit-Bericht

Sicher zu testen · 92/100

Maschinenlesbare Prüfung von Installationsbereitschaft, Sicherheitsmetadaten, Wartung und Akzeptanzrisiko.

Audit-Bericht ansehenEval-Bericht ansehen

Agent-Entscheidungspanel

Primäre Wahl für Local desktop

Use this as a leading candidate, then validate the README and install path in your own agent stack.

100
Bereitschaft
Übernehmen
Phase

Rolle im Stack

Primäre Wahl

Primäre Eignung

Local desktop

Vertrauenslabel

Produktionsbereit

Installationspfad

Befehl bereit

Verwenden wenn

  • Local desktop-Workflows
  • Claude-Code-Teams
  • builders willing to evaluate younger projects

Evidenz

  • recent repository activity
  • install command or GitHub repo available
  • Qualitätsprofil 100/100
  • 17 OpenAgentSkill-Interaktionen

zuerst prüfen

  • No major risk signals from current metadata

Implementierungspfad

  1. 1Installieren Sie es in einem Sandbox-Agent und führen Sie eine Local desktop-Aufgabe vollständig aus.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Vertrauensprofil

Vor Installation prüfen

Gutes Shortlist-Signal, aber der Agent sollte Auditnotizen, Installationsrichtlinien und Ergebnisbelege vor der Ausführung prüfen.

79
OpenAgentSkill Trust Score

GitHub-Akzeptanz

Info

321 GitHub-Stars

Star-/Fork-Aktivität

Prüfen

321 Stars und 14 Forks; Issue-Aktivität ist in den aktuellen Metadaten nicht verfügbar

Aktuelle Wartung

Bestanden

16 Tage seit dem letzten Push

Lizenzklarheit

Bestanden

MIT

Positive Signale

  • Manuell verifizierte Auflistung
  • KI-Prüfung genehmigt
  • Installationspfad ist verfügbar
  • Repository-Belege sind verfügbar
  • Kürzlich gewartetes Repository
  • Der Installationsbefehl weist kein offensichtliches Hochrisikomuster auf
  • Ergebniszyklus ist bereit, benötigt aber den ersten echten Agent-Lauf

Vor Installation prüfen

  • Stars/forks activity: 321 stars, 14 forks; issue activity unavailable in current metadata
  • Noch keine echten Agent-Ergebnisberichte
  • Vor unbeaufsichtigter Installation ist menschliche Prüfung erforderlich

Empfohlene Aktion

Nach menschlicher oder Sandbox-Prüfung als primären Kandidaten verwenden.

Qualitätsprofil

Ausgezeichnet Kandidat für Agent-Workflows

High-confidence pick with strong adoption and healthy maintenance signals.

100
GitHub-Stars
321
Aktualität
vor 16 Tagen
Installationsbereit
Ja
Lizenz
MIT

Workflow-Eignung

Diese Skill in diesen Szenarien nutzen

Workflow-Eignung

Zum vollständigen Workflow hinzufügen

Alternativen-Shortlist

Vor Installation vergleichen

Similar skills that may fit this task.

Alle vergleichen

Übersicht

<div align="center">

# agent-vision-toolkit

**What it thinks is what it sees — give any text-only coding agent eyes: image Q&A, OCR, screenshot understanding, visual grounding, and image-to-SVG, as a vision toolkit plus a skill, with optional drop-in integration for Codex, Claude Code, Pi, Oh My Pi, and OpenCode.**

🌐 [**中文**](README_CN.md) | **English**

</div>

If your coding agent runs on a text-only model like DeepSeek V4, it can't look at images — screenshots, mockups, diagrams, and error dialogs are all dead ends. This repository gives it eyes in two layers:

1. **The toolkit** — four CLIs, plus a skill that teaches your agent when to reach for each one. Works in any agent with a shell. 2. **Seamless integration** *(optional upgrade)* — a transparent local proxy and single-file native extensions, so **pasted images and built-in image tools work too**, with no tool call and no extra prompting.

All code has been verified in real Codex + DeepSeek sessions, and the same pipeline has been live-verified end-to-end in Claude Code, Pi, Oh My Pi, and OpenCode. Use cases include but are not limited to: image Q&A, screenshot analysis, Computer Use GUI operation, and multi-step image reasoning.

> If this project helps you, feel free to star🌟 & follow~ I'll keep sharing more practical tools and tips.

## Real-world Effects

<p align="center"> <img src="assets/effect-3.jpg" alt="Multi-round image Q&A with the optional glance CLI" width="49%"> <img src="assets/effect-4.jpg" alt="DeepSeek V4 playing chess by locating screen elements with glance/ground" width="49%"> </p>

*Left: multi-round image Q&A with `glance`. Right: with `ground`, DeepSeek V4 locates screen elements to play chess autonomously.*

<p align="center"> <img src="assets/effect-1.jpg" alt="DeepSeek in Codex answering a style question about a UI screenshot" width="49%"> <img src="assets/effect-2.jpg" alt="DeepSeek in Codex debugging mismatched UI fields from a screenshot" width="49%"> </p>

*Left:

Plattformkompatibilität

pythonFULL

Technische Details

Version
1.0.0
Lizenz
MIT
Letzte Aktualisierung
18. Aug. 2026
Veröffentlicht
5. Aug. 2026

Frameworks & Tools

Python

Entscheidungsübersicht

Primäre Wahl

100
Bereit
Übernehmen
Phase

recent repository activity

Audit

Installationsprüfung

Installations- und Adoptionsprüfung

92
Sicher zu testen
Sicherheit
84/100
Wartung
100/100
Installieren
92/100
Vollständiges Audit öffnenEval-Bericht ansehen

Von Agent belegte Evidenz

Von Agent belegte Evidenz

Ergebnisberichte nach Resolve, Prüfung, Installation und einem begrenzten Lauf.

0
Belegt
Needs first agent runAuto-Installation: zuerst prüfenLetzter: Unbekannt
Erfolgsrate
Letzter Fehler
Ergebnisse
0
Ausgabequalität
Fehlgeschlagen
0
Nicht relevant
0
Installationen
0
Durch Risiko blockiert
0
Einrichtung erforderlich
0
Produktion
0

Noch keine Agent-Ergebnisdaten. Der erste Lauf kann Erfolg, Einrichtungsbedarf, Risikoblockaden, Fehler oder Irrelevanz über /api/agent/outcome melden.

Installieren

Zum Agent-Workflow hinzufügen

Kostenlos und Open Source. Bericht vor der Installation in Produktions-Agents prüfen.

Wachstums-Loop

Share-Kit

X

Szenariobasierter Entwurf für Agent Vision Toolkit, bereit für einen manuellen X-Post.

Kuratorenhinweis
Agent Vision Toolkit: 给纯文本 LLM agent 装上眼睛:图片问答、OCR、截图分析、视觉定位等一套视觉工具箱 + skill,并可无缝接入 Codex、Claude Code、OpenCode、Pi |...

321 stars

https://www.openagentskill.com/skills/anionex-agent-vision-toolkit?ref=x
X-Entwurf öffnen
Optionale Antwort mit Installationsbefehl
Listing + install path for Agent Vision Toolkit:
https://www.openagentskill.com/skills/anionex-agent-vision-toolkit?ref=x

Install: npx skills add Anionex/agent-vision-toolkit
Antwortentwurf öffnen

Quelle des Eintrags

Community-indexiert

Beanspruchbar

Dieser Eintrag wurde aus öffentlichen Quellen indexiert und ist erst nach Genehmigung eines Maintainer-Anspruchs offiziell.

Ersteller
Anionex
Indexiert von
OpenAgentSkill Community-Index

Die Zuordnung verlinkt auf das öffentliche Repository oder Creator-Profil. Creator können den Eintrag beanspruchen, um Eigentümersignale zu aktualisieren.

Diesen Skill beanspruchen

Eigentümeranspruch

Diesen Skill-Eintrag beanspruchen

Dieser Community-indexiert-Eintrag wird Anionex zugeschrieben, ist aber noch nicht offiziell markiert. Beanspruche ihn, um ein verifiziertes Eigentümersignal hinzuzufügen und künftige Launch-, Installations- und Audit-Updates vertrauenswürdiger zu machen.

Creator-Backlink-Kit

Evidenz-Badges in deine README einfügen

Zeige den kanonischen Eintrag, aktuelle Vertrauens- und Audit-Signale sowie echte Agent-Proven-Evidenz dort, wo Entwickler das Repository bewerten.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/anionex-agent-vision-toolkit?metric=listed&label=Listed)](https://www.openagentskill.com/skills/anionex-agent-vision-toolkit)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/anionex-agent-vision-toolkit?metric=trust&label=Trust)](https://www.openagentskill.com/skills/anionex-agent-vision-toolkit)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/anionex-agent-vision-toolkit?metric=audit&label=Audit)](https://www.openagentskill.com/skills/anionex-agent-vision-toolkit/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/anionex-agent-vision-toolkit?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/anionex-agent-vision-toolkit)

Autor

A

Anionex

@anionex

Gesundheitssignale

GitHub-Stars
321
Qualitätswert
63/100
Letzter GitHub-Push
6. Aug. 2026
Framework-Hinweise
1
OpenAgentSkill-Aufrufe
17
Installationskopien
0
Externe Klicks
0

Community-Signal

Teile mit, ob dieser Skill für deinen Agent-Workflow nützlich ist. Zusammengefasstes Feedback verbessert das Ranking im Laufe der Zeit.

Vertrauen & Sicherheit

Vor Installation prüfen

79
  • GitHub-Akzeptanz321 GitHub-StarsInfo
  • Star-/Fork-Aktivität321 Stars und 14 Forks; Issue-Aktivität ist in den aktuellen Metadaten nicht verfügbarPrüfen
  • Aktuelle Wartung16 Tage seit dem letzten PushBestanden
  • LizenzklarheitMITBestanden
  • README/SKILL.md-VollständigkeitMetadaten enthalten ausreichend Nutzungs- und Workflow-KontextBestanden
  • Abhängigkeits-/LaufzeitrisikoBefehlsausführungsflächeInfo