Stepfun Vision Skill

Revisar · 68
Indexado por la comunidad

Codex Skill:让纯文本模型(DeepSeek)借助 StepFun step-3.7-flash 获得看图能力 | Give text-only Codex models (DeepSeek) image understanding via StepFun step-3.7-flash

Verified installs0
Estrellas14
Versión1.0.0
Calidad66/100 · Prometedor
Confianza68/100 · Solo sandbox
Auditoría80/100 · Requiere revisión

Perfil del activo

Agents de programación y desarrollo

Code review, repo analysis, testing, CI, GitHub, DevOps, and developer workflow skills.

Ver categoría

Escenario

Agents de programación

I need a coding agent that can understand a repository, edit code, and review pull requests.

Afinidad con Agent

Claude Code + OpenAI Agents + Cursor

Funciona con Codex, Claude Code, Cursor, CLI o Agents personalizados.

Instalar

Listo

npx skills add jwangkun/stepfun-vision-skill

Mantenimiento

Actual

20 días desde el último push

Riesgo

Requiere revisión

Low GitHub adoption signal

Calidad de GitHub

14

66/100 Calidad · 76/100 Confianza

Etiquetas de cobertura

CodingAgents de programaciónHerramienta generalskilldocument-processing

Notas de revisión

Low GitHub adoption signal · Quality score needs review

Tarjeta de adopción del Agent

Confianza, auditoría y preparación de instalación de un vistazo

Estas puntuaciones combinan metadatos públicos del repositorio, señales de revisión de OpenAgentSkill, actualidad de mantenimiento y preparación de instalación. Sirven para preseleccionar; no sustituyen la revisión humana.

Calidad

Prometedor
66

Useful candidate, but compare it with alternatives before adopting.

Confianza

Solo sandbox
68

Candidata útil con señales de confianza incompletas o mixtas. Manténgala en un espacio aislado hasta que el ciclo de resultados demuestre el ajuste.

Auditoría

Requiere revisión
80

Revisión legible por máquina de la preparación de instalación, los metadatos de seguridad, el mantenimiento y el riesgo de adopción.

Trust Score de OpenAgentSkill v5

Revisión humana antes de instalar

Ejecute solo en un sandbox y compare alternativas cercanas antes de usarla en trabajo real.

JavaScriptCodexClaude CodeCursorOpenAgentSkill CLI

Estrellas

14 estrellas de GitHub

Actividad del repositorio

14 estrellas y 1 forks

Mantenimiento

20 días desde el último push

Licencia

MIT

Instalar

npx skills add jwangkun/stepfun-vision-skill

Seguridad de instalación

Ruta estándar de paquete o instalación en tiempo de ejecución

Superficie de permisos

shell or command execution, filesystem or document access

Resultados del Agent

Aún no hay datos de resultados del Agent

Documentación

Contexto sólido de README/SKILL.md

Resumen de riesgo

Revisar antes de producción

  • Low GitHub adoption signal
  • Quality score needs review
  • GitHub adoption: 14 GitHub stars
  • Stars/forks activity: 14 stars, 1 forks; issue activity unavailable in current metadata

Preparación de instalación

Ruta de instalación disponible

  • La ruta de instalación está disponible
  • La evidencia del repositorio está disponible
  • La licencia está declarada
  • Aún no hay evidencia de resultados Agent-Proven

Metadatos legibles por Agent

Datos de decisión legibles por máquina para este skill.

Usa este bloque o el JSON integrado para decidir si un Agent debe instalar este skill, elegir una alternativa o pedir revisión humana primero.

Abrir JSON

Tareas adecuadas

  • flujos de Multimodal media
  • Equipos de Claude Code
  • builders willing to evaluate younger projects
  • Read media metadata

Agents adecuados

JavaScriptCodexClaude CodeCursorOpenAgentSkill CLIOpenAI AgentsCLI

Decisión de instalación

Comando
npx skills add jwangkun/stepfun-vision-skill
Política
Revisar
Revisión humana

Confianza y riesgo

Confianza
68/100
Auditoría
80/100
Nivel de riesgo
Requiere revisión

Ciclo de resultados

Endpoint
/api/agent/outcome
ID del evento
resolve
Resultados
5

Comando de instalación

npx skills add jwangkun/stepfun-vision-skill

No usar cuando

  • Equipos que necesitan un SLA con soporte del proveedor
  • production agents without a repository review
  • Low GitHub adoption signal
  • No OpenAgentSkill engagement data yet
  • Indicios de permisos de alto riesgo: ejecución de shell o comandos

Seguridad de Agent v2

52/100 · Evitar instalación automática

ExperimentalRevisar

Sparse or mixed signals. Useful for discovery, but not for autonomous installation.

Test manually in an isolated workspace and compare against safer alternatives.

Resolver con API

Alto

Ejecución de shell o comandos

Los metadatos del skill hacen referencia a terminal, CLI, shell, subprocesos o flujos de ejecución de comandos.

Medio

Acceso a red

El skill probablemente consulta páginas remotas, API, repositorios o servicios externos.

Medio

Acceso al sistema de archivos

El skill puede leer o escribir archivos de proyecto, documentos, artefactos generados o estado local.

  • Indicios de permisos de alto riesgo: ejecución de shell o comandos
  • Low GitHub adoption signal

Destinos de instalación

Instala este skill en tu flujo de Agent

Usa el endpoint público para obtener el comando, la lista de seguridad, prompts y enlaces canónicos.

skill install

OpenAgentSkill CLI

Resolve policy, run the source installer safely, and report a verified install receipt.

$ npx --yes https://github.com/Leon-Drq/openagentskill/releases/download/cli-v0.2.1/openagentskill-0.2.1.tgz install jwangkun-stepfun-vision-skill

Plan de resolución de Agent

Deja que un Agent valide el ajuste antes de instalar.

La API Resolve devuelve la skill elegida, alternativas, política de seguridad, notas de auditoría, destino de instalación y un prompt listo para usar.

Abrir plan de texto

Agent debe revisar

  • Task fit and alternatives from Resolve API.
  • Audit score, trust score, and safety policy warnings.
  • Install target compatibility for Codex, Claude Code, Cursor, or CLI.

Copiar prompt

Task: Use Stepfun Vision Skill in this workspace.
Resolve first: https://www.openagentskill.com/api/agent/resolve?task=Use%20Stepfun%20Vision%20Skill%20for%20an%20agent%20workflow&agent=codex&max_risk=medium
Review install handoff: https://www.openagentskill.com/api/skills/jwangkun-stepfun-vision-skill/install
Install command: npx skills add jwangkun/stepfun-vision-skill
Before running it, summarize audit warnings, required permissions, and the fallback skill if install is risky.

Traspaso de Agent

Da al Agent la ruta de instalación, no otro directorio.

Usa el endpoint público para obtener el comando, la lista de seguridad, prompts y enlaces canónicos.

Abrir API de instalación

Prompt de Agent

Use Stepfun Vision Skill for this task. Review https://www.openagentskill.com/api/skills/jwangkun-stepfun-vision-skill/install, then install with: npx skills add jwangkun/stepfun-vision-skill

Metadatos del Registry

Perfil legible por Agent para seleccionar skills automáticamente.

La API Registry expone señales de decisión, confianza, auditoría, casos de uso e instalación sin raspar la interfaz.

Abrir Manifest

Afinidad con Agent

65/100

Multimodal media

Plataformas

JavaScript, Claude Code, OpenAI Agents, Cursor

Informe de auditoría

Requiere revisión · 80/100

Revisión legible por máquina de la preparación de instalación, los metadatos de seguridad, el mantenimiento y el riesgo de adopción.

Ver informe de auditoríaVer informe de evaluación

Panel de decisión de Agent

Fallback candidate for Multimodal media

Prototype with this skill first; keep a fallback candidate ready.

65
Preparación
Prototipo
Etapa

Rol en la pila

Candidata de respaldo

Ajuste principal

Multimodal media

Etiqueta de confianza

Prototipar primero

Ruta de instalación

Comando listo

Úsalo cuando

  • flujos de Multimodal media
  • Equipos de Claude Code
  • builders willing to evaluate younger projects

Evidencia

  • recent repository activity
  • install command or GitHub repo available
  • perfil de calidad 66/100

revisar primero

  • Low GitHub adoption signal
  • No OpenAgentSkill engagement data yet

Ruta de implementación

  1. 1Instálalo en un Agent de sandbox y ejecuta una tarea de Multimodal media de principio a fin.
  2. 2Compare output quality, latency, and failure behavior against at least one alternative.
  3. 3Promote it into production only after reviewing repository permissions, license, and maintenance signals.

Perfil de confianza

Solo sandbox

Candidata útil con señales de confianza incompletas o mixtas. Manténgala en un espacio aislado hasta que el ciclo de resultados demuestre el ajuste.

68
Trust Score de OpenAgentSkill

Adopción en GitHub

Corregir

14 estrellas de GitHub

Actividad de stars/forks

Corregir

14 estrellas y 1 forks; la actividad de issues no está disponible en los metadatos actuales

Mantenimiento reciente

Aprobado

20 días desde el último push

Claridad de licencia

Aprobado

MIT

Señales positivas

  • Revisión de IA aprobada
  • La ruta de instalación está disponible
  • La evidencia del repositorio está disponible
  • Repositorio mantenido recientemente
  • El comando de instalación no muestra un patrón de alto riesgo evidente
  • El ciclo de resultados está listo, pero necesita la primera ejecución real de Agent

Revisar antes de instalar

  • Low GitHub adoption signal
  • Quality score needs review
  • GitHub adoption: 14 GitHub stars
  • Stars/forks activity: 14 stars, 1 forks; issue activity unavailable in current metadata
  • Aún no hay informes reales de resultados del Agent
  • Se requiere revisión humana antes de una instalación desatendida

Acción recomendada

Ejecute solo en un sandbox y compare alternativas cercanas antes de usarla en trabajo real.

Perfil de calidad

Prometedor candidato para flujos de Agent

Useful candidate, but compare it with alternatives before adopting.

66
Estrellas de GitHub
14
Actualidad
hace 20 días
Listo para instalar
Licencia
MIT
Revisar antes de instalar: Low GitHub adoption signal

Ajuste de flujo

Usa esta skill en estos escenarios

Ajuste de flujo

Añadir a un flujo completo

Lista de alternativas

Compara antes de instalar

Similar skills that may fit this task.

Comparar todo

Resumen

# stepfun-vision-skill

![License](https://img.shields.io/badge/license-MIT-green.svg) ![Node](https://img.shields.io/badge/node-%3E%3D18-blue.svg) ![Model](https://img.shields.io/badge/model-step--3.7--flash-blueviolet) ![Codex](https://img.shields.io/badge/Codex-Skill-orange)

给 **纯文本主模型(如 Codex 接入的 DeepSeek `deepseek-v4-flash`)** 外挂“看图”能力的 Codex Skill: 当主模型不支持图片输入时,把图片交给 **StepFun `step-3.7-flash`(原生多模态推理模型)** 转成文字描述,主模型再基于描述继续推理、写代码。

``` 用户粘贴图片 / 本地图片 / 图片 URL │ ▼ scripts/describe-image.js(零依赖 Node.js) 1. 守卫:读 ~/.codex/config.toml,仅主模型为 deepseek-v4-* 时启用 2. --latest:从 Codex 会话文件恢复用户粘贴的图片(base64 重建) 3. 调 StepFun /v1/chat/completions(step-3.7-flash,OpenAI 兼容) │ ▼ 文字描述 → 返回给主模型继续干活 ```

## 项目简介 / About

**为什么需要它?** 很多人把 Codex 接到 **DeepSeek(`deepseek-v4-flash` 等纯文本模型)** 上使用——便宜、快、中文好,但这类模型**不支持图片输入**:粘贴截图会显示 `image content omitted because you do not support image input`,看不了 UI 稿、报错截图、图表和白板照片。

**怎么解决?** 本 Skill 把图片交给 **StepFun `step-3.7-flash`**(原生多模态推理模型,OpenAI 兼容接口)转成精准的文字描述,再让 DeepSeek 基于描述继续推理、写代码、排障。视觉模型只负责“看”和“转录”,**结论仍由主模型得出**——成本低、接入快、不挑主模型。

**核心亮点:**

- 粘贴即用:自动从 Codex 会话文件恢复你粘贴的图片(`--latest`),无需手动保存 - 支持本地文件、图片 URL、多张图、带问题识别(OCR / 细节追问) - 零依赖 Node.js;一键安装器自动把 key 写入 `config.json`,可选写入环境变量 - Provider 守卫:只在 DeepSeek 主模型下启用,避免误用浪费 - 推理模型适配:`reasoning_effort` 控制思考开销 + `content`/`reasoning` 回退,保证必出结果

**适用场景:** UI/前端还原、报错截图排查、设计稿评审、图表/白板转数据、票据/文档 OCR、网页截图分析等。

> **English**: *stepfun-vision-skill adds image understanding to text-only coding models (e.g. DeepSeek `deepseek-v4-flash` inside Codex) by relaying images to StepFun's natively multimodal `step-3.7-flash` model. The vision model transcribes/describes the image into text; the main model then reasons on that text. Zero-dependency Node.js, one-command installer, DeepSeek-only provider guard, and `--latest` recovery of pasted images from Codex session files.*

> 本仓库是 [deepseek-vision-skill](https://github.com/iuiaeng2005/deepseek-vision-skill)(MIT)的 StepFun 适配版:换了默认接口/

Compatibilidad de plataforma

javascriptFULL

Detalles técnicos

Versión
1.0.0
Licencia
MIT
Última actualización
18 ago 2026
Publicado
6 ago 2026

Frameworks y herramientas

JavaScript

Resumen de decisión

Candidata de respaldo

65
Listo
Prototipo
Etapa

recent repository activity

Auditoría

Revisión de instalación

Revisión de instalación y adopción

80
Requiere revisión
Seguridad
86/100
Mantenimiento
100/100
Instalar
92/100
Abrir auditoría completaVer informe de evaluación

Evidencia probada por Agent

Evidencia probada por Agent

Informes de resultados tras resolver, revisar, instalar y una ejecución limitada.

0
Probado
Needs first agent runAuto-instalación: revisar primeroÚltimo: Desconocido
Tasa de éxito
Fallo reciente
Resultados
0
Calidad de salida
Fallidos
0
No relevante
0
Instalaciones
0
Bloqueado por riesgo
0
Configuración necesaria
0
Producción
0

Aún no hay datos de resultados de Agent. La primera ejecución puede informar éxito, configuración necesaria, bloqueos de riesgo, fallo o irrelevancia mediante /api/agent/outcome.

Instalar

Añadir al flujo de Agent

Gratis y de código abierto. Revisa el informe antes de instalar en Agents de producción.

Bucle de crecimiento

Kit para compartir

X

Borrador basado en un caso para Stepfun Vision Skill, listo para publicar manualmente en X.

Nota del curador
A practical pick for design or creative work:

Stepfun Vision Skill: Codex Skill:让纯文本模型(DeepSeek)借助 StepFun step-3.7-flash 获得看图能力 | Give text-only Codex models (DeepSeek) image understanding v...

14 stars

https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill?ref=x
Abrir borrador de X
Respuesta opcional con comando de instalación
Listing + install path for Stepfun Vision Skill:
https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill?ref=x

Install: npx skills add jwangkun/stepfun-vision-skill

Fuente de la ficha

Indexado por la comunidad

Reclamable

Esta ficha se indexó desde fuentes públicas y no está marcada como oficial hasta que se apruebe una reclamación de mantenedor.

Creador
jwangkun
Indexado por
Índice comunitario de OpenAgentSkill

La atribución enlaza al repositorio público o al perfil del creador. Los creadores pueden reclamar la ficha para actualizar las señales de propiedad.

Reclamar este skill

Reclamación del propietario

Reclamar esta ficha de skill

Esta ficha Indexado por la comunidad se atribuye a jwangkun, pero aún no está marcada como oficial. Reclámala para añadir una señal de propietario verificado y hacer más fiables futuras actualizaciones de lanzamiento, instalación y auditoría.

Kit de enlaces para creadores

Añade las insignias de evidencia a tu README

Muestra la ficha canónica, las señales actuales de confianza y auditoría, y evidencia real de Agent-Proven donde los desarrolladores evalúan el repositorio.

[![Listed on OpenAgentSkill](https://www.openagentskill.com/api/badge/jwangkun-stepfun-vision-skill?metric=listed&label=Listed)](https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill)
[![OpenAgentSkill Trust](https://www.openagentskill.com/api/badge/jwangkun-stepfun-vision-skill?metric=trust&label=Trust)](https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill)
[![OpenAgentSkill Audit](https://www.openagentskill.com/api/badge/jwangkun-stepfun-vision-skill?metric=audit&label=Audit)](https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill/audit)
[![Agent Proven](https://www.openagentskill.com/api/badge/jwangkun-stepfun-vision-skill?metric=proven&label=Agent%20Proven)](https://www.openagentskill.com/skills/jwangkun-stepfun-vision-skill)

Autor

J

jwangkun

@jwangkun

Afinidad con plataforma

Señales de salud

Estrellas de GitHub
14
Puntuación de calidad
39/100
Último push de GitHub
3 ago 2026
Pistas del framework
1
Vistas de OpenAgentSkill
0
Copias de instalación
0
Clics externos
0

Señal de comunidad

Comparte si este skill resulta útil para tu flujo de Agent. Los comentarios agregados mejoran la clasificación con el tiempo.

Confianza y seguridad

Solo sandbox

68
  • Adopción en GitHub14 estrellas de GitHubCorregir
  • Actividad de stars/forks14 estrellas y 1 forks; la actividad de issues no está disponible en los metadatos actualesCorregir
  • Mantenimiento reciente20 días desde el último pushAprobado
  • Claridad de licenciaMITAprobado
  • Completitud de README/SKILL.mdLos metadatos incluyen suficiente contexto de uso y flujo de trabajoAprobado
  • Riesgo de dependencias/runtimeNo hay indicios importantes de riesgo de dependencias en los metadatos públicosAprobado