Directorio de skills

Descubre skills reutilizables para AI agents.

Busca skills reales de GitHub por tarea y revisa stars, confianza, auditoría, categoría y ruta de instalación antes de utilizarlos.

Cada recomendación conserva un vínculo claro con su repositorio, auditoría y ruta de instalación.

Resultados de búsqueda: automatic-speech-recognition

Directorio en inglés

WhisperX: Automatic Speech Recognition with Word-level Timestamps (& Diarization)

23K
Stars
87/100
Confianza
Categoría: media-automationAuditoría

React and Next.js performance guidance for writing, reviewing, and refactoring production UI code.

30K
Stars
88/100
Confianza
Categoría: coding-agentsAuditoría

Fast and extensible multi-platform HTTP/1-2-3 web server with automatic HTTPS

73K
Stars
80/100
Confianza
Categoría: legal-complianceAuditoría

The world's simplest facial recognition api for Python and the command line

57K
Stars
77/100
Confianza
Categoría: ml-automationAuditoría

Offline speech recognition API for Android, iOS, Raspberry Pi and servers with Python, Java, C# and Node

15K
Stars
87/100
Confianza
Categoría: media-automationAuditoría

VoxCPM2: Tokenizer-Free TTS for Multilingual Speech Generation, Creative Voice Design, and True-to-Life Cloning

31K
Stars
87/100
Confianza
Categoría: media-automationAuditoría

Multilingual speech understanding: ASR + emotion recognition + audio event detection. 50+ languages, 15x faster than Whisper, non-autoregressive.

8.6K
Stars
77/100
Confianza
Categoría: media-automationAuditoría

A Lightweight Face Recognition and Facial Attribute Analysis (Age, Gender, Emotion and Race) Library for Python

23K
Stars
87/100
Confianza
Categoría: ml-automationAuditoría

An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System

21K
Stars
77/100
Confianza
Categoría: media-automationAuditoría

🌈一个跨平台的划词翻译和OCR软件 | A cross-platform software for text translation and recognition.

19K
Stars
87/100
Confianza
Categoría: document-processingAuditoría

Speech-to-text, text-to-speech, speaker diarization, speech enhancement, source separation, and VAD using next-gen Kaldi with onnxruntime without Internet connection. Support embedded systems, Android, iOS, HarmonyOS, Raspberry Pi, RISC-V, RK NPU, Axera NPU, Ascend NPU, x86_64 servers, websocket server/client, support 12 programming languages

13K
Stars
87/100
Confianza
Categoría: media-automationAuditoría

A Smart, Automatic, Fast and Lightweight Web Scraper for Python

7.9K
Stars
81/100
Confianza
Categoría: web-automationAuditoría