暂未收录效果图
查看技能说明Mlx Audio
Blaizzy
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
OPENAGENTSKILL / DIRECTORY
为下一项任务找到合适的技能。探索适用于 Codex、Claude Code、Cursor 等 Agent 的工具。
69 Skills
搜索结果: 69
暂未收录效果图
查看技能说明Blaizzy
A text-to-speech (TTS), speech-to-text (STT) and speech-to-speech (STS) library built on Apple's MLX framework, providing efficient speech analysis on Apple Silicon.
暂未收录效果图
查看技能说明pytorch
Data manipulation and transformation for audio signal processing, powered by PyTorch
暂未收录效果图
查看技能说明libAudioFlux
暂未收录效果图
查看技能说明tyiannak
Python Audio Analysis Library: Feature Extraction, Classification, Segmentation and Applications
暂未收录效果图
查看技能说明iver56
A Python library for audio data augmentation. Useful for making audio ML models work well in the real world, not just in the lab.
暂未收录效果图
查看技能说明hkchengrex
[CVPR 2025] MMAudio: Taming Multimodal Joint Training for High-Quality Video-to-Audio Synthesis
暂未收录效果图
查看技能说明diodiogod
A ComfyUI custom node integration for local multi-engine multi-language Text-to-Speech and Voice Conversion. Supports: RVC, Echo-TTS, Qwen3-TTS, Cozy Voice 3, Step Audio…
暂未收录效果图
查看技能说明archinetai
A timeline of the latest AI models for audio generation, starting in 2023!
暂未收录效果图
查看技能说明gitmylo
暂未收录效果图
查看技能说明BinWang28
The hub for audio AI research: papers, open models, benchmarks & datasets across audio LLMs, speech recognition, TTS, music & audio generation.
暂未收录效果图
查看技能说明Blaizzy
暂未收录效果图
查看技能说明stepfun-ai
A powerful 3B-parameter, LLM-based Reinforcement Learning audio edit model excels at editing emotion, speaking style, and paralinguistics, and features robust zero-shot…
暂未收录效果图
查看技能说明GoogleChrome
Audion is a Chrome extension that adds a Web Audio panel to Developer Tools. This panel visualizes the web audio graph in real-time.
暂未收录效果图
查看技能说明FunAudioLLM
Multilingual speech understanding: ASR + emotion recognition + audio event detection. 50+ languages, 15x faster than Whisper, non-autoregressive.
暂未收录效果图
查看技能说明nexu-io
Audio generation skill — jingles, beds, voiceover, and sound effects. Routes music requests to Suno V5 / Udio / Lyria, speech to MiniMax TTS / FishAudio / ElevenLabs V3,…
暂未收录效果图
查看技能说明calesthio
Generate expressive, multilingual narration with fish.audio (S1 / S2-generation models) and reuse cloned voices via reference_id. Use when the user prefers fish.audio/Fi…