Claude Skills para Audio y voz
Las skills de audio y voz cubren trabajo en ambas direcciones: voz a texto y texto a voz. En el lado de voz a texto, esto incluye transcripción de audio y video, diarización de hablantes, marcas de tiempo a nivel de palabra y resumen de grabaciones como entrevistas o reuniones. En el lado de texto a voz, incluye narración, locuciones, lecturas de accesibilidad, prompts de audio, generación de voz por lotes y doblaje o traducción. Algunas skills también se ocupan del procesamiento de audio general. La lista a continuación está ordenada por demanda de búsqueda observada y revisada por su relevancia para este tema. No es un respaldo, y la inclusión no garantiza calidad ni idoneidad. Úsala como punto de partida: lee la descripción y los requisitos de cada skill, comprueba qué credenciales o claves de API espera y confirma su alcance antes de añadirla a tu agent.
8 para empezar
45 opciones revisadas
Empieza por estos.
Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).
Estos son los resultados más relevantes. Abre un Skill, lee sus instrucciones y decide si encaja.
- Puesto 01Ver Agent SkillDirecta
text-to-speech
Convierte texto a voz con la IA de voz de ElevenLabs, con soporte para más de 70 idiomas, varios modelos, ajustes de voz y locuciones.
Necesita (declarado): API key · Network access
11.935 · popularidad - Puesto 02Ver Agent SkillDirecta
speech-to-text
Transcribe audio a texto con ElevenLabs Scribe v2 en más de 90 idiomas, con diarización de hablantes, marcas de tiempo a nivel de palabra y prompting con términos clave.
Necesita (declarado): API key · Network access
8398 · popularidad - Puesto 03Ver Agent SkillDirecta
speech
OficialÚsalo cuando el usuario pida narración text-to-speech o voiceover, lecturas de accesibilidad, prompts de audio o generación de voz por lotes mediante la API de audio de OpenAI; ejecuta el CLI incluido (`scripts/text_to_speech.py`) con voces integradas y requiere `OPENAI_API_KEY` para llamadas en vivo. La creación de voces personalizadas queda fuera de alcance.
- Puesto 04Ver Agent SkillDirecta
transcribe
OficialTranscribe archivos de audio a texto con diarización opcional y pistas de hablantes conocidos. Úsalo cuando un usuario pida transcribir voz de audio/video, extraer texto de grabaciones o etiquetar hablantes en entrevistas o reuniones.
- Puesto 05Ver Agent SkillDirecta
qianwen-audio-tts
Sintetiza voz a partir de texto con modelos Qwen TTS, admitiendo voiceovers, narración y aplicaciones de TTS mediante HTTP API y CosyVoice.
Necesita (declarado): Python
4758 · popularidad - Puesto 06Ver Agent SkillDirecta
qwencloud-audio-tts
Sintetiza voz a partir de texto con modelos Qwen TTS, con soporte para voiceovers, narración y aplicaciones TTS mediante HTTP y WebSocket.
Necesita (declarado): Python
1439 · popularidad - Puesto 07Ver Agent SkillDirecta
azure-speech-to-text
Transcribe audio a texto usando la REST API de Azure AI Speech Fast Transcription con marcas de tiempo a nivel de palabra, diarización de hablantes e identificación multilingüe.
Necesita (declarado): Network access
479 · popularidad - Puesto 08Ver Agent SkillDirecta
azure-text-to-speech
Genera audio de narración neuronal usando el text-to-speech REST de Azure AI Speech con voces multilingües y control de prosodia SSML.
Necesita (declarado): Network access
299 · popularidad
Explorar 37 Agent Skills más
- Puesto 09Ver Agent SkillDirecta
byted-text-to-speech
Sintetiza texto a voz usando la API TTS de Volcengine Doubao, con soporte para streaming, múltiples voces y control de velocidad/tono/volumen.
165 · popularidad - Puesto 10Ver Agent SkillDirecta
deepgram-js-speech-to-text
Usa Deepgram Speech-to-Text v1 en JavaScript/TypeScript para transcripción de audio pregrabado y en vivo mediante REST y WebSocket.
Necesita (declarado): Node.js
69 · popularidad - Puesto 11Ver Agent SkillDirecta
fish-audio
Genera audio de texto a voz con IA, usa voces guardadas o crea clones de voz one-shot mediante la AceDataCloud Fish Audio API.
4092 · popularidad - Puesto 12Ver Agent SkillDirecta
fish-audio-tts
Produce voz y clona voces con Fish Audio, abarcando su API TTS alojada, modelos de pesos abiertos, streaming y marcadores de entrega expresiva.
72 · popularidad - Puesto 13Ver Agent SkillDirecta
blog-audio
Genera narración en audio de entradas de blog usando Google Gemini TTS, con modos de resumen, lectura completa en voz alta y podcast de dos hablantes con 30 voces.
Necesita (declarado): API key
2256 · popularidad - Puesto 14Ver Agent SkillDirecta
audio-transcription
Transcribe audio local o remoto en texto duradero y artefactos con marcas de tiempo mediante PostPlus, con marcas de tiempo opcionales y salidas listas para subtítulos.
1293 · popularidad - Puesto 15Ver Agent SkillDirecta
eachlabs-voice-audio
Ofrece texto a voz, voz a texto, conversión de voz y procesamiento de audio mediante modelos de IA de EachLabs, incluidos ElevenLabs TTS y Whisper.
289 · popularidad - Puesto 16Ver Agent SkillDirecta
venice-audio-transcription
Transcribe archivos de audio a texto mediante el endpoint /audio/transcriptions compatible con OpenAI de Venice, abarcando modelos, formatos, marcas de tiempo y pistas de idioma.
156 · popularidad - Puesto 17Ver Agent SkillDirecta
gemini-tts
Genera voz a partir de texto usando modelos TTS de Google Gemini, con soporte para múltiples voces, conversaciones multihablante y streaming.
85 · popularidad - Puesto 18Ver Agent SkillDirecta
script-to-voiceover
Convierte un guion en texto plano en una voz en off narrada por IA, eligiendo la entrega mediante selección de voz y elaboración del guion.
104 · popularidad - Puesto 19Ver Agent SkillDirecta
plaud-embedded-transcription-api-skill
Implementa la Transcription API de Plaud Embedded para subir y transcribir archivos de audio, con detección de idioma, reducción de ruido y diarización.
64 · popularidad - Puesto 20Ver Agent SkillDirecta
modelslab-audio-generation
Genera voz, música y efectos de sonido usando la v7 Voice API de ModelsLab, con soporte para TTS, STT, conversión de voz y doblaje.
63 · popularidad - Puesto 21Ver Agent SkillDirecta
asr
Implementa voz a texto (ASR) usando el z-ai-web-dev-sdk, transcribiendo archivos de audio y con soporte para funciones de entrada de voz.
204 · popularidad - Puesto 22Ver Agent SkillDirecta
moss-tts-nano-speech
Skill experta para MOSS-TTS-Nano, un modelo TTS multilingüe en tiempo real de 0.1B que se ejecuta en CPU con clonación de voz y soporte de streaming.
465 · popularidad - Puesto 23Ver Agent SkillDirecta
voice-audio-engineer
Experto en síntesis de voz, TTS, clonación de voz, producción de podcasts y procesamiento de habla mediante ElevenLabs, abarcando estándares de sonoridad y mezcla de diálogos.
356 · popularidad - Puesto 24Ver Agent SkillDirecta
ai-voiceover
Mini-skill de narración y voiceover con IA que usa ElevenLabs para elegir voces, escribir para el oído y dirigir la interpretación en contenido de video.
309 · popularidad - Puesto 25Ver Agent SkillDirecta
voice-design
Selecciona y crea voces de IA para contenido usando ElevenLabs, Qwen3-TTS y otras plataformas, ajustando las características de la voz a la marca y la audiencia.
188 · popularidad - Puesto 26Ver Agent SkillDirecta
framevideo-voiceover-ssml
Crea narración a partir de subtítulos o transcripciones del proyecto y redacta guiones de voz estilo SSML con marcado de fonemas, pausas y números para voiceovers.
156 · popularidad - Puesto 27Ver Agent SkillDirecta
azure-speech-to-text-rest-py
Transcribe archivos de audio cortos (hasta 60 segundos) usando la Azure Speech to Text REST API en Python sin el Speech SDK.
79 · popularidad - Puesto 28Ver Agent SkillPosible
azure-ai
OficialÚsalo para Azure AI: Search, Speech, OpenAI, Document Intelligence. Ayuda con búsqueda, búsqueda vectorial/híbrida, voz a texto, texto a voz, transcripción, OCR. CUÁNDO: AI Search, búsqueda de consultas, búsqueda vectorial, búsqueda híbrida, búsqueda semántica, voz a texto, texto a voz, transcribir, OCR, convertir texto a voz.
- Puesto 29Ver Agent SkillPosible
azure-ai-voicelive-py
OficialCrea aplicaciones de IA de voz en tiempo real usando el SDK de Azure AI Voice Live (azure-ai-voicelive). Usa este skill al crear aplicaciones en Python que necesiten comunicación de audio bidireccional en tiempo real con Azure AI, incluidos asistentes de voz, chatbots habilitados por voz, traducción de voz a voz en tiempo real, avatares controlados por voz o cualquier streaming de audio basado en WebSocket con modelos de IA. Admite Server VAD (detección de actividad de voz), conversación por turnos, llamada a funciones, herramientas MCP, integración de avatares y transcripción.
Necesita (declarado): API key
- Puesto 30Ver Agent SkillPosible
azure-ai-voicelive-dotnet
Oficial| SDK de Azure AI Voice Live para .NET. Crea aplicaciones de voz de IA en tiempo real con comunicación WebSocket bidireccional. Úsalo para asistentes de voz, IA conversacional, voz a voz en tiempo real y chatbots con voz. Disparadores: "voice live", "real-time voice", "VoiceLiveClient", "VoiceLiveSession", "voice assistant .NET", "bidirectional audio", "speech-to-speech".
Necesita (declarado): API key
- Puesto 31Ver Agent SkillPosible
azure-ai-voicelive-java
Oficial| SDK de Azure AI VoiceLive para Java. Conversaciones de voz bidireccionales en tiempo real con asistentes de IA usando WebSocket. Disparadores: "VoiceLiveClient java", "voice assistant java", "real-time voice java", "audio streaming java", "voice activity detection java".
Necesita (declarado): API key
- Puesto 32Ver Agent SkillPosible
azure-ai-contentunderstanding-py
Oficial| SDK de Azure AI Content Understanding para Python. Úsalo para la extracción de contenido multimodal de documentos, imágenes, audio y video. Disparadores: "azure-ai-contentunderstanding", "ContentUnderstandingClient", "multimodal analysis", "document extraction", "video analysis", "audio transcription".
- Puesto 33Ver Agent SkillPosible
azure-ai-openai-dotnet
Oficial| SDK de Azure OpenAI para .NET. Biblioteca cliente para los servicios de Azure OpenAI y OpenAI. Úsala para chat completions, embeddings, generación de imágenes, transcripción de audio y assistants. Disparadores: "Azure OpenAI", "AzureOpenAIClient", "ChatClient", "chat completions .NET", "GPT-4", "embeddings", "DALL-E", "Whisper", "OpenAI .NET".
Necesita (declarado): API key
- Puesto 34Ver Agent SkillPosible
syncfusion-react-speech-to-text
Implementa el componente Syncfusion React SpeechToText para reconocimiento de voz en tiempo real, entrada de micrófono y formularios habilitados por voz.
627 · popularidad - Puesto 35Ver Agent SkillPosible
syncfusion-blazor-speech-to-text
Implementa entrada de voz speech-to-text en aplicaciones Blazor usando el componente SpeechToText de Syncfusion con reconocimiento en tiempo real y soporte multilingüe.
324 · popularidad - Puesto 36Ver Agent SkillPosible
syncfusion-angular-speech-to-text
Implementa el componente Syncfusion Angular SpeechToText para conversión de voz a texto en tiempo real con localización y manejo de errores.
268 · popularidad - Puesto 37Ver Agent SkillPosible
audio-voice-recovery
Pautas de forense de audio y recuperación de voz para mejorar grabaciones degradadas, reducción de ruido, aislamiento de voz y transcripción difícil.
298 · popularidad - Puesto 38Ver Agent SkillPosible
voiceover-direction
Dirige a talentos de voz para lograr interpretaciones que coincidan con la visión de marca, cubriendo briefs de VO, casting, guiones hablables y dirección de sesión.
275 · popularidad - Puesto 39Ver Agent SkillPosible
precision-voiceover-sync
Alinea el timing de la narración con las acciones en pantalla, ejecutando alineación automatizada y luego ajustando manualmente los puntos de sincronización.
102 · popularidad - Puesto 40Ver Agent SkillPosible
media-use
DestacadoAgent Media OS, el skill único para todas las necesidades multimedia en un proyecto de HyperFrames. Resuelve BGM, SFX, imagen, icono, logotipo de marca, voz, etalonaje de color o LUT en un archivo local congelado o un bloque listo para pegar + registro en el libro mayor (un verbo, `resolve`); genera mediante modelos de TTS / música / imagen cuando el catálogo no lo tenga; produce locución, transcripción, subtítulos y eliminación de fondo a través de un único motor de audio compartido; opera sobre medios (cortar / reencuadrar / transformar); y reutiliza recursos entre proyectos. Úsalo también para comentarios vagos de que el metraje real se ve oscuro, plano, aburrido, debería sentirse retro/cámara de vídeo/impresión/ASCII, necesita p.
447.090 · popularidad - Puesto 41Ver Agent SkillPosible
ai-avatar-video
DestacadoCrea avatares de IA y videos de talking head mediante el CLI inference.sh. Recomendado: P-Video-Avatar (el más rápido, económico y con TTS integrado). También: OmniHuman, Fabric, PixVerse. Audio: Inworld TTS-2 (más de 100 idiomas, control de emociones para personajes), ElevenLabs, Kokoro. Capacidades: avatares guiados por audio, texto a avatar, videos con lipsync, generación de talking head, presentadores virtuales, contenido UGC. Úsalo para: presentadores de IA, videos explicativos, influencers virtuales, doblaje, videos de marketing, anuncios UGC, avatares de gaming, diálogos de NPC. Disparadores: ai avatar, talking head, lipsync, avatar video, virtual presenter, ai spokesperson
142.016 · popularidad - Puesto 42Ver Agent SkillPosible
wonda-cli
DestacadoUsar el CLI de Wonda para generar imágenes, videos, música y audio desde la terminal, además de investigación y automatización en LinkedIn, Reddit y X/Twitter.
74.605 · popularidad - Puesto 43Ver Agent SkillPosible
video-producer-agent
Orquesta videos completos con voz en off, música y visuales, combinando guion, voz en off de Gemini TTS y ensamblaje final.
58 · popularidad - Puesto 44Ver Agent SkillPosible
fish-audio-sdk
Escribe código con los SDK oficiales de Fish Audio para texto a voz, voz a texto, clonación de voz y TTS en tiempo real por WebSocket en Python y JavaScript.
873 · popularidad - Puesto 45Ver Agent SkillPosible
byted-mediakit-voiceover-editing
Skill de edición de voz de Volcano Engine MediaKit para cortar contenido de talking-head, cubriendo ASR, procesamiento de audio y exportación de video.
301 · popularidad
Preguntas frecuentes
- ¿Qué tipos de tareas entran en las skills de audio y voz?
- Cubren transcripción, texto a voz, resumen, doblaje y traducción, y procesamiento de audio. El trabajo de audio va en ambas direcciones: voz a texto para tareas de transcripción y resumen, y texto a voz para tareas de locución y doblaje.
- ¿Cómo está ordenada esta lista?
- Se clasifica según la demanda de búsqueda observada y se revisa por su relevancia para el tema. No es un respaldo de ninguna skill.
- ¿Estas skills necesitan API keys o cuentas?
- Depende de la skill. Algunas skills de texto a voz requieren una clave de API para llamadas en vivo, y otras pueden crear voces personalizadas como parte de su alcance, mientras que algunas lo dejan explícitamente fuera de alcance.
- ¿Pueden estas skills manejar varios idiomas y hablantes?
- Algunas sí. Ciertas skills de transcripción admiten más de 90 idiomas con diarización de hablantes y marcas de tiempo a nivel de palabra, y algunas skills de texto a voz admiten más de 70 idiomas con múltiples modelos y ajustes de voz.
Cómo instalar un Agent Skill
Los Agent Skills son archivos SKILL.md. La mayoría de los agentes los detectan cuando están en el directorio de skills correcto:
- Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
- From the registry — run npx skills add elevenlabs/skills@text-to-speech.
- Or download text-to-speech from its source and place that SKILL.md in the directory above.
Cómo elegir Comprueba la fuente y las instrucciones del propio Skill antes de instalar. Las etiquetas Official y Notable describen procedencia, no seguridad.