Claude Skills para Audio y voz

Las skills de audio y voz cubren trabajo en ambas direcciones: voz a texto y texto a voz. En el lado de voz a texto, esto incluye transcripción de audio y video, diarización de hablantes, marcas de tiempo a nivel de palabra y resumen de grabaciones como entrevistas o reuniones. En el lado de texto a voz, incluye narración, locuciones, lecturas de accesibilidad, prompts de audio, generación de voz por lotes y doblaje o traducción. Algunas skills también se ocupan del procesamiento de audio general. La lista a continuación está ordenada por demanda de búsqueda observada y revisada por su relevancia para este tema. No es un respaldo, y la inclusión no garantiza calidad ni idoneidad. Úsala como punto de partida: lee la descripción y los requisitos de cada skill, comprueba qué credenciales o claves de API espera y confirma su alcance antes de añadirla a tu agent.

8 para empezar
45 opciones revisadas

Empieza por estos.

Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).

Estos son los resultados más relevantes. Abre un Skill, lee sus instrucciones y decide si encaja.

45 opciones revisadas

  1. Puesto 04
    Directa

    transcribe

    Oficial

    Transcribe archivos de audio a texto con diarización opcional y pistas de hablantes conocidos. Úsalo cuando un usuario pida transcribir voz de audio/video, extraer texto de grabaciones o etiquetar hablantes en entrevistas o reuniones.

    • Transcription
    Ver Agent Skill
  2. Puesto 05
    Directa

    qianwen-audio-tts

    Sintetiza voz a partir de texto con modelos Qwen TTS, admitiendo voiceovers, narración y aplicaciones de TTS mediante HTTP API y CosyVoice.

    • Text to speech

    Necesita (declarado): Python

    4758 · popularidad
    Ver Agent Skill
  3. Puesto 06
    Directa

    qwencloud-audio-tts

    Sintetiza voz a partir de texto con modelos Qwen TTS, con soporte para voiceovers, narración y aplicaciones TTS mediante HTTP y WebSocket.

    • Text to speech

    Necesita (declarado): Python

    1439 · popularidad
    Ver Agent Skill
  4. Puesto 07
    Directa

    azure-speech-to-text

    Transcribe audio a texto usando la REST API de Azure AI Speech Fast Transcription con marcas de tiempo a nivel de palabra, diarización de hablantes e identificación multilingüe.

    • Transcription
    • Text to speech
    • Dubbing and translation

    Necesita (declarado): Network access

    479 · popularidad
    Ver Agent Skill
  5. Puesto 08
    Directa

    azure-text-to-speech

    Genera audio de narración neuronal usando el text-to-speech REST de Azure AI Speech con voces multilingües y control de prosodia SSML.

    • Text to speech

    Necesita (declarado): Network access

    299 · popularidad
    Ver Agent Skill
Explorar 37 Agent Skills más
  1. Puesto 09
    Directa

    byted-text-to-speech

    Sintetiza texto a voz usando la API TTS de Volcengine Doubao, con soporte para streaming, múltiples voces y control de velocidad/tono/volumen.

    • Text to speech
    165 · popularidad
    Ver Agent Skill
  2. Puesto 10
    Directa

    deepgram-js-speech-to-text

    Usa Deepgram Speech-to-Text v1 en JavaScript/TypeScript para transcripción de audio pregrabado y en vivo mediante REST y WebSocket.

    • Transcription
    • Text to speech

    Necesita (declarado): Node.js

    69 · popularidad
    Ver Agent Skill
  3. Puesto 11
    Directa

    fish-audio

    Genera audio de texto a voz con IA, usa voces guardadas o crea clones de voz one-shot mediante la AceDataCloud Fish Audio API.

    • Text to speech
    • Audio processing
    4092 · popularidad
    Ver Agent Skill
  4. Puesto 12
    Directa

    fish-audio-tts

    Produce voz y clona voces con Fish Audio, abarcando su API TTS alojada, modelos de pesos abiertos, streaming y marcadores de entrega expresiva.

    • Text to speech
    72 · popularidad
    Ver Agent Skill
  5. Puesto 13
    Directa

    blog-audio

    Genera narración en audio de entradas de blog usando Google Gemini TTS, con modos de resumen, lectura completa en voz alta y podcast de dos hablantes con 30 voces.

    • Text to speech
    • Summarization
    • Audio processing

    Necesita (declarado): API key

    2256 · popularidad
    Ver Agent Skill
  6. Puesto 14
    Directa

    audio-transcription

    Transcribe audio local o remoto en texto duradero y artefactos con marcas de tiempo mediante PostPlus, con marcas de tiempo opcionales y salidas listas para subtítulos.

    • Transcription
    • Dubbing and translation
    1293 · popularidad
    Ver Agent Skill
  7. Puesto 15
    Directa

    eachlabs-voice-audio

    Ofrece texto a voz, voz a texto, conversión de voz y procesamiento de audio mediante modelos de IA de EachLabs, incluidos ElevenLabs TTS y Whisper.

    • Transcription
    • Text to speech
    • Dubbing and translation
    289 · popularidad
    Ver Agent Skill
  8. Puesto 16
    Directa

    venice-audio-transcription

    Transcribe archivos de audio a texto mediante el endpoint /audio/transcriptions compatible con OpenAI de Venice, abarcando modelos, formatos, marcas de tiempo y pistas de idioma.

    • Transcription
    • Dubbing and translation
    156 · popularidad
    Ver Agent Skill
  9. Puesto 17
    Directa

    gemini-tts

    Genera voz a partir de texto usando modelos TTS de Google Gemini, con soporte para múltiples voces, conversaciones multihablante y streaming.

    • Text to speech
    • Audio processing
    85 · popularidad
    Ver Agent Skill
  10. Puesto 18
    Directa

    script-to-voiceover

    Convierte un guion en texto plano en una voz en off narrada por IA, eligiendo la entrega mediante selección de voz y elaboración del guion.

    • Text to speech
    104 · popularidad
    Ver Agent Skill
  11. Puesto 19
    Directa

    plaud-embedded-transcription-api-skill

    Implementa la Transcription API de Plaud Embedded para subir y transcribir archivos de audio, con detección de idioma, reducción de ruido y diarización.

    • Transcription
    64 · popularidad
    Ver Agent Skill
  12. Puesto 20
    Directa

    modelslab-audio-generation

    Genera voz, música y efectos de sonido usando la v7 Voice API de ModelsLab, con soporte para TTS, STT, conversión de voz y doblaje.

    • Transcription
    • Text to speech
    • Dubbing and translation
    63 · popularidad
    Ver Agent Skill
  13. Puesto 21
    Directa

    asr

    Implementa voz a texto (ASR) usando el z-ai-web-dev-sdk, transcribiendo archivos de audio y con soporte para funciones de entrada de voz.

    • Transcription
    204 · popularidad
    Ver Agent Skill
  14. Puesto 22
    Directa

    moss-tts-nano-speech

    Skill experta para MOSS-TTS-Nano, un modelo TTS multilingüe en tiempo real de 0.1B que se ejecuta en CPU con clonación de voz y soporte de streaming.

    • Text to speech
    465 · popularidad
    Ver Agent Skill
  15. Puesto 23
    Directa

    voice-audio-engineer

    Experto en síntesis de voz, TTS, clonación de voz, producción de podcasts y procesamiento de habla mediante ElevenLabs, abarcando estándares de sonoridad y mezcla de diálogos.

    • Transcription
    • Text to speech
    • Audio processing
    356 · popularidad
    Ver Agent Skill
  16. Puesto 24
    Directa

    ai-voiceover

    Mini-skill de narración y voiceover con IA que usa ElevenLabs para elegir voces, escribir para el oído y dirigir la interpretación en contenido de video.

    • Text to speech
    • Dubbing and translation
    309 · popularidad
    Ver Agent Skill
  17. Puesto 25
    Directa

    voice-design

    Selecciona y crea voces de IA para contenido usando ElevenLabs, Qwen3-TTS y otras plataformas, ajustando las características de la voz a la marca y la audiencia.

    • Text to speech
    • Summarization
    • Dubbing and translation
    188 · popularidad
    Ver Agent Skill
  18. Puesto 26
    Directa

    framevideo-voiceover-ssml

    Crea narración a partir de subtítulos o transcripciones del proyecto y redacta guiones de voz estilo SSML con marcado de fonemas, pausas y números para voiceovers.

    • Text to speech
    • Dubbing and translation
    • Audio processing
    156 · popularidad
    Ver Agent Skill
  19. Puesto 27
    Directa

    azure-speech-to-text-rest-py

    Transcribe archivos de audio cortos (hasta 60 segundos) usando la Azure Speech to Text REST API en Python sin el Speech SDK.

    • Transcription
    79 · popularidad
    Ver Agent Skill
  20. Puesto 28
    Posible

    azure-ai

    Oficial

    Úsalo para Azure AI: Search, Speech, OpenAI, Document Intelligence. Ayuda con búsqueda, búsqueda vectorial/híbrida, voz a texto, texto a voz, transcripción, OCR. CUÁNDO: AI Search, búsqueda de consultas, búsqueda vectorial, búsqueda híbrida, búsqueda semántica, voz a texto, texto a voz, transcribir, OCR, convertir texto a voz.

    • Transcription
    • Text to speech
    • Dubbing and translation
    Ver Agent Skill
  21. Puesto 29
    Posible

    azure-ai-voicelive-py

    Oficial

    Crea aplicaciones de IA de voz en tiempo real usando el SDK de Azure AI Voice Live (azure-ai-voicelive). Usa este skill al crear aplicaciones en Python que necesiten comunicación de audio bidireccional en tiempo real con Azure AI, incluidos asistentes de voz, chatbots habilitados por voz, traducción de voz a voz en tiempo real, avatares controlados por voz o cualquier streaming de audio basado en WebSocket con modelos de IA. Admite Server VAD (detección de actividad de voz), conversación por turnos, llamada a funciones, herramientas MCP, integración de avatares y transcripción.

    • Transcription
    • Dubbing and translation

    Necesita (declarado): API key

    Ver Agent Skill
  22. Puesto 30
    Posible

    azure-ai-voicelive-dotnet

    Oficial

    | SDK de Azure AI Voice Live para .NET. Crea aplicaciones de voz de IA en tiempo real con comunicación WebSocket bidireccional. Úsalo para asistentes de voz, IA conversacional, voz a voz en tiempo real y chatbots con voz. Disparadores: "voice live", "real-time voice", "VoiceLiveClient", "VoiceLiveSession", "voice assistant .NET", "bidirectional audio", "speech-to-speech".

    Necesita (declarado): API key

    Ver Agent Skill
  23. Puesto 31
    Posible

    azure-ai-voicelive-java

    Oficial

    | SDK de Azure AI VoiceLive para Java. Conversaciones de voz bidireccionales en tiempo real con asistentes de IA usando WebSocket. Disparadores: "VoiceLiveClient java", "voice assistant java", "real-time voice java", "audio streaming java", "voice activity detection java".

    • Transcription

    Necesita (declarado): API key

    Ver Agent Skill
  24. Puesto 32
    Posible

    azure-ai-contentunderstanding-py

    Oficial

    | SDK de Azure AI Content Understanding para Python. Úsalo para la extracción de contenido multimodal de documentos, imágenes, audio y video. Disparadores: "azure-ai-contentunderstanding", "ContentUnderstandingClient", "multimodal analysis", "document extraction", "video analysis", "audio transcription".

    • Transcription
    Ver Agent Skill
  25. Puesto 33
    Posible

    azure-ai-openai-dotnet

    Oficial

    | SDK de Azure OpenAI para .NET. Biblioteca cliente para los servicios de Azure OpenAI y OpenAI. Úsala para chat completions, embeddings, generación de imágenes, transcripción de audio y assistants. Disparadores: "Azure OpenAI", "AzureOpenAIClient", "ChatClient", "chat completions .NET", "GPT-4", "embeddings", "DALL-E", "Whisper", "OpenAI .NET".

    • Transcription

    Necesita (declarado): API key

    Ver Agent Skill
  26. Puesto 34
    Posible

    syncfusion-react-speech-to-text

    Implementa el componente Syncfusion React SpeechToText para reconocimiento de voz en tiempo real, entrada de micrófono y formularios habilitados por voz.

    • Transcription
    • Dubbing and translation
    627 · popularidad
    Ver Agent Skill
  27. Puesto 35
    Posible

    syncfusion-blazor-speech-to-text

    Implementa entrada de voz speech-to-text en aplicaciones Blazor usando el componente SpeechToText de Syncfusion con reconocimiento en tiempo real y soporte multilingüe.

    • Transcription
    324 · popularidad
    Ver Agent Skill
  28. Puesto 36
    Posible

    syncfusion-angular-speech-to-text

    Implementa el componente Syncfusion Angular SpeechToText para conversión de voz a texto en tiempo real con localización y manejo de errores.

    • Transcription
    • Dubbing and translation
    268 · popularidad
    Ver Agent Skill
  29. Puesto 37
    Posible

    audio-voice-recovery

    Pautas de forense de audio y recuperación de voz para mejorar grabaciones degradadas, reducción de ruido, aislamiento de voz y transcripción difícil.

    • Transcription
    298 · popularidad
    Ver Agent Skill
  30. Puesto 38
    Posible

    voiceover-direction

    Dirige a talentos de voz para lograr interpretaciones que coincidan con la visión de marca, cubriendo briefs de VO, casting, guiones hablables y dirección de sesión.

    • Text to speech
    275 · popularidad
    Ver Agent Skill
  31. Puesto 39
    Posible

    precision-voiceover-sync

    Alinea el timing de la narración con las acciones en pantalla, ejecutando alineación automatizada y luego ajustando manualmente los puntos de sincronización.

    • Text to speech
    102 · popularidad
    Ver Agent Skill
  32. Puesto 40
    Posible

    media-use

    Destacado

    Agent Media OS, el skill único para todas las necesidades multimedia en un proyecto de HyperFrames. Resuelve BGM, SFX, imagen, icono, logotipo de marca, voz, etalonaje de color o LUT en un archivo local congelado o un bloque listo para pegar + registro en el libro mayor (un verbo, `resolve`); genera mediante modelos de TTS / música / imagen cuando el catálogo no lo tenga; produce locución, transcripción, subtítulos y eliminación de fondo a través de un único motor de audio compartido; opera sobre medios (cortar / reencuadrar / transformar); y reutiliza recursos entre proyectos. Úsalo también para comentarios vagos de que el metraje real se ve oscuro, plano, aburrido, debería sentirse retro/cámara de vídeo/impresión/ASCII, necesita p.

    • Transcription
    • Text to speech
    447.090 · popularidad
    Ver Agent Skill
  33. Puesto 41
    Posible

    ai-avatar-video

    Destacado

    Crea avatares de IA y videos de talking head mediante el CLI inference.sh. Recomendado: P-Video-Avatar (el más rápido, económico y con TTS integrado). También: OmniHuman, Fabric, PixVerse. Audio: Inworld TTS-2 (más de 100 idiomas, control de emociones para personajes), ElevenLabs, Kokoro. Capacidades: avatares guiados por audio, texto a avatar, videos con lipsync, generación de talking head, presentadores virtuales, contenido UGC. Úsalo para: presentadores de IA, videos explicativos, influencers virtuales, doblaje, videos de marketing, anuncios UGC, avatares de gaming, diálogos de NPC. Disparadores: ai avatar, talking head, lipsync, avatar video, virtual presenter, ai spokesperson

    • Text to speech
    • Dubbing and translation
    142.016 · popularidad
    Ver Agent Skill
  34. Puesto 42
    Posible

    wonda-cli

    Destacado

    Usar el CLI de Wonda para generar imágenes, videos, música y audio desde la terminal, además de investigación y automatización en LinkedIn, Reddit y X/Twitter.

    • Summarization
    74.605 · popularidad
    Ver Agent Skill
  35. Puesto 43
    Posible

    video-producer-agent

    Orquesta videos completos con voz en off, música y visuales, combinando guion, voz en off de Gemini TTS y ensamblaje final.

    • Text to speech
    • Summarization
    58 · popularidad
    Ver Agent Skill
  36. Puesto 44
    Posible

    fish-audio-sdk

    Escribe código con los SDK oficiales de Fish Audio para texto a voz, voz a texto, clonación de voz y TTS en tiempo real por WebSocket en Python y JavaScript.

    • Transcription
    • Text to speech
    873 · popularidad
    Ver Agent Skill
  37. Puesto 45
    Posible

    byted-mediakit-voiceover-editing

    Skill de edición de voz de Volcano Engine MediaKit para cortar contenido de talking-head, cubriendo ASR, procesamiento de audio y exportación de video.

    • Text to speech
    301 · popularidad
    Ver Agent Skill
Preguntas frecuentes

Preguntas frecuentes

¿Qué tipos de tareas entran en las skills de audio y voz?
Cubren transcripción, texto a voz, resumen, doblaje y traducción, y procesamiento de audio. El trabajo de audio va en ambas direcciones: voz a texto para tareas de transcripción y resumen, y texto a voz para tareas de locución y doblaje.
¿Cómo está ordenada esta lista?
Se clasifica según la demanda de búsqueda observada y se revisa por su relevancia para el tema. No es un respaldo de ninguna skill.
¿Estas skills necesitan API keys o cuentas?
Depende de la skill. Algunas skills de texto a voz requieren una clave de API para llamadas en vivo, y otras pueden crear voces personalizadas como parte de su alcance, mientras que algunas lo dejan explícitamente fuera de alcance.
¿Pueden estas skills manejar varios idiomas y hablantes?
Algunas sí. Ciertas skills de transcripción admiten más de 90 idiomas con diarización de hablantes y marcas de tiempo a nivel de palabra, y algunas skills de texto a voz admiten más de 70 idiomas con múltiples modelos y ajustes de voz.

Cómo instalar un Agent Skill

Los Agent Skills son archivos SKILL.md. La mayoría de los agentes los detectan cuando están en el directorio de skills correcto:

  • Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
  • From the registry — run npx skills add elevenlabs/skills@text-to-speech.
  • Or download text-to-speech from its source and place that SKILL.md in the directory above.

Cómo elegir Comprueba la fuente y las instrucciones del propio Skill antes de instalar. Las etiquetas Official y Notable describen procedencia, no seguridad.