Claude Skills für Audio und Stimme

Audio- und Voice-Skills decken Arbeit in beide Richtungen ab: Speech-to-Text und Text-to-Speech. Auf der Speech-to-Text-Seite umfasst das die Transkription von Audio und Video, Sprecher-Diarisierung, Zeitstempel auf Wortebene und die Zusammenfassung von Aufnahmen wie Interviews oder Meetings. Auf der Text-to-Speech-Seite umfasst es Narration, Voiceovers, Vorlesen für Barrierefreiheit, Audio-Prompts, Batch-Sprachgenerierung sowie Dubbing oder Übersetzung. Manche Skills übernehmen auch allgemeine Audioverarbeitung. Die folgende Liste ist nach beobachteter Suchnachfrage geordnet und auf Relevanz für dieses Thema geprüft. Sie ist keine Empfehlung, und die Aufnahme garantiert weder Qualität noch Eignung. Nutze sie als Ausgangspunkt: Lies die eigene Beschreibung und die Anforderungen jedes Skills, prüfe, welche Zugangsdaten oder API-Schlüssel er erwartet, und bestätige seinen Umfang, bevor du ihn zu deinem Agent hinzufügst.

8 zum Start
45 geprüfte Optionen

Hier anfangen.

Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).

Dies sind die relevantesten Ergebnisse. Öffne einen Skill, lies die Anleitung und prüfe die Eignung.

45 geprüfte Optionen

  1. Rang 04
    Direkt

    transcribe

    Offiziell

    Transkribiert Audiodateien in Text mit optionaler Diarisierung und Hinweisen zu bekannten Sprechern. Verwenden, wenn ein Nutzer darum bittet, Sprache aus Audio/Video zu transkribieren, Text aus Aufnahmen zu extrahieren oder Sprecher in Interviews oder Meetings zu kennzeichnen.

    • Transcription
    Agent Skill ansehen
  2. Rang 05
    Direkt

    qianwen-audio-tts

    Synthetisiert Sprache aus Text mit Qwen TTS-Modellen, unterstützt Voiceovers, Narration und TTS-Anwendungen über HTTP API und CosyVoice.

    • Text to speech

    Voraussetzungen (angegeben): Python

    4.758 · Beliebtheit
    Agent Skill ansehen
  3. Rang 06
    Direkt

    qwencloud-audio-tts

    Synthetisiert Sprache aus Text mit Qwen TTS-Modellen und unterstützt Voiceovers, Narration und TTS-Anwendungen über HTTP und WebSocket.

    • Text to speech

    Voraussetzungen (angegeben): Python

    1.439 · Beliebtheit
    Agent Skill ansehen
  4. Rang 07
    Direkt

    azure-speech-to-text

    Transkribiert Audio in Text mit der Azure AI Speech Fast Transcription REST API mit Zeitstempeln auf Wortebene, Sprecherdiarisierung und Mehrsprachenerkennung.

    • Transcription
    • Text to speech
    • Dubbing and translation

    Voraussetzungen (angegeben): Network access

    479 · Beliebtheit
    Agent Skill ansehen
  5. Rang 08
    Direkt

    azure-text-to-speech

    Erzeugt neuronales Erzähl-Audio mithilfe von Azure AI Speech REST Text-to-Speech mit mehrsprachigen Stimmen und SSML-Proso­die-Steuerung.

    • Text to speech

    Voraussetzungen (angegeben): Network access

    299 · Beliebtheit
    Agent Skill ansehen
37 weitere Agent Skills anzeigen
  1. Rang 09
    Direkt

    byted-text-to-speech

    Synthetisiert Text zu Sprache mit der Volcengine Doubao TTS API und unterstützt Streaming, mehrere Stimmen sowie Steuerung von Geschwindigkeit, Tonhöhe und Lautstärke.

    • Text to speech
    165 · Beliebtheit
    Agent Skill ansehen
  2. Rang 10
    Direkt

    deepgram-js-speech-to-text

    Verwendet Deepgram Speech-to-Text v1 in JavaScript/TypeScript für die Transkription vorab aufgezeichneter und Live-Audiodaten über REST und WebSocket.

    • Transcription
    • Text to speech

    Voraussetzungen (angegeben): Node.js

    69 · Beliebtheit
    Agent Skill ansehen
  3. Rang 11
    Direkt

    fish-audio

    Erzeugt KI-Text-to-Speech-Audio, verwendet gespeicherte Stimmen oder erstellt One-Shot-Voice-Clones über die AceDataCloud Fish Audio API.

    • Text to speech
    • Audio processing
    4.092 · Beliebtheit
    Agent Skill ansehen
  4. Rang 12
    Direkt

    fish-audio-tts

    Erzeugt Sprache und klont Stimmen mit Fish Audio, einschließlich der gehosteten TTS-API, Open-Weight-Modelle, Streaming und ausdrucksstarker Sprechmarker.

    • Text to speech
    72 · Beliebtheit
    Agent Skill ansehen
  5. Rang 13
    Direkt

    blog-audio

    Generiert Audio-Erzählungen von Blogbeiträgen mithilfe von Google Gemini TTS, mit Unterstützung für Zusammenfassung, vollständiges Vorlesen und Zwei-Sprecher-Podcast-Modus mit 30 Stimmen.

    • Text to speech
    • Summarization
    • Audio processing

    Voraussetzungen (angegeben): API key

    2.256 · Beliebtheit
    Agent Skill ansehen
  6. Rang 14
    Direkt

    audio-transcription

    Transkribiert lokale oder entfernte Audiodaten über PostPlus in dauerhafte Text- und Zeitstempel-Artefakte, mit optionalen Zeitstempeln und untertitelfertigen Ausgaben.

    • Transcription
    • Dubbing and translation
    1.293 · Beliebtheit
    Agent Skill ansehen
  7. Rang 15
    Direkt

    eachlabs-voice-audio

    Bietet Text-to-Speech, Speech-to-Text, Stimmkonvertierung und Audiobearbeitung über EachLabs AI-Modelle, darunter ElevenLabs TTS und Whisper.

    • Transcription
    • Text to speech
    • Dubbing and translation
    289 · Beliebtheit
    Agent Skill ansehen
  8. Rang 16
    Direkt

    venice-audio-transcription

    Transkribiert Audiodateien in Text über Venice' OpenAI-kompatiblen /audio/transcriptions Endpunkt, einschließlich Modelle, Formate, Zeitstempel und Sprachhinweise.

    • Transcription
    • Dubbing and translation
    156 · Beliebtheit
    Agent Skill ansehen
  9. Rang 17
    Direkt

    gemini-tts

    Erzeugt Sprache aus Text mit Google Gemini TTS-Modellen und unterstützt mehrere Stimmen, Multi-Speaker-Konversationen und Streaming.

    • Text to speech
    • Audio processing
    85 · Beliebtheit
    Agent Skill ansehen
  10. Rang 18
    Direkt

    script-to-voiceover

    Verwandelt ein Klartext-Skript in einen KI-narrativen Voiceover, wobei die Darbietung über Stimmauswahl und Skript-Handwerk gewählt wird.

    • Text to speech
    104 · Beliebtheit
    Agent Skill ansehen
  11. Rang 19
    Direkt

    plaud-embedded-transcription-api-skill

    Implementiert die Transcription API von Plaud Embedded zum Hochladen und Transkribieren von Audiodateien, mit Spracherkennung, Rauschunterdrückung und Diarisierung.

    • Transcription
    64 · Beliebtheit
    Agent Skill ansehen
  12. Rang 20
    Direkt

    modelslab-audio-generation

    Erzeugt Sprache, Musik und Soundeffekte mit der v7 Voice API von ModelsLab, unterstützt TTS, STT, Stimmkonvertierung und Dubbing.

    • Transcription
    • Text to speech
    • Dubbing and translation
    63 · Beliebtheit
    Agent Skill ansehen
  13. Rang 21
    Direkt

    asr

    Implementiert Speech-to-Text (ASR) mit dem z-ai-web-dev-sdk, transkribiert Audiodateien und unterstützt Sprach-Eingabefunktionen.

    • Transcription
    204 · Beliebtheit
    Agent Skill ansehen
  14. Rang 22
    Direkt

    moss-tts-nano-speech

    Experten-Skill für MOSS-TTS-Nano, ein 0,1B mehrsprachiges Echtzeit-TTS-Modell, das auf der CPU läuft, mit Voice-Cloning und Streaming-Unterstützung.

    • Text to speech
    465 · Beliebtheit
    Agent Skill ansehen
  15. Rang 23
    Direkt

    voice-audio-engineer

    Experte für Sprachsynthese, TTS, Voice Cloning, Podcast-Produktion und Sprachverarbeitung über ElevenLabs, einschließlich Loudness-Standards und Dialogmischung.

    • Transcription
    • Text to speech
    • Audio processing
    356 · Beliebtheit
    Agent Skill ansehen
  16. Rang 24
    Direkt

    ai-voiceover

    Mini-Skill für KI-Narration und Voiceover mit ElevenLabs, um Stimmen auszuwählen, fürs Hören zu schreiben und die Lieferung für Videoinhalte zu steuern.

    • Text to speech
    • Dubbing and translation
    309 · Beliebtheit
    Agent Skill ansehen
  17. Rang 25
    Direkt

    voice-design

    Wählt und erstellt KI-Stimmen für Inhalte mit ElevenLabs, Qwen3-TTS und anderen Plattformen und passt Stimmmerkmale an Marke und Zielgruppe an.

    • Text to speech
    • Summarization
    • Dubbing and translation
    188 · Beliebtheit
    Agent Skill ansehen
  18. Rang 26
    Direkt

    framevideo-voiceover-ssml

    Erstellt Narration aus Projekt-Untertiteln oder Transkripten und verfasst SSML-artige Voice-Skripte mit Phonem-, Pausen- und Zahlen-Markup für Voiceovers.

    • Text to speech
    • Dubbing and translation
    • Audio processing
    156 · Beliebtheit
    Agent Skill ansehen
  19. Rang 27
    Direkt

    azure-speech-to-text-rest-py

    Transkribiert kurze Audiodateien (bis zu 60 Sekunden) mit der Azure Speech to Text REST API in Python ohne das Speech SDK.

    • Transcription
    79 · Beliebtheit
    Agent Skill ansehen
  20. Rang 28
    Möglich

    azure-ai

    Offiziell

    Verwenden für Azure AI: Search, Speech, OpenAI, Document Intelligence. Hilft bei Suche, Vektor-/Hybridsuche, Speech-to-Text, Text-to-Speech, Transkription, OCR. WANN: AI Search, Query-Suche, Vektorsuche, Hybridsuche, semantische Suche, Speech-to-Text, Text-to-Speech, transkribieren, OCR, Text in Sprache umwandeln.

    • Transcription
    • Text to speech
    • Dubbing and translation
    Agent Skill ansehen
  21. Rang 29
    Möglich

    azure-ai-voicelive-py

    Offiziell

    Erstelle Echtzeit-Voice-AI-Anwendungen mit dem Azure AI Voice Live SDK (azure-ai-voicelive). Verwende diesen Skill, wenn du Python-Anwendungen erstellst, die Echtzeit-Kommunikation mit bidirektionalem Audio mit Azure AI benötigen, einschließlich Sprachassistenten, sprachfähigen Chatbots, Echtzeit-Sprache-zu-Sprache-Übersetzung, sprachgesteuerten Avataren oder jedem WebSocket-basierten Audio-Streaming mit KI-Modellen. Unterstützt Server VAD (Voice Activity Detection), turnusmäßige Konversation, Function Calling, MCP-Tools, Avatar-Integration und Transkription.

    • Transcription
    • Dubbing and translation

    Voraussetzungen (angegeben): API key

    Agent Skill ansehen
  22. Rang 30
    Möglich

    azure-ai-voicelive-dotnet

    Offiziell

    | Azure AI Voice Live SDK für .NET. Erstelle Echtzeit-Sprach-KI-Anwendungen mit bidirektionaler WebSocket-Kommunikation. Verwende es für Sprachassistenten, konversationelle KI, Echtzeit-Speech-to-Speech und sprachfähige Chatbots. Auslöser: "voice live", "real-time voice", "VoiceLiveClient", "VoiceLiveSession", "voice assistant .NET", "bidirectional audio", "speech-to-speech".

    Voraussetzungen (angegeben): API key

    Agent Skill ansehen
  23. Rang 31
    Möglich

    azure-ai-voicelive-java

    Offiziell

    | Azure AI VoiceLive SDK für Java. Echtzeit-bidirektionale Sprachkonversationen mit AI-Assistenten über WebSocket. Trigger: "VoiceLiveClient java", "voice assistant java", "real-time voice java", "audio streaming java", "voice activity detection java".

    • Transcription

    Voraussetzungen (angegeben): API key

    Agent Skill ansehen
  24. Rang 32
    Möglich

    azure-ai-contentunderstanding-py

    Offiziell

    | Azure AI Content Understanding SDK für Python. Verwenden für multimodale Inhaltsextraktion aus Dokumenten, Bildern, Audio und Video. Auslöser: "azure-ai-contentunderstanding", "ContentUnderstandingClient", "multimodal analysis", "document extraction", "video analysis", "audio transcription".

    • Transcription
    Agent Skill ansehen
  25. Rang 33
    Möglich

    azure-ai-openai-dotnet

    Offiziell

    | Azure OpenAI SDK für .NET. Client-Bibliothek für Azure OpenAI- und OpenAI-Dienste. Verwende sie für Chat Completions, Embeddings, Bildgenerierung, Audiotranskription und Assistenten. Auslöser: "Azure OpenAI", "AzureOpenAIClient", "ChatClient", "chat completions .NET", "GPT-4", "embeddings", "DALL-E", "Whisper", "OpenAI .NET".

    • Transcription

    Voraussetzungen (angegeben): API key

    Agent Skill ansehen
  26. Rang 34
    Möglich

    syncfusion-react-speech-to-text

    Implementiert die Syncfusion React SpeechToText-Komponente für Echtzeit-Spracherkennung, Mikrofoneingabe und sprachfähige Formulare.

    • Transcription
    • Dubbing and translation
    627 · Beliebtheit
    Agent Skill ansehen
  27. Rang 35
    Möglich

    syncfusion-blazor-speech-to-text

    Implementiert Speech-to-Text-Spracheingabe in Blazor-Anwendungen mit der Syncfusion SpeechToText-Komponente mit Echtzeiterkennung und Mehrsprachigkeitsunterstützung.

    • Transcription
    324 · Beliebtheit
    Agent Skill ansehen
  28. Rang 36
    Möglich

    syncfusion-angular-speech-to-text

    Implementiert die Syncfusion Angular SpeechToText-Komponente für Echtzeit-Sprache-zu-Text-Umwandlung mit Lokalisierung und Fehlerbehandlung.

    • Transcription
    • Dubbing and translation
    268 · Beliebtheit
    Agent Skill ansehen
  29. Rang 37
    Möglich

    audio-voice-recovery

    Audio-Forensik- und Stimmwiederherstellungsrichtlinien zur Verbesserung degradierter Aufnahmen, Rauschunterdrückung, Stimmisolierung und schwieriger Transkription.

    • Transcription
    298 · Beliebtheit
    Agent Skill ansehen
  30. Rang 38
    Möglich

    voiceover-direction

    Führt Voice-Talents an, um Darbietungen passend zur Markenvision zu liefern, mit VO-Briefs, Casting, sprechbaren Skripten und Session-Regie.

    • Text to speech
    275 · Beliebtheit
    Agent Skill ansehen
  31. Rang 39
    Möglich

    precision-voiceover-sync

    Richtet das Timing der Erzählung auf die Aktionen auf dem Bildschirm aus, mit automatischer Ausrichtung und anschließender manueller Feinabstimmung der Sync-Punkte.

    • Text to speech
    102 · Beliebtheit
    Agent Skill ansehen
  32. Rang 40
    Möglich

    media-use

    Beachtenswert

    Agent Media OS, der einzige Skill für jeden Medienbedarf in einem HyperFrames-Projekt. Löst BGM, SFX, Bild, Icon, Markenlogo, Stimme, Color Grade oder LUT in eine eingefrorene lokale Datei oder einen einfügefertigen Block + Ledger-Eintrag auf (ein Verb, `resolve`); generiert über TTS-/Musik-/Bildmodelle, wenn der Katalog nichts bietet; erzeugt Voiceover, Transkription, Untertitel und Hintergrundentfernung über eine gemeinsame Audio-Engine; arbeitet an Medien (schneiden / neu rahmen / transformieren); und verwendet Assets projektübergreifend wieder. Auch verwenden für vages Feedback, dass echtes Filmmaterial dunkel, flach, langweilig wirkt, sich retro/Camcorder/Print/ASCII anfühlen sollte, p benötigt

    • Transcription
    • Text to speech
    447.090 · Beliebtheit
    Agent Skill ansehen
  33. Rang 41
    Möglich

    ai-avatar-video

    Beachtenswert

    Erstelle KI-Avatare und Talking-Head-Videos über die inference.sh CLI. Empfohlen: P-Video-Avatar (schnellste, günstigste, integrierte TTS). Außerdem: OmniHuman, Fabric, PixVerse. Audio: Inworld TTS-2 (100+ Sprachen, Emotionssteuerung für Charaktere), ElevenLabs, Kokoro. Fähigkeiten: audiogesteuerte Avatare, Text-to-Avatar, Lipsync-Videos, Talking-Head-Generierung, virtuelle Präsentatoren, UGC-Inhalte. Verwendung für: KI-Präsentatoren, Erklärvideos, virtuelle Influencer, Dubbing, Marketingvideos, UGC-Anzeigen, Gaming-Avatare, NPC-Dialoge. Auslöser: ai avatar, talking head, lipsync, avatar video, virtual presenter, ai spokesperson

    • Text to speech
    • Dubbing and translation
    142.016 · Beliebtheit
    Agent Skill ansehen
  34. Rang 42
    Möglich

    wonda-cli

    Beachtenswert

    Verwendung der Wonda CLI zur Generierung von Bildern, Videos, Musik und Audio über das Terminal — plus LinkedIn-, Reddit- und X/Twitter-Recherche und -Automatisierung

    • Summarization
    74.605 · Beliebtheit
    Agent Skill ansehen
  35. Rang 43
    Möglich

    video-producer-agent

    Orchestriert komplette Videos mit Voiceover, Musik und Visuals, kombiniert Skript, Gemini TTS Voiceover und finale Montage.

    • Text to speech
    • Summarization
    58 · Beliebtheit
    Agent Skill ansehen
  36. Rang 44
    Möglich

    fish-audio-sdk

    Schreibt Code mit offiziellen Fish Audio SDKs für Text-to-Speech, Speech-to-Text, Voice Cloning und Echtzeit-WebSocket-TTS in Python und JavaScript.

    • Transcription
    • Text to speech
    873 · Beliebtheit
    Agent Skill ansehen
  37. Rang 45
    Möglich

    byted-mediakit-voiceover-editing

    Volcano Engine MediaKit Voiceover-Editing-Skill zum Schneiden von Talking-Head-Inhalten, inklusive ASR, Audiobearbeitung und Videoexport.

    • Text to speech
    301 · Beliebtheit
    Agent Skill ansehen
Häufige Fragen

Häufige Fragen

Welche Arten von Aufgaben fallen unter Audio- und Voice-Skills?
Sie decken Transkription, Text-to-Speech, Zusammenfassung, Synchronisation und Übersetzung sowie Audioverarbeitung ab. Audioarbeit läuft in beide Richtungen: Speech-to-Text für Transkriptions- und Zusammenfassungsaufgaben und Text-to-Speech für Voiceover- und Synchronisationsaufgaben.
Wie ist diese Liste geordnet?
Die Rangfolge basiert auf beobachteter Suchnachfrage und wird auf Relevanz für das Thema geprüft. Sie ist keine Empfehlung für einen bestimmten Skill.
Brauchen diese Skills API-Schlüssel oder Konten?
Das hängt vom Skill ab. Manche Text-to-Speech-Skills erfordern einen API-Schlüssel für Live-Aufrufe, und andere können im Rahmen ihres Umfangs eigene Stimmen erstellen, während manche dies ausdrücklich ausschließen.
Können diese Skills mehrere Sprachen und Sprecher verarbeiten?
Manche ja. Bestimmte Transkriptions-Skills unterstützen über 90 Sprachen mit Sprecherdiarisierung und Zeitstempeln auf Wortebene, und manche Text-to-Speech-Skills unterstützen über 70 Sprachen mit mehreren Modellen und Stimmeinstellungen.

Agent Skill installieren

Agent Skills sind SKILL.md-Dateien. Die meisten Agenten erkennen sie, sobald sie im richtigen Skills-Verzeichnis liegen:

  • Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
  • From the registry — run npx skills add elevenlabs/skills@text-to-speech.
  • Or download text-to-speech from its source and place that SKILL.md in the directory above.

Wie auswählen Prüfe Quelle und Anleitung des Skills vor der Installation. Die Labels Official und Notable beschreiben die Herkunft, nicht die Sicherheit.