Claude Skills für Audio und Stimme
Audio- und Voice-Skills decken Arbeit in beide Richtungen ab: Speech-to-Text und Text-to-Speech. Auf der Speech-to-Text-Seite umfasst das die Transkription von Audio und Video, Sprecher-Diarisierung, Zeitstempel auf Wortebene und die Zusammenfassung von Aufnahmen wie Interviews oder Meetings. Auf der Text-to-Speech-Seite umfasst es Narration, Voiceovers, Vorlesen für Barrierefreiheit, Audio-Prompts, Batch-Sprachgenerierung sowie Dubbing oder Übersetzung. Manche Skills übernehmen auch allgemeine Audioverarbeitung. Die folgende Liste ist nach beobachteter Suchnachfrage geordnet und auf Relevanz für dieses Thema geprüft. Sie ist keine Empfehlung, und die Aufnahme garantiert weder Qualität noch Eignung. Nutze sie als Ausgangspunkt: Lies die eigene Beschreibung und die Anforderungen jedes Skills, prüfe, welche Zugangsdaten oder API-Schlüssel er erwartet, und bestätige seinen Umfang, bevor du ihn zu deinem Agent hinzufügst.
8 zum Start
45 geprüfte Optionen
Hier anfangen.
Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).
Dies sind die relevantesten Ergebnisse. Öffne einen Skill, lies die Anleitung und prüfe die Eignung.
- Rang 01Agent Skill ansehenDirekt
text-to-speech
Konvertiert Text zu Sprache mit ElevenLabs Voice AI und unterstützt über 70 Sprachen, mehrere Modelle, Stimmeneinstellungen und Voiceovers.
Voraussetzungen (angegeben): API key · Network access
11.935 · Beliebtheit - Rang 02Agent Skill ansehenDirekt
speech-to-text
Transkribiert Audio zu Text mit ElevenLabs Scribe v2, mit über 90 Sprachen, Sprecher-Diarisierung, Zeitstempeln auf Wortebene und Keyterm-Prompting.
Voraussetzungen (angegeben): API key · Network access
8.398 · Beliebtheit - Rang 03Agent Skill ansehenDirekt
speech
OffiziellVerwenden, wenn der Nutzer Text-to-Speech-Erzählung oder Voiceover, Barrierefreiheits-Vorlesungen, Audio-Prompts oder Batch-Sprachgenerierung über die OpenAI Audio API anfragt; die mitgelieferte CLI (`scripts/text_to_speech.py`) mit integrierten Stimmen ausführen und `OPENAI_API_KEY` für Live-Aufrufe erforderlich. Die Erstellung eigener Stimmen liegt außerhalb des Umfangs.
- Rang 04Agent Skill ansehenDirekt
transcribe
OffiziellTranskribiert Audiodateien in Text mit optionaler Diarisierung und Hinweisen zu bekannten Sprechern. Verwenden, wenn ein Nutzer darum bittet, Sprache aus Audio/Video zu transkribieren, Text aus Aufnahmen zu extrahieren oder Sprecher in Interviews oder Meetings zu kennzeichnen.
- Rang 05Agent Skill ansehenDirekt
qianwen-audio-tts
Synthetisiert Sprache aus Text mit Qwen TTS-Modellen, unterstützt Voiceovers, Narration und TTS-Anwendungen über HTTP API und CosyVoice.
Voraussetzungen (angegeben): Python
4.758 · Beliebtheit - Rang 06Agent Skill ansehenDirekt
qwencloud-audio-tts
Synthetisiert Sprache aus Text mit Qwen TTS-Modellen und unterstützt Voiceovers, Narration und TTS-Anwendungen über HTTP und WebSocket.
Voraussetzungen (angegeben): Python
1.439 · Beliebtheit - Rang 07Agent Skill ansehenDirekt
azure-speech-to-text
Transkribiert Audio in Text mit der Azure AI Speech Fast Transcription REST API mit Zeitstempeln auf Wortebene, Sprecherdiarisierung und Mehrsprachenerkennung.
Voraussetzungen (angegeben): Network access
479 · Beliebtheit - Rang 08Agent Skill ansehenDirekt
azure-text-to-speech
Erzeugt neuronales Erzähl-Audio mithilfe von Azure AI Speech REST Text-to-Speech mit mehrsprachigen Stimmen und SSML-Prosodie-Steuerung.
Voraussetzungen (angegeben): Network access
299 · Beliebtheit
37 weitere Agent Skills anzeigen
- Rang 09Agent Skill ansehenDirekt
byted-text-to-speech
Synthetisiert Text zu Sprache mit der Volcengine Doubao TTS API und unterstützt Streaming, mehrere Stimmen sowie Steuerung von Geschwindigkeit, Tonhöhe und Lautstärke.
165 · Beliebtheit - Rang 10Agent Skill ansehenDirekt
deepgram-js-speech-to-text
Verwendet Deepgram Speech-to-Text v1 in JavaScript/TypeScript für die Transkription vorab aufgezeichneter und Live-Audiodaten über REST und WebSocket.
Voraussetzungen (angegeben): Node.js
69 · Beliebtheit - Rang 11Agent Skill ansehenDirekt
fish-audio
Erzeugt KI-Text-to-Speech-Audio, verwendet gespeicherte Stimmen oder erstellt One-Shot-Voice-Clones über die AceDataCloud Fish Audio API.
4.092 · Beliebtheit - Rang 12Agent Skill ansehenDirekt
fish-audio-tts
Erzeugt Sprache und klont Stimmen mit Fish Audio, einschließlich der gehosteten TTS-API, Open-Weight-Modelle, Streaming und ausdrucksstarker Sprechmarker.
72 · Beliebtheit - Rang 13Agent Skill ansehenDirekt
blog-audio
Generiert Audio-Erzählungen von Blogbeiträgen mithilfe von Google Gemini TTS, mit Unterstützung für Zusammenfassung, vollständiges Vorlesen und Zwei-Sprecher-Podcast-Modus mit 30 Stimmen.
Voraussetzungen (angegeben): API key
2.256 · Beliebtheit - Rang 14Agent Skill ansehenDirekt
audio-transcription
Transkribiert lokale oder entfernte Audiodaten über PostPlus in dauerhafte Text- und Zeitstempel-Artefakte, mit optionalen Zeitstempeln und untertitelfertigen Ausgaben.
1.293 · Beliebtheit - Rang 15Agent Skill ansehenDirekt
eachlabs-voice-audio
Bietet Text-to-Speech, Speech-to-Text, Stimmkonvertierung und Audiobearbeitung über EachLabs AI-Modelle, darunter ElevenLabs TTS und Whisper.
289 · Beliebtheit - Rang 16Agent Skill ansehenDirekt
venice-audio-transcription
Transkribiert Audiodateien in Text über Venice' OpenAI-kompatiblen /audio/transcriptions Endpunkt, einschließlich Modelle, Formate, Zeitstempel und Sprachhinweise.
156 · Beliebtheit - Rang 17Agent Skill ansehenDirekt
gemini-tts
Erzeugt Sprache aus Text mit Google Gemini TTS-Modellen und unterstützt mehrere Stimmen, Multi-Speaker-Konversationen und Streaming.
85 · Beliebtheit - Rang 18Agent Skill ansehenDirekt
script-to-voiceover
Verwandelt ein Klartext-Skript in einen KI-narrativen Voiceover, wobei die Darbietung über Stimmauswahl und Skript-Handwerk gewählt wird.
104 · Beliebtheit - Rang 19Agent Skill ansehenDirekt
plaud-embedded-transcription-api-skill
Implementiert die Transcription API von Plaud Embedded zum Hochladen und Transkribieren von Audiodateien, mit Spracherkennung, Rauschunterdrückung und Diarisierung.
64 · Beliebtheit - Rang 20Agent Skill ansehenDirekt
modelslab-audio-generation
Erzeugt Sprache, Musik und Soundeffekte mit der v7 Voice API von ModelsLab, unterstützt TTS, STT, Stimmkonvertierung und Dubbing.
63 · Beliebtheit - Rang 21Agent Skill ansehenDirekt
asr
Implementiert Speech-to-Text (ASR) mit dem z-ai-web-dev-sdk, transkribiert Audiodateien und unterstützt Sprach-Eingabefunktionen.
204 · Beliebtheit - Rang 22Agent Skill ansehenDirekt
moss-tts-nano-speech
Experten-Skill für MOSS-TTS-Nano, ein 0,1B mehrsprachiges Echtzeit-TTS-Modell, das auf der CPU läuft, mit Voice-Cloning und Streaming-Unterstützung.
465 · Beliebtheit - Rang 23Agent Skill ansehenDirekt
voice-audio-engineer
Experte für Sprachsynthese, TTS, Voice Cloning, Podcast-Produktion und Sprachverarbeitung über ElevenLabs, einschließlich Loudness-Standards und Dialogmischung.
356 · Beliebtheit - Rang 24Agent Skill ansehenDirekt
ai-voiceover
Mini-Skill für KI-Narration und Voiceover mit ElevenLabs, um Stimmen auszuwählen, fürs Hören zu schreiben und die Lieferung für Videoinhalte zu steuern.
309 · Beliebtheit - Rang 25Agent Skill ansehenDirekt
voice-design
Wählt und erstellt KI-Stimmen für Inhalte mit ElevenLabs, Qwen3-TTS und anderen Plattformen und passt Stimmmerkmale an Marke und Zielgruppe an.
188 · Beliebtheit - Rang 26Agent Skill ansehenDirekt
framevideo-voiceover-ssml
Erstellt Narration aus Projekt-Untertiteln oder Transkripten und verfasst SSML-artige Voice-Skripte mit Phonem-, Pausen- und Zahlen-Markup für Voiceovers.
156 · Beliebtheit - Rang 27Agent Skill ansehenDirekt
azure-speech-to-text-rest-py
Transkribiert kurze Audiodateien (bis zu 60 Sekunden) mit der Azure Speech to Text REST API in Python ohne das Speech SDK.
79 · Beliebtheit - Rang 28Agent Skill ansehenMöglich
azure-ai
OffiziellVerwenden für Azure AI: Search, Speech, OpenAI, Document Intelligence. Hilft bei Suche, Vektor-/Hybridsuche, Speech-to-Text, Text-to-Speech, Transkription, OCR. WANN: AI Search, Query-Suche, Vektorsuche, Hybridsuche, semantische Suche, Speech-to-Text, Text-to-Speech, transkribieren, OCR, Text in Sprache umwandeln.
- Rang 29Agent Skill ansehenMöglich
azure-ai-voicelive-py
OffiziellErstelle Echtzeit-Voice-AI-Anwendungen mit dem Azure AI Voice Live SDK (azure-ai-voicelive). Verwende diesen Skill, wenn du Python-Anwendungen erstellst, die Echtzeit-Kommunikation mit bidirektionalem Audio mit Azure AI benötigen, einschließlich Sprachassistenten, sprachfähigen Chatbots, Echtzeit-Sprache-zu-Sprache-Übersetzung, sprachgesteuerten Avataren oder jedem WebSocket-basierten Audio-Streaming mit KI-Modellen. Unterstützt Server VAD (Voice Activity Detection), turnusmäßige Konversation, Function Calling, MCP-Tools, Avatar-Integration und Transkription.
Voraussetzungen (angegeben): API key
- Rang 30Agent Skill ansehenMöglich
azure-ai-voicelive-dotnet
Offiziell| Azure AI Voice Live SDK für .NET. Erstelle Echtzeit-Sprach-KI-Anwendungen mit bidirektionaler WebSocket-Kommunikation. Verwende es für Sprachassistenten, konversationelle KI, Echtzeit-Speech-to-Speech und sprachfähige Chatbots. Auslöser: "voice live", "real-time voice", "VoiceLiveClient", "VoiceLiveSession", "voice assistant .NET", "bidirectional audio", "speech-to-speech".
Voraussetzungen (angegeben): API key
- Rang 31Agent Skill ansehenMöglich
azure-ai-voicelive-java
Offiziell| Azure AI VoiceLive SDK für Java. Echtzeit-bidirektionale Sprachkonversationen mit AI-Assistenten über WebSocket. Trigger: "VoiceLiveClient java", "voice assistant java", "real-time voice java", "audio streaming java", "voice activity detection java".
Voraussetzungen (angegeben): API key
- Rang 32Agent Skill ansehenMöglich
azure-ai-contentunderstanding-py
Offiziell| Azure AI Content Understanding SDK für Python. Verwenden für multimodale Inhaltsextraktion aus Dokumenten, Bildern, Audio und Video. Auslöser: "azure-ai-contentunderstanding", "ContentUnderstandingClient", "multimodal analysis", "document extraction", "video analysis", "audio transcription".
- Rang 33Agent Skill ansehenMöglich
azure-ai-openai-dotnet
Offiziell| Azure OpenAI SDK für .NET. Client-Bibliothek für Azure OpenAI- und OpenAI-Dienste. Verwende sie für Chat Completions, Embeddings, Bildgenerierung, Audiotranskription und Assistenten. Auslöser: "Azure OpenAI", "AzureOpenAIClient", "ChatClient", "chat completions .NET", "GPT-4", "embeddings", "DALL-E", "Whisper", "OpenAI .NET".
Voraussetzungen (angegeben): API key
- Rang 34Agent Skill ansehenMöglich
syncfusion-react-speech-to-text
Implementiert die Syncfusion React SpeechToText-Komponente für Echtzeit-Spracherkennung, Mikrofoneingabe und sprachfähige Formulare.
627 · Beliebtheit - Rang 35Agent Skill ansehenMöglich
syncfusion-blazor-speech-to-text
Implementiert Speech-to-Text-Spracheingabe in Blazor-Anwendungen mit der Syncfusion SpeechToText-Komponente mit Echtzeiterkennung und Mehrsprachigkeitsunterstützung.
324 · Beliebtheit - Rang 36Agent Skill ansehenMöglich
syncfusion-angular-speech-to-text
Implementiert die Syncfusion Angular SpeechToText-Komponente für Echtzeit-Sprache-zu-Text-Umwandlung mit Lokalisierung und Fehlerbehandlung.
268 · Beliebtheit - Rang 37Agent Skill ansehenMöglich
audio-voice-recovery
Audio-Forensik- und Stimmwiederherstellungsrichtlinien zur Verbesserung degradierter Aufnahmen, Rauschunterdrückung, Stimmisolierung und schwieriger Transkription.
298 · Beliebtheit - Rang 38Agent Skill ansehenMöglich
voiceover-direction
Führt Voice-Talents an, um Darbietungen passend zur Markenvision zu liefern, mit VO-Briefs, Casting, sprechbaren Skripten und Session-Regie.
275 · Beliebtheit - Rang 39Agent Skill ansehenMöglich
precision-voiceover-sync
Richtet das Timing der Erzählung auf die Aktionen auf dem Bildschirm aus, mit automatischer Ausrichtung und anschließender manueller Feinabstimmung der Sync-Punkte.
102 · Beliebtheit - Rang 40Agent Skill ansehenMöglich
media-use
BeachtenswertAgent Media OS, der einzige Skill für jeden Medienbedarf in einem HyperFrames-Projekt. Löst BGM, SFX, Bild, Icon, Markenlogo, Stimme, Color Grade oder LUT in eine eingefrorene lokale Datei oder einen einfügefertigen Block + Ledger-Eintrag auf (ein Verb, `resolve`); generiert über TTS-/Musik-/Bildmodelle, wenn der Katalog nichts bietet; erzeugt Voiceover, Transkription, Untertitel und Hintergrundentfernung über eine gemeinsame Audio-Engine; arbeitet an Medien (schneiden / neu rahmen / transformieren); und verwendet Assets projektübergreifend wieder. Auch verwenden für vages Feedback, dass echtes Filmmaterial dunkel, flach, langweilig wirkt, sich retro/Camcorder/Print/ASCII anfühlen sollte, p benötigt
447.090 · Beliebtheit - Rang 41Agent Skill ansehenMöglich
ai-avatar-video
BeachtenswertErstelle KI-Avatare und Talking-Head-Videos über die inference.sh CLI. Empfohlen: P-Video-Avatar (schnellste, günstigste, integrierte TTS). Außerdem: OmniHuman, Fabric, PixVerse. Audio: Inworld TTS-2 (100+ Sprachen, Emotionssteuerung für Charaktere), ElevenLabs, Kokoro. Fähigkeiten: audiogesteuerte Avatare, Text-to-Avatar, Lipsync-Videos, Talking-Head-Generierung, virtuelle Präsentatoren, UGC-Inhalte. Verwendung für: KI-Präsentatoren, Erklärvideos, virtuelle Influencer, Dubbing, Marketingvideos, UGC-Anzeigen, Gaming-Avatare, NPC-Dialoge. Auslöser: ai avatar, talking head, lipsync, avatar video, virtual presenter, ai spokesperson
142.016 · Beliebtheit - Rang 42Agent Skill ansehenMöglich
wonda-cli
BeachtenswertVerwendung der Wonda CLI zur Generierung von Bildern, Videos, Musik und Audio über das Terminal — plus LinkedIn-, Reddit- und X/Twitter-Recherche und -Automatisierung
74.605 · Beliebtheit - Rang 43Agent Skill ansehenMöglich
video-producer-agent
Orchestriert komplette Videos mit Voiceover, Musik und Visuals, kombiniert Skript, Gemini TTS Voiceover und finale Montage.
58 · Beliebtheit - Rang 44Agent Skill ansehenMöglich
fish-audio-sdk
Schreibt Code mit offiziellen Fish Audio SDKs für Text-to-Speech, Speech-to-Text, Voice Cloning und Echtzeit-WebSocket-TTS in Python und JavaScript.
873 · Beliebtheit - Rang 45Agent Skill ansehenMöglich
byted-mediakit-voiceover-editing
Volcano Engine MediaKit Voiceover-Editing-Skill zum Schneiden von Talking-Head-Inhalten, inklusive ASR, Audiobearbeitung und Videoexport.
301 · Beliebtheit
Häufige Fragen
- Welche Arten von Aufgaben fallen unter Audio- und Voice-Skills?
- Sie decken Transkription, Text-to-Speech, Zusammenfassung, Synchronisation und Übersetzung sowie Audioverarbeitung ab. Audioarbeit läuft in beide Richtungen: Speech-to-Text für Transkriptions- und Zusammenfassungsaufgaben und Text-to-Speech für Voiceover- und Synchronisationsaufgaben.
- Wie ist diese Liste geordnet?
- Die Rangfolge basiert auf beobachteter Suchnachfrage und wird auf Relevanz für das Thema geprüft. Sie ist keine Empfehlung für einen bestimmten Skill.
- Brauchen diese Skills API-Schlüssel oder Konten?
- Das hängt vom Skill ab. Manche Text-to-Speech-Skills erfordern einen API-Schlüssel für Live-Aufrufe, und andere können im Rahmen ihres Umfangs eigene Stimmen erstellen, während manche dies ausdrücklich ausschließen.
- Können diese Skills mehrere Sprachen und Sprecher verarbeiten?
- Manche ja. Bestimmte Transkriptions-Skills unterstützen über 90 Sprachen mit Sprecherdiarisierung und Zeitstempeln auf Wortebene, und manche Text-to-Speech-Skills unterstützen über 70 Sprachen mit mehreren Modellen und Stimmeinstellungen.
Agent Skill installieren
Agent Skills sind SKILL.md-Dateien. Die meisten Agenten erkennen sie, sobald sie im richtigen Skills-Verzeichnis liegen:
- Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
- From the registry — run npx skills add elevenlabs/skills@text-to-speech.
- Or download text-to-speech from its source and place that SKILL.md in the directory above.
Wie auswählen Prüfe Quelle und Anleitung des Skills vor der Installation. Die Labels Official und Notable beschreiben die Herkunft, nicht die Sicherheit.