オーディオと音声 向けの Claude Skills
音声とボイスのスキルは、双方向に走る作業を扱います。音声認識と音声合成です。音声認識側では、音声や動画の文字起こし、話者分離、単語単位のタイムスタンプ、インタビューや会議などの録音の要約が含まれます。音声合成側では、ナレーション、ボイスオーバー、アクセシビリティ向け読み上げ、音声プロンプト、バッチ音声生成、吹き替えや翻訳が含まれます。一般的な音声処理を扱うスキルもあります。以下のリストは観測された検索需要で順位付けされ、このトピックとの関連性が確認されたものです。推奨ではなく、掲載が品質や適合性を保証するものではありません。出発点として使い、各スキル自身の説明と要件を読み、想定される認証情報やAPIキーを確認し、エージェントに追加する前に範囲を確認してください。
8 件から開始
45 件のレビュー済み候補
まずはこちらから。
Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).
関連性の高い結果です。Skill の説明を読み、目的に合うか確認してください。
- 順位 01Agent Skill を見る直接一致
text-to-speech
ElevenLabs音声AIを使ってテキストを音声に変換します。70以上の言語、複数のモデル、音声設定、ナレーションに対応します。
前提条件(自己申告): API key · Network access
11,935 · 人気度 - 順位 02Agent Skill を見る直接一致
speech-to-text
ElevenLabs Scribe v2を使い、90以上の言語、話者ダイアライゼーション、単語レベルのタイムスタンプ、キータームプロンプティングに対応した音声のテキスト化。
前提条件(自己申告): API key · Network access
8,398 · 人気度 - 順位 03Agent Skill を見る直接一致
speech
公式ユーザーがテキスト読み上げナレーションやボイスオーバー、アクセシビリティ読み上げ、音声プロンプト、OpenAI Audio API経由のバッチ音声生成を求めたときに使用。同梱のCLI(`scripts/text_to_speech.py`)を組み込みボイスで実行し、ライブ呼び出しには`OPENAI_API_KEY`が必要。カスタムボイス作成は対象外。
- 順位 04Agent Skill を見る直接一致
transcribe
公式音声ファイルをテキストに文字起こしします。オプションでダイアライゼーションと既知話者のヒントに対応。音声/動画からの音声の文字起こし、録音からのテキスト抽出、インタビューや会議での話者ラベル付けをユーザーが求める場合に使用します。
- 順位 05Agent Skill を見る直接一致
qianwen-audio-tts
Qwen TTS モデルでテキストから音声を合成。ナレーション、語り、TTS アプリケーションを HTTP API と CosyVoice 経由でサポート。
前提条件(自己申告): Python
4,758 · 人気度 - 順位 06Agent Skill を見る直接一致
qwencloud-audio-tts
Qwen TTSモデルでテキストから音声を合成し、HTTPとWebSocketを介してナレーション、語り、TTSアプリケーションに対応します。
前提条件(自己申告): Python
1,439 · 人気度 - 順位 07Agent Skill を見る直接一致
azure-speech-to-text
Azure AI Speech Fast Transcription REST API で音声をテキスト化。単語レベルのタイムスタンプ、話者分離、多言語識別に対応。
前提条件(自己申告): Network access
479 · 人気度 - 順位 08Agent Skill を見る直接一致
azure-text-to-speech
Azure AI Speech RESTのテキスト読み上げを使い、多言語ボイスとSSMLプロソディ制御に対応したニューラルナレーション音声を生成。
前提条件(自己申告): Network access
299 · 人気度
ほか 37 件の Agent Skills を表示
- 順位 09Agent Skill を見る直接一致
byted-text-to-speech
Volcengine Doubao TTS APIを使い、テキストを音声合成します。ストリーミング、複数の音声、速度/ピッチ/音量の制御に対応します。
165 · 人気度 - 順位 10Agent Skill を見る直接一致
deepgram-js-speech-to-text
JavaScript/TypeScriptでDeepgram Speech-to-Text v1を使用し、RESTとWebSocket経由で録音済み音声とライブ音声を文字起こしします。
前提条件(自己申告): Node.js
69 · 人気度 - 順位 11Agent Skill を見る直接一致
fish-audio
AceDataCloud Fish Audio API経由でAIテキスト読み上げ音声を生成し、保存済み音声を使用、またはワンショット音声クローンを作成。
4,092 · 人気度 - 順位 12Agent Skill を見る直接一致
fish-audio-tts
Fish Audioで音声生成とボイスクローンを実行。ホスト型TTS API、オープンウェイトモデル、ストリーミング、表現力豊かなデリバリーマーカーを網羅。
72 · 人気度 - 順位 13Agent Skill を見る直接一致
blog-audio
Google Gemini TTSを使いブログ記事の音声ナレーションを生成。要約、全文読み上げ、30ボイス対応の2話者ポッドキャストモードに対応。
前提条件(自己申告): API key
2,256 · 人気度 - 順位 14Agent Skill を見る直接一致
audio-transcription
PostPlusを通じてローカルまたはリモートの音声を耐久性のあるテキストとタイムスタンプ成果物に文字起こしし、オプションのタイムスタンプと字幕対応の出力を提供します。
1,293 · 人気度 - 順位 15Agent Skill を見る直接一致
eachlabs-voice-audio
ElevenLabs TTSやWhisperを含むEachLabs AIモデルを介して、テキスト読み上げ、音声認識、音声変換、音声処理を提供します。
289 · 人気度 - 順位 16Agent Skill を見る直接一致
venice-audio-transcription
Venice の OpenAI 互換 /audio/transcriptions エンドポイントで音声ファイルをテキスト化。モデル、フォーマット、タイムスタンプ、言語ヒントを網羅。
156 · 人気度 - 順位 17Agent Skill を見る直接一致
gemini-tts
Google Gemini TTSモデルを使用してテキストから音声を生成し、複数の声、複数話者の会話、ストリーミングに対応します。
85 · 人気度 - 順位 18Agent Skill を見る直接一致
script-to-voiceover
プレーンテキストのスクリプトをAIナレーションのボイスオーバーに変換し、声の選択とスクリプト作成を通じて読み上げ方を決めます。
104 · 人気度 - 順位 19Agent Skill を見る直接一致
plaud-embedded-transcription-api-skill
Plaud Embedded の Transcription API を実装し、音声ファイルをアップロードして文字起こし。言語検出、ノイズ低減、話者分離に対応。
64 · 人気度 - 順位 20Agent Skill を見る直接一致
modelslab-audio-generation
ModelsLabのv7 Voice APIを使って音声、音楽、効果音を生成し、TTS、STT、音声変換、吹き替えに対応します。
63 · 人気度 - 順位 21Agent Skill を見る直接一致
asr
z-ai-web-dev-sdkを使用して音声認識(ASR)を実装し、音声ファイルを文字起こしして音声入力機能をサポートします。
204 · 人気度 - 順位 22Agent Skill を見る直接一致
moss-tts-nano-speech
CPU上で動作し、音声クローンとストリーミングに対応する0.1Bの多言語リアルタイムTTSモデル、MOSS-TTS-Nanoのエキスパートスキル。
465 · 人気度 - 順位 23Agent Skill を見る直接一致
voice-audio-engineer
ElevenLabs による音声合成、TTS、声質クローン、ポッドキャスト制作、音声処理のエキスパート。ラウドネス基準と対話ミックスを網羅。
356 · 人気度 - 順位 24Agent Skill を見る直接一致
ai-voiceover
ElevenLabsを使ったAIナレーションとナレーションのミニスキル。声の選択、耳で聴くための文章作成、動画コンテンツ向けのデリバリー演出を行う。
309 · 人気度 - 順位 25Agent Skill を見る直接一致
voice-design
ElevenLabs、Qwen3-TTSなどのプラットフォームを使いコンテンツ向けのAI音声を選択・作成し、音声特性をブランドとオーディエンスに合わせる。
188 · 人気度 - 順位 26Agent Skill を見る直接一致
framevideo-voiceover-ssml
プロジェクトの字幕やトランスクリプトからナレーションを作成し、音素、ブレーク、数字マークアップを備えたSSML風の音声スクリプトをボイスオーバー向けに執筆します。
156 · 人気度 - 順位 27Agent Skill を見る直接一致
azure-speech-to-text-rest-py
Speech SDKを使わず、PythonでAzure Speech to Text REST APIを使い短い音声ファイル(最大60秒)を文字起こし。
79 · 人気度 - 順位 28Agent Skill を見る一致の可能性
azure-ai
公式Azure AI(Search、Speech、OpenAI、Document Intelligence)に使用。検索、ベクトル/ハイブリッド検索、音声テキスト化、テキスト音声化、文字起こし、OCRを支援。WHEN: AI Search、クエリ検索、ベクトル検索、ハイブリッド検索、セマンティック検索、音声テキスト化、テキスト音声化、文字起こし、OCR、テキストの音声変換。
- 順位 29Agent Skill を見る一致の可能性
azure-ai-voicelive-py
公式Azure AI Voice Live SDK(azure-ai-voicelive)を使ったリアルタイム音声AIアプリケーションを構築します。Azure AIとのリアルタイム双方向音声通信を必要とするPythonアプリケーションを作成する際にこのスキルを使用します。音声アシスタント、音声対応チャットボット、リアルタイムの音声間翻訳、音声駆動アバター、またはAIモデルとのWebSocketベースの音声ストリーミングを含みます。Server VAD(音声活動検出)、ターン制会話、関数呼び出し、MCPツール、アバター統合、文字起こしに対応します。
前提条件(自己申告): API key
- 順位 30Agent Skill を見る一致の可能性
azure-ai-voicelive-dotnet
公式| .NET向けAzure AI Voice Live SDK。双方向WebSocket通信でリアルタイム音声AIアプリを構築。音声アシスタント、会話AI、リアルタイム音声間変換、音声対応チャットボットに使用。トリガー: "voice live"、"real-time voice"、"VoiceLiveClient"、"VoiceLiveSession"、"voice assistant .NET"、"bidirectional audio"、"speech-to-speech"。
前提条件(自己申告): API key
- 順位 31Agent Skill を見る一致の可能性
azure-ai-voicelive-java
公式| Azure AI VoiceLive SDK for Java。WebSocket を使った AI アシスタントとのリアルタイム双方向音声会話。トリガー: "VoiceLiveClient java"、"voice assistant java"、"real-time voice java"、"audio streaming java"、"voice activity detection java"。
前提条件(自己申告): API key
- 順位 32Agent Skill を見る一致の可能性
azure-ai-contentunderstanding-py
公式| Python向けAzure AI Content Understanding SDK。ドキュメント、画像、音声、動画からのマルチモーダルコンテンツ抽出に使用。トリガー:「azure-ai-contentunderstanding」「ContentUnderstandingClient」「multimodal analysis」「document extraction」「video analysis」「audio transcription」。
- 順位 33Agent Skill を見る一致の可能性
azure-ai-openai-dotnet
公式| .NET用Azure OpenAI SDK。Azure OpenAIおよびOpenAIサービスのクライアントライブラリ。チャット補完、埋め込み、画像生成、音声文字起こし、アシスタントに使用します。トリガー: "Azure OpenAI"、"AzureOpenAIClient"、"ChatClient"、"chat completions .NET"、"GPT-4"、"embeddings"、"DALL-E"、"Whisper"、"OpenAI .NET"。
前提条件(自己申告): API key
- 順位 34Agent Skill を見る一致の可能性
syncfusion-react-speech-to-text
リアルタイム音声認識、マイク入力、音声対応フォームのためのSyncfusion React SpeechToTextコンポーネントを実装します。
627 · 人気度 - 順位 35Agent Skill を見る一致の可能性
syncfusion-blazor-speech-to-text
Syncfusion SpeechToTextコンポーネントを用いてBlazorアプリケーションに音声-to-テキスト音声入力を実装し、リアルタイム認識と多言語サポートを備えます。
324 · 人気度 - 順位 36Agent Skill を見る一致の可能性
syncfusion-angular-speech-to-text
Syncfusion Angular SpeechToText コンポーネントを実装し、ローカライズとエラー処理を備えたリアルタイム音声テキスト変換を実現。
268 · 人気度 - 順位 37Agent Skill を見る一致の可能性
audio-voice-recovery
劣化した録音の改善、ノイズ低減、音声分離、困難な文字起こしのための音声フォレンジックと音声復元のガイドライン。
298 · 人気度 - 順位 38Agent Skill を見る一致の可能性
voiceover-direction
ブランドのビジョンに合ったパフォーマンスを声優に演出し、VOブリーフ、キャスティング、読み上げ可能なスクリプト、セッションディレクションをカバーします。
275 · 人気度 - 順位 39Agent Skill を見る一致の可能性
precision-voiceover-sync
ナレーションのタイミングを画面上の動作に合わせ、自動アラインメントを実行した後に同期ポイントを手動調整します。
102 · 人気度 - 順位 40Agent Skill を見る一致の可能性
media-use
注目Agent Media OS は、HyperFrames プロジェクトのあらゆるメディアニーズに対応する単一のスキルです。BGM、SFX、画像、アイコン、ブランドロゴ、音声、カラーグレード、LUT を、凍結されたローカルファイルまたは貼り付け可能なブロック + 台帳レコードに解決します(動詞は `resolve` の 1 つ)。カタログにない場合は TTS / 音楽 / 画像モデルで生成します。ボイスオーバー、文字起こし、キャプション、背景除去を 1 つの共有オーディオエンジンで生成します。メディアを操作し(cut / reframe / transform)、アセットをプロジェクト間で再利用します。実際の映像が暗い、平坦、退屈に見える、レトロ/カムコーダ/プリント/ASCII の雰囲気にすべき、といった曖昧なフィードバックにも使用します。
447,090 · 人気度 - 順位 41Agent Skill を見る一致の可能性
ai-avatar-video
注目inference.sh CLIでAIアバターとトーキングヘッド動画を作成。推奨: P-Video-Avatar(最速・最安・TTS内蔵)。ほか: OmniHuman、Fabric、PixVerse。音声: Inworld TTS-2(100以上の言語、キャラクターの感情操作)、ElevenLabs、Kokoro。機能: 音声駆動アバター、テキストからアバター、リップシンク動画、トーキングヘッド生成、バーチャルプレゼンター、UGCコンテンツ。用途: AIプレゼンター、解説動画、バーチャルインフルエンサー、吹き替え、マーケティング動画、UGC広告、ゲームアバター、NPCの会話。トリガー: ai avatar、talking head、lipsync、avatar video、virtual presenter、ai spokesperson
142,016 · 人気度 - 順位 42Agent Skill を見る一致の可能性
wonda-cli
注目Wonda CLI を使ってターミナルから画像、動画、音楽、音声を生成する。さらに LinkedIn、Reddit、X/Twitter のリサーチと自動化も行う。
74,605 · 人気度 - 順位 43Agent Skill を見る一致の可能性
video-producer-agent
スクリプト、Gemini TTSナレーション、最終アセンブリを組み合わせ、ナレーション、音楽、ビジュアルを備えた完全なビデオをオーケストレーションします。
58 · 人気度 - 順位 44Agent Skill を見る一致の可能性
fish-audio-sdk
公式Fish Audio SDKを使い、PythonとJavaScriptでテキスト読み上げ、音声認識、音声クローン、リアルタイムWebSocket TTSのコードを作成。
873 · 人気度 - 順位 45Agent Skill を見る一致の可能性
byted-mediakit-voiceover-editing
Volcano Engine MediaKitのナレーション編集スキル。トーキングヘッドコンテンツのカット、ASR、音声処理、ビデオエクスポートを網羅します。
301 · 人気度
よくある質問
- 音声・ボイスのスキルにはどのようなタスクが含まれますか?
- それらは文字起こし、text to speech、要約、吹き替えと翻訳、音声処理をカバーします。音声作業は双方向に進みます。transcribeとsummarizeタスクではspeech to text、voiceoverとdubbingタスクではtext to speechです。
- このリストはどのように並べられていますか?
- 観測された検索需要に基づいて順位付けされ、トピックとの関連性が確認されています。これはいかなるスキルの推奨でもありません。
- これらのスキルにはAPIキーやアカウントが必要ですか?
- スキルによります。一部のtext-to-speechスキルはライブ呼び出しにAPIキーが必要で、スコープの一部としてカスタムボイスを作成できるものもあれば、それを明示的にスコープ外とするものもあります。
- これらのスキルは複数の言語や話者に対応できますか?
- 一部は対応しています。特定の文字起こしSkillは話者ダイアリゼーションと単語レベルのタイムスタンプを備え、90以上の言語をサポートし、一部のテキスト読み上げSkillは複数のモデルと音声設定で70以上の言語をサポートしています。
Agent Skill のインストール方法
Agent Skills は SKILL.md ファイルです。適切な skills ディレクトリに置くと、多くのエージェントが自動で認識します。
- Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
- From the registry — run npx skills add elevenlabs/skills@text-to-speech.
- Or download text-to-speech from its source and place that SKILL.md in the directory above.
選び方 インストール前に出典と Skill 自身の説明を確認してください。Official と Notable は出所を示すラベルで、安全性の保証ではありません。