オーディオと音声 向けの Claude Skills

音声とボイスのスキルは、双方向に走る作業を扱います。音声認識と音声合成です。音声認識側では、音声や動画の文字起こし、話者分離、単語単位のタイムスタンプ、インタビューや会議などの録音の要約が含まれます。音声合成側では、ナレーション、ボイスオーバー、アクセシビリティ向け読み上げ、音声プロンプト、バッチ音声生成、吹き替えや翻訳が含まれます。一般的な音声処理を扱うスキルもあります。以下のリストは観測された検索需要で順位付けされ、このトピックとの関連性が確認されたものです。推奨ではなく、掲載が品質や適合性を保証するものではありません。出発点として使い、各スキル自身の説明と要件を読み、想定される認証情報やAPIキーを確認し、エージェントに追加する前に範囲を確認してください。

8 件から開始
45 件のレビュー済み候補

まずはこちらから。

Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).

関連性の高い結果です。Skill の説明を読み、目的に合うか確認してください。

45 件のレビュー済み候補

  1. 順位 04
    直接一致

    transcribe

    公式

    音声ファイルをテキストに文字起こしします。オプションでダイアライゼーションと既知話者のヒントに対応。音声/動画からの音声の文字起こし、録音からのテキスト抽出、インタビューや会議での話者ラベル付けをユーザーが求める場合に使用します。

    • Transcription
    Agent Skill を見る
  2. 順位 05
    直接一致

    qianwen-audio-tts

    Qwen TTS モデルでテキストから音声を合成。ナレーション、語り、TTS アプリケーションを HTTP API と CosyVoice 経由でサポート。

    • Text to speech

    前提条件(自己申告): Python

    4,758 · 人気度
    Agent Skill を見る
  3. 順位 06
    直接一致

    qwencloud-audio-tts

    Qwen TTSモデルでテキストから音声を合成し、HTTPとWebSocketを介してナレーション、語り、TTSアプリケーションに対応します。

    • Text to speech

    前提条件(自己申告): Python

    1,439 · 人気度
    Agent Skill を見る
  4. 順位 07
    直接一致

    azure-speech-to-text

    Azure AI Speech Fast Transcription REST API で音声をテキスト化。単語レベルのタイムスタンプ、話者分離、多言語識別に対応。

    • Transcription
    • Text to speech
    • Dubbing and translation

    前提条件(自己申告): Network access

    479 · 人気度
    Agent Skill を見る
  5. 順位 08
    直接一致

    azure-text-to-speech

    Azure AI Speech RESTのテキスト読み上げを使い、多言語ボイスとSSMLプロソディ制御に対応したニューラルナレーション音声を生成。

    • Text to speech

    前提条件(自己申告): Network access

    299 · 人気度
    Agent Skill を見る
ほか 37 件の Agent Skills を表示
  1. 順位 09
    直接一致

    byted-text-to-speech

    Volcengine Doubao TTS APIを使い、テキストを音声合成します。ストリーミング、複数の音声、速度/ピッチ/音量の制御に対応します。

    • Text to speech
    165 · 人気度
    Agent Skill を見る
  2. 順位 10
    直接一致

    deepgram-js-speech-to-text

    JavaScript/TypeScriptでDeepgram Speech-to-Text v1を使用し、RESTとWebSocket経由で録音済み音声とライブ音声を文字起こしします。

    • Transcription
    • Text to speech

    前提条件(自己申告): Node.js

    69 · 人気度
    Agent Skill を見る
  3. 順位 11
    直接一致

    fish-audio

    AceDataCloud Fish Audio API経由でAIテキスト読み上げ音声を生成し、保存済み音声を使用、またはワンショット音声クローンを作成。

    • Text to speech
    • Audio processing
    4,092 · 人気度
    Agent Skill を見る
  4. 順位 12
    直接一致

    fish-audio-tts

    Fish Audioで音声生成とボイスクローンを実行。ホスト型TTS API、オープンウェイトモデル、ストリーミング、表現力豊かなデリバリーマーカーを網羅。

    • Text to speech
    72 · 人気度
    Agent Skill を見る
  5. 順位 13
    直接一致

    blog-audio

    Google Gemini TTSを使いブログ記事の音声ナレーションを生成。要約、全文読み上げ、30ボイス対応の2話者ポッドキャストモードに対応。

    • Text to speech
    • Summarization
    • Audio processing

    前提条件(自己申告): API key

    2,256 · 人気度
    Agent Skill を見る
  6. 順位 14
    直接一致

    audio-transcription

    PostPlusを通じてローカルまたはリモートの音声を耐久性のあるテキストとタイムスタンプ成果物に文字起こしし、オプションのタイムスタンプと字幕対応の出力を提供します。

    • Transcription
    • Dubbing and translation
    1,293 · 人気度
    Agent Skill を見る
  7. 順位 15
    直接一致

    eachlabs-voice-audio

    ElevenLabs TTSやWhisperを含むEachLabs AIモデルを介して、テキスト読み上げ、音声認識、音声変換、音声処理を提供します。

    • Transcription
    • Text to speech
    • Dubbing and translation
    289 · 人気度
    Agent Skill を見る
  8. 順位 16
    直接一致

    venice-audio-transcription

    Venice の OpenAI 互換 /audio/transcriptions エンドポイントで音声ファイルをテキスト化。モデル、フォーマット、タイムスタンプ、言語ヒントを網羅。

    • Transcription
    • Dubbing and translation
    156 · 人気度
    Agent Skill を見る
  9. 順位 17
    直接一致

    gemini-tts

    Google Gemini TTSモデルを使用してテキストから音声を生成し、複数の声、複数話者の会話、ストリーミングに対応します。

    • Text to speech
    • Audio processing
    85 · 人気度
    Agent Skill を見る
  10. 順位 18
    直接一致

    script-to-voiceover

    プレーンテキストのスクリプトをAIナレーションのボイスオーバーに変換し、声の選択とスクリプト作成を通じて読み上げ方を決めます。

    • Text to speech
    104 · 人気度
    Agent Skill を見る
  11. 順位 19
    直接一致

    plaud-embedded-transcription-api-skill

    Plaud Embedded の Transcription API を実装し、音声ファイルをアップロードして文字起こし。言語検出、ノイズ低減、話者分離に対応。

    • Transcription
    64 · 人気度
    Agent Skill を見る
  12. 順位 20
    直接一致

    modelslab-audio-generation

    ModelsLabのv7 Voice APIを使って音声、音楽、効果音を生成し、TTS、STT、音声変換、吹き替えに対応します。

    • Transcription
    • Text to speech
    • Dubbing and translation
    63 · 人気度
    Agent Skill を見る
  13. 順位 21
    直接一致

    asr

    z-ai-web-dev-sdkを使用して音声認識(ASR)を実装し、音声ファイルを文字起こしして音声入力機能をサポートします。

    • Transcription
    204 · 人気度
    Agent Skill を見る
  14. 順位 22
    直接一致

    moss-tts-nano-speech

    CPU上で動作し、音声クローンとストリーミングに対応する0.1Bの多言語リアルタイムTTSモデル、MOSS-TTS-Nanoのエキスパートスキル。

    • Text to speech
    465 · 人気度
    Agent Skill を見る
  15. 順位 23
    直接一致

    voice-audio-engineer

    ElevenLabs による音声合成、TTS、声質クローン、ポッドキャスト制作、音声処理のエキスパート。ラウドネス基準と対話ミックスを網羅。

    • Transcription
    • Text to speech
    • Audio processing
    356 · 人気度
    Agent Skill を見る
  16. 順位 24
    直接一致

    ai-voiceover

    ElevenLabsを使ったAIナレーションとナレーションのミニスキル。声の選択、耳で聴くための文章作成、動画コンテンツ向けのデリバリー演出を行う。

    • Text to speech
    • Dubbing and translation
    309 · 人気度
    Agent Skill を見る
  17. 順位 25
    直接一致

    voice-design

    ElevenLabs、Qwen3-TTSなどのプラットフォームを使いコンテンツ向けのAI音声を選択・作成し、音声特性をブランドとオーディエンスに合わせる。

    • Text to speech
    • Summarization
    • Dubbing and translation
    188 · 人気度
    Agent Skill を見る
  18. 順位 26
    直接一致

    framevideo-voiceover-ssml

    プロジェクトの字幕やトランスクリプトからナレーションを作成し、音素、ブレーク、数字マークアップを備えたSSML風の音声スクリプトをボイスオーバー向けに執筆します。

    • Text to speech
    • Dubbing and translation
    • Audio processing
    156 · 人気度
    Agent Skill を見る
  19. 順位 27
    直接一致

    azure-speech-to-text-rest-py

    Speech SDKを使わず、PythonでAzure Speech to Text REST APIを使い短い音声ファイル(最大60秒)を文字起こし。

    • Transcription
    79 · 人気度
    Agent Skill を見る
  20. 順位 28
    一致の可能性

    azure-ai

    公式

    Azure AI(Search、Speech、OpenAI、Document Intelligence)に使用。検索、ベクトル/ハイブリッド検索、音声テキスト化、テキスト音声化、文字起こし、OCRを支援。WHEN: AI Search、クエリ検索、ベクトル検索、ハイブリッド検索、セマンティック検索、音声テキスト化、テキスト音声化、文字起こし、OCR、テキストの音声変換。

    • Transcription
    • Text to speech
    • Dubbing and translation
    Agent Skill を見る
  21. 順位 29
    一致の可能性

    azure-ai-voicelive-py

    公式

    Azure AI Voice Live SDK(azure-ai-voicelive)を使ったリアルタイム音声AIアプリケーションを構築します。Azure AIとのリアルタイム双方向音声通信を必要とするPythonアプリケーションを作成する際にこのスキルを使用します。音声アシスタント、音声対応チャットボット、リアルタイムの音声間翻訳、音声駆動アバター、またはAIモデルとのWebSocketベースの音声ストリーミングを含みます。Server VAD(音声活動検出)、ターン制会話、関数呼び出し、MCPツール、アバター統合、文字起こしに対応します。

    • Transcription
    • Dubbing and translation

    前提条件(自己申告): API key

    Agent Skill を見る
  22. 順位 30
    一致の可能性

    azure-ai-voicelive-dotnet

    公式

    | .NET向けAzure AI Voice Live SDK。双方向WebSocket通信でリアルタイム音声AIアプリを構築。音声アシスタント、会話AI、リアルタイム音声間変換、音声対応チャットボットに使用。トリガー: "voice live"、"real-time voice"、"VoiceLiveClient"、"VoiceLiveSession"、"voice assistant .NET"、"bidirectional audio"、"speech-to-speech"。

    前提条件(自己申告): API key

    Agent Skill を見る
  23. 順位 31
    一致の可能性

    azure-ai-voicelive-java

    公式

    | Azure AI VoiceLive SDK for Java。WebSocket を使った AI アシスタントとのリアルタイム双方向音声会話。トリガー: "VoiceLiveClient java"、"voice assistant java"、"real-time voice java"、"audio streaming java"、"voice activity detection java"。

    • Transcription

    前提条件(自己申告): API key

    Agent Skill を見る
  24. 順位 32
    一致の可能性

    azure-ai-contentunderstanding-py

    公式

    | Python向けAzure AI Content Understanding SDK。ドキュメント、画像、音声、動画からのマルチモーダルコンテンツ抽出に使用。トリガー:「azure-ai-contentunderstanding」「ContentUnderstandingClient」「multimodal analysis」「document extraction」「video analysis」「audio transcription」。

    • Transcription
    Agent Skill を見る
  25. 順位 33
    一致の可能性

    azure-ai-openai-dotnet

    公式

    | .NET用Azure OpenAI SDK。Azure OpenAIおよびOpenAIサービスのクライアントライブラリ。チャット補完、埋め込み、画像生成、音声文字起こし、アシスタントに使用します。トリガー: "Azure OpenAI"、"AzureOpenAIClient"、"ChatClient"、"chat completions .NET"、"GPT-4"、"embeddings"、"DALL-E"、"Whisper"、"OpenAI .NET"。

    • Transcription

    前提条件(自己申告): API key

    Agent Skill を見る
  26. 順位 34
    一致の可能性

    syncfusion-react-speech-to-text

    リアルタイム音声認識、マイク入力、音声対応フォームのためのSyncfusion React SpeechToTextコンポーネントを実装します。

    • Transcription
    • Dubbing and translation
    627 · 人気度
    Agent Skill を見る
  27. 順位 35
    一致の可能性

    syncfusion-blazor-speech-to-text

    Syncfusion SpeechToTextコンポーネントを用いてBlazorアプリケーションに音声-to-テキスト音声入力を実装し、リアルタイム認識と多言語サポートを備えます。

    • Transcription
    324 · 人気度
    Agent Skill を見る
  28. 順位 36
    一致の可能性

    syncfusion-angular-speech-to-text

    Syncfusion Angular SpeechToText コンポーネントを実装し、ローカライズとエラー処理を備えたリアルタイム音声テキスト変換を実現。

    • Transcription
    • Dubbing and translation
    268 · 人気度
    Agent Skill を見る
  29. 順位 37
    一致の可能性

    audio-voice-recovery

    劣化した録音の改善、ノイズ低減、音声分離、困難な文字起こしのための音声フォレンジックと音声復元のガイドライン。

    • Transcription
    298 · 人気度
    Agent Skill を見る
  30. 順位 38
    一致の可能性

    voiceover-direction

    ブランドのビジョンに合ったパフォーマンスを声優に演出し、VOブリーフ、キャスティング、読み上げ可能なスクリプト、セッションディレクションをカバーします。

    • Text to speech
    275 · 人気度
    Agent Skill を見る
  31. 順位 39
    一致の可能性

    precision-voiceover-sync

    ナレーションのタイミングを画面上の動作に合わせ、自動アラインメントを実行した後に同期ポイントを手動調整します。

    • Text to speech
    102 · 人気度
    Agent Skill を見る
  32. 順位 40
    一致の可能性

    media-use

    注目

    Agent Media OS は、HyperFrames プロジェクトのあらゆるメディアニーズに対応する単一のスキルです。BGM、SFX、画像、アイコン、ブランドロゴ、音声、カラーグレード、LUT を、凍結されたローカルファイルまたは貼り付け可能なブロック + 台帳レコードに解決します(動詞は `resolve` の 1 つ)。カタログにない場合は TTS / 音楽 / 画像モデルで生成します。ボイスオーバー、文字起こし、キャプション、背景除去を 1 つの共有オーディオエンジンで生成します。メディアを操作し(cut / reframe / transform)、アセットをプロジェクト間で再利用します。実際の映像が暗い、平坦、退屈に見える、レトロ/カムコーダ/プリント/ASCII の雰囲気にすべき、といった曖昧なフィードバックにも使用します。

    • Transcription
    • Text to speech
    447,090 · 人気度
    Agent Skill を見る
  33. 順位 41
    一致の可能性

    ai-avatar-video

    注目

    inference.sh CLIでAIアバターとトーキングヘッド動画を作成。推奨: P-Video-Avatar(最速・最安・TTS内蔵)。ほか: OmniHuman、Fabric、PixVerse。音声: Inworld TTS-2(100以上の言語、キャラクターの感情操作)、ElevenLabs、Kokoro。機能: 音声駆動アバター、テキストからアバター、リップシンク動画、トーキングヘッド生成、バーチャルプレゼンター、UGCコンテンツ。用途: AIプレゼンター、解説動画、バーチャルインフルエンサー、吹き替え、マーケティング動画、UGC広告、ゲームアバター、NPCの会話。トリガー: ai avatar、talking head、lipsync、avatar video、virtual presenter、ai spokesperson

    • Text to speech
    • Dubbing and translation
    142,016 · 人気度
    Agent Skill を見る
  34. 順位 42
    一致の可能性

    wonda-cli

    注目

    Wonda CLI を使ってターミナルから画像、動画、音楽、音声を生成する。さらに LinkedIn、Reddit、X/Twitter のリサーチと自動化も行う。

    • Summarization
    74,605 · 人気度
    Agent Skill を見る
  35. 順位 43
    一致の可能性

    video-producer-agent

    スクリプト、Gemini TTSナレーション、最終アセンブリを組み合わせ、ナレーション、音楽、ビジュアルを備えた完全なビデオをオーケストレーションします。

    • Text to speech
    • Summarization
    58 · 人気度
    Agent Skill を見る
  36. 順位 44
    一致の可能性

    fish-audio-sdk

    公式Fish Audio SDKを使い、PythonとJavaScriptでテキスト読み上げ、音声認識、音声クローン、リアルタイムWebSocket TTSのコードを作成。

    • Transcription
    • Text to speech
    873 · 人気度
    Agent Skill を見る
  37. 順位 45
    一致の可能性

    byted-mediakit-voiceover-editing

    Volcano Engine MediaKitのナレーション編集スキル。トーキングヘッドコンテンツのカット、ASR、音声処理、ビデオエクスポートを網羅します。

    • Text to speech
    301 · 人気度
    Agent Skill を見る
よくある質問

よくある質問

音声・ボイスのスキルにはどのようなタスクが含まれますか?
それらは文字起こし、text to speech、要約、吹き替えと翻訳、音声処理をカバーします。音声作業は双方向に進みます。transcribeとsummarizeタスクではspeech to text、voiceoverとdubbingタスクではtext to speechです。
このリストはどのように並べられていますか?
観測された検索需要に基づいて順位付けされ、トピックとの関連性が確認されています。これはいかなるスキルの推奨でもありません。
これらのスキルにはAPIキーやアカウントが必要ですか?
スキルによります。一部のtext-to-speechスキルはライブ呼び出しにAPIキーが必要で、スコープの一部としてカスタムボイスを作成できるものもあれば、それを明示的にスコープ外とするものもあります。
これらのスキルは複数の言語や話者に対応できますか?
一部は対応しています。特定の文字起こしSkillは話者ダイアリゼーションと単語レベルのタイムスタンプを備え、90以上の言語をサポートし、一部のテキスト読み上げSkillは複数のモデルと音声設定で70以上の言語をサポートしています。

Agent Skill のインストール方法

Agent Skills は SKILL.md ファイルです。適切な skills ディレクトリに置くと、多くのエージェントが自動で認識します。

  • Claude Code — copy the SKILL.md for text-to-speech into ~/.claude/skills/text-to-speech/ for yourself, or .claude/skills/text-to-speech/ to share it with a project.
  • From the registry — run npx skills add elevenlabs/skills@text-to-speech.
  • Or download text-to-speech from its source and place that SKILL.md in the directory above.

選び方 インストール前に出典と Skill 自身の説明を確認してください。Official と Notable は出所を示すラベルで、安全性の保証ではありません。