面向音频与语音的 Claude Skills

音频与语音 Skill 涵盖双向的工作:语音转文字和文字转语音。在语音转文字方面,包括音频和视频转录、说话人分离、词级时间戳,以及对访谈或会议等录音的摘要。在文字转语音方面,包括旁白、配音、无障碍朗读、音频提示、批量语音生成,以及配音或翻译。有些 Skill 还处理通用音频处理。以下列表按观察到的搜索需求排序,并针对与本主题的相关性进行了审核。它不构成背书,收录也不保证质量或适用性。请将其作为起点:阅读每个 Skill 自己的描述和要求,查看它需要哪些凭据或 API 密钥,并在将其加入你的 Agent 之前确认其适用范围。

8 个先看
45 个已审核选项

从这些开始。

Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).

这些是和这项工作最接近的结果。从第一条开始,打开后即可安装。

45 个已审核选项

  1. 排名 04
    直接匹配

    transcribe

    官方

    将音频文件转录为文本,支持可选的说话人分离和已知说话人提示。当用户要求从音频/视频转录语音、从录音中提取文本,或标记访谈或会议中的说话人时使用。

    • Transcription
    查看 Agent Skill
  2. 排名 05
    直接匹配

    qianwen-audio-tts

    使用 Qwen TTS 模型从文本合成语音,通过 HTTP API 和 CosyVoice 支持旁白、解说和 TTS 应用。

    • Text to speech

    声明的前提(自述): Python

    4,758 · 受欢迎程度
    查看 Agent Skill
  3. 排名 06
    直接匹配

    qwencloud-audio-tts

    使用 Qwen TTS 模型从文本合成语音,通过 HTTP 和 WebSocket 支持配音、旁白和 TTS 应用。

    • Text to speech

    声明的前提(自述): Python

    1,439 · 受欢迎程度
    查看 Agent Skill
  4. 排名 07
    直接匹配

    azure-speech-to-text

    使用 Azure AI Speech Fast Transcription REST API 将音频转录为文本,支持词级时间戳、说话人分离和多语言识别。

    • Transcription
    • Text to speech
    • Dubbing and translation

    声明的前提(自述): Network access

    479 · 受欢迎程度
    查看 Agent Skill
  5. 排名 08
    直接匹配

    azure-text-to-speech

    使用 Azure AI Speech REST 文本转语音生成神经旁白音频,支持多语言语音和 SSML 韵律控制。

    • Text to speech

    声明的前提(自述): Network access

    299 · 受欢迎程度
    查看 Agent Skill
展开另外 37 个 Agent Skills
  1. 排名 09
    直接匹配

    byted-text-to-speech

    使用 Volcengine Doubao TTS API 合成文本到语音,支持流式传输、多种音色以及语速/音调/音量控制。

    • Text to speech
    165 · 受欢迎程度
    查看 Agent Skill
  2. 排名 10
    直接匹配

    deepgram-js-speech-to-text

    在 JavaScript/TypeScript 中使用 Deepgram Speech-to-Text v1,通过 REST 和 WebSocket 进行预录音频和实时音频转录。

    • Transcription
    • Text to speech

    声明的前提(自述): Node.js

    69 · 受欢迎程度
    查看 Agent Skill
  3. 排名 11
    直接匹配

    fish-audio

    通过 AceDataCloud Fish Audio API 生成 AI 文本转语音音频、使用已保存的声音或创建一次性声音克隆。

    • Text to speech
    • Audio processing
    4,092 · 受欢迎程度
    查看 Agent Skill
  4. 排名 12
    直接匹配

    fish-audio-tts

    使用 Fish Audio 生成语音并克隆声音,涵盖其托管 TTS API、开放权重模型、流式传输和富有表现力的表达标记。

    • Text to speech
    72 · 受欢迎程度
    查看 Agent Skill
  5. 排名 13
    直接匹配

    blog-audio

    使用 Google Gemini TTS 生成博客文章的音频旁白,支持摘要、全文朗读和双人播客模式,提供 30 种语音。

    • Text to speech
    • Summarization
    • Audio processing

    声明的前提(自述): API key

    2,256 · 受欢迎程度
    查看 Agent Skill
  6. 排名 14
    直接匹配

    audio-transcription

    通过 PostPlus 将本地或远程音频转录为持久文本和时间戳产物,支持可选时间戳和字幕就绪输出。

    • Transcription
    • Dubbing and translation
    1,293 · 受欢迎程度
    查看 Agent Skill
  7. 排名 15
    直接匹配

    eachlabs-voice-audio

    通过 EachLabs AI 模型(包括 ElevenLabs TTS 和 Whisper)提供文本转语音、语音转文本、声音转换和音频处理。

    • Transcription
    • Text to speech
    • Dubbing and translation
    289 · 受欢迎程度
    查看 Agent Skill
  8. 排名 16
    直接匹配

    venice-audio-transcription

    通过 Venice 兼容 OpenAI 的 /audio/transcriptions 端点将音频文件转录为文本,涵盖模型、格式、时间戳和语言提示。

    • Transcription
    • Dubbing and translation
    156 · 受欢迎程度
    查看 Agent Skill
  9. 排名 17
    直接匹配

    gemini-tts

    使用 Google Gemini TTS 模型从文本生成语音,支持多种声音、多说话人对话和流式传输。

    • Text to speech
    • Audio processing
    85 · 受欢迎程度
    查看 Agent Skill
  10. 排名 18
    直接匹配

    script-to-voiceover

    将纯文本脚本转换为 AI 旁白配音,通过声音选择和脚本技巧来决定表达方式。

    • Text to speech
    104 · 受欢迎程度
    查看 Agent Skill
  11. 排名 19
    直接匹配

    plaud-embedded-transcription-api-skill

    实现 Plaud Embedded 的 Transcription API,用于上传和转录音频文件,支持语言检测、降噪和说话人分离。

    • Transcription
    64 · 受欢迎程度
    查看 Agent Skill
  12. 排名 20
    直接匹配

    modelslab-audio-generation

    使用 ModelsLab 的 v7 Voice API 生成语音、音乐和音效,支持 TTS、STT、声音转换和配音。

    • Transcription
    • Text to speech
    • Dubbing and translation
    63 · 受欢迎程度
    查看 Agent Skill
  13. 排名 21
    直接匹配

    asr

    使用 z-ai-web-dev-sdk 实现语音转文本(ASR),转录音频文件并支持语音输入功能。

    • Transcription
    204 · 受欢迎程度
    查看 Agent Skill
  14. 排名 22
    直接匹配

    moss-tts-nano-speech

    MOSS-TTS-Nano 专家技能,这是一个 0.1B 多语言实时 TTS 模型,可在 CPU 上运行,支持声音克隆和流式输出。

    • Text to speech
    465 · 受欢迎程度
    查看 Agent Skill
  15. 排名 23
    直接匹配

    voice-audio-engineer

    语音合成、TTS、声音克隆、播客制作和语音处理方面的专家,通过 ElevenLabs 实现,涵盖响度标准和对话混音。

    • Transcription
    • Text to speech
    • Audio processing
    356 · 受欢迎程度
    查看 Agent Skill
  16. 排名 24
    直接匹配

    ai-voiceover

    AI 旁白和配音迷你技能,使用 ElevenLabs 挑选声音、为听觉撰写内容,并为视频内容指导表达。

    • Text to speech
    • Dubbing and translation
    309 · 受欢迎程度
    查看 Agent Skill
  17. 排名 25
    直接匹配

    voice-design

    使用 ElevenLabs、Qwen3-TTS 和其他平台为内容选择并创建 AI 声音,将声音特征与品牌和受众相匹配。

    • Text to speech
    • Summarization
    • Dubbing and translation
    188 · 受欢迎程度
    查看 Agent Skill
  18. 排名 26
    直接匹配

    framevideo-voiceover-ssml

    从项目字幕或转录稿创建旁白,并编写 SSML 风格语音脚本,包含音素、停顿和数字标记用于配音。

    • Text to speech
    • Dubbing and translation
    • Audio processing
    156 · 受欢迎程度
    查看 Agent Skill
  19. 排名 27
    直接匹配

    azure-speech-to-text-rest-py

    使用 Python 中的 Azure Speech to Text REST API 转录短音频文件(最长 60 秒),无需 Speech SDK。

    • Transcription
    79 · 受欢迎程度
    查看 Agent Skill
  20. 排名 28
    可能匹配

    azure-ai

    官方

    适用于 Azure AI:Search、Speech、OpenAI、Document Intelligence。帮助处理搜索、向量/混合搜索、语音转文本、文本转语音、转录、OCR。WHEN:AI Search、查询搜索、向量搜索、混合搜索、语义搜索、语音转文本、文本转语音、转录、OCR、将文本转换为语音。

    • Transcription
    • Text to speech
    • Dubbing and translation
    查看 Agent Skill
  21. 排名 29
    可能匹配

    azure-ai-voicelive-py

    官方

    使用 Azure AI Voice Live SDK(azure-ai-voicelive)构建实时语音 AI 应用。在创建需要与 Azure AI 进行实时双向音频通信的 Python 应用时使用此技能,包括语音助手、语音聊天机器人、实时语音到语音翻译、语音驱动虚拟形象,或任何基于 WebSocket 的 AI 模型音频流传输。支持 Server VAD(语音活动检测)、回合制对话、函数调用、MCP 工具、虚拟形象集成和转录。

    • Transcription
    • Dubbing and translation

    声明的前提(自述): API key

    查看 Agent Skill
  22. 排名 30
    可能匹配

    azure-ai-voicelive-dotnet

    官方

    | 适用于 .NET 的 Azure AI Voice Live SDK。使用双向 WebSocket 通信构建实时语音 AI 应用。适用于语音助手、对话式 AI、实时语音转语音和语音聊天机器人。触发词:"voice live"、"real-time voice"、"VoiceLiveClient"、"VoiceLiveSession"、"voice assistant .NET"、"bidirectional audio"、"speech-to-speech"。

    声明的前提(自述): API key

    查看 Agent Skill
  23. 排名 31
    可能匹配

    azure-ai-voicelive-java

    官方

    | 适用于 Java 的 Azure AI VoiceLive SDK。使用 WebSocket 与 AI 助手进行实时双向语音对话。触发词:"VoiceLiveClient java"、"voice assistant java"、"real-time voice java"、"audio streaming java"、"voice activity detection java"。

    • Transcription

    声明的前提(自述): API key

    查看 Agent Skill
  24. 排名 32
    可能匹配

    azure-ai-contentunderstanding-py

    官方

    | 面向 Python 的 Azure AI Content Understanding SDK。用于从文档、图像、音频和视频中进行多模态内容提取。触发词:"azure-ai-contentunderstanding"、"ContentUnderstandingClient"、"multimodal analysis"、"document extraction"、"video analysis"、"audio transcription"。

    • Transcription
    查看 Agent Skill
  25. 排名 33
    可能匹配

    azure-ai-openai-dotnet

    官方

    | 适用于 .NET 的 Azure OpenAI SDK。用于 Azure OpenAI 和 OpenAI 服务的客户端库。用于聊天补全、嵌入、图像生成、音频转录和助手。触发词:"Azure OpenAI"、"AzureOpenAIClient"、"ChatClient"、"chat completions .NET"、"GPT-4"、"embeddings"、"DALL-E"、"Whisper"、"OpenAI .NET"。

    • Transcription

    声明的前提(自述): API key

    查看 Agent Skill
  26. 排名 34
    可能匹配

    syncfusion-react-speech-to-text

    实现 Syncfusion React SpeechToText 组件,用于实时语音识别、麦克风输入和语音表单。

    • Transcription
    • Dubbing and translation
    627 · 受欢迎程度
    查看 Agent Skill
  27. 排名 35
    可能匹配

    syncfusion-blazor-speech-to-text

    在 Blazor 应用中使用 Syncfusion SpeechToText 组件实现语音转文本语音输入,支持实时识别和多语言。

    • Transcription
    324 · 受欢迎程度
    查看 Agent Skill
  28. 排名 36
    可能匹配

    syncfusion-angular-speech-to-text

    实现 Syncfusion Angular SpeechToText 组件,支持实时语音转文本,并具备本地化和错误处理。

    • Transcription
    • Dubbing and translation
    268 · 受欢迎程度
    查看 Agent Skill
  29. 排名 37
    可能匹配

    audio-voice-recovery

    音频取证和语音恢复指南,用于增强退化录音、降噪、人声分离和困难转录。

    • Transcription
    298 · 受欢迎程度
    查看 Agent Skill
  30. 排名 38
    可能匹配

    voiceover-direction

    指导配音人才呈现符合品牌愿景的表演,涵盖 VO 简报、选角、可朗读脚本和录音指导。

    • Text to speech
    275 · 受欢迎程度
    查看 Agent Skill
  31. 排名 39
    可能匹配

    precision-voiceover-sync

    将旁白时间与屏幕动作对齐,先运行自动对齐,再手动微调同步点。

    • Text to speech
    102 · 受欢迎程度
    查看 Agent Skill
  32. 排名 40
    可能匹配

    media-use

    精选

    Agent Media OS,HyperFrames 项目中满足所有媒体需求的单一技能。将 BGM、SFX、图像、图标、品牌 logo、语音、调色或 LUT 解析为冻结的本地文件或可直接粘贴的块 + 台账记录(一个动词,`resolve`);当目录中没有时,通过 TTS / 音乐 / 图像模型生成;通过一个共享音频引擎制作旁白、转录、字幕和背景移除;对媒体进行操作(cut / reframe / transform);并跨项目复用资产。也适用于模糊反馈,例如真实素材看起来偏暗、平淡、无聊,应该具有复古/摄像机/印刷/ASCII 感,需要 p……

    • Transcription
    • Text to speech
    447,090 · 受欢迎程度
    查看 Agent Skill
  33. 排名 41
    可能匹配

    ai-avatar-video

    精选

    通过 inference.sh CLI 创建 AI 虚拟形象和口播视频。推荐:P-Video-Avatar(最快、最便宜、内置 TTS)。其他:OmniHuman、Fabric、PixVerse。音频:Inworld TTS-2(100+ 种语言,支持角色情感控制)、ElevenLabs、Kokoro。能力:音频驱动虚拟形象、文本转虚拟形象、唇同步视频、口播生成、虚拟主播、UGC 内容。适用场景:AI 主播、讲解视频、虚拟网红、配音、营销视频、UGC 广告、游戏虚拟形象、NPC 对话。触发词:ai avatar、talking head、lipsync、avatar video、virtual presenter、ai spokesperson

    • Text to speech
    • Dubbing and translation
    142,016 · 受欢迎程度
    查看 Agent Skill
  34. 排名 42
    可能匹配

    wonda-cli

    精选

    使用Wonda CLI从终端生成图像、视频、音乐和音频——以及LinkedIn、Reddit和X/Twitter研究和自动化

    • Summarization
    74,605 · 受欢迎程度
    查看 Agent Skill
  35. 排名 43
    可能匹配

    video-producer-agent

    编排包含配音、音乐和视觉效果的完整视频,结合脚本、Gemini TTS配音和最终合成。

    • Text to speech
    • Summarization
    58 · 受欢迎程度
    查看 Agent Skill
  36. 排名 44
    可能匹配

    fish-audio-sdk

    使用官方 Fish Audio SDK 编写代码,在 Python 和 JavaScript 中实现文本转语音、语音转文本、声音克隆和实时 WebSocket TTS。

    • Transcription
    • Text to speech
    873 · 受欢迎程度
    查看 Agent Skill
  37. 排名 45
    可能匹配

    byted-mediakit-voiceover-editing

    火山引擎MediaKit配音剪辑技能,用于剪辑口播内容,涵盖ASR、音频处理和视频导出。

    • Text to speech
    301 · 受欢迎程度
    查看 Agent Skill
常见问题

常见问题

哪些任务属于音频和语音技能?
它们涵盖转录、文本转语音、摘要、配音和翻译,以及音频处理。音频工作双向进行:语音转文本用于转录和摘要任务,文本转语音用于旁白和配音任务。
这个列表是如何排序的?
它按观察到的搜索需求排名,并经过与主题相关性的审核。这不代表对任何 skill 的背书。
这些技能需要 API 密钥或账户吗?
取决于具体技能。有些文本转语音技能需要 API key 才能进行实时调用,另一些可能将创建自定义语音纳入其范围,而有些则明确将其排除在外。
这些 skills 能处理多种语言和说话人吗?
有些可以。某些转录技能支持 90 多种语言,具备说话人分离和词级时间戳,一些文本转语音技能支持 70 多种语言,提供多种模型和语音设置。

如何安装 Agent Skill

从本页第一条开始。Claude Code 会读取放进 skills 目录的 SKILL.md:

  • Claude Code——把 text-to-speech 的 SKILL.md 复制到 ~/.claude/skills/text-to-speech/(个人使用),或 .claude/skills/text-to-speech/(随项目共享)。
  • 从 registry 安装——运行 npx skills add elevenlabs/skills@text-to-speech。
  • 或者从 text-to-speech 的来源下载 SKILL.md,放进上面的目录。

如何挑选 安装前先看出处和技能自身的说明。Official 与 Notable 标签描述的是来源,不代表安全。