面向音频与语音的 Claude Skills
音频与语音 Skill 涵盖双向的工作:语音转文字和文字转语音。在语音转文字方面,包括音频和视频转录、说话人分离、词级时间戳,以及对访谈或会议等录音的摘要。在文字转语音方面,包括旁白、配音、无障碍朗读、音频提示、批量语音生成,以及配音或翻译。有些 Skill 还处理通用音频处理。以下列表按观察到的搜索需求排序,并针对与本主题的相关性进行了审核。它不构成背书,收录也不保证质量或适用性。请将其作为起点:阅读每个 Skill 自己的描述和要求,查看它需要哪些凭据或 API 密钥,并在将其加入你的 Agent 之前确认其适用范围。
8 个先看
45 个已审核选项
从这些开始。
Audio work runs both directions: speech to text (transcribe, summarize) and text to speech (voiceover, dubbing).
这些是和这项工作最接近的结果。从第一条开始,打开后即可安装。
- 排名 01查看 Agent Skill直接匹配
text-to-speech
使用 ElevenLabs 语音 AI 将文本转换为语音,支持 70+ 种语言、多种模型、语音设置和配音。
声明的前提(自述): API key · Network access
11,935 · 受欢迎程度 - 排名 02查看 Agent Skill直接匹配
speech-to-text
使用 ElevenLabs Scribe v2 将音频转写为文本,支持 90 多种语言、说话人分离、词级时间戳和关键术语提示。
声明的前提(自述): API key · Network access
8,398 · 受欢迎程度 - 排名 03查看 Agent Skill直接匹配
speech
官方当用户要求文本转语音旁白或配音、无障碍朗读、音频提示,或通过 OpenAI Audio API 批量生成语音时使用;运行捆绑的 CLI(`scripts/text_to_speech.py`),使用内置语音,实时调用需要 `OPENAI_API_KEY`。自定义语音创建不在范围内。
- 排名 04查看 Agent Skill直接匹配
transcribe
官方将音频文件转录为文本,支持可选的说话人分离和已知说话人提示。当用户要求从音频/视频转录语音、从录音中提取文本,或标记访谈或会议中的说话人时使用。
- 排名 05查看 Agent Skill直接匹配
qianwen-audio-tts
使用 Qwen TTS 模型从文本合成语音,通过 HTTP API 和 CosyVoice 支持旁白、解说和 TTS 应用。
声明的前提(自述): Python
4,758 · 受欢迎程度 - 排名 06查看 Agent Skill直接匹配
qwencloud-audio-tts
使用 Qwen TTS 模型从文本合成语音,通过 HTTP 和 WebSocket 支持配音、旁白和 TTS 应用。
声明的前提(自述): Python
1,439 · 受欢迎程度 - 排名 07查看 Agent Skill直接匹配
azure-speech-to-text
使用 Azure AI Speech Fast Transcription REST API 将音频转录为文本,支持词级时间戳、说话人分离和多语言识别。
声明的前提(自述): Network access
479 · 受欢迎程度 - 排名 08查看 Agent Skill直接匹配
azure-text-to-speech
使用 Azure AI Speech REST 文本转语音生成神经旁白音频,支持多语言语音和 SSML 韵律控制。
声明的前提(自述): Network access
299 · 受欢迎程度
展开另外 37 个 Agent Skills
- 排名 09查看 Agent Skill直接匹配
byted-text-to-speech
使用 Volcengine Doubao TTS API 合成文本到语音,支持流式传输、多种音色以及语速/音调/音量控制。
165 · 受欢迎程度 - 排名 10查看 Agent Skill直接匹配
deepgram-js-speech-to-text
在 JavaScript/TypeScript 中使用 Deepgram Speech-to-Text v1,通过 REST 和 WebSocket 进行预录音频和实时音频转录。
声明的前提(自述): Node.js
69 · 受欢迎程度 - 排名 11查看 Agent Skill直接匹配
fish-audio
通过 AceDataCloud Fish Audio API 生成 AI 文本转语音音频、使用已保存的声音或创建一次性声音克隆。
4,092 · 受欢迎程度 - 排名 12查看 Agent Skill直接匹配
fish-audio-tts
使用 Fish Audio 生成语音并克隆声音,涵盖其托管 TTS API、开放权重模型、流式传输和富有表现力的表达标记。
72 · 受欢迎程度 - 排名 13查看 Agent Skill直接匹配
blog-audio
使用 Google Gemini TTS 生成博客文章的音频旁白,支持摘要、全文朗读和双人播客模式,提供 30 种语音。
声明的前提(自述): API key
2,256 · 受欢迎程度 - 排名 14查看 Agent Skill直接匹配
audio-transcription
通过 PostPlus 将本地或远程音频转录为持久文本和时间戳产物,支持可选时间戳和字幕就绪输出。
1,293 · 受欢迎程度 - 排名 15查看 Agent Skill直接匹配
eachlabs-voice-audio
通过 EachLabs AI 模型(包括 ElevenLabs TTS 和 Whisper)提供文本转语音、语音转文本、声音转换和音频处理。
289 · 受欢迎程度 - 排名 16查看 Agent Skill直接匹配
venice-audio-transcription
通过 Venice 兼容 OpenAI 的 /audio/transcriptions 端点将音频文件转录为文本,涵盖模型、格式、时间戳和语言提示。
156 · 受欢迎程度 - 排名 17查看 Agent Skill直接匹配
gemini-tts
使用 Google Gemini TTS 模型从文本生成语音,支持多种声音、多说话人对话和流式传输。
85 · 受欢迎程度 - 排名 18查看 Agent Skill直接匹配
script-to-voiceover
将纯文本脚本转换为 AI 旁白配音,通过声音选择和脚本技巧来决定表达方式。
104 · 受欢迎程度 - 排名 19查看 Agent Skill直接匹配
plaud-embedded-transcription-api-skill
实现 Plaud Embedded 的 Transcription API,用于上传和转录音频文件,支持语言检测、降噪和说话人分离。
64 · 受欢迎程度 - 排名 20查看 Agent Skill直接匹配
modelslab-audio-generation
使用 ModelsLab 的 v7 Voice API 生成语音、音乐和音效,支持 TTS、STT、声音转换和配音。
63 · 受欢迎程度 - 排名 21查看 Agent Skill直接匹配
asr
使用 z-ai-web-dev-sdk 实现语音转文本(ASR),转录音频文件并支持语音输入功能。
204 · 受欢迎程度 - 排名 22查看 Agent Skill直接匹配
moss-tts-nano-speech
MOSS-TTS-Nano 专家技能,这是一个 0.1B 多语言实时 TTS 模型,可在 CPU 上运行,支持声音克隆和流式输出。
465 · 受欢迎程度 - 排名 23查看 Agent Skill直接匹配
voice-audio-engineer
语音合成、TTS、声音克隆、播客制作和语音处理方面的专家,通过 ElevenLabs 实现,涵盖响度标准和对话混音。
356 · 受欢迎程度 - 排名 24查看 Agent Skill直接匹配
ai-voiceover
AI 旁白和配音迷你技能,使用 ElevenLabs 挑选声音、为听觉撰写内容,并为视频内容指导表达。
309 · 受欢迎程度 - 排名 25查看 Agent Skill直接匹配
voice-design
使用 ElevenLabs、Qwen3-TTS 和其他平台为内容选择并创建 AI 声音,将声音特征与品牌和受众相匹配。
188 · 受欢迎程度 - 排名 26查看 Agent Skill直接匹配
framevideo-voiceover-ssml
从项目字幕或转录稿创建旁白,并编写 SSML 风格语音脚本,包含音素、停顿和数字标记用于配音。
156 · 受欢迎程度 - 排名 27查看 Agent Skill直接匹配
azure-speech-to-text-rest-py
使用 Python 中的 Azure Speech to Text REST API 转录短音频文件(最长 60 秒),无需 Speech SDK。
79 · 受欢迎程度 - 排名 28查看 Agent Skill可能匹配
azure-ai
官方适用于 Azure AI:Search、Speech、OpenAI、Document Intelligence。帮助处理搜索、向量/混合搜索、语音转文本、文本转语音、转录、OCR。WHEN:AI Search、查询搜索、向量搜索、混合搜索、语义搜索、语音转文本、文本转语音、转录、OCR、将文本转换为语音。
- 排名 29查看 Agent Skill可能匹配
azure-ai-voicelive-py
官方使用 Azure AI Voice Live SDK(azure-ai-voicelive)构建实时语音 AI 应用。在创建需要与 Azure AI 进行实时双向音频通信的 Python 应用时使用此技能,包括语音助手、语音聊天机器人、实时语音到语音翻译、语音驱动虚拟形象,或任何基于 WebSocket 的 AI 模型音频流传输。支持 Server VAD(语音活动检测)、回合制对话、函数调用、MCP 工具、虚拟形象集成和转录。
声明的前提(自述): API key
- 排名 30查看 Agent Skill可能匹配
azure-ai-voicelive-dotnet
官方| 适用于 .NET 的 Azure AI Voice Live SDK。使用双向 WebSocket 通信构建实时语音 AI 应用。适用于语音助手、对话式 AI、实时语音转语音和语音聊天机器人。触发词:"voice live"、"real-time voice"、"VoiceLiveClient"、"VoiceLiveSession"、"voice assistant .NET"、"bidirectional audio"、"speech-to-speech"。
声明的前提(自述): API key
- 排名 31查看 Agent Skill可能匹配
azure-ai-voicelive-java
官方| 适用于 Java 的 Azure AI VoiceLive SDK。使用 WebSocket 与 AI 助手进行实时双向语音对话。触发词:"VoiceLiveClient java"、"voice assistant java"、"real-time voice java"、"audio streaming java"、"voice activity detection java"。
声明的前提(自述): API key
- 排名 32查看 Agent Skill可能匹配
azure-ai-contentunderstanding-py
官方| 面向 Python 的 Azure AI Content Understanding SDK。用于从文档、图像、音频和视频中进行多模态内容提取。触发词:"azure-ai-contentunderstanding"、"ContentUnderstandingClient"、"multimodal analysis"、"document extraction"、"video analysis"、"audio transcription"。
- 排名 33查看 Agent Skill可能匹配
azure-ai-openai-dotnet
官方| 适用于 .NET 的 Azure OpenAI SDK。用于 Azure OpenAI 和 OpenAI 服务的客户端库。用于聊天补全、嵌入、图像生成、音频转录和助手。触发词:"Azure OpenAI"、"AzureOpenAIClient"、"ChatClient"、"chat completions .NET"、"GPT-4"、"embeddings"、"DALL-E"、"Whisper"、"OpenAI .NET"。
声明的前提(自述): API key
- 排名 34查看 Agent Skill可能匹配
syncfusion-react-speech-to-text
实现 Syncfusion React SpeechToText 组件,用于实时语音识别、麦克风输入和语音表单。
627 · 受欢迎程度 - 排名 35查看 Agent Skill可能匹配
syncfusion-blazor-speech-to-text
在 Blazor 应用中使用 Syncfusion SpeechToText 组件实现语音转文本语音输入,支持实时识别和多语言。
324 · 受欢迎程度 - 排名 36查看 Agent Skill可能匹配
syncfusion-angular-speech-to-text
实现 Syncfusion Angular SpeechToText 组件,支持实时语音转文本,并具备本地化和错误处理。
268 · 受欢迎程度 - 排名 37查看 Agent Skill可能匹配
audio-voice-recovery
音频取证和语音恢复指南,用于增强退化录音、降噪、人声分离和困难转录。
298 · 受欢迎程度 - 排名 38查看 Agent Skill可能匹配
voiceover-direction
指导配音人才呈现符合品牌愿景的表演,涵盖 VO 简报、选角、可朗读脚本和录音指导。
275 · 受欢迎程度 - 排名 39查看 Agent Skill可能匹配
precision-voiceover-sync
将旁白时间与屏幕动作对齐,先运行自动对齐,再手动微调同步点。
102 · 受欢迎程度 - 排名 40查看 Agent Skill可能匹配
media-use
精选Agent Media OS,HyperFrames 项目中满足所有媒体需求的单一技能。将 BGM、SFX、图像、图标、品牌 logo、语音、调色或 LUT 解析为冻结的本地文件或可直接粘贴的块 + 台账记录(一个动词,`resolve`);当目录中没有时,通过 TTS / 音乐 / 图像模型生成;通过一个共享音频引擎制作旁白、转录、字幕和背景移除;对媒体进行操作(cut / reframe / transform);并跨项目复用资产。也适用于模糊反馈,例如真实素材看起来偏暗、平淡、无聊,应该具有复古/摄像机/印刷/ASCII 感,需要 p……
447,090 · 受欢迎程度 - 排名 41查看 Agent Skill可能匹配
ai-avatar-video
精选通过 inference.sh CLI 创建 AI 虚拟形象和口播视频。推荐:P-Video-Avatar(最快、最便宜、内置 TTS)。其他:OmniHuman、Fabric、PixVerse。音频:Inworld TTS-2(100+ 种语言,支持角色情感控制)、ElevenLabs、Kokoro。能力:音频驱动虚拟形象、文本转虚拟形象、唇同步视频、口播生成、虚拟主播、UGC 内容。适用场景:AI 主播、讲解视频、虚拟网红、配音、营销视频、UGC 广告、游戏虚拟形象、NPC 对话。触发词:ai avatar、talking head、lipsync、avatar video、virtual presenter、ai spokesperson
142,016 · 受欢迎程度 - 排名 42查看 Agent Skill可能匹配
wonda-cli
精选使用Wonda CLI从终端生成图像、视频、音乐和音频——以及LinkedIn、Reddit和X/Twitter研究和自动化
74,605 · 受欢迎程度 - 排名 43查看 Agent Skill可能匹配
video-producer-agent
编排包含配音、音乐和视觉效果的完整视频,结合脚本、Gemini TTS配音和最终合成。
58 · 受欢迎程度 - 排名 44查看 Agent Skill可能匹配
fish-audio-sdk
使用官方 Fish Audio SDK 编写代码,在 Python 和 JavaScript 中实现文本转语音、语音转文本、声音克隆和实时 WebSocket TTS。
873 · 受欢迎程度 - 排名 45查看 Agent Skill可能匹配
byted-mediakit-voiceover-editing
火山引擎MediaKit配音剪辑技能,用于剪辑口播内容,涵盖ASR、音频处理和视频导出。
301 · 受欢迎程度
常见问题
- 哪些任务属于音频和语音技能?
- 它们涵盖转录、文本转语音、摘要、配音和翻译,以及音频处理。音频工作双向进行:语音转文本用于转录和摘要任务,文本转语音用于旁白和配音任务。
- 这个列表是如何排序的?
- 它按观察到的搜索需求排名,并经过与主题相关性的审核。这不代表对任何 skill 的背书。
- 这些技能需要 API 密钥或账户吗?
- 取决于具体技能。有些文本转语音技能需要 API key 才能进行实时调用,另一些可能将创建自定义语音纳入其范围,而有些则明确将其排除在外。
- 这些 skills 能处理多种语言和说话人吗?
- 有些可以。某些转录技能支持 90 多种语言,具备说话人分离和词级时间戳,一些文本转语音技能支持 70 多种语言,提供多种模型和语音设置。
如何安装 Agent Skill
从本页第一条开始。Claude Code 会读取放进 skills 目录的 SKILL.md:
- Claude Code——把 text-to-speech 的 SKILL.md 复制到 ~/.claude/skills/text-to-speech/(个人使用),或 .claude/skills/text-to-speech/(随项目共享)。
- 从 registry 安装——运行 npx skills add elevenlabs/skills@text-to-speech。
- 或者从 text-to-speech 的来源下载 SKILL.md,放进上面的目录。
如何挑选 安装前先看出处和技能自身的说明。Official 与 Notable 标签描述的是来源,不代表安全。