返回技能库
音频 / 开发精选

播客音频生成 Skill

用 Azure OpenAI Realtime API 把文字内容生成播客式音频,覆盖 WebSocket、PCM 转 WAV 和前端播放。

查看安装方式

技能说明

适合从文章、研究摘要或教程制作音频内容,也适合开发文字转语音和实时播放功能。需要 Azure OpenAI Realtime API;API 密钥必须只放在服务端,调用费用和模型可用性需自行确认。

关于此技能

播客音频生成技能指导 Agent 使用 Azure OpenAI Realtime API,把文字内容生成可播放的播客式音频。它覆盖 React 前端、FastAPI 后端、WebSocket 流式接收、PCM 转 WAV 和浏览器播放。

核心能力

实时音频生成

通过 GPT Realtime Mini 的 WebSocket 接收音频片段和同步文字稿。

前后端完整方案

提供 React 播放端、FastAPI 服务端、事件处理和 PCM 转 WAV 的实现路径。

声音与格式处理

说明 voice 选择、24kHz 16-bit 单声道 PCM 输出和 Base64 WAV 播放方式。

适用场景

从文章制作播客

把产品说明、研究摘要或教程改造成适合收听的播客式叙事。

构建音频内容功能

为 Web 应用增加文字转音频、实时播放和转写展示。

验证 Azure Realtime 集成

快速搭建 WebSocket 链路,检查连接、事件、错误处理和音频封装。

使用步骤

  1. 01

    第一步:配置服务

    准备 Azure OpenAI Realtime API 的密钥、基础 Endpoint 和 gpt-realtime-mini 部署,密钥只放在服务端环境变量中。

  2. 02

    第二步:建立连接

    后端把 HTTPS Endpoint 转成 WebSocket 地址,发送叙事提示和文本内容,并收集音频与转写事件。

  3. 03

    第三步:输出播放

    将 24kHz PCM 音频封装为 WAV 或 Base64,再由前端转成音频 Blob 播放。

常见问题

需要什么服务?+

需要可用的 Azure OpenAI Realtime API 和 gpt-realtime-mini 部署;相关调用可能产生费用。

API 密钥放在哪里?+

只放在后端环境变量,不要写入前端、日志、公开仓库或聊天内容。

Endpoint 怎么填?+

技能说明 Endpoint 使用基础地址,不要在环境变量里追加 /openai/v1/;程序会在后端转换为 WebSocket 地址。

安装前检查

把兼容性、来源和安装入口先看清楚,再放进自己的工作流。

信息卡
兼容平台

Codex · Claude Code · Cursor

来源状态

已提供来源链接

安装方式

命令可直接复制

最近整理

2026/08/25

安装提醒:即使有清晰的来源和安装方式,也建议先阅读 SKILL.md,确认它会访问哪些文件和服务。

安装命令
npx skills add microsoft/skills

适用平台与标签

CodexClaude CodeCursorGitHub Copilot兼容 Agent Skills#播客#音频生成#Azure OpenAI