技能说明
适合从文章、研究摘要或教程制作音频内容,也适合开发文字转语音和实时播放功能。需要 Azure OpenAI Realtime API;API 密钥必须只放在服务端,调用费用和模型可用性需自行确认。
关于此技能
播客音频生成技能指导 Agent 使用 Azure OpenAI Realtime API,把文字内容生成可播放的播客式音频。它覆盖 React 前端、FastAPI 后端、WebSocket 流式接收、PCM 转 WAV 和浏览器播放。
核心能力
实时音频生成
通过 GPT Realtime Mini 的 WebSocket 接收音频片段和同步文字稿。
前后端完整方案
提供 React 播放端、FastAPI 服务端、事件处理和 PCM 转 WAV 的实现路径。
声音与格式处理
说明 voice 选择、24kHz 16-bit 单声道 PCM 输出和 Base64 WAV 播放方式。
适用场景
从文章制作播客
把产品说明、研究摘要或教程改造成适合收听的播客式叙事。
构建音频内容功能
为 Web 应用增加文字转音频、实时播放和转写展示。
验证 Azure Realtime 集成
快速搭建 WebSocket 链路,检查连接、事件、错误处理和音频封装。
使用步骤
- 01
第一步:配置服务
准备 Azure OpenAI Realtime API 的密钥、基础 Endpoint 和 gpt-realtime-mini 部署,密钥只放在服务端环境变量中。
- 02
第二步:建立连接
后端把 HTTPS Endpoint 转成 WebSocket 地址,发送叙事提示和文本内容,并收集音频与转写事件。
- 03
第三步:输出播放
将 24kHz PCM 音频封装为 WAV 或 Base64,再由前端转成音频 Blob 播放。
常见问题
需要什么服务?+
需要可用的 Azure OpenAI Realtime API 和 gpt-realtime-mini 部署;相关调用可能产生费用。
API 密钥放在哪里?+
只放在后端环境变量,不要写入前端、日志、公开仓库或聊天内容。
Endpoint 怎么填?+
技能说明 Endpoint 使用基础地址,不要在环境变量里追加 /openai/v1/;程序会在后端转换为 WebSocket 地址。
安装前检查
把兼容性、来源和安装入口先看清楚,再放进自己的工作流。
Codex · Claude Code · Cursor
已提供来源链接
命令可直接复制
2026/08/25
安装提醒:即使有清晰的来源和安装方式,也建议先阅读 SKILL.md,确认它会访问哪些文件和服务。
npx skills add microsoft/skills