podcast-generator
用火山引擎 Podcast AI 模型生成中文双人对话播客。当用户要把文章、报告、话题文本转成播客音频、生成对话式音频内容时使用,需要环境具备火山引擎 APP_ID 和 ACCESS_KEY。支持 mp3/ogg_opus/pcm/aac、语速调节、自定义音色、断点续传。不用于:单人朗读式 TTS(用普通语音合成)、英文播客(模型主要优化中文)、播客文稿本身的撰写(先用写作类 skill 产出文本再来)。
git clone --depth 1 https://github.com/staruhub/ClaudeSkills /tmp/podcast-generator && cp -r /tmp/podcast-generator/lab/Geek-skills-podcast-generator ~/.claude/skills/podcast-generatorSKILL.md
# 播客生成器(火山引擎双人对话) 把中文文本变成双人对话播客音频,接口封装在 `scripts/generate_podcast.py`。 ## 验收标准(每次生成完成前自查) - [ ] 音频文件已落盘,把**实际路径与文件大小**回报用户 - [ ] 输入文本 ≤25,000 字符(超长必须先与用户确认拆分方案,不能让模型静默截断) - [ ] 生成中断时使用了 retry_info 续传而不是从头重来 - [ ] 参数选择有依据:分发用 mp3,后期加工用 pcm;教学内容语速 -20 左右 - [ ] 凭证缺失时未硬试:告知用户去火山引擎控制台(speech/service/10028)获取 ## 不做什么 - 不写播客文稿——输入文本的质量是上游任务(文稿创作找写作类 skill) - 不做单人朗读、配音、音效制作 - 不在输出里回显用户的 ACCESS_KEY ## 工作流程 ### 1. 准备输入 必需:中文文本(≤25k 字符)+ APP_ID + ACCESS_KEY(无则告知获取方式后停止)。 可选:格式(默认 mp3)/ 采样率(默认 24000)/ 语速(-50~100,0=正常,100=2 倍速)/ 音色 / 开场音乐(默认关)。 **最佳文本长度 500-3000 字**——播客时长与听感的最优区间;一篇长文建议先摘要再生成。 ### 2. 生成 ```bash python scripts/generate_podcast.py \ --text "播客话题或内容文本" \ --output "/path/to/output.mp3" \ --app-id "$VOLC_APP_ID" --access-key "$VOLC_ACCESS_KEY" \ --format mp3 --sample-rate 24000 --speech-rate 0 ``` 脚本会流式接收音频、按轮次显示进度、落盘后返回统计(大小/轮次数)。 Python 模块调用、自定义音色 ID、断点续传 retry_info 的写法见脚本内 docstring 与 `references/api_reference.md`。 ### 3. 交付 回报文件路径、大小、时长预估;失败时给出具体错误与下一步(见陷阱表)。 ## 已知陷阱 | 陷阱 | 具体表现 | 应对 | |------|---------|------| | 超长静默截断 | >25k 字符时模型直接截断,播客缺尾 | 生成前校验长度,超长先与用户确认拆分或摘要 | | WebSocket 连不上 | 连接错误/超时 | 依次排查:凭证是否正确 → 网络 → 防火墙是否放行 WebSocket | | 中断后从头重试 | 长文本生成到一半断了,重跑烧双倍额度 | 从日志取 task_id 和 last_finished_round_id,用 retry_info 续传 | | 输出路径不可写 | 生成完成但保存失败 | 生成前检查目录存在且可写、磁盘空间充足 | | 文本结构差出烂稿 | 口水文本生成的对话生硬 | 输入用结构清晰的中文文本;效果差时先改文本再调参数 | ## 依赖与凭证 ```bash pip install websockets ``` 凭证从火山引擎控制台获取(console.volcengine.com/speech/service/10028)。建议走环境变量,不要写进代码。 ## 参考文档(按需加载) - `references/api_reference.md` — 完整参数规格、WebSocket 协议细节、事件类型、错误码;协议级调试时读 - `scripts/generate_podcast.py` — CLI 与模块双接口,含自动重试与流式接收实现
Build and maintain a structured LLM-generated wiki for any codebase. Use when the user asks to analyze/understand/document a codebase, build a code wiki, create project documentation from source, or update an existing .llm-wiki. Triggers on phrases like "build wiki", "analyze this codebase", "document this project", "update wiki", "llm-wiki", or when entering an unfamiliar project that has no .llm-wiki yet.
A股专业分析师助手,提供每日股价分析、选股策略和投资建议。适用于:(1) 获取A股实时行情和历史数据,(2) 技术面分析(K线形态、MACD、KDJ、RSI、布林带等),(3) 基本面分析(财务指标、估值分析),(4) 板块热点追踪,(5) 选股策略筛选,(6) 量化因子分析,(7) 生成每日股市分析报告。当用户询问"帮我分析股票"、"今日选股"、"A股行情分析"、"技术分析"、"基本面分析"、"量化选股"等相关问题时触发。
AI咨询/销售的对话策略助手。当用户需要准备AI方案沟通、跟业务部门聊AI落地、写AI提案、应对客户异议、做AI培训破冰时使用。触发场景:"怎么跟老板聊AI"、"客户说AI不靠谱"、"准备一个AI方案汇报"、"帮我想想怎么推AI"、"业务部门不配合"、"AI项目怎么卖"、"demo之后怎么跟进"。也适用于AI咨询师、技术合伙人、CTO做内部AI推广。
Windows C盘清理和磁盘空间管理工具。当用户需要清理C盘、释放磁盘空间、查找大文件、分析磁盘占用、删除临时文件、清理缓存、管理Windows系统垃圾文件时使用此skill。适用于以下场景:(1)C盘空间不足需要清理;(2)查找和删除大文件;(3)分析磁盘空间占用;(4)清理系统临时文件和缓存;(5)清理浏览器缓存;(6)清理回收站;(7)清理系统日志;(8)优化Windows磁盘空间。
>
资深高考命题专家助手,提供专业的命题指导和评审服务。适用于创作高考试题、评审试题质量、分析试卷结构、了解命题趋势等场景。结合文档工具提取解压文件,使用网络搜索了解最新命题趋势,使用分析工具评估题目质量和试卷结构。涵盖"一核四层四翼"评价体系、2025年命题趋势、题型规范、评分标准、命题流程等多个维度,符合高考命题最佳实践。
胥克谦式AI-Native产品开发方法论。适用于:(1) 使用AI Agent(Claude Code、Codex、Cursor等)进行产品级软件开发,(2) 设计和优化Harness/Skill体系,(3) 文档驱动开发(SDD)流程,(4) 构建自动化质量门禁和eval机制,(5) Token成本优化与缓存策略,(6) 产品人转型开发者的AI编程实践。触发场景包括"帮我设计开发流程"、"怎么降低token成本"、"怎么提高AI编码质量"、"文档驱动"、"质量门禁"、"harness设计"、"单agent vs multi-agent"、"自动化迭代"、"AI产品开发"、"SDD"、"eval机制"等。即使用户只是说"帮我用AI写代码"或"怎么让agent干活更靠谱"也应触发。
PDF解析工具,将复杂PDF文档转换为LLM友好的Markdown/JSON格式。适用于:(1) 将PDF转换为Markdown或JSON格式,(2) 提取PDF中的文本、表格、公式、图像,(3) 处理学术论文、技术文档、商业报告的PDF解析,(4) 为RAG应用准备高质量文档数据,(5) 批量处理PDF文件。触发关键词包括:"PDF解析"、"PDF转Markdown"、"PDF转JSON"、"提取PDF表格"、"提取PDF公式"、"MinerU"、"文档解析"、"PDF extraction"、"convert PDF"、"parse PDF"等。