一个 Skill 就能做完整 PPT?PPT Master 来了!
文章目录
- 一、PPT Master Skill 核心能力
- 二、环境安装
- 三、实际测试任务与 Prompt
- 四、完整操作过程
- 五、最终产物与效果
- 六、实际使用后的判断
最近试了一下开源的PPT Master Skill。和常见的“一句话直接生成 PPT”不同,它没有拿到内容后直接开始做,而是先把整个制作流程拆开,一步步确认!
我比较喜欢的一点是,正式生成 PPT 之前,它会先把准备怎么做给你看一遍。哪里不合适可以提前改,这样生成结果不完全依赖一次 Prompt,也减少了“生成完才发现方向不对,再全部重来”的情况。
一、PPT Master Skill 核心能力
PPT Master 是一个面向 Coding Agent 的开源 PPT Skill,主要有两类用途:从零生成 PPT,以及重新设计已有 PPT。
1. 从零生成 PPT
给它文章、Word、PDF、网页、Markdown 或大纲后,Skills 会先进行意图确认和对齐,再进入后续的 PPT 制作流程。
第一阶段先确定:
给谁讲、为什么讲、最重要的信息是什么。
第二阶段再确定:
准备怎么讲、做多少页、采用什么视觉和版式。
方向确认后,才进入正式制作,逐页生成内容,并经过预览、检查和修改,最后导出可继续编辑的.pptx。
这个skills实用的一点是,生成之前会先把内容方向和页面结构梳理一遍,而不是直接开始排版:
先把方向确认清楚,再让 AI 执行。
这样能明显减少生成十几页后再整体返工的情况。
2. 美化已有 PPT
如果已经有一份内容完整的 PPT,也可以保留原来的文字、页数、顺序和数据,只重新处理版式、层级、留白、配色和整体视觉。
原文件不会被覆盖,而是另外生成一份新版 PPT。
所以它更像两套工作流:
- 内容还没成型 → 从零生成。
- 内容已经确定 → 保留内容,重新设计。
整体来看,PPT Master 可以看成一套高度符合人类AI协作 制作 PowerPoint 的完整工作流。它关注的不只是“最后那几页长什么样”,还把前面的方向确认和后面的修改交付一起考虑进去了。
二、环境安装
PPT Master 需要Python 3.10+,适配 Codex、Claude Code 等的 Coding Agent。
1. 安装 PPT Master
进入 Codex 全局 Skill 目录:
cd$HOME\.codex\skills克隆 PPT Master:
gitclone https://github.com/hugohe3/ppt-master.git ppt-master目录结构大致如下:
C:\Users\<用户名>\.codex\ └─ skills\ └─ ppt-master\ ├─ SKILL.md ├─ requirements.txt ├─ scripts\ └─ workflows\2. 安装 Python 依赖
进入 PPT Master:
cd$HOME\.codex\skills\ppt-master安装依赖:
pipinstall-rrequirements.txt官方目前要求Python 3.10+。安装完成后,PPT Master 的材料处理、页面生成、预览、校验和 PPTX 导出等脚本就可以正常运行。
后续使用其他项目时无需再次安装,直接让 Codex 调用全局的ppt-masterSkill 即可。
Windows 下建议项目路径和最终 PPT 文件名尽量使用英文,能减少部分脚本和文件路径的兼容问题。
三、实际测试任务与 Prompt
为了看 PPT Master 面对真实技术内容时的表现,我选了一篇关于NVIDIA Vera Rubin 最新进展的技术文章作为测试材料。
这篇文章同时涉及Groq 3 LPX、Spectrum-X、Scale-In、NVLink Fusion等多个模块,既有技术指标,也有系统之间的关系,比较适合测试 PPT Master 对内容结构、信息层级和技术架构图的处理能力。
我实际使用的 Prompt:
$ppt-master:ppt-master 阅读 /home/lihao/worktrees/ppt/英伟达公布 Vera Rubin 最新进展:推理、网络和定制芯片全面升级.md, 请使用 PPT Master 根据提供内容制作专业、高质量、可直接交付的 PowerPoint。 所有 PPT 设计都应服务于信息的准确、高效传达,并通过合理的图文排版、信息层级与视觉引导,符合人脑接收信息的注意力机制。 遵循业界最佳 PPT(PowerPoint)设计实践,采用现代科技风,整体直观、主题与内容高度匹配,避免花里胡哨和过度设计,使最终成果不仅易读、清晰,也更接近真正能够交付的工作成果。 背景以纯白色为主。配色应专业、协调、克制,可结合主题使用 #F8FAFC / #002FA7 / #06FFFF / #FF0066 / #1F2937,不要求全部使用,且不得影响文字清晰度与可读性。 优先通过信息层级、留白、版式和视觉结构提升表达效率;复杂内容可根据需要转化为流程图、结构图、关系图、图表或表格,避免文字堆积和无意义装饰。 保持整套 PPT 的字体、网格、间距和视觉语言统一,优先使用可编辑的 PowerPoint 原生文本、形状、连接线、图表和表格。 使用 Default Generate PPTX 工作流,先完成内容结构与 Design Spec,确认后再生成最终 PPTX。这里没有直接规定每一页怎么排,而是把风格、信息表达原则和交付要求说清楚,具体的内容结构和页面设计交给 PPT Master 在后面的两阶段确认中完成。
四、完整操作过程
提交材料和 Prompt 后,PPT Master 会进入Default Generate PPTX工作流。
skills会经过两阶段确认,再进入生成阶段。确认既可以直接在对话中完成,也可以通过 Skill 运行时临时拉起的本地 Flask 页面操作。
同时建议直接给出更适合agent体质的素材材料markdown哦
1. 第一阶段:确认这份 PPT 要讲什么
任务启动后,PPT Master 会先分析原始材料,但不会马上开始画页面。
运行时会临时启动一个本地确认页面,例如:
http://127.0.0.1:5050也可以直接在 Agent 对话中完成确认。
第一阶段主要确认:
确认四类信息:
演示目标:目标受众是谁,这份 PPT 要完成什么,核心信息和行动是什么;
使用方式:用于现场汇报、独立阅读还是混合场景,最终材料准备拿来做什么;
- 画布格式:例如 16:9、4:3、竖屏、A4 等;
- 设计基础:根据当前内容从零设计,还是使用已有的 Brand、Style、Layout、Deck 模板。
PPT Master 目前内置了不少常见品牌,例如:
NVIDIA、Google、Microsoft、AWS、Anthropic、IBM、Huawei、Tencent、Xiaomi、Alibaba、McKinsey、BCG、Bain、Deloitte、PwC、JPMorgan、中国电信、中国电建、中汽研 等。
这一阶段成先把沟通目标定下来:确定这份 PPT 到底要表达什么。
2. 第二阶段:确认整套 PPT 怎么呈现
第一阶段确认后,PPT Master 才开始进一步规划整套演示文稿。
第二阶段主要确认:
- PPT 页数;
- 内容结构和叙事方式;
- 整套设计方向;
- 页面版式;
- 字体与配色;
- 图片和图表的使用方式;
- 模板如何应用;
- 是否需要备注、动画等附加内容。
PPT Master 会给出推荐方案,我可以直接采用,也可以在这里继续调整。
• ## Stage 2 · 设计方案确认 - 模板应用:01_title_slide.svg 封面;10_hero_statement.svg 核心判断;13_kpi_dashboard.svg 指标;04_two_content.svg、05_comparison.svg、15_data_story.svg 解释机 制;07_blank.svg 承载自适应架构图。保留 Master、64px 安全框与原生占位结构。 - 方案 A「AI Factory 系统蓝图」★:从整体架构进入四项技术机制,持续复用同一张系统心智地图;Blueprint + Swiss 网格,推荐采用。 - 方案 B「性能证据账本」:按问题、机制、指标、限制组织;数据新闻式排版,便于会后查阅。 - 方案 C「Agent 请求旅程」:沿 Token 生成、Scale-Up、Scale-Out、Scale-In 展开;强调端到端路径与连续状态。 - 配色:白色主背景;NVIDIA #76B900 为身份主色,#1A1A1A 正文,#F8FAFC 表面,#002FA7 结构辅助,#06FFFF / #FF0066 仅作少量路径或异常标记。 - 字体:微软雅黑 + Arial;正文 24px,标题 42px,副标题 32px,注释 18px;代码与组件标识使用 Consolas。 - 图标:tabler-outline,统一 2px 描边。 - 图片:仅使用 NVIDIA 官方产品图、架构图和网络拓扑;不使用 AI 图片。 - 制作:14 页、平衡阅读模式、连续生成;演讲者备注开启,自定义动画与配音关闭。 - P01–P02:封面;从单颗 GPU 到完整 AI Factory 五层体系。 - P03–P04:Agent 工作负载为何放大 Token 延迟;Groq 3 LPX 的定位与 3400 Token/s、4× 指标。 - P05–P06:Nebius Token Factory 部署;传统三层网络扩展代价。 - P07–P08:Spectrum-X 多平面机制;51.2 万 GPU、90% 带宽、11× 恢复、1.6× 产出等指标。 - P09–P10:Scale-In 卸载安全、存储与运维;Scale-Up / Scale-Out / Scale-In 关系。 - P11–P12:NVLink Fusion 接入定制 XPU;Vera Rubin 端到端 AI Factory 架构。 - P13–P14:关键指标总览;平台战略、客户价值与成本/稳定性/产出待验证项。 请回复 确认方案 A,或列出修改项。确认后我将生成完整 Design Spec,并在锁定前再次交付你审核。也就是先确认:
讲什么 → 怎么讲 → 再开始制作。
3. 生成 Design Spec
两阶段确认完成后,PPT Master 会根据前面的选择生成整套 PPT 的 Design Spec。
这里会进一步固定:
- 每一页准备表达什么;
- 信息层级怎么组织;
- 页面采用什么视觉结构;
- 哪些内容适合使用图表、结构图或关系图;
- 整套 PPT 需要遵守哪些设计规则。
可以把它理解成正式制作之前的一份“施工图”。
PPT Master 会根据前面确认好的内容和设计方向继续完成规划。
4. 正式生成、预览与修改
前面的方案确认完成后,PPT Master 才开始逐页生成。
这一步不是把原文直接拆成十几页,而是根据内容选择合适的表达方式。比如这次 NVIDIA 的材料里有 Groq 3 LPX、Spectrum-X、Scale-In、NVLink Fusion,以及 Vera Rubin AI Factory 的整体关系,这些内容更适合用结构图、关系图、数据卡片来讲,而不是堆大段文字。
页面生成后,可以直接在本地浏览器里预览整套 PPT,也可以继续做一些调整:
- 改文字;
- 调颜色、字体和字号;
- 移动元素位置;
- 给某个区域添加修改标注。
简单修改可以直接在预览页完成。如果某一页需要重新排版,也可以加标注,再回到 Agent 里让它继续改。
这是skills挺实用的方面。实际做 PPT 本来就很少一次定稿,先生成一版,再针对具体页面调整,比整套重新生成更顺手。
6. 检查并导出 PPTX
页面完成后,PPT Master 还会进行导出前检查,例如页面元素、文字溢出和文件结构等问题。
通过检查后,最终导出.pptx文件和对应的讲稿。
生成出来的 PPT 仍然可以在 PowerPoint 中继续修改,包括文字、形状、图表、表格等原生对象。
整个流程大致可以概括为:
提供材料 + Prompt ↓ 第一阶段:确认沟通目标 ↓ 第二阶段:确认设计方案 ↓ 生成 Design Spec ↓ 逐页制作 ↓ 浏览器预览 / 修改 ↓ 质量检查 ↓ 导出可编辑 PPTX从实际操作来看,PPT Master 并不是想把人工判断完全去掉,而是把人的判断集中在几个关键节点,再让 Agent 完成后面的执行。
五、最终产物与效果
最终生成了一套完整的 ** PPT**,内容基本按照前面确认的结构展开。
整体采用白底、NVIDIA 绿色为主色,技术内容主要通过结构图、关系图、指标卡片来表达,没有大面积堆文字。
最终导出的是可继续编辑的.pptx,后续仍然可以直接在 PowerPoint 中修改文字、形状、图表和页面细节。
六、实际使用后的判断
完整跑下来, PPT Master的体验感把整个过程做得更接近正常的 PPT 制作流程。
1. 好在哪
第一,两阶段确认确实能少返工。
先把内容和风格定下来,再开始生成,不容易做到一半发现方向不对。
第二,不只是排版,也会一起考虑内容怎么讲。
该用结构图、数据卡片还是文字,它会根据内容来安排。
第三,生成完还能继续改。
哪页不满意可以单独调整,不用整套重新做。
第四,最后拿到的是可编辑的 PPTX。
文字、形状、图表都还能在 PowerPoint 里继续改,这点比较实用。
2. 不足
它也不是完全没有成本。
首先,生成速度不算快。这套流程需要经过确认、规划、逐页生成和检查,token花了不少。
最终效果仍然比较依赖模型本身。复杂架构图、信息密度高的页面,有时还是需要自己再调一遍。
3. 适合什么场景
我觉得它比较适合:
- 技术分享;
- 研究汇报;
- 方案汇报;
- 行业分析;
- 已有材料转 PPT;
- 对可编辑性和最终交付质量要求比较高的场景。