大数跨境

别急着用AI做PPT,先搞清楚六种做法差在哪

别急着用AI做PPT,先搞清楚六种做法差在哪 AI驱动数字化转型
2026-07-30
2
导读:关于PPT工具,Star最多的不一定最好,技术最深的也不一定最对。跟你工作流匹配的那个,才是对的。
现代职场人几乎人人都要做PPT,我们在AI工具里输入一句话,一份完整的演示文稿就在你电脑上生成了。放在两年前,可能需要一个设计师加一个文案干一整天。
但问题来了。同样是AI生成PPT,有的给网页文件,有的给.pptx,有的直接操作你电脑运行PowerPoint。每种做法的差异比你想的大得多,选错路线等于白干。
我扫了一遍GitHub上所有能找到的PPT生成项目,筛选出22个有代表性的,逐一核对仓库状态和Star数。不是推荐清单,是一张技术路线的地图。看完你就知道自己应该属于哪一种。所有数据来自2026年7月29日实时核实。

01
HTML演示
这个做法输出一个单文件HTML,任何浏览器都能打开,不用装PowerPoint、不用解ZIP、不用管版本兼容。视觉上限由CSS和Canvas决定,动画、特效、自定义字体,什么都能做。
代价是交付后不能编辑。客户要改一个字,要么打开浏览器开发者工具改HTML,要么回到AI重新来一遍。这不是"做PPT",而是"做Web演示文稿"。代表性工具是:
frontend-slides
26.4k Star
作者 zarazhangrui
https://github.com/zarazhangrui/frontend-slides
HTML演示里Star最多的项目。思路很直接:不问你想要什么风格,先生成三个预览让你挑。很多人描述不清楚自己喜欢的视觉风格,但看到之后一眼就知道。内置十二套视觉预设,分成暗色系、亮色系和特殊风格三大类。后面加了PPT转换能力,可以把现有.pptx转成Web演示。作者是zarazhangrui,一个不会写代码但靠AI代理做出了26k Star项目的创作者。
guizang-ppt-skill
22.6k Star
作者 op7418(歸藏)
https://github.com/op7418/guizang-ppt-skill
电子杂志的视觉调性。衬线大标题配非衬线正文,再加上等宽字体做元数据,三级字体分工。WebGL流体背景只在封面页出现,正文页非常克制。五套主题色:墨水经典、靛蓝瓷、森林墨、牛皮纸、沙丘。作者不让你自定义色值,理由很硬核:保护美学比给自由更重要。AGPL 3.0协议,商用的话要注意。
html-ppt-skill
7.4k Star
作者 lewislulu
https://github.com/lewislulu/html-ppt-skill
资源量最大的HTML演示项目。36套主题、15个完整模板、31种单页布局、47种动画。最有特色的功能是演讲者模式:在任何Deck里按S键,弹出一个独立窗口,包含当前幻灯片、下一页预览、提词器、计时器,两个窗口通过BroadcastChannel实时同步。
dashi-ppt-skill
4.3k Star
作者 chuspeeism
https://github.com/chuspeeism/dashi-ppt-skill
生成的演示文稿在浏览器里可以直接编辑,不是只读展示。输出可以导出HTML、PDF和PPTX。适合需要分享链接、对方不用装任何软件的场景。
02
原生PPTX
走这条路,输出的才是真正的.pptx文件。每个文本框、每个形状、每个图表在PowerPoint里都能点开编辑,不是图片,不是模板填空。
技术基础是python-pptx,一个纯Python的PPTX读写库。它封装了OOXML的一整套规范,当AI要创建一个文本框时,底层操作的是p:sp和p:txBody这类XML元素,但AI不需要直接和XML打交道。
ppt-master
41.5k Star
作者 Hugo He(hugohe3)
https://github.com/hugohe3/ppt-master
也许是今年PPT赛道上最重要的项目,作者是金融从业者,CPA加CPV双证。他受不了AI生成的PPT都是不能改的图片,干脆自己写了这套工具。几个月飙到41k Star,目前还在加速。
技术核心是SVG到DrawingML的转换。LLM最擅长生成SVG格式,但SVG不能直接作为可编辑形状嵌入PPTX。ppt-master做了一层转换:解析SVG的矩形、圆形、路径、文字等元素,映射到OOXML的形状元素,把填充、线条、变换等属性翻译成PowerPoint原生格式。转换完之后,每个文字框、每个图表在PPTX里都是真的,不是图片。
从PDF、DOCX、URL、Markdown都能生成。支持复刻模板、动画、语音旁白。生成时本地5050端口开一个预览,点选元素说"改这个"就能循环修改。推荐用Kimi K3或Claude驱动,上下文窗口越大质量越好。
presenton
9.2k Star
作者 presenton
https://github.com/presenton/presenton
把自己定位成Gamma和Canva的开源替代品。支持Docker部署,也有桌面应用。可以用自己的API密钥,支持Ollama本地模型,数据不出本机。内置MCP Server。支持导出可编辑PPTX。不想被SaaS绑架的人会喜欢这个。
ppt-agent-skills
853 Star
作者 sunbigfly
https://github.com/sunbigfly/ppt-agent-skills
把PPT制作当成软件工程来做。需求分析、架构设计、模块组装、测试验证,四阶段流水线由严格的状态机驱动。每页HTML构建后自动截图做视觉审计,检测到布局溢出就用DOM加CSS重写来修复。几十页的技术报告或产品白皮书,用这个思路做不容易翻车。
mckinsey-pptx
528 Star
作者 seulee26, AX Labs
https://github.com/seulee26/mckinsey-pptx
40个麦肯锡风格模板,加上一个会解释"为什么选这个模板"的subagent。咨询行业的PPT本身就是做决策推理,Skill学推理,设计上是自洽的。韩语为主的项目,但模板和逻辑通用。
academic-pptx-skill
694 Star
作者 Gabberflast
https://github.com/Gabberflast/academic-pptx-skill
给学术场景做的。强制使用行动式标题,比如"市场规模在X推动下三年翻倍"而不是"市场分析"。还管结构化论证、引用标准、排版规范。学术PPT的套路被代码化了。配合Anthropic官方的PPTX技能一起用。
addsumtech/slides_maker
261 Star
作者 Addsum
https://github.com/addsumtech/slides_maker
这个项目有个独特的设计:独立的评审环节。生成完PPTX之后,另一个AI化身评审者回头挑毛病。布局太挤、对比度不够、数字和原文对不上,这些问题会被标记出来送回修改。不是生成模型自己给自己打分。支持16:9、4:3、小红书3:4卡片、9:16故事封面多种画幅。
03
AI图像驱动
不用文本框,不计算布局。AI图像模型直接生成一整张16:9的图片,文字、装饰、背景都渲染进像素里。
文字渲染精度是关键。GPT Image 2在这方面比前代强很多。但代价是成品不能逐字编辑,改文案等于重新生成整张图。
NanoBanana-PPT-Skills
3.0k Star
作者 op7418(歸藏)
https://github.com/op7418/NanoBanana-PPT-Skills
基于Google Nano Banana Pro图片生成模型。两种风格:渐变毛玻璃卡片和矢量插画。支持智能转场视频,用可灵AI生成页面过渡动效,FFmpeg合成完整PPT视频。2K分辨率每页大约30秒。适合需要把PPT转成视频分发的场景。
gpt-image2-ppt-skills
1.1k Star
作者 JuneYaooo
https://github.com/JuneYaooo/gpt-image2-ppt-skills
十套精选风格加一个模板克隆模式:丢一个.pptx进去,gpt-image-2仿版式,你换内容。后来补了22个扩展风格。默认10路并发出图,10页大约30秒。支持自然语言编辑,说"改第三页副标题"就针对那一页重新生成。最近加了可编辑模式(默认关闭),开启后文字和图形可以拆成独立对象。

04
MCP协议层
这个做法跟前几条完全不同。它不生成文件,而是让AI直接操作你电脑上正在运行的PowerPoint。
基于Windows COM Interop技术。PowerPoint自身暴露出完整的COM接口,MCP Server把接口包装成AI能调用的工具。每个操作都在PowerPoint窗口里即时生效,所见即所得。只有Windows能用,必须装PowerPoint。
PptMcp (trsdn/mcp-server-ppt)
35 Star
https://github.com/trsdn/mcp-server-ppt
33个工具,204个操作。覆盖幻灯片、形状、文本、图表、表格、动画、转场、图片、备注、超链接、幻灯片放映、导出、VBA宏等。用的PowerPoint官方COM API,文件安全有保障。
PPTAgent / DeepPresenter
4.8k Star
中科院信工所(icip-cas)
https://github.com/icip-cas/PPTAgent
学术机构出品,论文被EMNLP 2025和ACL 2026接收。核心设计是反思式生成:Agent生成完每一页后回头检查,判断要不要重做。配套的DeepPresenter-9B是微调过的专用模型,在HuggingFace可以下载。现在支持CLI一键安装,用uvx pptagent generate就能用。不支持Windows。
05
垂直场景专用
完全放弃通用性,把能力收敛到特定场景。不做万能引擎,专攻一个方向。
fullstack-mkt-skills
475 Star
作者 minhnv0807
https://github.com/minhnv0807/fullstack-mkt-skills
60个营销技能打包在一起:内容日历、TikTokMeta广告文案、KPI计算器、A/B测试。PPT只是它能做的事之一。基准数据针对越南市场,但逻辑通用。
ppt-translator
66 Star
作者 daekeun-ml
https://github.com/daekeun-ml/ppt-translator
解决一个很具体的问题:翻译PPT的时候保留格式。底层用Amazon Bedrock,支持CLI和MCP两种接入方式。翻译PPT最头疼的不是译文质量,是格式错位。支持90多种语言,自动检测源语言。已发布到v1.0.8。
odin-slides
145 Star
作者 leonid20000
https://github.com/leonid20000/odin-slides
把长Word文档变成结构化PPT。几十页报告写完,压缩成30页演示。LLM自动拆解文档再重组成PPT大纲。适合先出报告再做演示的工作流。
microsoft/presentations
7 Star
微软官方
https://github.com/microsoft/presentations
微软开源的Markdown到PPT工具。读一份Markdown规格文件,生成带动画、图片、AI视觉和演讲者备注的PowerPoint。把PPT当成代码管理,每次构建都是版本化的.pptx,可重复可对比。需配合Azure AI使用。

06
综合设计平台
这一类超出了PPT的边界。它们是把整个设计流程装进AI代理的体系。
open-design
82.2k Star
作者 nexu-io
https://github.com/nexu-io/open-design
Claude Design的开源替代品。能做Web原型、桌面和移动应用界面、演示文稿、图片、视频、动态图形。HTML、PDF、PPTX、MP4都能导出。支持25种以上的CLI,Claude Code、Codex、Cursor、Hermes、Kimi这些都能用。4月28日上线,3个月冲到82k Star。Apache 2.0协议。PPT只是它的能力之一。
07
三条线帮你判断
第一条线:你的PPT做完之后,客户或老板要不要改?要改的话,走原生PPTX路线。不改但追求好看,走HTML或图像路线。不确定的话走原生路线最安全,可编辑的PPTX随时能降级成图片,反过来不行。
第二条线:你在什么操作系统上干活?Windows加装了PowerPoint,所有路线都走得通。macOS或Linux的话,COM Automation这条路不通,其他都没问题。
第三条线:预算允许你用多好的模型?原生PPTX路线花的是LLM的费用,推荐Kimi K3或Claude。图像路线多付一笔图像生成费。项目本身全是开源的,但模型API费用是防不住的运营成本。
Star最多的不一定最好,技术最深的也不一定最对。跟你工作流匹配的那个,才是对的。

【声明】内容源于网络
0
0
AI驱动数字化转型
专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
内容 1081
粉丝 1
AI驱动数字化转型 专注AI,促进智造行业数据衍生,服务智能制造企业的数字化、智能化,聚焦大模型私域部署、大模型微调、数据清洗、AI模型训练、私域知识库及agent技术延展等。行业智能,落地为先。
总阅读10.4k
粉丝1
内容1.1k