AI PPT 生成器

AI PPT 生成器

AIPRODUCTDESIGNFRONTENDBACKENDTOOLOPENSOURCESSE

项目简介

AI PPT 生成器是一个开源自托管的 Web 应用,解决的是「我有一堆文字,怎么变成一份像样的 PPT」这件事。它和市面上大多数 AI PPT 工具最大的不同,是生成之前会先跟你对话。你把文章、笔记、报告草稿粘进去,AI 先帮你梳理思路、提出结构,你在可编辑的大纲上改完、确认,它再开始流式生成多页幻灯片。生成完可以直接在页面上点哪改哪,然后一键导出自包含 HTML、PDF 或可在 PowerPoint 里二次编辑的 PPTX。

做这个项目的起因,是我用了几款主流 AI PPT 产品后都卡在同一个地方。它们大多是「粘贴文字 → 等十几秒 → 吐出一份成品」,中间没有任何确认环节。结果就是结构不对、要点跑偏,你只能在一个已经定型的文件上返工,反而比自己从零写还累。我想把「想清楚做什么」和「动手做」这两件事拆开,让用户在还没花 token、还没生成之前,就先把结构敲定。

痛点与分析

做 PPT 真正耗时间的从来不是排版,而是想清楚要讲什么。多数人面对一份几万字的材料,第一反应是发怵,不知道该砍什么、留什么、分几页。现有工具把这个思考过程直接跳过了,用一个黑盒一次性给结果,用户对内容没有掌控感。生成的东西一旦不符合预期,就要么整份重来,要么在 PowerPoint 里逐页硬改。

我观察到三个具体的痛点。第一,生成不可控,AI 自作主张地分章节、起标题,用户只能被动接受。第二,编辑体验差,很多 AI PPT 工具导出后才能改,网页里只是个预览,改一个字要进 PowerPoint。第三,数据不放心,企业用户尤其敏感,不想把内部材料和自己的 API Key 暴露给第三方 SaaS,而大多数工具要求你把 Key 填进浏览器,或者把原文上传到它们的服务器。

核心矛盾其实是效率和掌控感的冲突。AI 想要快,一键出稿;用户想要稳,知道自己在讲什么。我没有在「生成得更快」上死磕,而是把精力放在生成前的对齐和生成后的可编辑上,让快和可控能同时成立。

产品亮点

交互侧,最关键的设计是「先对话、后生成」两步走。进入产品是一个干净的输入框,支持粘贴万字长文,也能直接拖入 Markdown 文件按标题自动拆页。点击开始后进入对话澄清阶段,左侧是和 AI 的自然语言交流,右侧是一份实时同步的结构化大纲。你可以直接在大纲上增删页面、拖拽调整顺序、行内修改标题和要点,也可以让 AI 根据某一页继续追问。等大纲满意了,再点确认,AI 才真正开始生成。

生成阶段做的是流式反馈。页面会一边接收模型返回的内容,一边把已经成型的幻灯片实时渲染出来,进度文案精确到「正在生成第 3 页 · 市场增长分析」,而不是一个干巴巴的转圈。这个阶段支持随时取消,取消后已经生成的页面会作为草稿保留,不会前功尽弃。

编辑侧坚持「所见即所得」。幻灯片上的标题、正文、要点都能直接点击修改,光标落在你点的位置,而不是反人类地整段全选。配套做了撤销重做、版式一键切换(封面、要点、双栏、引用、章节分隔、大数字、结尾等多种版式,切换时内容会自动迁移不丢失)、自动保存到本地、刷新可恢复。演示模式支持键盘翻页、备注、工具栏自动隐藏,导出覆盖 HTML、PDF、PPTX 三种格式,其中 PPTX 在 PowerPoint 里仍可二次编辑文字。

安全上做了一个我认为很重要的取舍。API Key 只保存在服务端,用 AES-256-GCM 加密存储,浏览器全程接触不到明文 Key,也看不到真实模型名。这意味着企业可以把它部署在内网,配好一个服务端托管的 Key,团队成员开箱即用,不用各自去申请和配置。整个项目支持 Docker 一键自托管。

业务流程

用户的完整路径是这样的。粘贴或导入长文后,系统进入澄清环节,AI 一边用自然语言和你讨论重点,一边输出严格的结构化大纲;用户在大纲上直接编辑调整,这是第一个关键决策点,结构没对齐就不往下走。确认大纲后进入流式生成,系统逐页产出幻灯片并实时预览。生成完成进入编辑器,用户可以逐页修改文字、切换版式、调整顺序,或者随时回到澄清阶段重新梳理结构。最终在演示模式下放映,或导出为 HTML、PDF、PPTX 交付。

整个流程里,「对话澄清」和「编辑」两个环节都允许随时回退,因为我认为做 PPT 本来就是个反复迭代的过程,不应该是一条只能往前走的单行道。

商业化

目标用户分三类。知识工作者和职场人,需要快速把报告、汇报材料变成 PPT;教育培训者,要把讲义、课程内容做成课件;以及有数据安全要求的中小企业和团队,想要一个能私有化部署的内部工具。

商业化上,开源版免费,覆盖个人用户并建立口碑;面向团队提供托管版订阅,按席位收费,包含共享模板、协作和历史管理;面向企业提供私有化部署与定制,卖点正是数据不出内网、Key 集中托管。护城河不在模型本身,模型能力会越来越同质化,而在于「生成前对齐结构」这套交互沉淀下来的使用习惯,以及自托管带来的企业信任。

未来规划

接下来重点是两块。一是把内容质量做厚,增加汇报、教学、产品发布、学术答辩等场景模板,扩充版式库和图表、图标能力,让生成结果不再千篇一律。二是把单页 AI 操作做深,每页支持一键润色、扩写、精简、重写,把大模型的能力下沉到每一张幻灯片上。

做完这个项目我最大的感受是,AI 产品的差异往往不在模型多强,而在你敢不敢在「快」和「对」之间加一道确认。多数人选择了更快,我选择让用户先想清楚。这道看似拖慢节奏的对话,恰恰是让结果真正可用的原因。